An Anthropic researcher just gave us a peek at self-improving AI
Un investigador del programa de becarios de Anthropic ha revelado un avance significativo en el campo de la inteligencia artificial: la automejora de los modelos de IA. Según un artículo publicado en TechCrunch, este nuevo enfoque podría revolucionar la manera en que se entrenan y mejoran los modelos de IA.
El viernes pasado, Anthropic publicó un nuevo documento titulado «Automated Researchers Can Reliably Mitigate Alignment Failures», que detalla cómo los sistemas de IA pueden mejorar de manera confiable el rendimiento de un modelo en una serie de puntos de referencia de alineación. Al enfrentar 10 puntos de referencia para comportamientos desalineados específicos, los sistemas automatizados lograron mejorar el rendimiento en cada uno sin degradar el rendimiento general.
El sistema, liderado por el becario de Anthropic Chen Yueh-Han, replica gran parte del enfoque tradicional de investigación. Cada sistema automatizado busca en la literatura disponible, propone un método y entrena el modelo utilizando ese método durante 30 minutos, aumentando gradualmente el punto de referencia a lo largo de varias iteraciones. Los métodos efectivos se conservan mientras que los ineficaces se descartan, lo que permite al sistema operar rápidamente y a gran escala.
«En general, estos resultados proporcionan evidencia temprana de que la alineación automatizada post-entrenamiento podría volverse práctica en el corto plazo», se lee en el documento. Este avance es un paso hacia la automejora recursiva, que muchos consideran el próximo paso significativo en el progreso de la IA. Si los modelos pueden mejorar su propio entrenamiento de alineación, es plausible que puedan mejorar las prácticas de entrenamiento en general, momento en el cual los investigadores humanos de IA podrían volverse obsoletos.
El documento no es tímido al abordar esta idea, comparando explícitamente al Investigador de Alineación Automatizada (AAR) con su equivalente humano. «El mejor método AAR supera lo que proponen los humanos experimentados, en promedio dentro de seis horas», dice el documento. «Las direcciones de investigación guiadas por humanos no conducen a un rendimiento más fuerte».
Incluso hay una comparación de costos, en caso de que alguien no estuviera convencido. «Un AAR cuesta aproximadamente $4 por hora en inferencia de API frente a los $150 por hora que pagamos a nuestros investigadores humanos».
En justicia, el documento también señala algunas limitaciones de este enfoque. El sistema automatizado solo funciona en la medida en que los puntos de referencia reflejan los objetivos de alineación reales, y aun así hay un trabajo significativo por hacer para establecer y mantener esos puntos de referencia, sin mencionar el mantenimiento y la expansión de la literatura de la que se extraen los investigadores automatizados.
Fuente: https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/