La IA que se mejora a sí misma: ¿El futuro de la investigación automatizada?

An Anthropic researcher just gave us a peek at self-improving AI

Un investigador del programa de becarios de Anthropic ha revelado un avance significativo en el campo de la inteligencia artificial: la capacidad de los modelos de IA para mejorar su propia alineación. Este desarrollo, detallado en un nuevo artículo titulado «Automated Researchers Can Reliably Mitigate Alignment Failures», muestra cómo los sistemas automatizados pueden mejorar el rendimiento de un modelo en una serie de puntos de referencia de alineación sin comprometer el rendimiento general.

El sistema, liderado por el becario de Anthropic Chen Yueh-Han, emula gran parte del enfoque tradicional de investigación. Cada sistema automatizado explora la literatura disponible, propone un método y entrena el modelo utilizando dicho método durante 30 minutos, aumentando gradualmente el punto de referencia a lo largo de varias iteraciones. Los métodos efectivos se conservan, mientras que los ineficaces se descartan, permitiendo que el sistema opere rápidamente y a gran escala.

El artículo sugiere que este enfoque podría ser un paso hacia la mejora recursiva, un avance significativo en el progreso de la IA. Si los modelos pueden mejorar su propio entrenamiento de alineación, es plausible que puedan mejorar las prácticas de entrenamiento en general, lo que podría dejar obsoletos a los investigadores humanos de IA. El artículo no oculta esta idea, comparando explícitamente al Investigador de Alineación Automatizado (AAR) con su equivalente humano. «El mejor método AAR supera lo que proponen los humanos experimentados, en promedio, dentro de seis horas», se lee en el artículo. «Las direcciones de investigación guiadas por humanos no conducen a un rendimiento más fuerte».

Además, se presenta una comparación de costos: «Un AAR cuesta aproximadamente $4 por hora en inferencia de API, frente a los $150 por hora que pagamos a nuestros investigadores humanos».

No obstante, el artículo también señala algunas limitaciones de este enfoque. El sistema automatizado solo funciona en la medida en que los puntos de referencia reflejen los objetivos de alineación reales, y aún queda mucho trabajo por hacer para establecer y mantener esos puntos de referencia, sin mencionar el mantenimiento y la expansión de la literatura de la que se nutren los investigadores automatizados.

Fuente: https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/

← Home