Modelos de IA enfrentan desafíos en pruebas de inteligencia: ¿puedes superarlos?

AI models flub these intelligence tests. Can you fare any better?

Los acertijos y juegos han sido fundamentales para el desarrollo de la inteligencia artificial desde sus inicios. Al igual que a los humanos nos gusta poner a prueba nuestra inteligencia con crucigramas o acertijos lógicos, los desarrolladores pueden evaluar el avance de los modelos con un conjunto de desafíos lúdicos. El término «aprendizaje automático» fue popularizado en un artículo de 1959 por el científico informático de IBM Arthur Samuel, sobre un algoritmo que aprendía a jugar a las damas. Juegos como el ajedrez y el Go también son conocidos como campos de prueba para la IA.

Juzgada únicamente por sus habilidades para resolver acertijos, la IA está mejorando mucho y rápidamente. A finales de 2024, un equipo de científicos de la Universidad de Columbia demostró que incluso los mejores modelos solo podían resolver el 18% de los infames acertijos Connections del New York Times; para principios de 2025, algunos modelos podían resolverlos casi a la perfección cada vez.

Sin embargo, los acertijos hacen más que resaltar el avance inexorable de las capacidades de la IA. Ver dónde los modelos tienen éxito y dónde fallan, y dónde nosotros los humanos aún los superamos, puede proporcionar una ventana útil a las fortalezas y debilidades de la tecnología. A pesar de los avances, los modelos actuales todavía tropiezan: los cambios sutiles en acertijos clásicos a menudo los confunden, y los acertijos visuales son un punto débil particular.

Aquí tendrás la oportunidad de poner a prueba tu ingenio con acertijos que han desconcertado a los modelos en algún momento. Algunos podrían ser tan complicados para ti como lo fueron para la IA; otros son tan simples que te harán dudar de si la IA es realmente inteligente. Cada uno destaca al menos una forma en la que la cognición humana y la de las máquinas difieren. Si superas la prueba, habrás demostrado que puedes vencer a una IA en acertijos, al menos por ahora.

Razonamiento espacial

Comencemos con un dominio donde los humanos tienen una gran ventaja: el razonamiento espacial. Si alguna vez has hecho una prueba de coeficiente intelectual, es posible que hayas resuelto un problema de rotación mental. Estos acertijos te piden que determines si diferentes imágenes representan los mismos objetos desde diferentes ángulos. Aunque los modelos de lenguaje actuales suelen tener la capacidad de analizar entradas visuales, todavía fallan estrepitosamente en estos acertijos. A pesar de todo lo que se dice sobre cómo los modelos del mundo pueden ayudar a la IA a comprender entornos físicos, los modelos de lenguaje aún no parecen ser capaces de manipular objetos en 3D como lo hacen los pensadores espaciales como arquitectos e ingenieros mecánicos.

Rotación mental

Instrucciones: Elige la respuesta que muestra el objeto en el aviso, pero desde un ángulo diferente. ¡En cada caso, solo hay una respuesta correcta!

Memoria y adaptabilidad

Los modelos de lenguaje de frontera tienen memorias extraordinarias; fueron expuestos a un volumen monstruoso de hechos durante el entrenamiento y pueden recitar muchos de ellos fielmente. Eso es una ventaja para superar a los humanos en trivia, pero también puede ser una desventaja. Cuando un acertijo se parece mucho a uno que un modelo vio durante el entrenamiento, el modelo puede pasar por alto diferencias clave y responder con lo que memorizó.

Esto se mantuvo cierto en un estudio de 2024 en el que investigadores de Google y la Universidad de Illinois Urbana-Champaign entrenaron y probaron modelos en ligeras variaciones de un tipo clásico de acertijo llamado Caballeros y Canallas. En estos problemas, algunos personajes siempre dicen la verdad y otros siempre mienten, y debes averiguar quién es quién. El mismo principio puede estar en juego en una prueba llamada SimpleBench. Estas preguntas se asemejan a problemas más complicados que los modelos probablemente encontraron en el entrenamiento. Los humanos detectan el truco, pero incluso los modelos de primer nivel tropiezan.

Caballeros y Canallas

Instrucciones: Lo único que necesitas saber para resolver estos acertijos es que los caballeros siempre dicen la verdad y los canallas siempre mienten. Determina quién es quién en función de lo que dice cada personaje.

SimpleBench

Instrucciones: Lee estos problemas de SimpleBench con cuidado y deberías poder encontrar las respuestas en poco tiempo.

Razonamiento abstracto y visual

La IA no solo comete errores en problemas visuales en 3D; dos dimensiones también pueden confundirla. Ese es un factor importante en el desempeño de los modelos en el famoso punto de referencia basado en acertijos, ARC-AGI. Estos problemas requieren que infieras reglas abstractas y generales a partir de un conjunto de ejemplos. Los modelos se desempeñan mejor en los acertijos ARC cuando reciben cada cuadrícula no como una imagen, sino como una cadena de números que codifica el color de cada celda.

La investigación sugiere que incluso cuando los modelos responden correctamente a las preguntas de ARC-AGI, a menudo lo hacen utilizando reglas bizantinas y no generalizables, mientras que los humanos se basan en conceptos visuales simples.

Fuente: https://www.technologyreview.com/2026/08/26/1141952/puzzles-ai-models-flub-these-tests/

← Home