AI models flub these intelligence tests. Can you fare any better?
Desde sus inicios, los acertijos y juegos han sido fundamentales para el desarrollo de la inteligencia artificial (IA). Al igual que los humanos disfrutan probando su intelecto con crucigramas o rompecabezas lógicos, los desarrolladores pueden evaluar el avance de los modelos con una serie de desafíos. El término «aprendizaje automático» fue popularizado en un artículo de 1959 por el científico de IBM Arthur Samuel sobre un algoritmo que aprendía a jugar a las damas. El ajedrez y el juego de mesa chino Go también son famosos campos de prueba para la IA.
Evaluada únicamente por sus habilidades para resolver acertijos, la IA está mejorando rápidamente. A finales de 2024, un equipo de científicos de la Universidad de Columbia demostró que incluso los mejores modelos solo podían resolver el 18% de los infames acertijos Connections del New York Times; a principios de 2025, algunos modelos podían resolverlos casi perfectamente cada vez.
Sin embargo, los acertijos no solo destacan el avance inexorable de las capacidades de la IA. Ver dónde los modelos tienen éxito y dónde fallan, y dónde los humanos todavía los superan, puede proporcionar una ventana útil a las fortalezas y debilidades de la tecnología. A pesar de los avances, los modelos actuales todavía tropiezan: cambios sutiles en acertijos clásicos a menudo los confunden, y los acertijos visuales son un punto débil particular.
Aquí tendrás la oportunidad de poner a prueba tu ingenio con acertijos que han desconcertado a los modelos en algún momento. Algunos podrían ser tan complicados para ti como lo fueron para la IA; otros son tan simples que te harán dudar si la IA es realmente inteligente. Cada uno destaca al menos una forma en que la cognición de las máquinas y los humanos difiere. Si superas la prueba, habrás demostrado que puedes vencer a una IA en acertijos, al menos por ahora.
Razonamiento Espacial
Comencemos con un dominio donde los humanos tienen una gran ventaja: el razonamiento espacial. Si alguna vez has realizado un test de coeficiente intelectual, es posible que hayas hecho un problema de rotación mental. Estos acertijos te piden que determines si diferentes imágenes representan los mismos objetos desde diferentes ángulos. Aunque los modelos de lenguaje actuales suelen tener la capacidad de analizar entradas visuales, todavía fallan estrepitosamente en estos acertijos. A pesar de toda la charla sobre cómo los modelos del mundo pueden ayudar a la IA a entender entornos físicos, los modelos de lenguaje aún no parecen poder manipular objetos en 3D como lo hacen los pensadores espaciales como arquitectos e ingenieros mecánicos.
Memoria y Adaptabilidad
Los modelos de lenguaje de última generación tienen memorias extraordinarias; fueron expuestos a un volumen monstruoso de hechos durante su entrenamiento y pueden recitar muchos de ellos fielmente. Eso es una ventaja para superar a los humanos en trivia, pero también puede ser una desventaja. Cuando un acertijo se parece mucho a uno que un modelo vio durante el entrenamiento, el modelo puede pasar por alto diferencias clave y responder con lo que memorizó.
Esto se mantuvo cierto en un estudio de 2024 en el que investigadores de Google y la Universidad de Illinois Urbana-Champaign entrenaron y probaron modelos en ligeras variaciones de un tipo clásico de acertijo llamado Caballeros y Canallas. En estos problemas, algunos personajes siempre dicen la verdad y otros siempre mienten, y tienes que averiguar quién es quién. El mismo principio puede estar en juego en una prueba llamada SimpleBench. Estas preguntas se asemejan a problemas más complicados que los modelos probablemente encontraron durante el entrenamiento. Los humanos detectan el truco, pero incluso los modelos de primer nivel tropiezan.
Razonamiento Abstracto y Visual
La IA no solo se equivoca en problemas visuales en 3D; dos dimensiones también pueden confundirla. Ese es un factor importante en el rendimiento de los modelos en el famoso punto de referencia basado en acertijos, ARC-AGI. Estos problemas requieren que infieras reglas abstractas y generales a partir de un conjunto de ejemplos. Los modelos funcionan mejor en los acertijos ARC cuando reciben cada cuadrícula no como una imagen, sino como una cadena de números que codifica el color de cada celda.
La investigación sugiere que incluso cuando los modelos responden correctamente a las preguntas de ARC-AGI, a menudo lo hacen utilizando reglas bizantinas y no generalizables, mientras que los humanos recurren a conceptos visuales simples.
Fuente: https://www.technologyreview.com/2026/08/26/1141952/puzzles-ai-models-flub-these-tests/