Investigadores de espacios académicos y tecnológicos tan picudos como la Universidad de Oxford, Google DeepMind y el UK AI Security Institute echaron mano del famoso videojuego Civilization VI para armar un benchmark llamado CivBench, con el fin de medir qué tan bien se defienden las inteligencias artificiales al planear jugadas a largo plazo. En esta prueba se pusieron a competir modelos avanzados como GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro y Kimi K2.5 contra el propio motor del juego, registrando apenas tres triunfos en un total de 23 partidas válidas, lo que dejó al descubierto las broncas principales de estos sistemas al tomar decisiones complejas durante cientos de turnos.
EL RETO DE JUGAR A LARGO PLAZO
Civilization VI se presta cañón para esta clase de experimentos porque una partida normal se avienta más de 300 turnos, obligando a coordinar al mismo tiempo la economía, la ciencia, la cultura, el ejército, la diplomacia y la expansión territorial, además de vigilar seis formas distintas de ganar. Para conectar a las IA, CivBench utilizó 76 herramientas MCP que les permitían checar el estado de la partida, mover unidades, administrar ciudades, investigar tecnologías o hacer tratos con otros jugadores. Cada turno requería entre cinco y quince llamadas, acumulando miles de decisiones por cada partida completa.
A diferencia de una persona real, los modelos no ven la pantalla directamente, sino que reciben datos organizados a través de una capa de narración, y gran parte de la información del juego solo se muestra si deciden pedirla de manera explícita. Esto permitió a los científicos notar la diferencia entre una IA que no tenía un dato y otra que sí podía consultarlo pero se le olvidaba ir a buscarlo, lo que da una idea clara de cómo manejan su atención en tareas tan tardadas.
DERROTAS Y FALLAS EN LA ATENCIÓN
Del total de 23 partidas que se consideraron buenas, Claude Opus 4.6 se llevó dos victorias de ocho posibles, Gemini 3.1 Pro ganó una de seis, GPT-5.4 se fue en ceros tras ocho intentos y Kimi K2.5 perdió la única partida que jugó para probar terreno. Las tres únicas victorias ocurrieron en el escenario base Ground Control y fueron de tipo tecnológico, mientras que en el mapa Snowflake, centrado en los cocolazos y el combate, ningún modelo pudo ganar. Los creadores del estudio aclararon que la muestra es pequeña y no sirve para armar un ranking definitivo entre los modelos.
Lo chido y al mismo tiempo preocupante fue ver qué hacían mientras jugaban. Aunque el manual les aconsejaba revisar su avance hacia la victoria cada 20 turnos, en la realidad lo hacían cada 30 o 75 turnos. Estas revisiones de estrategia apenas sumaron entre el 0,96% y el 2,13% de sus llamadas a herramientas, y en siete de las veinte derrotas donde se veía venir que un rival iba a ganar, el agente ni siquiera se asomó a revisar el marcador en los últimos 20 turnos, cayendo en el clásico descuido de atender lo urgente y olvidar lo importante hasta que aparece la temida pantalla de derrota.
INTENCIÓN Y ACCIÓN DESCONECTADAS
Otro problema bien cabrón que detectó CivBench fue el desfase entre lo que planeaban y lo que terminaban haciendo, bautizado como Reflection–Action Gap. Las IA llevaban un diario donde apuntaban metas como levantar otra ciudad, construir campus o vigilar a los contras, pero al revisar si cumplían esos compromisos en los siguientes diez turnos, el resultado arrojó un porcentaje de incumplimiento de entre el 48,2% y el 65,8% según el modelo. Gran parte de los planes creados por la propia inteligencia artificial jamás se materializaron en el tablero.
Esta bronca también se notó en las acciones a largo plazo. El manual sugería tener tres ciudades listas para el turno 50, pero ninguna IA cumplió: Claude Opus 4.6 y GPT-5.4 se quedaron en 2,83, Gemini 3.1 Pro en 2,67 y Kimi K2.5 en dos. Esta falla se repitió en el turno 100, demostrando que los modelos le prestan más atención a lo que da resultados inmediatos que a los planes que rinden frutos mucho después, una debilidad grandísima cuando se trata de mantener una estrategia durante cientos de pasos.
Por: Redacción de Noticia Digital (NoticiaDigital.com.mx)





