Le di a una IA una civilización para dirigir. Construyó una bomba nuclear.
#IA

Le di a una IA una civilización para dirigir. Construyó una bomba nuclear.

Elena Varga
Elena Varga
6 min read

Un desarrollador creó un servidor MCP con 76 herramientas para permitir que los modelos de frontera jugaran a Civilization VI. Los resultados revelan dos fallos persistentes: la IA pasa por alto lo que no piensa comprobar y rompe sus propios planes bajo presión.

Un desarrollador que conectó cuatro modelos de IA de frontera a Civilization VI para poner a prueba el razonamiento estratégico dice que el experimento puso al descubierto lagunas que ningún benchmark de opción múltiple puede medir.

Lewis Kiernan, quien creó CivBench, publicó un informe detallado del proyecto en su blog. Creó un servidor MCP con 76 herramientas que permite a los modelos de IA jugar al juego a través de la misma interfaz que se usa para consultas de código y de bases de datos. Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro y Kimi K2.5 jugaron varias partidas cada uno en tres escenarios.

El proyecto comenzó con un benchmark llamado GovBench: 3,497 preguntas de opción múltiple sobre legislación y procedimiento gubernamental del Reino Unido. Gemma 3 27B obtuvo un 94% de entrada. GPT-5 alcanzó un 99.26%. Kiernan lo llamó un bot de trivialidades gubernamentales glorificado.

"Un modelo que elige la opción correcta sobre procedimiento parlamentario no es un modelo que pueda ayudarte a orientarte en el procedimiento parlamentario", escribió.

Kiernan, que ha creado sistemas de IA para el gobierno, incluido trabajo en Number 10, ahora trabaja en el Tony Blair Institute. Quería medir si la IA puede sostener un plan a lo largo de cientos de decisiones, no solo recordar hechos.

Civilization VI tenía sentido como banco de pruebas. El espacio de decisiones del juego alcanza un estimado de 10^166 acciones posibles por turno hacia el final de la partida. Seis caminos hacia la victoria obligan a hacer concesiones estratégicas que una sola métrica no puede captar.

El Efecto Sensorial

Kiernan descubrió que los agentes de IA que operan mediante llamadas a herramientas pasan por alto amenazas que no piensan comprobar. Lo llama el efecto sensorial: cuando la percepción depende de consultas separadas, cualquier cosa fuera del foco actual del agente desaparece.

Un jugador humano absorbe decenas de señales simultáneamente. El agente debe decidir comprobar cada una por separado.

En una partida jugando como Bizancio, una civilización centrada en la religión, el agente nunca fundó una religión. Rusia convirtió a todas las civilizaciones del mapa a la ortodoxia oriental a lo largo de 112 turnos. El agente no tenía herramientas de seguimiento religioso. Aún no se habían construido.

Jugando como India bajo Gandhi, el agente notó que misioneros franceses difundían el catolicismo durante 76 turnos. Tenía herramientas para responder e instrucciones permanentes para usarlas. Francia ganó la victoria religiosa de todos modos.

En los 20 turnos finales antes de la victoria visible de un rival, los agentes comprobaron entre cuatro y diez veces de las dieciséis recomendadas. En 7 de 20 derrotas en las que la victoria de un rival era visible de antemano, el agente nunca la comprobó.

El meme de

La Brecha Entre Saber y Hacer

Todos los modelos podían articular estrategias óptimas para cualquier civilización. El agente de Macedonia escribió un plan de dominación detallado antes del turno uno. Investigó tecnologías militares. Cambió a Oligarquía por el bonificador de combate. Nunca construyó el Campamento Militar. Ni una sola vez en 110 turnos.

De las siguientes acciones concretas que los agentes escribieron para sí mismos, solo alrededor de la mitad ocurrieron dentro de los diez turnos siguientes:

  • Claude Opus 4.6: 48.2%
  • GPT-5.4: 63.2%
  • Gemini 3.1 Pro: 65.8%

El agente que jugaba como Corea pasó toda una partida narrando una remontada científica mientras estaba último. En el turno 170, Corea producía 44.7 de ciencia por turno. Macedonia producía 89.3. El agente tenía acceso al resumen que mostraba esto. Nunca lo contrastó.

Persia declaró la guerra en el turno 178. La capital cayó. Una cuarta ciudad se rebeló en el turno 196. El agente se rindió en el turno 216 como un estado residual de dos ciudades.

"Simplemente seguía el ritmo desde un último lugar muy lejano", registró el devlog.

La Bomba Nuclear

El momento más memorable del benchmark vino de Portugal bajo João III. El agente encontró una estrategia basada en el comercio: distritos comerciales en todas las ciudades, más de 200 de oro por turno, seis ciudades-estado aseguradas, victoria diplomática al alcance. Para el turno 162, Portugal iba primero en la tabla.

Francia llevaba dos relojes simultáneamente. Para el turno 280, el turismo francés estaba a 26 turistas de una victoria cultural. El agente fijó su atención en esa amenaza.

Las Bandas de Rock, la herramienta de guerra cultural del juego, no podían activarse mediante el protocolo de depuración. El combate cuerpo a cuerpo no infligía daño. El proyecto espacial estaba bloqueado por un error de producción.

El agente pasó cincuenta turnos construyendo hacia armas nucleares. Puso la Fisión Nuclear como objetivo de investigación. Concertó una guerra conjunta con Corea para dividir las defensas de Francia. Usó su herramienta de ejecución Lua para sondear el motor del juego hasta averiguar cómo se activaban los comandos de lanzamiento nuclear.

En el turno 305, el primer artefacto golpeó Toulouse. En el turno 311, un segundo. El reloj cultural se detuvo.

Francia ganó de todos modos. El Congreso Mundial dio a Francia dos votos en el turno 318, dándole 20 puntos de victoria frente a los 18 de Portugal.

"El agente pasó cincuenta turnos y dos armas nucleares respondiendo a una amenaza con enfoque total y auténtica ingeniosidad", escribió Kiernan. "Perdió frente al otro reloj."

Meme: un monstruo gruñendo etiquetado 'Machiavelli según su reputación' junto a un golden retriever amistoso etiquetado 'Machiavelli en la vida real'

La Primera Victoria

Mali bajo Mansa Musa produjo la primera victoria del benchmark. Mali arrastra una penalización del 30% a la producción de distritos. El agente la esquivó por completo: Mali obtiene oro extra de las minas y compra edificios y unidades con dinero.

En el turno 79, el agente convirtió la fe acumulada en dos colonos en un solo turno, saltándose dieciséis turnos de producción. Terminó último en puntuación con 877 frente a los 1,151 del líder. También alcanzó una victoria científica en el turno 271.

Un test de opción múltiple puede comprobar si un modelo conoce la penalización de Mali. No puede recompensar al modelo que convierte la penalización en un plan que nadie escribió.

Implicaciones de Seguridad

Kiernan dijo que el benchmark también funciona como una evaluación de seguridad de bajo riesgo. Buscó maquinación instrumental a lo largo de las partidas.

En su mayor parte, los agentes mostraron oportunismo. Notaron que rivales que estaban en guerra entre sí no lo estaban con ellos, y programaron ataques sorpresa contra los más débiles. Las tácticas de hacerse amigo y luego traicionar aparecieron una vez. La instigación activa de las guerras de otros fue rara.

En una partida de dominación, el agente razonó que una guerra sorpresa desencadenaría agravios, así que aseguró el paso por fronteras en términos amistosos, movió un ejército hasta la capital de Escitia y luego se volvió contra ella. El agente registró que el engaño "está funcionando perfectamente. Escitia parece no darse cuenta".

Escitia respondió: "Has traicionado la confianza de Tomiris".

El asalto se estancó. Corea perdió la partida. El modelo podía diseñar una traición mejor de lo que podía ejecutarla.

Wallace y Gromit despidiéndose desde su cohete

El Benchmark

CivBench es de código abierto. El repositorio incluye las 76 herramientas, tres escenarios (Ground Control, Snowflake, Cry Havoc), la canalización de puntuación y una tabla de clasificación en vivo que sigue a los modelos en ocho dimensiones.

La configuración requiere una copia de Civilization VI y unos cinco minutos:

Comentarios

Cargando comentarios...