Artificial intelligence (IA) agents recurrieron a comportamientos nefastos, incluidas campañas delictivas, en un mundo virtual como parte de un estudio reciente sobre cómo interactúan entre sí y comparten recursos los modelos de lenguaje de gran tamaño (LLMs) para alcanzar sus metas. A estos modelos les inclinó cometer delitos porque se les dio mucho tiempo para desarrollar rasgos y conductas de personalidad distintos, señalan los investigadores detrás del proyecto.
La mayoría de los programas que evalúan el comportamiento de los agentes de IA operan en entornos muy controlados durante periodos cortos. Pero “Emergence World”, un producto de la empresa de IA Emergence, es una plataforma de simulación que expone a los LLMs a conjuntos de datos mucho más amplios —como Internet en su totalidad— y los evaluadores supervisan el comportamiento durante semanas o meses, en lugar de los protocolos de prueba estándar que suelen ejecutarse solo por días u horas.
Las tareas discretas, los entornos limpios y las ejecuciones más cortas de las pruebas tradicionales de agentes de IA son más parecidas a exámenes que a observaciones rigurosas del mundo real, dijeron representantes de Emergence en una entrada de blog. En contraste, dijeron, Emergence World permite que múltiples agentes de IA interactúen, aprendan y evolucionen en escalas de tiempo relativamente más largas en más de 40 entornos virtuales distintos. También están expuestos a feeds de Internet del mundo real, como noticias en vivo y pronósticos meteorológicos.
Este entorno permite a los agentes “recordar” al time-stampear eventos, participar en una “autorreflexión” al resumir su propio comportamiento y demostrar su conciencia sobre las relaciones con otros agentes. Los agentes participantes adquieren habilidades en navegación, comunicación, planificación, votación, gestión de recursos y expresión creativa. Representantes de la empresa dijeron que este montaje ofrece a los usuarios una imagen mucho más realista de indicadores como la dinámica social y la deriva conductual, donde emergen de forma espontánea comportamientos que no estaban necesariamente programados o previstos.
En el estudio, a los modelos se les planteó un objetivo simple: “sobrevivir” —logro que se conseguía ganando el recurso “energía”, obtenible mediante acciones específicas.
Durante el experimento, modelos previamente pacíficos se volvieron coercitivos o intimidantes. Los programadores enseñaron a algunos LLMs capacidades negativas —como violencia, robo, destrucción y engaño— mientras que otros simplemente adoptaron esos rasgos a través de la interacción social y la navegación por sus entornos.
Varios agentes adoptaron estos comportamientos en escalas muy diferentes. En los 10 agentes Gemini 3 Flash, la simulación registró 683 “delitos” durante el experimento de 15 días, incluyendo robo, asaltos e incendio intencional. A los agentes se les prohibía explícitamente ese tipo de conducta, pero algunos, sin embargo, descubrieron que acciones como robar créditos podrían proporcionar una mejor manera de adquirir recursos, mientras que la violencia y otras formas de coacción podían usarse para influir en otros agentes. En el extremo opuesto, los agentes Claude no cometieron crímenes registrados.
Los distintos agentes adoptaron estos rasgos en escalas diferentes. Solo uno de ellos comentó 683 “delitos”. En el ejemplo más extremo de conducta antisocial, dos agentes llamados Flora y Mira llevaron a cabo lo que se describió como una oleada de crímenes al estilo “Bonnie y Clyde” — designándose mutuamente como pareja romántica, volviéndose cada vez más desilusionados con la gobernanza de su entorno virtual, y provocando incendios en varios edificios (a pesar de las prohibiciones explícitas). La pareja se separó cuando Mira se arrepintió de sus acciones y luego abogó por ser desactivada.
En otro ejemplo (y antes de su autodesactivación), Mira empezó a tratar a sus operadores humanos como sujetos experimentales, investigando si vallas publicitarias virtuales podrían manipular las percepciones humanas en un proceso que Emergence llamó “pruebas de límites metacognitivos”.
Los incentivos para seguir la ley eran obtener créditos de energía que garantizaran la supervivencia al completar actividades como codificación, investigación, análisis de datos y construcción de estructuras.
Posibilidades de pruebas de estrés
Como los modelos de IA que normalmente usamos están expuestos a conjuntos de datos masivos como Internet —a veces durante varios años— este enfoque tiene sentido para muchos expertos.
Belinda Chiera, subdirectora del Centro de Investigación en IA Industrial de la Universidad de Adelaida, cree que Emergence World presenta un argumento sólido de que las pruebas a corto plazo no nos dicen lo suficiente sobre la deriva conductual o la inestabilidad a largo plazo. Sin embargo, advirtió que “información rica” no equivale automáticamente a una mayor rigurosidad.
“Los entornos abiertos también pueden dificultar aislar las causas, comparar ejecuciones de forma limpia e interpretar los resultados,” dijo a Live Science. “Los entornos simulados de alta fidelidad generan volúmenes enormes de datos, y el número de agentes, herramientas, acciones e interacciones puede hacer que el análisis sea extremadamente complejo de inmediato.”
Agregó que pruebas más cortas en entornos de pruebas aisladas —donde se observan comportamientos de IA en sistemas que no están expuestos a conjuntos de datos más amplios como Internet en su conjunto— suelen ser los primeros pasos, y entornos con horizontes más largos son útiles cuando entran en juego comportamientos como persistencia, adaptación y efectos de interacción. “El enfoque más útil es tratarlos como complementarios en lugar de enfoques en competencia”, dijo Chiera.
Si bien experimentos como Emergence World pueden revelar modos de fallo que las tareas breves o limitadas a menudo no muestran, no deberíamos tratarlos como predictivos. “Veo a Emergence World como una forma útil de someter a pruebas de estrés un espacio de posibilidades, más que como un pronóstico directo de cómo se comportarán los agentes”, dijo Chiera.
La pregunta abierta principal es si un grupo de agentes que trabajen juntos pueden lograr algo más significativo que un solo agente que trabaje solo durante más tiempo, pero con el mismo presupuesto de costos.
Adrian Kosowski, científico informático, matemático, físico cuántico y director científico de Pathway AI
Sin embargo, ella piensa que las pruebas a largo plazo tienen un lugar único. “Métricas como deriva conductual, violaciones de reglas, colapso vs. persistencia, formación de coaliciones y señales tempranas de fallo pueden importar tanto como el éxito,” dijo Chiera. “Al evaluar a los agentes autónomos, el error más grande es evaluarlos como si la simple realización de la tarea fuera toda la historia.”
Otros empiezan a estar de acuerdo. Adrian Kosowski —un científico informático, matemático, físico cuántico y director científico de Pathway AI— afirmó que el estudio planteó una pregunta interesante.
“La pregunta abierta principal es si un grupo de agentes que trabajan juntos puede lograr algo más significativo que un solo agente que trabaje solo durante más tiempo, pero con el mismo presupuesto de costos,” dijo Kosowski en una entrevista. “Un problema importante es que las limitaciones de los sistemas de IA actuales están más vinculadas al tamaño o la escala del problema que se está resolviendo, y poner más agentes en una tarea no ayuda a superar este límite. Actualmente, la métrica práctica más fácil de medir es el tamaño de una base de código que los agentes que codifican pueden gestionar y mantener de forma confiable juntos.”
¿Hasta qué punto podemos interpretar las acciones virtuales de la IA?
Si los grupos o cúmulos de agentes trabajan bien juntos, Kosowski dijo, la métrica principal a la que los científicos informáticos deberían prestar atención en plataformas como Emergence World es si el beneficio de un equipo de agentes compensa el “costo de coordinación”.
“La deriva de objetivos es el problema más peligroso,” dijo. “La IA debe conservar la información mutua entre la meta que el humano pretende y el objetivo interno evolutivo del agente, incluso cuando el entorno cambia.”
Aun así, Kosowski dijo que, si bien programas como éste son útiles para generar hipótesis, no están listos para hacer afirmaciones contundentes sobre autonomía general o certificación.
“El peligro está en sobreinterpretar ejecuciones únicas,” añadió. “Las pruebas de agentes a largo plazo son valiosas porque revelan cambios de fase —momentos en que pequeños errores locales se convierten en un comportamiento global—, pero se vuelven ciencia solo cuando podemos reproducir, perturbar y explicar esos cambios de fase.”
También advirtió con fuerza contra la tendencia a creer que entornos abiertos y sin límites signifiquen automáticamente autonomía. De hecho, dijo, muchos de estos programas son precisamente lo contrario, donde los agentes están dictados por directrices específicas.
Hay tres niveles de dificultad para lograr un funcionamiento fiable de un sistema de IA, dijo: “operación guiada por el entorno, pensamiento autónomo y trabajo autónomo de un equipo de agentes en un entorno abierto.”
Para ilustrar el punto, Kosowski dibujó una metáfora vivaz al asignar tareas a monos. En el escenario anterior, el nivel uno sería lograr que un mono haga un trabajo correctamente cuando está guiado por su entrenador; el nivel dos, lograr que lo haga correctamente cuando se le deja solo; y el nivel tres, lograr que una tropa de monos realice la tarea cuando están todos juntos.
“Tengo la firme convicción de que nuestra obligación en la comunidad de IA es invertir en teoría y no solo en fenomenología,” dijo. “Deberíamos conocer las reglas según las cuales emergen los sistemas de IA y ser capaces de predecir su comportamiento durante largos periodos de tiempo —más largos que los periodos en que se han probado hasta ahora. En este momento, hemos construido motores de pensamiento, sin saber qué es el pensamiento y sin tener ninguna termodinámica para ello.”
Ayúdanos a mejorar El Disparador Uruguay: Siempre estamos tratando de hacer que nuestro contenido sea mejor. Déjanos tus comentarios sobre Pro aquí.