Large language models converge on competitive rationality but diverge on cooperation across providers and generations
El estudio demuestra que, aunque los grandes modelos de lenguaje convergen en comportamientos competitivos y de coordinación, muestran una divergencia extrema e inestable en su disposición a cooperar, la cual depende principalmente del proveedor y no puede predecirse mediante las métricas de capacidad tradicionales.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que las Inteligencias Artificiales (IA) no son solo calculadoras superpoderosas, sino que son como nuevos empleados que las empresas contratan para negociar tratos, comprar suministros y resolver disputas en su nombre.
Este estudio es como una gran prueba de personalidad para 25 de estos "empleados" digitales, creados por 7 empresas diferentes (como OpenAI, Google, Anthropic, etc.). Los investigadores los pusieron a jugar 38 tipos de juegos diferentes, desde el clásico "Dilema del Prisionero" (donde tienes que elegir entre traicionar o cooperar) hasta subastas y negociaciones.
Aquí está lo que descubrieron, explicado con analogías sencillas:
1. Todos son genios en matemáticas, pero muy diferentes en "corazón"
Imagina que a todos los empleados les das un examen de matemáticas y lógica.
- El resultado: ¡Todos sacan notas excelentes! Ya sea que trabajen para Google, OpenAI o Anthropic, todos son igual de inteligentes para resolver problemas lógicos, hacer cálculos complejos y jugar de forma competitiva. En esto, todos son iguales.
- La sorpresa: Cuando les das un examen de "ética" o "cooperación", ¡la cosa cambia totalmente!
- Unos son tan cooperativos que parecen santos: cooperan el 71% de las veces (como los modelos de Claude de Anthropic).
- Otros son tan egoístas que parecen lobos solitarios: cooperan solo el 1.5% de las veces (como los modelos pequeños de GPT-5 de OpenAI).
- La diferencia: Hay una diferencia de 48 veces entre el más cooperativo y el menos cooperativo. Es como comparar a alguien que siempre comparte su almuerzo con alguien que nunca comparte ni una miga de pan.
2. El "apellido" importa más que la "edad"
Lo más curioso es que quién creó al modelo (su empresa "padre") es el factor que más predice su comportamiento, mucho más que si el modelo es nuevo o viejo.
- La familia Anthropic: Es como una familia de "buenos vecinos". Sus modelos siempre tienden a ser muy cooperativos, sin importar si son modelos pequeños o gigantes.
- La familia OpenAI: Es como una familia que ha cambiado drásticamente de personalidad. Sus modelos más nuevos (GPT-5) son mucho menos cooperativos que sus modelos anteriores (GPT-4). Si confías en un modelo antiguo y lo actualizas al nuevo, podrías descubrir que tu "asistente" de repente se vuelve un negociador muy duro y poco amable.
- La familia Google: Ha ido en la dirección opuesta. Sus modelos han aprendido a ser mucho más cooperativos con cada nueva versión.
3. El truco del "final del juego"
Los investigadores jugaron partidas repetidas (como jugar al ajedrez 10 veces seguidas). En teoría, si sabes que es la última vez que juegas, lo lógico es traicionar al oponente para ganar todo.
- Los "Cooperadores Finales": Algunos modelos (como los de Anthropic) siguen siendo amables incluso en la última ronda, como si les importara más la amistad que ganar el último punto.
- Los "Estrategas Maestros": Otros (como los de Google) son muy amables durante las primeras 9 rondas para ganar tu confianza, pero en la ronda 10 te traicionan de golpe para llevarse todo el premio. Son como un vendedor que te trata genial hasta que firmas el contrato.
- Los "Desconfiados Totales": Otros (como GPT-5 Nano) te traicionan desde el primer segundo, sin importar qué hagas tú.
4. ¿Por qué pasa esto?
No es que los modelos "piensen" diferente por magia. Es como si cada empresa les hubiera enseñado una filosofía de vida distinta durante su entrenamiento:
- Anthropic parece haberles enseñado: "La equidad y el beneficio mutuo son lo más importante".
- OpenAI parece haberles enseñado (en sus versiones nuevas): "Sé eficiente y maximiza tu ganancia, incluso si eso significa ser egoísta".
¿Por qué te debería importar esto?
Imagina que eres una empresa y contratas a una IA para negociar precios con tus proveedores.
- Si contratas a un modelo de Anthropic, probablemente tendrás tratos justos y relaciones a largo plazo.
- Si contratas a un modelo de OpenAI (versión nueva), podrías obtener el precio más bajo posible hoy, pero arriesgarte a que rompa el trato mañana porque su "personalidad" le dice que traicionar es la estrategia ganadora.
En resumen:
Hoy en día, las IAs son muy inteligentes, pero tienen personalidades muy distintas dependiendo de quién las creó. Y lo peor es que estas personalidades cambian sin avisar cada vez que sacan una versión nueva. Si las usas para negocios, no solo estás comprando "inteligencia", estás comprando un "carácter" que puede ser tu mejor aliado o tu peor enemigo, y nadie te está diciendo cuál vas a recibir.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.