← Últimos artículos
🤖 AI

Humans' ALMANAC: A Human Collaboration Dataset of Action-Level Mental Model Annotations for Agent Collaboration

El artículo presenta ALMANAC, un conjunto de datos de 2.987 anotaciones de modelos mentales a nivel de acción derivadas de la colaboración diádica humana en la Tarea del Mapa, diseñado para cerrar la brecha en el entrenamiento y la evaluación de la capacidad de los agentes de LLM para mantener modelos mentales alineados y simular comportamientos de colaboración humana.

Autores originales: Jiaju Chen, Yuxuan Lu, Jiayi Su, Chaoran Chen, Songlin Xiao, Zheng Zhang, Yun Wang, Yunyao Li, Jian Zhao, Tongshuang Wu, Toby Jia-Jun Li, Dakuo Wang, Bingsheng Yao

Publicado 2026-06-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jiaju Chen, Yuxuan Lu, Jiayi Su, Chaoran Chen, Songlin Xiao, Zheng Zhang, Yun Wang, Yunyao Li, Jian Zhao, Tongshuang Wu, Toby Jia-Jun Li, Dakuo Wang, Bingsheng Yao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando dibujar un mapa del tesoro con un amigo, pero están en habitaciones diferentes. Solo pueden comunicarse a través de un chat de texto. Una persona (el Guía) tiene el mapa original con el camino correcto trazado. La otra persona (el Seguidor) tiene un mapa en blanco con solo los puntos de referencia (como una montaña o un puente) pero sin el camino.

Para tener éxito, tienen que trabajar juntos: el Guía describe el camino y el Seguidor intenta dibujarlo.

Este es el núcleo de un nuevo proyecto de investigación llamado ALMANAC. Aquí está el desgino sencillo de lo que hicieron los investigadores y por qué es importante, utilizando analogías de la vida cotidiana.

1. El Problema: Los robots son buenos "haciendo", pero malos "pensando juntos"

Actualmente, los agentes de IA (como los chatbots avanzados) son excelentes siguiendo órdenes. Si dices "Reserva un vuelo", lo hacen. Pero la verdadera colaboración humana no es solo seguir órdenes; se trata de alineación mental.

Piensa en un equipo humano como una banda de jazz. No solo están leyendo una partitura; están constantemente escuchándose entre sí, adivinando qué va a tocar el otro músico y ajustando su propio ritmo en tiempo real. Tienen un "modelo mental compartido".

  • Razonamiento propio: "¿Por qué estoy tocando esta nota?"
  • Intención del compañero: "¿Qué está intentando hacer mi compañero de banda?"
  • Objetivo del equipo: "¿Seguimos intentando tocar una pieza de jazz o nos hemos desviado hacia el rock?"

El artículo argumenta que la IA actual es como un robot que solo sabe tocar su propio instrumento perfectamente, pero no tiene idea de qué está pensando el resto de la banda. Los conjuntos de datos existentes solo registran qué dijo la gente y qué hizo, pero omiten el porqué dentro de sus cabezas.

2. La Solución: ALMANAC (El conjunto de datos de "lectura de mente")

Los investigadores construyeron un nuevo conjunto de datos llamado ALMANAC para solucionar esto. Tomaron la "Tarea del Mapa" descrita anteriormente y añadieron una capa especial de observación.

Cómo recolectaron los datos:

  1. El Juego: 50 personas jugaron la Tarea del Mapa en parejas (25 parejas en total).
  2. Los "Puntos de Control": Cada vez que la pareja alcanzaba el 25%, 50% y 75% de la tarea, el juego se pausaba brevemente. Los jugadores tenían que hablar rápidamente por un micrófono y responder: "¿Cuál crees que es nuestro objetivo en este momento?", "¿Qué crees que está intentando hacer tu compañero?" y "¿Por qué acabas de hacer eso?".
  3. La Repetición: Después del juego, los jugadores veían una repetición de sus propias acciones. Por cada movimiento que realizaban (dibujar una línea, borrar un error, enviar un mensaje), tenían que etiquetar de nuevo su estado mental.

El Resultado:
Terminaron con 2,987 acciones específicas, y para cada una de ellas, tienen un registro de:

  • La acción realizada (ej. "Dibujó una línea").
  • El Objetivo del Equipo (ej. "Estamos intentando conectar el puente con la montaña").
  • La Intención del Compañero (ej. "Creo que mi compañero está confundido sobre la dirección").
  • El Razonamiento Propio (ej. "Dibujé esto porque pensé que la montaña estaba a la izquierda").
  • Una Justificación (una explicación de formato libre de su proceso de pensamiento).

3. El Experimento: ¿Puede la IA "leer mentes"?

Los investigadores probaron seis modelos de IA diferentes (incluyendo modelos grandes como GPT-5.5 y Claude) para ver si podían usar este nuevo conjunto de datos para actuar como un colaborador humano. Le dieron a la IA dos tareas:

  1. Predecir el Siguiente Movimiento: "Basándote en lo que ha ocurrido hasta ahora, ¿qué hará el humano después?"
  2. Predecir el Estado Mental: "Basándote en lo que ha ocurrido hasta ahora, ¿qué está pensando el humano en este momento?"

Los Hallazgos:

  • El "Qué" es fácil, el "Por qué" es difícil: Los modelos de IA fueron bastante buenos prediciendo la siguiente acción (ej. "El humano probablemente dibujará una línea").
  • La "Mente" es complicada: Los modelos tuvieron dificultades para predecir los pensamientos internos (los modelos mentales). Podían adivinar el objetivo compartido (ej. "Estamos construyendo un puente") razonablemente bien, pero eran pésimos adivinando el razonamiento privado y personal del humano (ej. "Estoy dibujando esto porque estoy nervioso").
  • El Rol Importa:
    • Los Guías (quienes dan instrucciones) eran más difíciles de predecir mentalmente para la IA porque sus pensamientos implican una planificación espacial compleja que no siempre se expresa en voz alta.
    • Los Seguidores (quienes dibujan) eran más fáciles de predecir mentalmente porque sus pensamientos están directamente moldeados por las instrucciones explícitas del Guía.
  • El Entrenamiento Ayuda: Cuando "enseñaron" (ajuste fino o fine-tuning) a un modelo de IA más pequeño usando este conjunto de datos específico, este mejoró mucho en la simulación del comportamiento humano, casi alcanzando a los modelos gigantes y costosos.

4. La Conclusión

El artículo concluye que para que la IA sea un verdadero colaborador, no podemos limitarnos a entrenarla en cómo completar tareas. Necesitamos entrenarla en cómo piensan los humanos mientras trabajan juntos.

ALMANAC es el primer conjunto de datos que empareja las acciones humanas con estos "modelos mentales a nivel de acción". Demuestra que, si bien la IA está mejorando en la simulación del comportamiento humano, todavía lucha por comprender el razonamiento interno e invisible que hace que el trabajo en equipo humano funcione. El conjunto de datos proporciona las "ruedas de entrenamiento" necesarias para enseñar a la IA a alinear su modelo mental con el de un humano, en lugar de simplemente seguir órdenes a ciegas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →