← Últimos artículos
💬 NLP

Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs

Este estudio evalúa la capacidad de siete Modelos de Lenguaje Grandes para inferir conocimientos individuales de dominio a partir de registros de comunicación en Slack comparando sus estimaciones sin entrenamiento previo con habilidades autoinformadas, encontrando que, aunque Gemini 2.5 Flash logró la mayor precisión, el rendimiento de inferencia depende débilmente del volumen de mensajes y destaca la necesidad de enfoques que preserven la privacidad y sean conscientes de la estructura.

Autores originales: Ko Watanabe, Shoya Ishimaru

Publicado 2026-05-25
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ko Watanabe, Shoya Ishimaru

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que entras en una oficina masiva y bulliciosa. Tienes un problema complicado, pero no sabes a quién preguntar. ¿Es la persona en la esquina que habla de programación todo el día? ¿O la que parece saberlo todo sobre la gestión de proyectos? Por lo general, tendrías que deambular, preguntar a algunas personas y esperar encontrar al experto adecuado. Este "juego de adivinanzas" desperdicia tiempo y dinero.

Este artículo plantea una pregunta sencilla: ¿Puede una IA actuar como un becario superobservador que lee el historial de chat de todos y te dice instantáneamente quién sabe qué?

Aquí está el desglose de su experimento, explicado de forma sencilla:

La Configuración: El "Detective de Chats"

Los investigadores tomaron una pila gigante de mensajes de chat reales de la cuenta de Slack de una empresa (aproximadamente 27.000 mensajes de 43 personas a lo largo de varios años). Alimentaron estos mensajes en siete "supercerebros" diferentes (Modelos de Lenguaje Grandes como GPT, Claude y Gemini).

Piensa en estos modelos de IA como diferentes tipos de detectives:

  • Algunos son rápidos pero quizás un poco superficiales (como un escáner rápido).
  • Algunos son lentos pero pensadores profundos (como un profesor analizando un libro).
  • Algunos son generalistas, mientras que otros son especialistas.

La tarea de la IA era leer los chats y crear un "informe de habilidades" para cada persona. Por ejemplo, si alguien seguía hablando de "Python" y "Ciencia de Datos", la IA adivinaría: "Esta persona sabe Python".

La Verificación de la Realidad: El "Autoreporte"

Para ver si la IA era realmente buena en su trabajo, los investigadores pidieron a los humanos reales que se calificaran a sí mismos. Crearon un sitio web simple donde cada persona veía la lista de habilidades que la IA había encontrado y decía: "Sí, sé esto", o "No, no sé".

Luego, los investigadores compararon la suposición de la IA con la respuesta real del humano. Es como un profesor calificando la suposición de un estudiante sobre las respuestas de un examen frente a la hoja de respuestas real.

Los Resultados: ¿Quién ganó el concurso?

Los investigadores probaron siete modelos de IA diferentes. Así es como se clasificaron:

  1. El Ganador: Gemini 2.5 Flash fue el mejor adivino. Se equivocó en aproximadamente 21 puntos en una escala de 0 a 100. (Si el humano dijo que era un 80% experto, la IA adivinó alrededor del 59% o el 101%).
  2. El Subcampeón: Gemini 2.5 Pro estuvo muy cerca.
  3. El Grupo Intermedio: Los modelos Claude (Haiku y Sonnet) estuvieron bien, pero no tan agudos como los modelos Gemini.
  4. Los que Tuvieron Dificultades: Los modelos GPT (incluyendo el muy famoso GPT-4o y GPT-5) tuvieron el peor rendimiento. Se equivocaron en aproximadamente 33 puntos de media.

La Gran Conclusión: Incluso la mejor IA no fue perfecta. Podía captar la idea general de quién sabía qué, pero no podía identificar el nivel exacto de experiencia con alta precisión.

El Giro Sorprendente: Más Texto ≠ Mejores Adivinanzas

Podrías pensar: "Si le doy a la IA un millón de mensajes en lugar de mil, se volverá más inteligente, ¿verdad?"

No necesariamente. Los investigadores descubrieron que simplemente tener más historial de chat no hacía automáticamente que las suposiciones de la IA fueran más precisas.

  • ¿Por qué? Porque muchos mensajes de chat son solo "De acuerdo", "Entendido" o "¿Almuerzo a la 1?". Estos no te dicen lo que alguien sabe.
  • El Límite: Una vez que la IA tenía una cantidad mínima de chat con la que trabajar, añadir más no ayudaba mucho. Es como intentar adivinar la película favorita de alguien leyendo su lista de la compra; no importa cuán larga sea la lista, no te dirá mucho sobre sus gustos cinematográficos.

La Conclusión Final

El estudio demuestra que la IA puede echar un vistazo a nuestros registros de chat y hacer una suposición decente sobre nuestras habilidades. Es una herramienta útil para obtener un mapa aproximado de "quién sabe qué" en una empresa.

Sin embargo, aún no es una bola de cristal mágica. La IA todavía comete errores, y los famosos modelos GPT ni siquiera quedaron en primer lugar en esta prueba específica. Los investigadores también señalaron que, para que esto funcione en la vida real, las empresas tendrían que ser muy cuidadosas con la privacidad, ya que enviar chats privados de la empresa a servidores de IA externos es un tema delicado.

En resumen: La IA está mejorando en leer la sala, pero aún necesita aprender a distinguir entre la experiencia real de una persona y simplemente su cotilleo diario.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →