← Últimos artículos
💬 NLP

Semantic Variability of Replies Across LLMs: Implications for Designing Conversation-Based Assessment

Este estudio demuestra que la elección del LLM y el contexto conversacional impactan significativamente en la consistencia semántica de las respuestas generadas, lo que sugiere que las estrategias de prompting actuales son insuficientes para garantizar respuestas estables y comparables entre diferentes modelos en evaluaciones basadas en la conversación.

Autores originales: Jiangang Hao

Publicado 2026-08-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jiangang Hao

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo moderno de la educación, medir qué tan bien las personas se comunican y trabajan juntas ha sido durante mucho tiempo un problema obstinado. A diferencia de un examen de matemáticas donde un solo número demuestra que un estudiante sabe la respuesta, habilidades como la colaboración ocurren en el flujo desordenado y constante de la conversación. Para medir esto de manera justa, los educadores deben asegurar que cada estudiante enfrente un desafío similar, incluso si la conversación toma un camino diferente. Recientemente, la inteligencia artificial ha ofrecido una nueva forma de resolver esto. Al utilizar programas informáticos que pueden hablar y escuchar, las escuelas pueden crear compañeros virtuales para que los estudiantes practiquen con ellos. Estos programas pueden adaptarse a lo que dice el estudiante, creando una conversación natural que revela qué tan bien está pensando y trabajando el alumno. Sin embargo, una preocupación silenciosa ha crecido entre los expertos: si el programa informático cambia, ¿cambia también la conversación? Si un estudiante toma un examen hoy con una versión del software y otro estudiante lo toma el próximo año con una versión más nueva, ¿estarán respondiendo las mismas preguntas de la misma manera? Esta pregunta toca el corazón de la equidad. Si las respuestas de la computadora cambian drásticamente dependiendo de qué modelo la ejecute, la prueba podría dejar de medir la capacidad del estudiante y empezar a medir las peculiaridades del software.

Un investigador del Educational Testing Service se propuso investigar precisamente este problema. Quería saber si el significado de la respuesta de una computadora permanece igual cuando el software subyacente cambia. Para averiguarlo, no inventó conversaciones falsas. En su lugar, tomó mensajes reales de proyectos científicos en línea del pasado donde dos personas trabajaron juntas para resolver problemas. Seleccionó 61 momentos específicos de estos chats donde una persona había dicho algo importante y la otra persona había dado una respuesta clara y útil. El investigador luego pidió a cuatro versiones diferentes de un modelo de lenguaje de gran tamaño —un tipo de inteligencia artificial diseñada para comprender y generar lenguaje humano— que respondieran a esos mismos 61 mensajes. Realizó este experimento dos veces para cada mensaje. En la primera ejecución, la computadora vio solo el mensaje individual que debía responder. En la segunda ejecución, vio ese mensaje más todo el historial de la conversación que le precedía. Por cada uno de los mensajes, cada modelo de computadora generó 100 respuestas diferentes para ver cuánto variaban las respuestas.

Los resultados mostraron que tanto la elección del modelo de computadora como el contexto conversacional afectan la similitud de la respuesta. Cuando el investigador comparó las 100 respuestas generadas por un solo modelo, encontró que las respuestas eran bastante similares entre sí, con puntuaciones de similitud que oscilaban entre 0.715 y 0.795. Pero cuando compararon las respuestas de un modelo contra las respuestas de un modelo diferente, la similitud disminuyó significativamente. Era como si cada modelo tuviera su propia voz distintiva y su propia forma de pensar. El efecto de añadir el historial de la conversación dependió del modelo específico utilizado; en algunos casos, incluir el historial del chat mejoró ligeramente la alineación de las respuestas con las respuestas humanas, pero no hizo que los modelos estuvieran más de acuerdo entre sí en todos los casos. El estudio también encontró que los modelos más nuevos de la misma familia de software tendían a producir respuestas más similares entre sí que con los modelos más antiguos y diferentes. Esto sugiere que el "árbol genealógico" del software juega un papel significativo en cómo se comporta junto con las instrucciones específicas dadas.

Quizás lo más importante es que el investigador descubrió que confiar únicamente en el "prompting" (instrucciones) y el contexto conversacional puede no ser suficiente para garantizar un comportamiento de respuesta altamente similar cuando el LLM subyacente cambia. Incluso cuando se les dio a los modelos el mismo prompt y el mismo historial de conversación, la elección del modelo seguía provocando diferencias significativas en el contenido semántico de las respuestas. El estudio sugiere que confiar en la flexibilidad natural de estos sistemas de inteligencia artificial es arriesgado para las pruebas de alto impacto. Si una prueba depende de que la computadora mantenga la conversación en el camino correcto, y la computadora cambia su estilo cada vez que se actualiza, los resultados de la prueba podrían volverse poco fiables. El investigador concluyó que para construir un sistema de evaluación justo y duradero, no pueden limitarse a confiar en que el software haga lo correcto por sí solo. En su lugar, necesitan construir capas adicionales de control en el sistema —como reglas o plantillas— que aseguren que las respuestas de la computadora se mantengan dentro de un rango seguro y consistente, sin importar qué versión del software esté ejecutándose debajo. Sin estas salvaguardas, la rápida evolución de la inteligencia artificial podría socavar la misma equidad que la evaluación educativa pretende proteger.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →