← Últimos artículos
💬 NLP

Measuring Form and Function in Language Models

Este artículo introduce la métrica de Elección Alternativa Contextual (CAC) para evaluar cuantitativamente los modelos de lenguaje en las propiedades sintácticas formales y funcionales del discurso de los determinantes en inglés, revelando que, aunque algunos modelos muy grandes pueden igualar el rendimiento de los niños humanos en ambas pruebas, ningún modelo actual entrenado con datos comparables logra esto simultáneamente.

Autores originales: Héctor Javier Vázquez Martínez, Charles Yang

Publicado 2026-05-28
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Héctor Javier Vázquez Martínez, Charles Yang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a hablar como un humano. Tienes dos formas de verificar si funciona:

  1. La Prueba de Gramática: ¿Dice "El gato" en lugar de "Gato el"? (Forma correcta)
  2. La Prueba de Conversación: ¿Sabe cuándo decir "El gato" frente a "Un gato" basándose en lo que acaba de decir la otra persona? (Función correcta)

Este artículo trata sobre construir una mejor prueba para los Modelos de Lenguaje (LLM) observando cómo aprenden a hablar los niños reales. Los autores, investigadores de la Universidad de Pensilvania, argumentan que hemos estado probando la IA demasiado como un examen de gramática y muy poco como una conversación real.

Aquí está el desglose de su trabajo usando analogías simples:

1. El Problema: La Trampa de la "Opción Múltiple"

La mayoría de las pruebas de IA actuales son como exámenes de opción múltiple. Le muestras a la IA dos oraciones:

  • "El perro ladró."
  • "Perro el ladró."
    Y preguntas: "¿Cuál es la correcta?"

La IA usualmente acierta esto. Pero los autores dicen que esto es como probar a un niño pidiéndole que señale una imagen de un perro frente a un gato. No demuestra que entiendan cómo usar la palabra en una historia real. Los niños reales no toman exámenes de opción múltiple; simplemente hablan. Para saber realmente si una IA está "aprendiendo" como un humano, necesitamos ver cómo maneja el flujo desordenado y de ida y vuelta de una conversación real.

2. La Nueva Herramienta: "Elección Alternativa Contextual" (CAC)

Los autores inventaron una nueva forma de probar la IA llamada CAC. Piénsalo como un juego de "completar los espacios en blanco", pero con un giro.

  • La Configuración: Toman una grabación real de una madre hablando con su hijo de 2 años.
  • El Juego: Ocultan la palabra que usó el niño (usualmente una palabra pequeña como "el" o "un") y le preguntan a la IA: "Dado lo que la mamá acaba de decir, ¿qué palabra debería ir aquí?"
  • El Objetivo: No solo quieren que la IA elija la palabra correcta. Quieren ver si el patrón de elecciones de la IA coincide con el patrón del niño.

3. Las Dos Métricas (La Puntuación)

Los autores crearon dos puntuaciones específicas para ver si la IA se comporta como un niño humano.

Puntuación A: La Prueba de "Mezclar y Combinar" (Productividad Formal)

  • El Concepto: Un niño inteligente sabe que "el" y "un" pueden ir con casi cualquier sustantivo. No solo están memorizando "el perro" y "un gato". Conocen la regla.
  • La Prueba: Los investigadores observan cuántos sustantivos diferentes usa la IA con "el" y "un". Si la IA solo usa "el" con palabras específicas que memorizó, reprueba. Si los mezcla libremente con muchas palabras diferentes, aprueba.
  • El Resultado: Muchos modelos de IA aprobaron esto. Aprendieron la regla de "mezclar y combinar".

Puntuación B: La Prueba de "Flujo de Conversación" (Función del Discurso)

  • El Concepto: Esta es la parte difícil. En una conversación real, si una mamá dice: "Mira al perro", el niño usualmente responde: "El perro es grande". Pero si la mamá dice: "Veo un perro", el niño podría decir: "Un perro está corriendo".
    • A veces mantienes la misma palabra ("el" -> "el").
    • A veces cambias ("un" -> "el").
    • El cambio depende enteramente del contexto de la historia.
  • La Prueba: Los investigadores midieron con qué frecuencia la IA cambiaba palabras en comparación con la frecuencia con la que los humanos reales cambian palabras.
  • El Resultado: Aquí es donde la mayoría de las IAs fallaron. Incluso los modelos grandes e inteligentes tendían a cambiar palabras aleatoriamente, como un lanzamiento de moneda. No parecían entender la historia detrás de las palabras. Conocían la gramática, pero no conocían las reglas sociales de la conversación.

4. La Gran Sorpresa

Los autores probaron 45 modelos de IA diferentes.

  • Los Modelos "Pequeños": Los modelos entrenados con aproximadamente la misma cantidad de datos que un niño de 2 años (10–20 millones de palabras) generalmente fallaron ambas pruebas. No habían aprendido lo suficiente.
  • Los Modelos "Grandes": Los modelos masivos entrenados con miles de millones de palabras (del tamaño de todo internet) lo hicieron mucho mejor.
    • Dos modelos aprobaron ambas pruebas. Sonaron como humanos tanto en gramática como en flujo de conversación.
    • Un modelo aprobó la prueba de conversación pero falló la prueba de gramática.
    • Muchos otros aprobaron la prueba de gramática pero fallaron la prueba de conversación.

5. La Conclusión

El artículo concluye que el tamaño importa, pero no es todo.

Solo porque una IA pueda aprobar un examen de gramática no significa que entienda el lenguaje como lo hace un humano. Podría estar simplemente memorizando patrones. Para ser verdaderamente un "modelo cognitivo" del aprendizaje humano, una IA necesita aprobar la prueba de "Flujo de Conversación", mostrando que entiende por qué elegimos ciertas palabras basándonos en la historia que estamos contando.

Actualmente, solo los modelos más grandes están comenzando a mostrar esta comprensión similar a la humana, pero incluso ellos son una mezcla. Los autores sugieren que si queremos construir una IA mejor, debemos dejar de tratarlos como estudiantes tomando un examen y empezar a tratarlos como niños pequeños en una conversación.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →