← Últimos artículos
💬 NLP

Vectors from Larger Language Models Predict Human Reading Time and fMRI Data More Poorly when Dimensionality Expansion is Controlled

Este estudio demuestra que al controlar la expansión de la dimensionalidad mediante el uso de modelos de lenguaje de gran tamaño no entrenados, el poder predictivo de los vectores de LLM entrenados para el tiempo de lectura humana y los datos de fMRI exhibe un escalado inverso, con el valor añadido del entrenamiento disminuyendo a cero con tan solo unos pocos miles de millones de parámetros.

Autores originales: Yi-Chien Lin, Hongao Zhu, William Schuler

Publicado 2026-09-01
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Yi-Chien Lin, Hongao Zhu, William Schuler

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Durante décadas, los científicos han observado cómo las computadoras aprenden a leer y escribir con una velocidad que parece casi biológica. Estas máquinas, conocidas como modelos de lenguaje de gran tamaño, son entrenadas con vastas bibliotecas de texto humano hasta que pueden predecir la siguiente palabra en una oración con una precisión sorprendente. Debido a que manejan el lenguaje tan bien, los investigadores comenzaron a preguntarse si estas máquinas no solo nos estaban imitando, sino que en realidad estaban reflejando la forma en que nuestros propios cerebros procesan el lenguaje. La esperanza predominante era que, a medida que estos modelos se volvieran más grandes y complejos, mejorarían cada vez más en su capacidad para predecir cuánto tiempo tarda un humano en leer una palabra, o cómo nuestros cerebros se iluminan cuando escuchamos una historia. Esta idea sugería que la arquitectura de estas mentes digitales podría ser un mapa de la arquitectura del pensamiento humano, implicando que cualquier falla al coincidir con los datos humanos era simplemente una cuestión de necesitar más potencia de cómputo.

Sin embargo, un nuevo estudio de investigadores de la Universidad Estatal de Ohio y la Universidad de California, San Diego, desafía esta visión optimista. Descubrieron que cuando controlaron cuidadosamente el tamaño masivo de los datos que estos modelos producían, la relación entre el tamaño del modelo y el rendimiento similar al humano cambió de una manera específica: el beneficio adicional del entrenamiento desapareció. En lugar de que el proceso de entrenamiento hiciera a los modelos más grandes significativamente mejores que sus contrapartes no entrenadas, los modelos más grandes no funcionaban mejor que las versiones no entrenadas del mismo tamaño. El estudio sugiere que el éxito aparente de estos sistemas masivos fue en gran medida una ilusión creada por el enorme volumen de información al que podían acceder, más que un entendimiento genuino del lenguaje. Cuando los investigadores eliminaron esta ventaja, el entrenamiento que hacía que estos modelos fueran tan poderosos no pareció ofrecer ningún beneficio extra sobre una versión completamente no entrenada de la misma máquina.

Para entender cómo llegaron a esta conclusión, uno debe primero observar cómo se prueban típicamente estos modelos. Los investigadores suelen introducir una historia en un modelo de lenguaje y comparan el estado interno del modelo con datos humanos, como cuánto tiempo hace una pausa una persona en una palabra específica o cómo responde su cerebro a una oración. En estudios previos, parecía que los modelos más grandes, que tienen más variables internas con las que trabajar, predecían consistentemente mejor el comportamiento humano. Esto llevó a una teoría llamada la hipótesis de "calidad-potencia": cuanto más grande es el modelo, más se asemeja a la mente humana. Pero los investigadores sospechaban de un error oculto en esta lógica. Cuando un modelo se hace más grande, no solo se vuelve más inteligente; también produce un número mucho mayor de señales internas, o vectores, para analizar. Es como darle a un estudiante un examen con el doble de preguntas; incluso si el estudiante no sabe nada, tener más preguntas le da más oportunidades de adivinar la respuesta correcta por suerte. Los investigadores se dieron cuenta de que los estudios previos podrían haber estado midiendo el beneficio de tener más preguntas, en lugar del beneficio de tener un mejor cerebro.

Para resolver este rompecasas, el equipo diseñó una serie de experimentos que separaron el efecto del tamaño del efecto de la inteligencia. Reunieron datos de cinco familias diferentes de modelos de lenguaje, que iban desde modelos pequeños con unos pocos cientos de millones de parámetros hasta modelos masivos con 66 mil millones de parámetros. Probaron estos modelos contra datos humanos reales, incluyendo tiempos de lectura de personas leyendo historias naturales y escaneos cerebrales de personas escuchando esas mismas historias. En su primer experimento, replicaron los hallazgos anteriores: a medida que los modelos crecían, sus predicciones del comportamiento humano parecían mejorar. Esto confirmó que el efecto de "calidad-potencia" era visible en la superficie.

Pero luego, introdujeron un control crucial. Tomaron los mismos modelos y los observaron antes de ser entrenados en cualquier texto en absoluto. Estos modelos no entrenados tienen exactamente el mismo tamaño y estructura que los entrenados, pero son esencialmente ruido aleatorio, sin conocimiento del lenguaje. Al comparar los modelos entrenados contra sus gemelos no entrenados, los investigadores pudieron ver cuánto de la mejora provenía del aprendizaje real y cuánto provenía simplemente de tener un mayor número de señales internas con las que trabajar. Utilizaron un método similar a un reservorio, donde una red no entrenada de gran tamaño actúa como una fuente de materia prima que puede ser moldeada por un clasificador simple. Si el entrenamiento realmente estaba haciendo al modelo más humano, la versión entrenada debería haber superado significativamente a la versión no entrenada, especialmente a medida que los modelos crecían.

Los resultados fueron sorprendentes. Cuando los investigadores controlaron el tamaño de las señales internas, la ventaja extra del entrenamiento desapareció. De hecho, para modelos de más de unos pocos miles de millones de parámetros, las versiones entrenadas no funcionaron mejor que las no entrenadas. En varios conjuntos de datos, el beneficio adicional del entrenamiento cayó a cero. Esto significa que las mejoras masivas observadas en estudios anteriores no se debieron a que los modelos más grandes hubieran aprendido un entendimiento más profundo del lenguaje, sino simplemente porque tenían más dimensiones internas para ajustar los datos. Los investigadores encontraron que, a medida que los modelos crecían más allá de cierto punto, la contribución del entrenamiento al ajuste del modelo sobre una línea base no entrenada caía a cero, en lugar de aumentar. Cuanto más grande se volvía el modelo, menos añadía el proceso de entrenamiento al poder predictivo proporcionado únicamente por el tamaño del modelo.

El estudio también analizó diferentes capas dentro de los modelos, verificando si las secciones medias de la red, que algunos trabajos previos sugerían que eran más importantes, se comportaban de manera diferente. Encontraron el mismo patrón: la contribución del entrenamiento cayó a cero en todas las capas a medida que los modelos crecían. Incluso cuando ajustaron sus métodos estadísticos para dar cuenta de la posibilidad de que los modelos simplemente estuvieran alcanzando un límite en qué tan bien podían predecir los datos humanos, la tendencia se mantuvo. Los investigadores concluyeron que el éxito de estos grandes modelos en la predicción del comportamiento humano se debe en gran medida a un efecto estadístico donde tener más variables permite un mejor ajuste, en lugar de ser un reflejo genuino de la cognición humana.

Este hallazgo sugiere una desalineación significativa entre la forma en que estos sistemas artificiales están construidos y la forma en que funcionan los cerebros humanos. El proceso de entrenamiento que hace que estos modelos sean tan buenos generando texto no necesariamente los hace mejores modelos de la lectura o la actividad cerebral humana. De hecho, el estudio argumenta que las versiones no entrenadas de estas redes masivas, que actúan como reservorios complejos de conexiones aleatorias, podrían ser tan efectivas como las versiones costosas y totalmente entrenadas para predecir datos humanos. Los investigadores proponen que los estudios futuros deberían usar estos modelos no entrenados como un estándar de referencia para asegurar que cualquier mejora atribuida al entrenamiento sea real y no solo un subproducto del tamaño del modelo. Si bien la idea de que "más grande es mejor" ha impulsado el campo durante años, este trabajo sugiere que, en el ámbito del procesamiento del lenguaje humano, hay un punto donde añadir más tamaño y entrenamiento no nos acerca a la comprensión de la mente humana, sino que nos aleja de ella.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →