Index SLM Technical Report
Bilibili presenta Index-1.9B, una serie de modelos de lenguaje pequeños y abiertos que cuentan con una base de 1.9 mil millones de parámetros entrenada con 2.8 billones de tokens con un esquema especializado de Warmup-Stable-Decay y una capa Norm-Head, la cual logra un rendimiento competitivo en evaluaciones estándar e incluye variantes para preentrenamiento puro, alineación de chat y juego de roles basado en personajes.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás construyendo un cerebro robótico diminuto, superinteligente, que cabe en tu bolsillo. La mayoría de la gente piensa que los cerebros más grandes siempre son mejores, pero un equipo en Bilibili decidió ver si podían crear un robot de 1.900 millones de parámetros (llamémoslo Index-1.9B) que diera la talla muy por encima de su peso. No se limitaron a encoger un modelo gigante; reconstruyeron el motor desde cero utilizando 2,8 billones de palabras de material de lectura, principalmente en chino e inglés.
Esta es la historia de cómo lo hicieron, qué descubrieron y las extrañas sorpresas que encontraron en el camino.
La receta secreta: Cómo entrenaron el cerebro
1. La lista de lectura (Datos)
Piensa en los datos de entrenamiento como la biblioteca del robot. No simplemente volcaron todo el internet ahí. Lo limpiaron como un bibliotecario organizando un desván desordenado. Eliminaron duplicados (¡incluso encontraron un menú de meses del año que se había copiado 156.000 veces por error!) y filtraron los sesgos.
- La mezcla: La biblioteca es principalmente libros y páginas web, pero se aseguraron de incluir un 6% de código y un 10% de contenido de alta calidad como artículos académicos y enciclopedias.
- La sorpresa: Descubrieron que leer "manuales de instrucciones" (como "Escribe un poema" o "Resuelve este problema matemático") durante la etapa final del entrenamiento hizo que el robot pareciera mucho más inteligente en las pruebas. De hecho, añadir solo un 7% de estos datos de instrucción aumentó sus puntuaciones en los exámenes en unos 7 puntos. Incluso lanzaron dos versiones del robot —una con esta lectura adicional y otra sin ella— para que todos pudieran ver exactamente cuánto ayudó.
2. La estructura del cerebro (Arquitectura)
Normalmente, cuando tienes una cantidad fija de "potencia cerebral" (parámetros), puedes hacer el cerebro ancho (muchas neuronas en una capa) o profundo (muchas capas apiladas).
- El hallazgo: El equipo probó un diseño "profundo y estrecho" (36 capas) frente a uno "ancho y superficial" (9 capas). El profundo ganó en todas las ocasiones. Es como construir un rascacielos en lugar de un almacén ancho y plano; para este tamaño, ir hacia arriba funcionó mejor que hacia los lados.
- El estabilizador: También añadieron una capa especial llamada "Norm-Head". Imagina que el cerebro del robot se marea un poco cuando intenta adivinar la siguiente palabra porque algunas palabras son raras. Esta nueva capa actúa como un estabilizador, manteniendo el cerebro tranquilo incluso cuando el robot está aprendiendo muy rápido.
3. El programa de aprendizaje (El método "WSD")
La mayoría de los robots aprenden a un ritmo constante o desaceleran gradualmente. Index-1.9B utiliza un programa de "Calentamiento–Estable–Decaimiento" (WSD, por sus siglas en inglés).
- La estrategia: Primero, se calienta. Luego, aprende a una velocidad constante y alta (la fase "Estable") mientras lee toda la biblioteca. Finalmente, en la fase de "Decaimiento", se ralentiza pero cambia a leer solo los mejores libros curados (los artículos académicos y las enciclopedias).
- El resultado: Esta combinación de ralentizarse mientras lee datos de alta calidad le dio el mayor impulso en su rendimiento.
La extraña sorpresa: El "Salto"
Aquí está la parte que incluso los autores aún no pueden explicar del todo.
Durante la fase "Estable", cuando el robot estaba leyendo a una velocidad constante, algo extraño sucedió. Entre los 1,0 y los 1,2 billones de tokens de lectura, las puntuaciones de las pruebas del robot dieron un salto repentino. Pasó de ser promedio a superar a varios modelos de 7B, sin cambiar la velocidad de aprendizaje ni el tipo de datos.
- La certeza: El artículo admite que esto es un misterio. Sugieren que tal vez la combinación de los datos de alta calidad con la alta velocidad de aprendizaje simplemente "encajó" en ese momento, pero no han probado exactamente por qué. Es como si un estudiante de repente entendiera todo tras leer un capítulo específico, aunque el profesor no haya cambiado la lección.
Las diferentes versiones del robot
El equipo no se detuvo en un solo modelo. Lanzaron toda una familia:
- Index-1.9B-Base: El cerebro puro y listo para cualquier cosa.
- Index-1.9B-Pure: Una versión de control que nunca leyó manuales de instrucciones. Esto demuestra que las puntuaciones "inteligentes" del modelo principal realmente provienen de esa lectura adicional.
- Index-1.9B-Chat: El modelo Base enseñado a hablar amablemente con los humanos, utilizando una técnica llamada "Optimización de Preferencia Directa" (DPO). Esto es como enseñarle al robot no solo a responder, sino a responder bien, mostrándole ejemplos de buenas frente a malas conversaciones.
- Index-1.9B-Character: Una versión que puede realizar juegos de rol. Utiliza un truco de "recuperación", donde consulta conversaciones pasadas con un personaje específico para mantener su personalidad. Es tan bueno en esto que clasifica por encima de muchos modelos mucho más grandes en pruebas de juego de rol.
Lo que puede (y no puede) hacer
Los triunfos:
- Inteligencia: En pruebas estándar de matemáticas, razonamiento y conocimiento general, Index-1.9B obtiene un promedio de 64,92. Esto es competitivo con, y a veces supera a, modelos que son varias veces más grandes. Específicamente, supera al modelo Llama-2-13B en la puntuación media general, aunque no vence a todos los modelos en cada benchmark contra todos los modelos más grandes.
- Lenguaje: Es excelente en chino e inglés. Además, el tokenizador que construyeron para el modelo logra las tasas de compresión más fuertes para japonés y coreano entre los tokenizadores que compararon, lo que lo hace eficiente para estos idiomas.
- Juego de rol: Puede interpretar personajes con alta consistencia, ocupando el 9º lugar general en una importante tabla de clasificación, superando a muchos modelos de 7B a 14B.
Los límites:
- Matemáticas y código: Aunque es decente, los autores admiten que estas siguen siendo áreas de mejora. No es un genio de las matemáticas todavía.
- Hechos: Debido a que es pequeño, todavía puede inventar hechos o malinterpretar instrucciones complejas.
- El misterio: ¿Ese repentino salto de rendimiento durante el entrenamiento? Todavía no saben exactamente por qué ocurrió.
La conclusión
El artículo demuestra que no necesitas un cerebro masivo y costoso para ser inteligente. Si alimentas a un robot pequeño con la mezcla adecuada de libros de alta calidad, le enseñas a leer profundamente en lugar de ampliamente, y le das un estabilizador especial para su cerebro, puede competir con los gigantes. También demostraron que los "datos de instrucción" (aprender a seguir órdenes) son un gran "truco de trampa" para las puntuaciones en los exámenes, y lanzaron la evidencia para que nadie pueda ocultar el hecho de que así es.
Es un modelo pequeño con una gran personalidad, algunas preguntas abiertas y un gran potencial.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.