← Últimos artículos
🤖 machine learning

Tevatron Meets Megatron: Expert-Parallel LLM Reranker Training on an Academic Budget

Este artículo presenta Tevatron 3.0, un marco de trabajo adecuado para presupuestos académicos que integra Megatron-Core para permitir el entrenamiento eficiente de rerankers de MoE a gran escala mediante paralelismo de expertos, demostrando que un modelo MoE de 30 mil millones de parámetros puede igualar la calidad de los modelos densos de 8 mil millones mientras activa menos parámetros y logra un mayor rendimiento de inferencia.

Autores originales: Zhichao Xu, Xueguang Ma, Shengyao Zhuang, Luyu Gao, Wenqian Ye, Yu Wang, Jamie Callan, Jimmy Lin

Publicado 2026-08-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhichao Xu, Xueguang Ma, Shengyao Zhuang, Luyu Gao, Wenqian Ye, Yu Wang, Jamie Callan, Jimmy Lin

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de encontrar una aguja específica en un enorme y caótico pajar. En el mundo de la informática, esto se llama "búsqueda". Primero, una computadora lanza una red amplia para atrapar mil posibles agujas (esto es la etapa de "recuperación"). Pero esa red es desordenada; atrapa mucha paja y algunas agujas equivocadas. Para solucionar esto, una segunda computadora, más inteligente, interviene para observar de cerca cada candidato y decidir cuál es la aguja real. Este segundo paso cuidadoso se llama "reclasificación" (reranking).

Durante mucho tiempo, estas computadoras inteligentes fueron como pequeñas y eficientes calculadoras. Pero recientemente, los investigadores se dieron cuenta de que si las hacían enormes —dándoles miles de millones de "neuronas" o "expertos"— se vuelven increíblemente buenas para encontrar la respuesta correcta. Sin embargo, hay un inconveniente: estos cerebros gigantes son tan pesados que requieren supercomputadoras del tamaño de un almacén para ser entrenados. La mayoría de los laboratorios universitarios y pequeños grupos de investigación no pueden permitirse un almacén. Están atrapados con computadoras más pequeñas y débiles que simplemente no pueden contener estos modelos gigantes en su memoria. Este artículo aborda exactamente ese problema: ¿cómo entrenamos estos motores de búsqueda masivos y superinteligentes con un presupuesto muy limitado sin necesidad de una supercomputadora?

Los autores de este artículo, un equipo de universidades como Utah, Waterloo y Carnegie Mellon, han construido una nueva herramienta llamada Tevatron 3.0. Piensa en la forma antigua de entrenar estos modelos como intentar subir un piano gigante y pesado por una escalera estre narrow, de uno en uno. Es lento, y a menudo el piano es demasiado grande para caber, por lo que tienes que rendirte. Las herramientas que usaban antes (llamadas PyTorch FSDP) eran como esa escalera; intentaban dividir el piano en piezas, pero las piezas seguían siendo demasiado pesadas para transportarlas eficientemente, y no podían manejar un tipo específico de piano (llamado "Mezcla de Expertos" o MoE) que tiene muchas partes internas diferentes que solo funcionan cuando se necesitan.

La solución del equipo es cambiar la escalera por un camión de mudanzas con un muelle de carga especial. Integraron un motor potente llamado "Megotron" en su kit de herramientas. Este nuevo motor no solo transporta el piano; lo divide en cajas diminutas y manejables que pueden cargarse en diferentes camiones (computadoras) simultáneamente. La parte más mágica de este nuevo motor es su capacidad para manejar el "Paralelismo de Expertos". Imagina un equipo de 128 expertos diferentes (como un chef, un mecánico y un poeta) trabajando en un problema. Las herramientas antiguas intentaban hacer que cada experto trabajara en cada problema, lo cual era un desperdicio de tiempo y espacio. El nuevo motor Megatron es lo suficientemente inteligente como para decir: "Está bien, para esta pregunta específica, solo el chef y el mecánico deben dar un paso al frente", mientras los demás se quedan atrás. Esto permite al equipo entrenar un modelo masivo con 30 mil millones de parámetros (un cerebro enorme) con un presupuesto que habría sido imposible antes.

El artículo muestra que este nuevo método funciona tan bien como los métodos antiguos y costosos. De hecho, cuando lo probaron, el nuevo sistema entrenó un modelo estándar de 8 mil millones de parámetros aproximadamente un 22% más rápido que la forma antigua. Pero la verdadera magia ocurrió con el gigante modelo de 30 mil millones de parámetros. Las herramientas antiguas simplemente no podían ejecutarlo; la memoria de la computadora colapsaba. La nueva herramienta, sin embargo, logró entrenarlo con éxito.

Aún más sorprendente, los autores descubrieron que este gigante modelo de 30 mil millones de parámetros, que solo "despierta" unos 3 mil millones de sus parámetros para cada pregunta, funcionó tan bien como el modelo más pequeño de 8 mil millones. Era como tener una biblioteca con 30 millones de libros, pero solo necesitar abrir 3 millones de ellos para encontrar la respuesta, y aun así obtener el mismo resultado que si hubieras leído los 8 millones de libros de una biblioteca más pequeña. No solo la calidad fue la misma, sino que, debido a que estaba haciendo menos trabajo por pregunta, también era más rápido al responderlas. Cuando probaron cuántas preguntas podía responder por segundo, el nuevo modelo gigante fue 1.43 veces más rápido que el más pequeño al usar un servidor de alta velocidad.

Los investigadores también probaron diferentes formas de enseñar al modelo. Intentaron enseñarle a la computadora mostrándole la respuesta correcta directamente (aprendizaje contrastivo) versus enseñarle a imitar a un modelo "maestro" (destilación). Descubrieron que ninguno de los dos métodos era un claro ganador; dependía del tipo específico de pregunta. También demostraron que se podía entrenar el modelo usando un método de "bajo rango" (LoRA), que es como actualizar solo las notas en un libro en lugar de reescribir todo el libro, y que todavía funcionaba casi tan bien como reescribir todo el libro, ahorrando una enorme cantidad de memoria.

En resumen, este artículo no solo dice "hicimos un modelo más grande". Demuestra que puedes construir estos motores de búsqueda masivos y supereficientes con un presupuesto académico estándar. Construyeron un puente que permite a los laboratorios pequeños acceder a la misma tecnología poderosa que antes estaba reservada para las más grandes empresas tecnológicas. Han liberado todo su código y los modelos entrenados para que cualquiera pueda probarlos. El resultado es un sistema que es más barato de entrenar, más rápido de usar y tan inteligente como las alternativas más caras.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →