← Últimos artículos
💬 NLP

RARE: Decoupling Representation Steering from Expert Routing in Mixture-of-Experts Language Models

El artículo presenta RARE, un marco agnóstico al enrutador que desacopla el direccionamiento de la representación del enrutamiento de expertos en modelos de Mezcla de Expertos (Mixture-of-Experts) mediante la proyección de perturbaciones de comportamiento en el espacio nulo del enrutador, mejorando así significativamente la efectividad del direccionamiento para la nocividad, la veracidad y la edición factual, al tiempo que preserva la utilidad del modelo.

Autores originales: Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

Publicado 2026-08-24
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de lenguaje extensos son los motores detrás de la inteligencia artificial moderna, capaces de escribir historias, resolver problemas y responder preguntas. Para hacer que estos sistemas masivos sean eficientes, muchos se construyen ahora utilizando un diseño llamado mezcla de expertos. Imagine una gran oficina donde un gerente recibe cada solicitud entrante y decide qué especialista específico debe manejarla. En estos modelos, el "gerente" es un mecanismo de enrutamiento que observa cada palabra de una oración y la envía a un pequeño grupo especializado de procesadores internos, o "expertos", en lugar de utilizar todo el cerebro de la computadora para cada tarea individual. Esto permite que el modelo sea increíblemente grande e inteligente, manteniéndose al mismo tiempo rápido y económico de ejecutar.

Los investigadores han buscado durante mucho tiempo formas de guiar o "dirigir" estos modelos hacia comportamientos específicos, como hacerlos más veraces o menos propensos a generar contenido dañino. Una técnica popular consiste en dar un pequeño empujón a los estados matemáticos internos del modelo durante el proceso de pensamiento, un método que funciona bien para los modelos más antiguos y simples donde cada parte del cerebro está siempre activa. Sin embargo, cuando los científicos intentaron aplicar esta misma técnica de empuje a los nuevos modelos de mezcla de expertos, a menudo fallaba. El problema era que el empujón destinado a cambiar el comportamiento también confundía accidentalmente al gerente, haciendo que enviara la solicitud a los especialistas equivocados. Este desajuste interrumpía el flujo natural del modelo, lo que conducía a resultados deficientes.

Un equipo de investigadores ha resuelto ahora este rompecabezas mediante el desarrollo de un nuevo marco llamado RARE. Su trabajo revela una visión crucial: el gerente en estos modelos se preocupa principalmente por el tema de la solicitud, no por el comportamiento específico que se espera que muestre el modelo. Ya sea que un usuario haga una pregunta sobre programación o le pida al modelo que rechace una solicitud dañina, el gerente tiende a enviar la solicitud al mismo conjunto de especialistas si el tema permanece igual. Los investigadores descubrieron que los métodos antiguos fallaban porque intentaban cambiar el comportamiento alterando el camino que tomaban los datos, lo que confundía al gerente. En cambio, su nuevo enfoque cambia el comportamiento sin cambiar el camino.

El marco RARE funciona filtrando cuidadosamente el "empujón" antes de que se aplique. Elimina cualquier parte de la instrucción que haría que el gerente cambiara de opinión sobre qué especialistas utilizar. Al hacer esto, el modelo continúa enviando la solicitud a los expertos correctos, pero esos expertos procesan la información de una manera que produce el comportamiento deseado. Los investigadores probaron este método en seis modelos grandes diferentes y en tres tareas distintas: hacer que los modelos sean menos dañinos, hacer que sean más veraces y actualizar hechos específicos que conocen.

Los resultados fueron sorprendentes. Al intentar evitar que los modelos siguieran instrucciones dañinas, el nuevo método tuvo éxito en el 53.3% de los casos, una mejora significativa respecto a los intentos anteriores, manteniendo al mismo tiempo un 67.8% de precisión en las pruebas de conocimiento general. En las pruebas de veracidad, el método mejoró la capacidad de los modelos para dar respuestas correctas del 41.0% al 58.6%. Quizás de forma más dramática, cuando se les pidió actualizar un hecho específico, la tasa de éxito saltó del 16.8% al 96.3%. Estas cifras sugieren que, al respetar el sistema de enrutamiento interno del modelo, los investigadores pueden guiar eficazmente su comportamiento sin romper su inteligencia subyacente.

El estudio también comparó cinco formas diferentes de calcular el empujón necesario para encontrar cuál funcionaba mejor. Descubrieron que un método basado en analizar la forma y la dispersión de los datos, en lugar de solo su dirección promedio, proporcionaba los resultados más consistentes y poderosos en todos los diferentes modelos. Este hallazgo sugiere que la geometría de los datos internos importa tanto como la dirección del cambio.

En última instancia, esta investigación demuestra que controlar el comportamiento de los modelos de IA modernos y complejos requiere un equilibrio delicado. No se puede simplemente forzar un cambio; se debe trabajar dentro de la arquitectura existente del modelo. Al preservar el camino natural que el modelo elige para un tema dado, es posible dirigir su producción hacia la seguridad, la verdad o la precisión. Este enfoque ofrece una forma confiable de adaptar estas poderosas herramientas para necesidades específicas sin comprometer sus capacidades generales, proporcionando un camino más claro para hacer que la inteligencia artificial esté más alineada con los valores humanos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →