← Últimos artículos
🤖 machine learning

DUET: Dual-Teacher On-Policy Distillation via Same-Weight Disagreement for Prohibition Compliance

El artículo propone DUET, un método de destilación on-policy de selección de tokens que aprovecha el desacuerdo por token entre dos profesores de pesos idénticos (uno con y otro sin contexto de prohibición) para generar una señal de supervisión limpia para entrenar modelos para cumplir con prohibiciones dinámicas y específicas de cada solicitud mientras se preserva la utilidad general.

Autores originales: Zihan Li, Feifei Li, Wenhui Que

Publicado 2026-08-18
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zihan Li, Feifei Li, Wenhui Que

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de lenguaje extensos son los motores detrás de muchos asistentes digitales modernos, capaces de generar texto similar al humano, resolver problemas y responder preguntas. Sin embargo, en el mundo real, estos modelos a menudo operan bajo reglas estrictas y cambiantes que no están codificadas de forma fija en sus cerebros, sino que se inyectan en sus instrucciones en el momento en que se utilizan. Una empresa podría decirle a un modelo que nunca revele sus herramientas internas, mientras que un hospital podría exigirle que nunca mencione nombres de pacientes. Estas reglas cambian dependiendo de quién pregunte y cuál sea la situación. El desafío para los desarrolladores es enseñar al modelo a obedecer estas prohibiciones específicas y temporales sin que sea tan cauteloso que se niegue a responder preguntas inofensivas, o tan confiado que accidentalmente rompa las reglas. Si un modelo no sigue estas instrucciones, puede provocar la filtración de datos o incidentes de seguridad de marca; si tiene demasiado miedo de hablar, se vuelve inútil.

Investigadores de Tencent han desarrollado un nuevo método llamado DUET para resolver este problema específico de enseñar a los modelos a seguir reglas en tiempo de ejecución. En lugar de intentar reentrenar el modelo desde cero o simplemente mostrarle ejemplos de respuestas buenas y malas, crearon un sistema que actúa como un par de gemelos idénticos. Un gemelo ve la regla prohibida en sus instrucciones, mientras que el otro gemelo, que tiene exactamente el mismo conocimiento y habilidades, no ve la regla. Debido a que estos dos "maestros" son, por lo demás, idénticos, cualquier diferencia en lo que dicen debe ser causada únicamente por la presencia o ausencia de esa regla específica. Los investigadores utilizan este desacuerdo para localizar exactamente dónde es probable que el modelo cometa un error.

El proceso funciona haciendo que el modelo estudiante genere una respuesta mientras ambos maestros gemelos observan. Cuando los dos maestros coinciden en cuál debería ser la siguiente palabra, el sistema ignora esa parte de la conversación, asumiendo que es segura e insignificante. Sin embargo, cuando los maestros discrepan —uno sugiriendo una palabra que revela un secreto y el otro sugiriendo una alternativa segura— el sistema marca ese momento específico como una oportunidad de aprendizaje crítica. Esto permite que el modelo estudiante enfoque su atención solo en las pocas palabras donde la regla realmente importa, en lugar de desperdiciar esfuerzo en los miles de palabras que son perfectamente adecuadas. El estudiante es entonces empujado suavemente lejos del maestro que ignora la regla y atraído hacia el maestro que la respeta, aprendiendo efectivamente a navegar el límite entre la utilidad y el cumplimiento.

Este enfoque aborda un fallo en los métodos anteriores donde los modelos eran entrenados con conversaciones completas. En esos sistemas antiguos, si un modelo cometía un solo error en una respuesta larga, toda la respuesta se trataba a menudo como mala, lo que confundía al modelo sobre qué palabras específicas eran el problema. Al aislar el desacuerdo al token exacto, o unidad de palabra, donde ocurre la violación, el nuevo método proporciona una señal mucho más clara. Los investigadores probaron esto en una variedad de tareas, incluyendo la protección de información personal, el seguimiento de directrices de seguridad y la adhesión a definiciones de herramientas comerciales. Encontraron que los modelos entrenados con este método de doble maestro eran significativamente mejores para negarse a romper las reglas mientras seguían siendo útiles para preguntas legítimas.

Los resultados mostraron que el nuevo método superó las técnicas existentes en diferentes tamaños de modelos, desde los más pequeños con 1.5 mil millones de parámetros hasta los más grandes con 8 mil millones. En sus pruebas, los modelos alcanzaron una tasa de cumplimiento de más del 72% al 85% en solicitudes de violación, lo que significa que rechazaron con éxito romper las reglas, mientras mantenían un alto nivel de utilidad para preguntas normales, preservando entre el 88% y el 93% de su capacidad para responder correctamente. Crucialmente, los modelos no perdieron su inteligencia general; seguían siendo igual de buenos en acertijos matemáticos y lógicos como antes. El estudio sugiere que, al usar dos modelos idénticos para encontrar el punto exacto donde una regla importa, los desarrolladores pueden crear asistentes de IA que sean tanto seguros como útiles, navegando instrucciones complejas y cambiantes sin necesidad de cantidades masivas de nuevos datos o perder sus capacidades principales.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →