Bias Fitting to Mitigate Length Bias of Reward Model in RLHF
Autores originales: Kangwen Zhao, Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Dongyun Xue, Wengang Zhou, Li Li, Houqiang Li
Autores originales: Kangwen Zhao, Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Dongyun Xue, Wengang Zhou, Li Li, Houqiang Li
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: FiMi-RM (Ajuste de Sesgo para Mitigar el Sesgo de Longitud en Modelos de Recompensa en RLHF)
Planteamiento del Problema
El Aprendizaje por Refuerzo a partir de la Retroalimentación Humana (RLHF) es el marco estándar para alinear los Grandes Modelos de Lenguaje (LLMs) con las preferencias humanas. Sin embargo, este proceso es susceptible al hackeo de recompensa (reward hacking), donde la política explota las fallas en el modelo de recompensa entrenado para maximizar las puntuaciones sin adherirse genuinamente a la intención humana. Una forma prevalente de este hackeo es el sesgo de longitud, donde los modelos de recompensa favorecen sistemáticamente las respuestas largas independientemente de su calidad real. Esto conduce a generaciones excesivamente verbosas en los modelos de uso descendente.
Las estrategias de mitigación existentes sufren limitaciones significativas:
- Falta de Caracterización: Algunos enfoques (por ejemplo, RRM) intentan equilibrar las distribuciones de datos o utilizar marcos causales sin modelar explícitamente la forma del sesgo.
- Suposiciones Lineales: Muchos métodos (por ejemplo, Penalización de Longitud, ODIN, Huang et al.) asumen una relación lineal entre la longitud de la respuesta y la recompensa. O bien restan un coeficiente fijo basado en la longitud, o utilizan regresión lineal para desacoplar la longitud de la calidad.
- Inadecuación: Estas suposiciones lineales no logran capturar la naturaleza intrincada y no lineal de cómo la longitud interactúa con las puntuaciones de recompensa, particularmente los patrones complejos observados en diferentes regímenes de longitud.
Metodología: FiMi-RM
Los autores proponen FiMi-RM (Bias Fitting to Mitigate Length Bias of Reward Model), un marco diseñado para aprender y corregir de forma autónoma los patrones de sesgo no lineales subyacentes. El enfoque opera en tres etapas distintas:
Etapa de Calentamiento (Warm-Up):
- Se entrena un modelo de recompensa estándar (modelr) utilizando la pérdida de Bradley-Terry sobre datos de preferencia.
- Crucialmente, esta etapa preserva el sesgo de longitud inherente del modelo de recompensa en lugar de intentar corregirlo inmediatamente. Esto asegura que el modelo posea una tendencia fuerte y sistemática a asignar puntuaciones más altas a las respuestas largas, proporcionando un objetivo claro para la etapa de ajuste posterior.
Etapa de Ajuste de Sesgo de Longitud (Length Bias Fitting):
- Se introduce un modelo de ajuste (fitting model, modelf) ligero para caracterizar explícitamente la relación entre la longitud de la respuesta ($len(y)$) y la salida de recompensa sesgada (r).
- Arquitectura: La longitud escalar se proyecta en un espacio de características de d dimensiones (usando una Codificación de Longitud inspirada en el Positional Encoding), se procesa a través de una arquitectura ResNet y se pasa por una cabeza de proyección lineal para predecir la recompensa (r^).
- Objetivo: El modelo de ajuste se entrena para minimizar la discrepancia entre su predicción (r^) y la salida real del modelo de recompensa (r). La optimización utiliza una pérdida de correlación de Pearson (Lpearson) para maximizar la correlación entre las recompensas predichas y las reales.
- Idea Clave: El uso de la pérdida de Pearson alinea los patrones de correlación sin imponer una restricción de linealidad al propio modelo de ajuste. El modelf basado en ResNet es libre de aprender dependencias complejas y no lineales.
Etapa de Mitigación de Sesgo de Longitud (Length Debiasing):
- El modelo de recompensa original se ajusta (fine-tuned) para desacoplar sus salidas de la longitud de la respuesta mientras preserva su capacidad para modelar las preferencias humanas.
- Mecanismo de Entrenamiento: El marco emplea una estrategia de entrenamiento alterno entre el modelo de recompensa y el modelo de ajuste.
- Función de Pérdida: El modelo de recompensa se optimiza utilizando una pérdida compuesta:
Ldebiased=Lpearson′+LBT- Lpearson′: Fuerza a que la salida del modelo de recompensa esté no correlacionada con la predicción del modelo de ajuste (eliminando efectivamente el sesgo aprendido).
- LBT: La pérdida estándar de Bradley-Terry, asegurando que el modelo mantenga su capacidad discriminativa para las preferencias humanas.
- La función indicadora $I(step)$ alterna los pasos de entrenamiento entre el ajuste del sesgo y la mitigación del sesgo del modelo de recompensa.
Contribuciones Clave
- Modelado de Sesgo No Lineal: El artículo introduce un marco de múltiples etapas que aprende autónomamente la relación no lineal entre la longitud de la respuesta y la recompensa "hackeada", yendo más allá de las simplistas suposiciones lineales de trabajos anteriores.
- Validación Empírica de la No Linealidad: A través del proceso de ajuste, los autores identifican un patrón de sesgo de múltiples etapas:
- Respuestas cortas (<100 tokens): Exhiben una fuerte correlación lineal donde la recompensa aumenta con la longitud.
- Respuestas más largas: La relación se aplana y, en algunos casos, muestra una ligera tendencia a la baja, lo que indica que el efecto positivo de la longitud sobre la recompensa disminuye o se revierte para salidas extendidas.
- Evaluación Exhaustiva: El método se valida mediante el análisis de la distribución longitud-recompensa, la tasa de victorias controlada por longitud y las distribuciones de longitud de respuesta a través de múltiples algoritmos de alineación (DPO y Best-of-N).
Resultados Experimentales
Los autores evaluaron FiMi-RM utilizando los modelos Qwen2.5-7B y Gemma2-9B en el conjunto de datos Anthropic HH, comparándolo con Modelos de Recompensa Vanilla, Penalización de Longitud y ODIN.
- Precisión de Preferencia: FiMi-RM logró una precisión más equilibrada en los subconjuntos donde la respuesta elegida era más larga (C-longer) frente a la más corta (R-longer). Aunque la precisión general en el subconjunto C-longer disminuyó ligeramente, los autores argumentan que esto indica la eliminación exitosa del "atajo de longitud" en lugar de una pérdida de comprensión semántica.
- Distribución Longitud-Recompensa: Los diagramas de dispersión revelaron que FiMi-RM produce una distribución de recompensa más simétrica y plana a través de los contenedores de longitud en comparación con las líneas base, confirmando una mitigación de sesgo efectiva.
- Desempeño en Descendente (BoN & DPO):
- Tasas de Victoria: FiMi-RM alcanzó la Tasa de Victoria Controlada por Longitud (LC-WR) y la Tasa de Victoria (WR) estándar más altas tanto en los entornos de Best-of-N (BoN) como de Optimización de Preferencia Directa (DPO).
- Verbocidad: El método redujo significativamente la longitud promedio de tokens de las respuestas generadas en comparación con el RM Vanilla y la Penalización de Longitud, manteniendo o mejorando el desempeño en benchmarks como MT-Bench e IFEval.
- Sesgo de Selección: En la selección de BoN, FiMi-RM demostró una preferencia más fuerte por salidas concisas en comparación con ODIN, que tendía a desplazar las preferencias hacia respuestas de longitud media en lugar de cortas.
Significancia y Reivindicaciones
El artículo afirma que FiMi-RM ofrece un enfoque más preciso y efectivo para mitigar el sesgo de longitud al modelar explícitamente la naturaleza no lineal del problema. Al desacoplar la longitud de la recompensa sin comprometer las capacidades centrales de modelado de preferencias, el método permite que los procesos de RLHF generen respuestas que son tanto de alta calidad como apropiadamente concisas.
Los autores señalan que, si bien su método reduce eficazmente las correlaciones espurias, la cuestión de si las preferencias humanas son enteramente independientes de la longitud sigue abierta. Reconocen que en ciertos contextos (por ejemplo, tareas que requieren explicaciones detalladas), una correlación positiva entre longitud y calidad puede ser genuina. Sin embargo, su marco distingue con éxito entre el sesgo explotable y la preferencia genuina, conduciendo a un alineamiento de modelos más seguro y efectivo.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.
Recibe los mejores artículos de machine learning cada semana.
Utilizado por investigadores de Stanford, Cambridge y la Academia Francesa de Ciencias.
Revisa tu bandeja de entrada para confirmar tu suscripción.
Algo salió mal. ¿Intentar de nuevo?
Sin spam, cancela cuando quieras.