← Últimos artículos
💬 NLP

BALTO: Balanced Token-Level Policy Optimization for Hallucination Mitigation

El artículo presenta BALTO, un marco de optimización de política equilibrada a nivel de token que mitiga las alucinaciones de los LLM mediante la proyección de juicios verificados a nivel de afirmación en recompensas a nivel de token para asegurar un entrenamiento estable y eficiente y una fidelidad superior sin sacrificar la capacidad informativa.

Autores originales: Ning Li, Zixuan Guo, Yan Xu, Wenbo Fei, Yifan Niu, Chang Luo, Yasheng Wang, Weiwen Liu, Yong Yu, Weinan Zhang

Publicado 2026-06-16
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ning Li, Zixuan Guo, Yan Xu, Wenbo Fei, Yifan Niu, Chang Luo, Yasheng Wang, Weiwen Liu, Yong Yu, Weinan Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El gran problema: El castigo de "talla única"

Imagina que estás enseñando a un estudiante (la IA) a escribir un ensayo de historia basado en un libro de texto específico. El estudiante escribe un ensayo de 500 palabras. Es mayormente preciso, pero en medio, inventa una fecha falsa para una batalla.

La forma antigua (Recompensas a nivel de respuesta):
En el pasado, los profesores (entrenadores de IA) leían todo el ensayo y le daban una única calificación. Si el ensayo tenía esa única fecha falsa, el profesor podría marcar todo el ensayo como "malo".

  • El resultado: El estudiante es castigado por todo el ensayo, incluso por las partes donde enumeró correctamente los nombres de los generales o el clima. Para evitar una mala nota, el estudiante aprende a escribir ensayos muy cortos y aburridos solo para estar seguro, o se confunde sobre qué hizo bien. Dejan de tomar riesgos y los ensayos se vuelven menos útiles.

La nueva solución: BALTO (El profesor "equilibrado")

Los autores de este artículo proponen un nuevo método llamado BALTO. En lugar de calificar todo el ensayo con una sola puntuación, BALTO actúa como un editor súper preciso que resalta exactamente qué palabras están mal y cuáles están bien.

Así es como funciona, paso a paso:

1. Encontrar las "manzanas podridas" (Detección de grano fino)

BALTO no solo mira el ensayo completo. Descompone el ensayo en pequeñas afirmaciones (como "La batalla ocurrió en 1863"). Comprueba cada afirmación contra el libro de texto.

  • Si una afirmación es falsa, marca las palabras específicas responsables (por ejemplo, "1863").
  • Si una afirmación es verdadera, marca esas palabras como "buenas".
  • Si una palabra es solo un conector (como "y" o "el"), la ignora.

2. La tarjeta de puntuación "equilibrada" (Asignación de crédito equilibrada)

Esta es la parte mágica. En el método antiguo, si encontrabas una fecha falsa, podrías simplemente restar puntos a todo el ensayo. BALTO hace algo más inteligente: equilibra la puntuación.

  • Las palabras malas: La fecha falsa recibe una puntuación negativa (una penalización).
  • Las palabras buenas: Los hechos correctos reciben una puntuación positiva (una recompensa).
  • El equilibrio: El sistema asegura que los "puntos malos" totales sean iguales a los "puntos buenos" totales.

La analogía: Imagina un sube y baja (balancín).

  • Si el estudiante escribe un dato falso, el sube y baja se inclina hacia ese lado.
  • Para arreglarlo, BALTO no solo empuja todo el sube y baja hacia abajo (castigando todo el ensayo). En su lugar, empuja los hechos correctos hacia arriba en el otro lado.
  • El objetivo es desplazar el peso: Mover la probabilidad lejos de los hechos falsos y hacia los hechos reales.

Por qué esto es mejor (La teoría)

El artículo utiliza las matemáticas para demostrar dos cosas principales:

  1. Menos ruido (Estabilidad): Cuando castigas todo el ensayo por un error, confundes a la IA. Ella piensa: "¿Fallé en la fecha? ¿O en la gramática? ¿O en la ortografía?". BALTO le dice a la IA exactamente dónde estuvo el error. Esto hace que el proceso de aprendizaje sea mucho más suave y menos caótico.
  2. Sin "bloqueo" (Eficiencia): Si la IA es muy mala al principio, el método antiguo podría darle una penalización tan grande que deja de aprender (estrellamiento de gradiente). Si la IA es casi perfecta, el método antiguo podría castigarla tan duramente por un pequeño desliz que la rompe. BALTO mantiene las recompensas y penalizaciones pequeñas y equilibradas, para que la IA aprenda de manera constante desde el principio hasta el final.

Los resultados: ¿Qué pasó?

Los investigadores probaron esto en tres "exámenes" diferentes (conjuntos de datos) que involucraban datos financieros, conocimiento general y comprensión lectora. Utilizaron dos modelos de IA diferentes (Qwen3-8B y Qwen3-4B).

  • Fidelidad: BALTO produjo menos mentiras que cualquier otro método.
  • Informatividad: A diferencia de los métodos antiguos que hacían que la IA escribiera respuestas cortas y seguras, BALTO permitió que la IA siguiera escribiendo respuestas largas, detalladas y útiles.
  • El compromiso: El artículo muestra que BALTO logra el mejor equilibrio: detiene a la IA de mentir sin hacer que la IA deje de hablar.

Resumen

Piensa en BALTO como un profesor que deja de calificar ensayos con un único sello de "Aprobado/Suspenso". En su lugar, usa un bolígrafo rojo para rodear la única mentira y un bolígrafo verde para resaltar la verdad, asegurando que el estudiante aprenda exactamente qué corregir sin perder la confianza en el resto de su trabajo. Esto conduce a una IA que es tanto honesta como útil.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →