← Últimos artículos
💻 computer science

ConsistentRFT: Reducing Visual Hallucinations in Flow-based Reinforcement Fine-Tuning

Este artículo presenta ConsistentRFT, un marco general que mitiga las alucinaciones visuales en el ajuste fino por refuerzo basado en flujo mediante el abordaje de los problemas de exploración limitada e imitación de trayectorias a través de un mecanismo de Despliegue de Granularidad Dinámica y una Optimización de Gradiente de Política Consistente.

Autores originales: Xiaofeng Tan, Jun Liu, Yuanting Fan, Bin-Bin Gao, Xi Jiang, Xiaochen Chen, Jinlong Peng, Chengjie Wang, Hongsong Wang, Feng Zheng

Publicado 2026-02-04
📖 4 min de lectura☕ Lectura para el café

Autores originales: Xiaofeng Tan, Jun Liu, Yuanting Fan, Bin-Bin Gao, Xi Jiang, Xiaochen Chen, Jinlong Peng, Chengjie Wang, Hongsong Wang, Feng Zheng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un artista talentoso (un generador de imágenes de IA) que es muy bueno dibujando imágenes basadas en tus descripciones. Sin embargo, cuando le pides que "pinte a un jugador de béisbol lanzando", a veces se obsesiona tanto con la textura del césped o las costuras de la pelota que olvida que el jugador en realidad sostiene un bate, o accidentalmente añade un tercer brazo. Esto se llama alucinación visual.

Este artículo presenta un nuevo método de entrenamiento llamado ConsistentRFT para solucionar esto. Así es como funciona, explicado de forma sencilla:

El Problema: El Artista "Sobreoptimizado"

Los investigadores descubrieron que las formas actuales de enseñar a estos artistas de IA (llamadas Ajuste Fino por Refuerzo o Reinforcement Fine-Tuning) tienen dos fallos principales:

  1. La Trampa del "Zoom" (Problema de Exploración):
    Imagina que la IA está tratando de aprender cómo se ve un "buen" dibujo generando muchas variaciones. Los métodos actuales actúan como un fotógrafo que solo hace zoom en detalles diminutos (como una sola hoja de un árbol) para ver si se ve nítido. Ignoran el árbol completo.

    • El Resultado: La IA se vuelve tan buena haciendo detalles diminutos perfectos que empieza a inventar detalles falsos (como añadir un patrón de cuadrícula o flores extra) solo para obtener una puntuación alta, incluso si la imagen principal no tiene sentido.
  2. La Confusión del "Imitador" (Problema de Explotación):
    Para aprender, la IA intenta copiar los dibujos "ganadores" que realizó durante la práctica. Pero debido a que el método de práctica fue un poco caótico (ruido aleatorio), la IA empieza a copiar el caos junto con las partes buenas.

    • El Resultado: La IA olvida las reglas suaves y lógicas que aprendió cuando fue creada inicialmente. Empieza a tomar atajos extraños, lo que genera imágenes inconsistentes o borrosas.

La Solución: ConsistentRFT

Los autores proponen un nuevo entrenador con dos estrategias para solucionar estos problemas:

1. La Estrategia de "Zoom Dinámico" (Despliegue de Granularidad Dinámica)

En lugar de solo hacer zoom en detalles diminutos o solo mirar la imagen completa, el nuevo método enseña a la IA a hacer ambas cosas, pero en el momento adecuado.

  • La Analogía: Imagina a un profesor diciéndole a un estudiante: "Primero, mira todo el bosque para asegurarte de que los árboles estén en su lugar (Semántica Global). Luego, haz zoom para asegurar que las hojas parezcan realistas (Detalles Locales)".
  • Cómo funciona: El sistema alterna entre "Granularidad Gruesa" (mirar el panorama general) y "Granularidad Fina" (mirar los detalles) durante el entrenamiento. También utiliza un filtro inteligente para elegir los ejemplos más diversos para estudiar, de modo que la IA no se limite a memorizar la misma hoja "perfecta" una y otra vez.

2. La Estrategia de "Mano Firme" (Optimización de Gradiente de Política Consistente)

Esta parte evita que la IA copie los dibujos de "práctica" caóticos y la obliga a ceñirse a las reglas lógicas que ya conoce.

  • La Analogía: Imagina que la IA está aprendiendo a montar en bicicleta. El método antiguo le decía que copiara el camino tambaleante y en zigzag de un ciclista ebrio solo porque llegó a la meta. El nuevo método dice: "No, copia el camino suave y recto de un ciclista experimentado, incluso si tomó una ruta ligeramente diferente".
  • Cómo funciona: Añade una regla que dice: "Lo que dibujes en el paso 10 debe conectarse lógicamente con lo que dibujaste en el paso 9". Esto evita que la IA alucine detalles extraños y desconectados solo para obtener una puntuación de recompensa alta.

Los Resultados: Un Mejor Artista

El artículo probó este nuevo método en un generador de imágenes popular llamado FLUX1.dev.

  • Menos Alucinaciones: Redujo las alucinaciones de "bajo nivel" (texturas extrañas, líneas de cuadrícula) en un 49% y las alucinaciones de "alto nivel" (objetos incorrectos, partes faltantes) en un 38%.
  • Mejor Generalización: A diferencia de otros métodos que mejoraban en las preguntas específicas de la prueba pero empeoraban en todo lo demás, este método mejoró la capacidad de la IA para entender nuevos comandos (prompts) no vistos previamente en un 5.1%.
  • Velocidad: Funciona tan rápido como los métodos estándar, lo que lo convierte en una actualización práctica.

En resumen: ConsistentRFT enseña a la IA a equilibrar la visión del panorama general con la de los detalles, y la obliga a mantenerse lógica, dando como resultado imágenes que son tanto hermosas como coherentes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →