← Nieuwste papers
💻 computer science

ConsistentRFT: Reducing Visual Hallucinations in Flow-based Reinforcement Fine-Tuning

Dit artikel introduceert ConsistentRFT, een algemeen framework dat visuele hallucinaties in flow-gebaseerde reinforcement fine-tuning vermindert door beperkte exploratie en trajectimitatieproblemen aan te pakken via een Dynamic Granularity Rollout-mechanisme en Consistent Policy Gradient Optimization.

Oorspronkelijke auteurs: Xiaofeng Tan, Jun Liu, Yuanting Fan, Bin-Bin Gao, Xi Jiang, Xiaochen Chen, Jinlong Peng, Chengjie Wang, Hongsong Wang, Feng Zheng

Gepubliceerd 2026-02-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xiaofeng Tan, Jun Liu, Yuanting Fan, Bin-Bin Gao, Xi Jiang, Xiaochen Chen, Jinlong Peng, Chengjie Wang, Hongsong Wang, Feng Zheng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een getalenteerde kunstenaar hebt (een AI-beeldgenerator) die erg goed is in het tekenen van plaatjes op basis van jouw beschrijvingen. Echter, wanneer je vraagt om "een honkbalspeler te schilderen die een worp werpt", raakt de AI soms zo geobsedeerd door de textuur van het gras of de stiksels op de bal dat ze vergeet dat de speler eigenlijk een knuppel vasthoudt, of ze voegen per ongeluk een derde arm toe. Dit wordt een visuele hallucinatie genoemd.

Dit artikel introduceert een nieuwe trainingsmethode genaamd ConsistentRFT om dit op te lossen. Zo werkt het, eenvoudig uitgelegd:

Het Probleen: De "Over-geoptimaliseerde" Kunstenaar

De onderzoekers ontdekten dat de huidige manieren om deze AI-kunstenaars te onderwijzen (genaamd Reinforcement Fine-Tuning) twee hoofdfouten hebben:

  1. De "Inzoom"-valstrik (Exploratieprobleem):
    Stel je voor dat de AI probeert te leren wat een "goede" afbeelding is door veel variaties te genereren. Huidige methoden werken als een fotograaf die alleen inzoomt op minuscule details (zoals een enkel blaadje aan een boom) om te zien of het scherp is. Ze negeren de hele boom.

    • Het resultaat: De AI wordt zo goed in het perfect maken van kleine details dat het begint met het verzinnen van nepdetails (zoals het toevoegen van een rasterpatroon of extra bloemen) puur om een hoge score te halen, zelfs als de hoofdafbeelding nergens op slaat.
  2. De "Naboots"-verwarring (Exploitatieprobleem):
    Om te leren, probeert de AI de "winnende" tekeningen na te bootsen die hij tijdens de oefening heeft gemaakt. Maar omdat de oefenmethode een beetje chaotisch was (door willekeurige ruis), begint de AI de chaos samen met de goede delen na te bootsen.

    • Het resultaat: De AI vergeet de vloeiende, logische regels die hij leerde toen hij oorspronkelijk werd gemaakt. Het begint vreemde afsnijdingen te nemen, wat leidt tot inconsistente of wazige afbeeldingen.

De Oplossing: ConsistentRFT

De auteurs stellen een nieuwe trainingscoach voor met twee strategieën om deze problemen op te lossen:

1. De "Dynamische Zoom"-strategie (Dynamic Granularity Rollout)

In plaats van alleen in te zoomen op kleine details of alleen naar het hele plaatje te kijken, leert deze nieuwe methode de AI om beide te doen, maar op de juiste momenten.

  • De Analogie: Stel je een leraar voor die tegen een student zegt: "Kijk eerst naar het hele bos om te controleren of de bomen op de juiste plek staan (Global Semantics). Zoom dan pas in om te controleren of de bladeren er realistisch uitzien (Local Details)."
  • Hoe het werkt: Het systeem schakelt tussen "Coarse-Grained" (kijken naar het grote geheel) en "Fine-Grained" (kijken naar details) tijdens de training. Het gebruikt ook een slim filter om de meest diverse voorbeelden te selecteren om te bestuderen, zodat de AI niet steeds weer hetzelfde "perfecte" blaadje uit het hoofd leert.

2. De "V steady Hand"-strategie (Consistent Policy Gradient Optimization)

Dit deel zorgt ervoor dat de AI stopt met het kopiëren van de chaotische "oefentekeningen" en dwingt hem om vast te houden aan de logische regels die hij al kent.

  • De Analogie: Stel je voor dat de AI leert fietsen. De oude methode vertelde hem om het wiebelige, zigzaggende pad van een dronken fietser na te bootsen, simpelweg omdat die de finish haalde. De nieuwe methode zegt: "Nee, kopieer het vloeiende, rechte pad van een ervaren fietser, zelfs als die een iets andere route nam."
  • Hoe het werkt: Het voegt een regel toe die zegt: "Wat je bij stap 10 tekent, moet logisch verbonden zijn met wat je bij stap 9 tekende." Dit voorkomt dat de AI vreemde, losgekoppelde details hallucineert om een hoge beloningsscore te krijgen.

De Resultaten: Een Betere Kunstenaar

De onderzoekers hebben deze nieuwe methode getest op een populaire beeldgenerator genaamd FLUX1.dev.

  • Minder Hallucinaties: Het verminderde "low-level" hallucinaties (vreemde texturen, rasterlijnen) met 49% en "high-level" hallucinaties (verkeerde objecten, ontbrekende onderdelen) met 38%.
  • Betere Generalisatie: In tegenstelling tot andere methoden die wel beter werden in de specifieke testvragen maar slechter in alles wat daarbuiten viel, verbeterde deze methode het vermogen van de AI om nieuwe, onbekende prompts te begrijpen met 5,1%.
  • Snelheid: Het werkt net zo snel als de standaardmethoden, waardoor het een praktische upgrade is.

Kortom: ConsistentRFT leert de AI om een balans te vinden tussen het kijken naar het grote geheel en het kijken naar de details, en dwingt hem om logisch te blijven, wat resulteert in afbeeldingen die zowel mooi zijn als daadwerkelijk zinvol.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →