← Nieuwste papers
💻 computer science

Intrinsic Gradient Suppression for Label-Noise Prompt Tuning in Vision-Language Models

Dit artikel stelt Double-Softmax Prompt Tuning (DSPT) voor, een methode zonder hyperparameters die gebruikmaakt van intrinsieke gradiëntonderdrukking door middel van sequentiële probabilistische normalisatie om Vision-Language-modellen robuust aan te passen aan labelruis door op natuurlijke wijze extreme updates van verkeerd gelabelde steekproeven te filteren.

Oorspronkelijke auteurs: Jiayu Li, Jiaxin Qi, Sheng Zhou, Jiaqiang Huang, Xiansheng Hua

Gepubliceerd 2026-05-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jiayu Li, Jiaxin Qi, Sheng Zhou, Jiaqiang Huang, Xiansheng Hua

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Een Slimme Student Leren met een Slecht Leerboek

Stel je een briljante student voor met de naam CLIP. Deze student heeft al miljoenen boeken gelezen en miljoenen afbeeldingen gezien, dus ze weten al veel over de wereld. Als je ze een foto van een auto toont en vraagt: "Is dit een auto of een hond?", kunnen ze meestal juist raden door alleen hun bestaande kennis te gebruiken (dit heet Zero-Shot leren).

Soms wil je deze student echter een specifieke nieuwe truc leren, zoals het herkennen van een zeer specifiek type vintage auto. Om dit te doen, leer je ze niet alles opnieuw; je geeft ze gewoon een paar "hintwoorden" (zogenaamde Prompts) om hen te helpen focussen. Dit proces heet Prompt Tuning.

Het Probleem: Het Slechte Leerboek
Normaal gesproken leer je de student met een leerboek waarin elke afbeelding het juiste label heeft. Maar in dit artikel stellen de auteurs een scenario voor waarin het leerboek vol staat met typfouten en leugens (Label Noise).

  • Het Scenario: Je toont de student een foto van een Auto, maar het leerboek zegt: "Dit is een Hond."
  • De Reactie: Omdat de student zo slim is, weten ze direct: "Wacht, dit is zeker een auto, geen hond!" Ze voelen zich zeer zeker van hun eigen kennis.
  • De Ramp: Bij standaard leermethoden krijgt de student, wanneer ze zeker zijn maar de leraar volhoudt dat ze fout zijn, een enorme "straf" (een enorme wiskundige gradient). De student denkt: "Oké, de leraar is zo zeker, ik moet wel fout zijn," en ze proberen wanhopig om te vergeten wat ze weten om bij de leugen te passen.
  • Het Resultaat: De student raakt in de war, vergeet hun oorspronkelijke kennis en begint slechter te presteren dan wanneer ze gewoon zonder hulp hadden geraden.

De Oplossing: De "Double-Softmax" Filter

De auteurs stellen een nieuwe leermethode voor die Double-Softmax Prompt Tuning (DSPT) heet. Ze betogen dat, aangezien de student (CLIP) al slim is, we voorzichtig moeten zijn. We mogen de fouten van de leraar niet toestaan om de student te snel hun mening te laten wijzigen.

Hier is hoe hun methode werkt, met een analogie:

1. De "Dubbelcheck" (De Filter)
Stel je voor dat de student hun hand opsteekt om te antwoorden.

  • Standaard Methode: De leraar kijkt naar het antwoord, ziet dat het niet overeenkomt met het leerboek, en slaat direct een enorme hamer (een enorme gradient) op het bureau.
  • DSPT Methode: Voordat de leraar de hamer slaat, gaat het antwoord door een Double-Softmax Filter. Dit is als een speciale ruisonderdrukkende koptelefoon voor het feedback van de leraar.

2. Hoe de Filter Werkt

  • Voor de Leugenaars (Ruizige Steekproeven): Wanneer de student 100% zeker is dat het een auto is, maar het leerboek zegt "Hond", realiseert de filter zich: "Dit is een enorme mismatch." In plaats van de leraar te laten schreeuwen tegen de student, dempt de filter de stem van de leraar. Het zet de enorme straf bijna op nul. De student negeert de leugen en behoudt hun oorspronkelijke kennis.
  • Voor de Waarheidssprekers (Schone Steekproeven): Wanneer de student onzeker is (misschien is het een wazige auto) en het leerboek zegt "Auto", laat de filter de stem van de leraar door, maar zachtjes. Het stelt de student in staat om nuttige nieuwe details te leren zonder overweldigd te worden.

3. De "Saturatiezone"
Het artikel noemt dit een "zelfaanpassende saturatiezone". Denk hierbij aan een schokdemper op een auto.

  • Als je een klein hobbel raakt (een kleine leermogelijkheid), rijdt de auto soepel.
  • Als je een enorm gat raakt (een enorme fout van een ruizig label), comprimeert de schokdemper zo hard dat de auto niet hevig stuitert. Het absorbeert de impact zodat de auto (het model) niet crasht.

Waarom Dit Speciaal Is

De meeste andere methoden proberen dit op te lossen door complexe regels toe te voegen of een mens te vragen om veel knoppen (hyperparameters) te draaien om te beslissen hoeveel straf de student moet krijgen.

  • De Claim van het Artikel: Hun methode is automatisch. Het heeft geen knoppen om te draaien nodig. Het gebeurt gewoon natuurlijk door de wiskunde die ze hebben gebruikt (de double-softmax).
  • Het Resultaat: In hun experimenten hield deze eenvoudige methode de student goed presterend, zelfs toen het leerboek 80% fout was. Andere methoden zorgden ervoor dat de student slechter presteerde dan wanneer ze gewoon blind hadden geraden.

Samenvatting van de Analogie

  • CLIP Model: Een slimme student met een sterk geheugen.
  • Label Noise: Een leerboek met willekeurige, verkeerde antwoorden.
  • Standaard Training: De student wordt bang door de verkeerde antwoorden en vergeet alles, waardoor ze slecht presteren.
  • DSPT (Double-Softmax): Een slimme filter die beseft: "De student heeft gelijk, het boek heeft ongelijk," en het slechte advies van het boek stillegt, waardoor de student alleen leert van het goede advies.

De auteurs bewezen dat ze, door een probleem dat meestal als slecht wordt gezien ("gradient vanishing" of het signaal dat te zwak wordt) om te zetten in een functie, een schild creëerden dat het model beschermt tegen het leren van leugens.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →