← Nieuwste papers
💻 computer science

HANCLIP: A Family of Hyperbolic Angular Negation Vision Language Models

HANCLIP introduceert een familie van visie-taalmodellen die gebruikmaken van hyperbolische geometrie en angulaire triplet-objectieven om negatie expliciet te coderen binnen een compact trainingskader, wat de gevoeligheid voor negatie op benchmarks zoals NegBench significant verbetert terwijl de prestaties op standaardtaken behouden blijven zonder dat grootschalige hertraining vereist is.

Oorspronkelijke auteurs: Hoang-Bao Le, Aiden Durrant, Thai Son Mai, Binh T. Nguyen, Liting Zhou, Cathal Gurrin

Gepubliceerd 2026-06-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hoang-Bao Le, Aiden Durrant, Thai Son Mai, Binh T. Nguyen, Liting Zhou, Cathal Gurrin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme bibliothecaris hebt (een Vision-Language Model) die miljoenen boeken heeft gelezen en naar miljoenen foto's heeft gekeken. Deze bibliothecaris is erg goed in het matchen van een foto van een "kat" met het woord "kat". Echter, deze bibliothecaris heeft een grappige blinde vlek: ze worstelen met het woord "niet".

Als je hen een foto van een kat laat zien en vraagt: "Is dit niet een hond?", raakt de bibliothecaris in de war. Omdat ze hebben geleerd door patronen te memoriseren, zien ze het woord "hond" en de foto van een kat, en hun brein zegt simpelweg: "Oh, die twee dingen verschijnen vaak samen in mijn trainingsdata," ook al zegt de zin dat ze elkaars tegenpolen zijn. Ze vertrouwen op oppervlakkige woordmatching in plaats van echt begrip van logica.

Het artikel introduceert een nieuw systeem genaamd HANCLIP om dit op te lossen. Zo werkt het, met behulp van eenvoudige analogieën:

1. Het Probleem: De "Platte" Kaart

Denk aan het brein van de bibliothecaris als een gigantische, platte kaart (Euclidische ruimte). Op deze kaart is alles gewoon een stip.

  • De stip voor "Kat" ligt dicht bij de stip voor "Kitten".
  • De stip voor "Hond" ligt ver weg.
  • Maar wanneer de bibliothecaris de zin "Niet een hond" ziet, weet hij niet waar die stip moet plaatsen. Het is te ver van "Hond", maar ook niet helemaal "Kat". De platte kaart wordt een rommeltje en de bibliothecaris gokt fout.

2. De Oplossing: Een "Boom" Kaart (Hyperbolische Ruimte)

De auteurs stellen voor om het brein van de bibliothecaris te verplaatsen naar een boomvormige kaart (Hyperbolische ruimte).

  • Stel je een boom voor waarbij de stam het centrum is. Hoe dichter je bij het centrum komt, hoe algemener het concept is (zoals "Dier"). Naarmate je naar de takken en bladeren beweegt, worden de zaken specifieker (zoals "Kat", "Hond", "Niet een hond").
  • In deze boomwereld kunnen "Kat" en "Niet een hond" op dezelfde tak zitten omdat het verwante concepten zijn, terwijl "Hond" op een compleet andere tak zit.
  • Dit stelt het model in staat om te begrijpen dat "Wat een afbeelding is" en "Wat een afbeelding niet is" verschillende takken van dezelfde boom zijn, in plaats van slechts willekeurige stippen op een platte vloer.

3. De "Hoek" Truc (Angular Triplet Negation Loss)

Het systeem gebruikt een tweede truc genaamd de Angular Triplet. Stel je drie mensen voor die in een kamer staan:

  1. De Negatieve Anker (N): Een persoon die een bord vasthoudt met de tekst "Hond".
  2. De Positieve (P): Een persoon die een bord vasthoudt met de tekst "Kat".
  3. De Negatie-Positieve (P'): Een persoon die een bord vasthoudt met de tekst "Niet een Hond".

Het systeem leert het model om naar de hoeken tussen hen te kijken:

  • De Uitlijning: Vanuit het perspectief van de "Hond"-persoon, moeten de "Kat"-persoon en de "Niet een Hond"-persoon in ongeveer de zelfde richting staan. Ze zijn immers beiden "geen hond".
  • De Scheiding: Echter, de "Kat"-persoon en de "Niet een Hond"-persoon moeten ver genoeg uit elkaar staan zodat ze niet met elkaar verward worden.

Door deze hoeken aan te passen, leert het model dat "Niet een hond" in een vergelijkbare richting wijst als "Kat" (omdat ze beide geen honden zijn), maar houdt het ze voldoende gescheiden om fouten te voorkomen.

4. Het Resultaat: Een Slimme, Efficiënte Upgrade

De auteurs hoefden het brein van de bibliothecaris niet vanaf nul op te bouwen. In plaats daarvan gebruikten ze een kleine, gerichte trainingsset van slechts 20.000 voorbeelden (een druppel op een gloeiende plaat vergeleken met de miljoenen die normaal nodig zijn).

Ze testten dit nieuwe "HANCLIP"-systeem op vier verschillende bestaande modellen (CLIP, LongCLIP, SmartCLIP en HiMo-CLIP). De resultaten waren:

  • Betere Logica: De modellen werden aanzienlijk beter in het beantwoorden van vragen met "niet" (zoals "Welke afbeelding bevat niet een auto?").
  • Geen Geheugenverlies: Cruciaal is dat de modellen niet vergaten hoe ze hun oude taken moesten uitvoeren. Ze zijn nog steeds even goed in het vinden van afbeeldingen op basis van eenvoudige beschrijvingen of het classificeren van afbeeldingen.
  • Efficiëntie: Ze bereikten deze verbeteringen zonder enorme hoeveelheden nieuwe data of het volledig hertrainen van het hele systeem nodig te hebben.

Kortom: HANCLIP geeft AI-modellen een betere "mentale kaart" en een set geometrische regels om het concept van "NIET" te begrijpen, waardoor ze kunnen redeneren over wat iets niet is, zonder hun vermogen te verliezen om te begrijpen wat iets wel is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →