← Nieuwste papers
💬 NLP

Do Reasoning Models Enhance Embedding Models?

Dit artikel toont aan dat het initialiseren van embedding-modellen met redeneerversterkte LLM's geen prestatievoordeel oplevert ten opzichte van basismodellen, omdat Reinforcement Learning met Verifieerbare Beloningen (RLVR) de globale semantische manifold behoudt, waardoor daaropvolgende contrastieve leerprocessen de representaties kunnen heraligneren ongeacht de initialisatie.

Oorspronkelijke auteurs: Wun Yu Chan, Shaojin Chen, Huihao Jing, Kwun Hang Lau, Elton Chun-Chai Li, Zihao Wang, Haoran Li, Yangqiu Song

Gepubliceerd 2026-01-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wun Yu Chan, Shaojin Chen, Huihao Jing, Kwun Hang Lau, Elton Chun-Chai Li, Zihao Wang, Haoran Li, Yangqiu Song

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Grote Vraag: Maakt "Nadenken" een Kaart Beter?

Stel je voor dat je een gigantische, ongelooflijk gedetailleerde kaart van de wereld hebt (dit is een Large Language Model). Deze kaart helpt je om je weg te vinden, relaties tussen steden te begrijpen en complex terrein te navigeren.

Onlangs hebben wetenschappers een nieuwe versie van deze kaart gemaakt door het model te leren om "harder na te denken" voordat het antwoord geeft. Ze gebruikten een methode genaamd RLVR (Reinforcement Learning with Verifiable Rewards). Het is alsof je de kaart een strenge coach geeft die zegt: "Gok niet zomaar een route; bereken elke stap, controleer je wiskunde en beweeg pas als je voor 100% zeker weet dat je gelijk hebt."

De grote vraag die de auteurs stelden was: Als de kaart leert om beter te "nadenken", wordt de kaart zelf dan een beter hulpmiddel voor navigatie?

Specifiek wilden ze weten of deze "denkende" modellen betere Embeddings maken. In simpele termen is een embedding een manier om een zin om te zetten in een punt op een kaart. Als twee zinnen hetzelfde betekenen, zouden hun punten vlak naast elkaar moeten liggen.

Het Verrassende Antwoord: Geen Verandering in de Kaart

De auteurs testten dit door de "denkende" modellen om te zetten in embedding-tools. Ze vergeleken ze met de originele, niet-denkende modellen.

Het resultaat: De "denkende" modellen presteerden precies hetzelfde als de originele modellen.

  • Analogie: Stel je voor dat je een GPS-app hebt. Je upgradet de app zodat de bestuurder complexe wiskundige problemen kan oplossen terwijl hij rijdt. Je zou verwachten dat de bestuurder betere routes kiest. Maar wanneer je de GPS test, zijn de routes identiek. Het "nadenken" heeft de kaart helemaal niet veranderd.

Dit was verrassend omdat iedereen ervan uitging dat als een model slimmer wordt in redeneren, het interne begrip van taal (de "kaart") ook beter moet worden.

Het Detectiewerk: Waarom Is Dit Gebeurd?

Om te ontdekken waarom de prestaties niet veranderden, vonden de auteurs een nieuw hulpmiddel uit genaamd HRSA (Hierarchical Representation Similarity Analysis). Zie HRSA als een röntgenapparaat met drie lagen dat naar de hersenen van het model kijkt vanuit verschillende hoeken:

  1. Het Coördinatensysteem (Representatieniveau): Wijzen de assen van de kaart in dezelfde richting?
  2. De Vorm van het Landschap (Geometrieniveau): Is de vorm van de bergen en valleien hetzelfde?
  3. De Bestemming (Functioneel niveau): Weet het model nog steeds hoe het naar dezelfde plaatsen moet komen?

Wat Ze Vonden: De "Manifold Realignment"

Met hun röntgenmachine ontdekten ze iets fascinerends genaamd Manifold Realignment.

  • Het "Nadenkproces" (RLVR) is als een Wandelaar:
    Wanneer het model leert om te "nadenken" (RLVR), tekent het niet de hele kaart opnieuw. Het verplaatst de bergen niet en verandert de oceaan niet. In plaats daarvan leert het simpelweg een beter pad om over het bestaande terrein te lopen.

    • Globale Vorm: De algemene vorm van de wereld (de "Global Geometry") blijft exact hetzelfde.
    • Lokale Vorm: De wandelaar kan echter de kleine struiken en rotsen direct onder zijn voeten herarrangeren (de "Local Geometry") om de specifieke reis gemakkelijker te maken.
  • Het "Embedding"-proces (Contrastive Learning) is als een Kompas:
    Wanneer ze deze modellen omzetten in embedding-tools, gebruikten ze een trainingsmethode genaamd "Contrastive Learning". Dit is als een kompas dat de kaart dwingt om uit te lijnen met een standaard raster.

    • Omdat het "denkende" model alleen de kleine struiken veranderde en niet de bergen (globale geometrie), kon het kompas de kaart gemakkelijk opnieuw uitlijnen.
    • Het kompas negeerde de kleine herordeningen en bracht de kaart van het "denkende" model weer in perfecte uitlijning met de kaart van het originele model.

De Vergelijking: "Nadenken" vs. "Onthouden"

De auteurs vergeleken dit ook met een andere methode genaamd SFT (Supervised Fine-Tuning), wat lijkt op het dwingen van het model om een specifieke lijst met antwoorden te onthouden.

  • SFT is als een hamer die op de kaart slaat. Het verbrijzelt de bergen en geeft de valleien een nieuwe vorm. Dit creëert een totaal andere kaart. Daarom presteren SFT-modellen vaak anders (soms zelfs slechter) op embedding-taken.
  • RLVR (Nadenken) is voorzichtig. Het houdt de structuur van de kaart intact en optimaliseert alleen de route.

De Conclusie

De paper concludeert dat RLVR (de "denkende" training) de onderliggende kaart niet fundamenteel verbetert.

  • Het optimaliseert het traject (het pad dat het model neemt om een probleem op te lossen).
  • Het herstructureert niet het landschap (de fundamentele manier waarop het model taal begrijpt).

Dus, als je op zoek bent naar een beter embedding-model (een betere kaart om vergelijkbare teksten te vinden), zal het simpelweg trainen van een model om harder te "denken" niet helpen. Je moet de kaart zelf veranderen, niet alleen de manier waarop het model eroverheen loopt. De "denkende" modellen lopen gewoon dezelfde oude kaart, maar ze nemen een iets ander, voorzichtiger pad om bij dezelfde bestemming te komen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →