← Nieuwste papers
💬 NLP

DIRECT: Direct Decoding for Efficient and Aligned Sequence Labeling with Large Language Models

Het artikel stelt DIRECT voor, een framework dat de prestaties en efficiëntie van grote taalmodellen voor sequentie-labeling verbetert door Direct Preference Optimization te combineren voor betere afstemming met een gecontroleerd, sjabloonvullend decodingsmechanisme dat redundante berekeningen minimaliseert.

Oorspronkelijke auteurs: Yilei Wang, Jiaxin Gan, Kexuan Zhang, Ling Li, Wentao Zhang, Peichao Lai

Gepubliceerd 2026-07-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yilei Wang, Jiaxin Gan, Kexuan Zhang, Ling Li, Wentao Zhang, Peichao Lai

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super slimme robot hebt die bijna elk boek op het internet heeft gelezen. Het kan gedichten schrijven, wiskundige problemen oplossen en praten als een mens. Dit is wat wetenschappers een "Large Language Model" (LLM) noemen. Maar hier is de crux: hoewel deze robot een genie is in algemene gesprekken, kan hij een beetje een puinhoop zijn wanneer je hem vraagt om zeer specifieke, regelgevoelige taken uit te voeren. Een van die taken is "sequence labeling". Denk aan het als een spelletje "tikkertje" waarbij je door een zin moet gaan en op elk woord een specifieke sticker moet plakken. Is "Apple" een bedrijf? Is "Tim" een persoon? Is "Maart" een datum? De robot moet elke enkele sticker precies goed krijgen, in de exacte juiste volgorde, zonder extra woorden of ontbrekende labels.

Het probleem is dat deze robots gewend zijn om creatief en vrij vloeiend te zijn. Wanneer je ze vraagt om strikte regels te volgen, raken ze soms in de war, vergeten ze het formaat, of verzinnen ze gewoon dingen. Ook, omdat ze zo praatgraag zijn, doen ze er lang over om over elk woord na te denken, wat ze traag en duur in gebruik maakt. Wetenschappers hebben geprobeerd deze robots beter te leren regels te volgen en sneller hun werk te doen, maar het is geweest alsof je een golden retriever probeert te leren om een precieze operatie uit te voeren.

Hier komt een nieuwe methode genaamd DIRECT om de hoek kijken. De onderzoekers achter dit artikel wilden twee grote hoofdpijndossiers oplossen: het feit dat de robot instructies niet goed genoeg opvolgt, en het feit dat de robot te traag is. Ze hebben de robot niet alleen harder iets geleerd; ze veranderden hoe de robot leert en hoe de robot denkt.

Eerst gaven ze de robot een speciale vorm van training genaamd Direct Preference Optimization (DPO). Stel je voor dat je een hond leert om te apporteren. In plaats van alleen te zeggen "Ga de bal halen", laat je de hond twee verschillende manieren zien waarop hij kan apporteren: één waarbij hij de bal perfect brengt, en één waarbij hij de bal halverwege laat vallen. Je zegt dan tegen de hond: "Ik vind de eerste veel beter." Door de robot duizenden van deze "goed vs. slecht" voorbeelden te laten zien, leert hij precies te begrijpen wat mensen verkiezen, waardoor het veel waarschijnlijker is dat hij de taak de eerste keer goed uitvoert.

Ten tweede, en dit is het echt slimme deel, veranderden ze hoe de robot zijn antwoord schrijft tijdens de eigenlijke test. Meestal moet een robot de hele zin opnieuw uitschrijven, woord voor woord, inclusief de woorden die hij al kent. Het is alsof je een student vraagt om het hele verhaal van "Assepoester" opnieuw te schrijven, alleen om de kleur van de jurk aan het einde te veranderen. DIRECT stopt deze verspilling. In plaats van het hele verhaal opnieuw te schrijven, krijgt de robot een "invul-sjabloon". Hij hoeft alleen de specifieke stickers (de labels) te schrijven en kan de rest overslaan. De computer onthoudt de rest van het verhaal onmiddellijk, wat een enorme hoeveelheid tijd en energie bespaart.

De resultaten van deze nieuwe aanpak zijn zeer indrukwekkend. De onderzoekers testten DIRECT op acht verschillende datasets, die als verschillende sets oefenopgaven dienen die zaken bevatten zoals het vinden van namen van mensen, plaatsen en organisaties. Ze kwamen tot de conclusie dat DIRECT niet alleen nauwkeuriger was dan andere topmethoden, maar ook aanzienlijk sneller. In feite was DIRECT op sommige tests tot wel 9 keer sneller dan de beste bestaande methoden.

Toen ze nauwkeurig keken naar waarom het zo goed werkte, ontdekten ze dat beide onderdelen van hun plan essentieel waren. Als ze de speciale training (DPO) hadden verwijderd, maakte de robot meer fouten. Als ze de "invul-truc" voor snelheid hadden verwijderd, kreeg de robot de juiste antwoorden maar duurde het eeuwen om het te doen. Door strikte regelvolgende training te combineren met een slimme manier om onnodig werk over te slaan, slaagde DIRECT erin om het beste van twee werelden te krijgen: een robot die zowel een perfectionist als een snelheidskampioen is.

Het artikel laat zien dat we met de juiste training en een beetje engineering-truquerij deze krachtige AI-tools veel nuttiger kunnen maken voor taken die precisie vereisen. Het gaat er niet alleen om de robot slimmer te maken; het gaat erom hem te leren hoe hij zich moet concentreren en hoe hij efficiënt kan werken, waardoor een praatgrage genie verandert in een betrouwbare, snelle werker.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →