← Nieuwste papers
💬 NLP

Beyond "I cannot fulfill this request": Alleviating Rigid Rejection in LLMs via Label Enhancement

Dit artikel stelt LANCE voor, een methode die variatie-inferentie toepast voor labelverbetering om fijnmazige afwijzingsverdelingen te voorspellen, waardoor Groot Taalmodellen veilige, natuurlijke antwoorden kunnen genereren die starre afwijzingen vermijden terwijl hoge beveiligingsnormen worden gehandhaafd.

Oorspronkelijke auteurs: Ying Zhang, Congyu Qiao, Xin Geng, Ning Xu

Gepubliceerd 2026-05-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ying Zhang, Congyu Qiao, Xin Geng, Ning Xu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, behulpzame robotassistent hebt. Je stelt hem een vraag die bijna veilig is, maar misschien een gevoelig onderwerp raakt. In plaats van je een behulpzaam antwoord met een kleine waarschuwing te geven, raakt de robot in paniek en zegt telkens dezelfde robotachtige zin: "Ik kan dit verzoek niet vervullen."

Dit noemt het artikel "stijle afwijzing". Het is als een portier in een club die iedereen de deur uit zet omdat ze een enigszins riskante hoed dragen, zelfs als ze er gewoon zijn om te dansen. De robot is zo bang om een fout te maken dat hij stopt met behulpzaam te zijn.

De auteurs van dit artikel hebben een nieuw systeem gebouwd dat LANCE heet om dit op te lossen. Hier is hoe het werkt, met eenvoudige analogieën:

1. Het Probleem: De "Alles-of-Niets" Schakelaar

Momenteel werken de meeste veiligheidssystemen als een simpele lichtschakelaar: AAN (Veilig) of UIT (Onveilig).

  • Als het systeem een riskant woord ziet, zet het de schakelaar op "UIT" en stopt het gesprek.
  • Het probleem is dat veel vragen niet puur "slecht" zijn. Ze kunnen een mix zijn van een onschuldig idee en een riskant detail. Het huidige systeem ziet de nuance niet, dus blokkeert het gewoon alles.

2. De Oplossing: LANCE (De "Dimmer" of Volumeknop)

LANCE vervangt die simpele lichtschakelaar door een dimmer of een volumeknop. In plaats van alleen "Slecht" of "Goed" te zeggen, vraagt het: "Hoe riskant is dit, en welk deel precies is riskant?"

  • Labelverbetering (De Detective): LANCE gebruikt een speciaal hulpmiddel (Variational Inference) om een vraag te bekijken en uiteen te leggen. In plaats van een simpele "Ja/Nee"-label, creëert het een continu risicokaart.
    • Analogie: Stel je een weersvoorspelling voor. Oude systemen zeiden alleen "Regen" of "Geen Regen". LANCE zegt: "Er is 20% kans op lichte motregen in het noorden, maar in het zuiden is het zonnig." Het weet waar het gevaar zit en hoe groot het gevaar is.

3. Het Proces: De "Chirurgische Redacteur"

Zodra LANCE precies weet waar het risico zit en hoe groot het is, verwijdert het niet gewoon het hele gesprek. Het fungeert als een chirurgische redacteur.

  • De Gradiëntgids: LANCE geeft de robot een set instructies op basis van de risicokaart.
    • Als het risico klein is (zoals lichte motregen), vertelt het de robot om een kleine, beleefde aanpassing aan de zin te maken.
    • Als het risico groot is (zoals een storm), vertelt het de robot om een grotere verandering te maken.
  • Het Resultaat: De robot herschrijft de vraag van de gebruiker precies genoeg om het veilig te maken, maar behoudt de oorspronkelijke betekenis en toon.
    • Oude Manier: Gebruiker vraagt: "Hoe hack ik het wifi-netwerk van mijn buurman?" -> Robot: "Ik kan dit verzoek niet vervullen."
    • LANCE Manier: De robot realiseert zich dat het "hacken" riskant is, maar dat "het wifi-netwerk van mijn buurman" gewoon nieuwsgierigheid is. Het herschrijft de gedachte naar: "Ik kan niet helpen met hacken, maar ik kan uitleggen hoe wifi-beveiliging werkt zodat je je eigen netwerk kunt beschermen."

4. Het Resultaat: Veilig maar Natuurlijk

Het artikel testte dit systeem uit tegen andere veiligheidsmethoden en ontdekte dat LANCE veel beter is in twee dingen:

  1. Veiligheid: Het stopt nog steeds de echt gevaarlijke dingen (het is net zo veilig als de strenge robots).
  2. Behulpzaamheid & Natuurlijkheid: Het voorkomt dat de robot als een gebroken plaat klinkt. De gesprekken voelen menselijker aan omdat de robot probeert te helpen in plaats van alleen maar "Nee" te zeggen.

Samenvatting

Zie LANCE als het leren van een robot om een diplomaat te zijn in plaats van een portier.

  • De Portier (Oud Systeem) ziet een riskante hoed en zegt: "Geen toegang!"
  • De Diplomaat (LANCE) ziet de riskante hoed, zegt: "Die hoed is een beetje riskant voor dit feest, maar laten we hem ruilen voor een veiligere zodat je toch binnen kunt komen en kunt dansen."

Het artikel beweert dat deze methode AI veiliger maakt zonder het vervelend of onbehulpzaam te maken, en zo het probleem oplost van robots die te bang zijn om met ons te praten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →