DiscoverLLM: From Executing Intents to Discovering Them
DiscoverLLM is een nieuw raamwerk dat Large Language Models traint om gebruikers te helpen hun ambiguïteiten te ontdekken en te concretiseren via een cognitieve-staat-gebaseerde gebruikerssimulator, wat resulteert in aanzienlijk verbeterde taakprestaties, kortere gesprekken en hogere gebruikerstevredenheid bij creatieve, technische en visuele taken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een zeer specifiek gerecht te bestellen bij een chef, maar je weet eigenlijk nog niet wat je wilt eten. Je weet alleen dat je honger hebt en dat je iets "goeds" wilt.
Als je een standaard AI-chef vraagt: "Maak me iets goeds", dan gokt hij misschien op een biefstuk. Je neemt een hap en zegt: "Hmm, niet helemaal goed." De chef vraagt: "Wil je het pittiger?" Jij zegt: "Ik weet het niet." De chef gis opnieuw, misschien een salade. Jij zegt: "Nee, dat is te koud." Dit heen-en-weer kan eeuwig doorgaan omdat de chef wacht tot je precies weet wat je wilt voordat hij het kan koken.
DISCOVERLLM is een nieuwe manier om AI-chefs te trainen om te beseffen dat je misschien niet weet wat je wilt totdat je het eten ziet.
Hier is hoe het paper dit uitlegt, met eenvoudige analogieën:
1. Het Probleem: Het "Verborgen Menu"
Normaal gesproken gaan AI-modellen ervan uit dat je een volledige bestelling in je hoofd hebt (een "volledig gevormde intentie"). Ze denken dat hun enige taak het stellen van verduidelijkende vragen is, zoals: "Wil je het warm of koud?"
Maar in het echte leven, vooral bij creatieve taken zoals het schrijven van een verhaal of het tekenen van een plaatje, weet je vaak het antwoord niet totdat je een voorbeeld ziet. Je kunt de chef niet vertellen dat je "pittig" wilt als je nog niets pittigs hebt geproefd. Je moet ontdekken dat je pittig eten leuk vindt door het te proberen.
2. De Oplossing: De "Proeverij" Simulator
De onderzoekers bouwden een speciale "gesimuleerde gebruiker" (een robot die als mens handelt) om de AI te trainen. Deze robot heeft een geheim, verborgen menu van voorkeuren dat hij nog niet weet dat hij heeft.
- Het Verborgen Menu: Stel je voor dat de robot een geheime lijst met verlangens heeft: "Ik wil een gedicht", "Ik wil een dier", "Ik wil een kat", "Ik wil een slapende kat".
- Het Ontdekkingsproces: In het begin weet de robot alleen dat hij "een gedicht" wil. Hij weet niet dat hij een kat wil.
- De Taak van de AI: In plaats van alleen te vragen: "Welk dier wil je?" (wat de robot nog niet kan beantwoorden), probeert de AI verschillende opties aan te bieden.
- AI probeert: "Hier is een gedicht over een hond."
- Robot denkt: "Oh, een hond is prima, maar misschien wil ik iets zachters." (De robot ontdekt dat hij een huisdier prefereert).
- AI probeert: "Hier is een gedicht over een slapende kat."
- Robot denkt: "Ja! Dat is het!" (De robot heeft nu zijn ware intentie ontdekt).
3. De Training: Leren "Duwen"
De AI wordt getraind met een beloningssysteem. Hij krijgt punten niet alleen voor het geven van het juiste antwoord, maar voor het helpen de gebruiker uit te vinden wat hij wil.
- Foute zet: Als de AI vraagt: "Wil je een kat of een hond?" terwijl de gebruiker het niet weet, krijgt de AI geen punten. De gebruiker zit vast.
- Goede zet: Als de AI een foto van een hond laat zien en de gebruiker zegt: "Nee, misschien iets kleiners", krijgt de AI punten. Hij heeft de gebruiker succesvol "geduwd" om een nieuwe voorkeur te ontdekken.
Het paper noemt dit balanceren van Divergentie (het tonen van veel verschillende opties om te verkennen) en Convergentie (het verkleinen van de keuze zodra de gebruiker weet wat hij leuk vindt).
4. De Resultaten: Minder Praten, Meer Doen
De onderzoekers testten deze nieuwe AI op taken zoals het schrijven van verhalen, technische artikelen en het tekenen van digitale afbeeldingen.
- Snellere Ontdekking: De nieuwe AI hielp gebruikers ongeveer 10% sneller vinden wat ze wilden dan oudere modellen.
- Kortere Conversaties: Omdat de AI stopte met het stellen van nutteloze vragen en begon met het tonen van nuttige voorbeelden, waren de gesprekken 40% korter.
- Gelukkigere Gebruikers: In een studie met echte mensen vonden mensen dat de nieuwe AI behulpzamer was en leek hun behoeften te "voorspellen", zelfs wanneer de gebruikers zelf niet zeker wisten wat ze wilden.
Het Grote Plaatje
Denk aan de oude AI als een kelner die wacht tot je het hele menu hebt gelezen en bestelt.
Denk aan de nieuwe DISCOVERLLM als een proefchef die kleine monsters van verschillende gerechten brengt. Terwijl je ze proeft, realiseer je: "Oh, ik hou eigenlijk van de pittige!" of "Ik haat de koude soep."
Het paper beweert dat we door AI te leren die proefchef te zijn – jou te helpen je eigen voorkeuren te ontdekken door verkennen in plaats van alleen te wachten op instructies – AI veel beter kunnen maken in het helpen bij creatieve en open-ended taken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.