ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution
Het paper introduceert ToolOmni, een unificerend agentic framework dat grote taalmodellen in staat stelt om zich in open-wereldscenario's aan te passen aan massale en evoluerende toolbibliotheken door middel van proactieve zoekopdrachten en grondige uitvoering, wat resulteert in een significante verbetering van de eind-tot-eind succesratio en generalisatievermogen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een super-intelligente assistent hebt die alles kan doen: van het boeken van een vakantie tot het repareren van een computer. Maar er is een probleem: deze assistent staat in een gigantische bibliotheek met miljoenen gereedschappen (apps, databases, diensten), en de bibliotheek groeit elke dag.
De meeste huidige assistenten hebben twee grote zwaktes:
- Ze zoeken te passief: ze gooien een vraag in de bibliotheek en hopen dat de eerste paar boeken die ze vinden goed zijn. Vaak missen ze het juiste gereedschap.
- Ze zijn te star: als er een nieuw gereedschap wordt toegevoegd, weten ze niet hoe ze dat moeten gebruiken, omdat ze alleen maar hebben geleerd wat ze in hun "hoofd" (geheugen) hebben opgeslagen.
ToolOmni is de oplossing. Het is een nieuw systeem dat deze assistent leert om niet alleen te gebruiken, maar ook actief te zoeken en te leren in een wereld die nooit stopt.
Hier is hoe het werkt, vertaald naar alledaagse beelden:
1. De Twee-Fase Opvoeding (Het Leren)
ToolOmni leert in twee stappen, net zoals je een kind zou opvoeden:
- Fase 1: De "Koudstart" (SFT)
Eerst krijgt de assistent een strenge leraar die hem laat zien hoe het moet. Ze krijgen duizenden voorbeelden van goede zoektochten en het juiste gebruik van gereedschappen. Dit is als het laten zien van een receptboekje. De assistent leert de basis: "Als je dit wilt, zoek dan naar dit." - Fase 2: De "Proef en Leer" (RL met GRPO)
Daarna wordt de assistent losgelaten in de echte wereld. Hier mag hij fouten maken! Als hij het verkeerde gereedschap kiest, krijgt hij een "rood lichtje" (een negatieve beloning). Als hij het goed doet, krijgt hij een "groen lichtje".
Het slimme aan ToolOmni is dat het twee verschillende scoreborden heeft:- Zoek-score: Heeft hij het juiste gereedschap gevonden?
- Uitvoerings-score: Heeft hij het gereedschap goed gebruikt om het probleem op te lossen?
Veel andere systemen kijken alleen naar het eindresultaat. ToolOmni kijkt ook naar het proces. Als je het juiste gereedschap vindt, maar het verkeerd gebruikt, krijg je toch feedback. Dit zorgt ervoor dat de assistent niet alleen slim zoekt, maar ook slim handelt.
2. De Actieve Zoektocht (Proactief Zoeken)
Stel je voor dat je op zoek bent naar een specifiek onderdel voor je fiets in een enorme garage.
- De oude manier: Je vraagt de garagebaas: "Heb je een fiets?" en hij geeft je de eerste 5 dozen die hij ziet. Vaak zit het juiste onderdeel er niet bij.
- ToolOmni's manier: ToolOmni denkt eerst na. Hij zegt: "Oké, ik heb een wiel nodig. Ik vraag eerst naar 'fietswielen'. Oh, die zijn te groot. Dan vraag ik specifiek naar '28-inch mountainbike wielen'. Nog steeds niet goed? Dan vraag ik naar 'merk X'."
ToolOmni stopt niet bij het eerste antwoord. Het stelt zelf nieuwe vragen, filtert de rommel eruit en houdt pas op als het precies de gereedschappen heeft die nodig zijn. Het is alsof het een detective is die zelf het spoor volgt, in plaats van iemand die blindelings een lijstje afwerkt.
3. De "Aardse" Uitvoering (Grounded Execution)
Zodra ToolOmni de juiste gereedschappen heeft gevonden, gaat het aan het werk. Maar het blijft hierbij aarden.
Het betekent: "Ik doe alleen wat de gereedschappen mij vertellen." Als een tool zegt: "Ik kan dit niet doen, je mist een nummer," dan denkt ToolOmni: "Ah, ik heb een fout gemaakt. Ik voeg het nummer toe en probeer het opnieuw."
Het leert dus ook om fouten op te lossen. Als een andere assistent vastloopt in een cirkel van fouten, denkt ToolOmni: "Dit werkt niet, ik probeer een andere route."
Waarom is dit zo belangrijk?
In de echte wereld veranderen gereedschappen constant. Nieuwe apps komen, oude verdwijnen.
- Oude systemen breken als ze een nieuw gereedschap tegenkomen, omdat ze niet zijn getraind om te zoeken.
- ToolOmni is als een veerkrachtige zwemmer. Als het water (de gereedschappen) verandert, zwemt het gewoon mee. Het leert de vaardigheid om te zoeken en te gebruiken, in plaats van alleen maar de namen van de gereedschappen uit het hoofd te leren.
Kortom: ToolOmni is een AI-assistent die niet alleen wacht tot je hem een gereedschap geeft, maar zelf actief de juiste gereedschappen zoekt, fouten durft te maken om te leren, en uiteindelijk het probleem oplost alsof het een ervaren vakman is in een wereld vol verandering.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.