← Nieuwste papers
🤖 AI

GTA: Generating Long-Horizon Tasks for Web Agents at Scale

Dit artikel introduceert GTA, een schaalbaar raamwerk dat realistische multi-hop webagenttaken met uitvoerbare trajecten automatisch genereert door crawling, op zoekopdrachten gebaseerde zaadselectie en geautomatiseerde validatie te integreren om de beperkingen van bestaande benchmarks te overwinnen en robuuste training en evaluatie mogelijk te maken.

Oorspronkelijke auteurs: Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey, Yilun Zhou, Muhao Chen, Jonathan May, Chien-Sheng Wu

Gepubliceerd 2026-05-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey, Yilun Zhou, Muhao Chen, Jonathan May, Chien-Sheng Wu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een robot te leren hoe je het internet gebruikt. De robot heeft een brein (een taalmodel) en handen (tools om te klikken en te typen), maar is momenteel erg onhandig. Het kan eenvoudige antwoorden vinden, zoals "Wat is de hoofdstad van Frankrijk?", maar het worstelt met complexe missies, zoals "Vind de goedkoopste vlucht naar Tokio, controleer of het hotel een zwembad heeft, en kijk of de vluchttijd past bij mijn afspraak bij de dokter."

Het probleem is dat we de robot niet genoeg goede oefening hebben gegeven.

Het Probleem: Trainen met een Gebroken Kaart

Momenteel lijken de meeste tests voor deze webrobots op het geven van een kaart met alleen een "Start" en een "Finish"-punt, maar zonder instructies over hoe je daar komt.

  • Oude Benchmarks: Dit zijn handgeschreven puzzels die door mensen zijn gemaakt. Ze zijn er maar weinig van, en ze testen vaak alleen eenvoudige, één-staps taken.
  • Automatische Pogingen: Sommige onderzoekers probeerden robots websites op hun eigen manier te laten verkennen om nieuwe puzzels te creëren. Maar dit was alsof je een peuter een winkelcentrum laat rondstruinen om speelgoed te vinden: ze vonden alleen de glimmende, voor de hand liggende dingen (zoals de speelgoedwinkel) en negeerden de rest (zoals de apotheek of het foodcourt). Het was ook ongelooflijk duur en traag.

Hierdoor "overfitten" robots. Ze hebben de specifieke puzzels die ze kregen uit het hoofd geleerd, maar kunnen geen omgaan met rommelige situaties uit de echte wereld waar ze tussen verschillende pagina's en websites moeten springen om een probleem op te lossen.

De Oplossing: GTA (De "Architect"-benadering)

De auteurs introduceren GTA (Generating Long-Horizon Tasks for Web Agents at Scale). Denk aan GTA niet als een leraar die werkbladen uitdeelt, maar als een hoofdarchitect die een trainingsgym bouwt.

Hier is hoe ze het bouwden, met eenvoudige stappen:

  1. De Crawl (Het in kaart brengen van de stad): In plaats van de robot blind te laten rondstruinen, stuurt GTA eerst een vloot digitale "verkenners" om hele websites in kaart te brengen (zoals e-commerce winkels, overheidswebsites en nieuwsportalen). Ze bouwen een complete "stadskaart" van elke pagina en hoe ze met elkaar verbonden zijn.
  2. De Zaad (Het kiezen van de uitdaging): In plaats van te raden hoe een moeilijke taak eruitziet, kiest GTA twee willekeurige locaties op de kaart (bijvoorbeeld een pagina over een specifiek schoenmodel en een pagina over een specifieke korting).
  3. De Generatie (Het schrijven van de missie): Er wordt aan een AI gevraagd om een missie te schrijven die vereist dat beide locaties worden bezocht om het op te lossen. Bijvoorbeeld: "Vind de prijs van de schoen op Pagina A, en controleer vervolgens of Pagina B een kortingsbon heeft die het goedkoper maakt."
  4. De Kwaliteitscontrole (De scheidsrechter): Voordat de missie wordt vrijgegeven, wordt deze gecontroleerd door een strenge scheidsrechter.
    • Is het oplosbaar? (Kun je het antwoord daadwerkelijk krijgen?)
    • Is het duidelijk? (Is er maar één juist antwoord?)
    • Is het multi-hop? (Dwingt het de robot om meer dan één pagina te bezoeken?)
  5. Het Gouden Pad (Het antwoordmodel): Cruciaal is dat GTA het exacte pad registreert dat de robot moet nemen. Dit stelt onderzoekers in staat om de missie perfect opnieuw af te spelen en precies te zien waar de robot het verkeerd deed.

Waarom Dit Belangrijk Is: De "Mens versus Robot"-Kloof

De auteurs testten deze nieuwe gym met huidige robots en vonden een enorme kloof:

  • De Robots: Wanneer ze geconfronteerd werden met deze nieuwe, meerstaps taken, faalden de robots het merendeel van de tijd (vaak met een score onder de 20%). Ze raakten verdwaald, gaven te vroeg op, of probeerden de zoekbalk te gebruiken in plaats van de site op de juiste manier te navigeren.
  • De Mensen: Toen mensen dezelfde taken probeerden, losten ze ze gemakkelijk op (85% succespercentage).
  • De Zoekmachine: Zelfs een simpele Google-zoekopdracht kon deze taken niet oplossen omdat het antwoord niet op één plek stond; het was verstopt over verschillende pagina's.

Belangrijkste Kenmerken van GTA

  • Het is een "Levende" Gym: In tegenstelling tot oude tests die statisch zijn (bevroren in de tijd), kan GTA blijven doorgaan met het genereren van nieuwe taken van live websites. Dit voorkomt dat robots gewoon de antwoorden uit het hoofd leren.
  • Het is Wereldwijd: Het werkt in veel talen (Engels, Italiaans, Japans, Duits, Chinees), niet alleen in het Engels. De robots worstelden zelfs nog meer met niet-Engelse sites.
  • Het is Cross-Website: Sommige taken vereisen dat de robot van een gezondheidssite naar een financiën-site springt om een probleem op te lossen, wat nabootst hoe echte mensen het web gebruiken.

De Conclusie

GTA is een nieuw, massaal en geautomatiseerd systeem voor het creëren van realistische, moeilijke trainingsmissies voor webrobots. Het bewijst dat huidige robots nog steeds vrij zwak zijn in het navigeren door de complexe, meerstaps aard van het echte internet. Door een manier te bieden om eindeloze, hoogwaardige en verifieerbare uitdagingen te genereren, helpt GTA onderzoekers precies te achterhalen waar robots falen, zodat ze betere robots kunnen bouwen.

Wat het NIET is:

  • Het is geen tool voor artsen of bedrijven om nu direct te gebruiken.
  • Het claimt niet het probleem van webagents op te lossen; het biedt gewoon een betere manier om ze te testen en laat zien hoeveel werk er nog te doen is.
  • Het behandelt geen taken die vereisen in te loggen op privéaccounts of echte aankopen te doen (vanwege veiligheidsregels).

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →