← Nieuwste papers
🤖 machine learning

Bittensor Agent Arenas as a Trajectory Primitive: Distilling a Shopping Agent from ShoppingBench Subnet Traces

Dit artikel toont aan dat een prikkel-gealigneerde Bittensor agent-arena (SN15) hoogwaardige, diverse agentische trajecten kan genereren die, wanneer deze gefilterd en gebruikt worden voor het post-trainen van een Qwen3-4B model, de ShoppingBench-prestaties significant verbeteren van 18,0% naar 42,7% ASR, terwijl de biases van synthetische data en de ruis van ongefilterde productielogs worden vermeden.

Oorspronkelijke auteurs: Shardul Bansal, Seth Schilbe, Jarrod Barnes

Gepubliceerd 2026-06-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shardul Bansal, Seth Schilbe, Jarrod Barnes

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar onervaren robotassistent probeert te leren hoe hij voor je boodschappen moet doen. Je wilt dat hij het perfecte item vindt op basis van jouw specifieke regels (prijs, kleur, verzendsnelheid), maar de robot blijft fouten maken of geeft te snel op.

Dit artikel gaat over hoe de auteurs een gigantische, geautomatiseerde trainingsgym hebben gebouwd om deze robot te leren, in plaats van hem simpelweg een tekstboek met "correcte" antwoorden te geven.

Hier is de onderverdeling van hun aanpak met behulp van eenvoudige analogieën:

1. Het Probleem: Het "Tekstboek" vs. De "Echte Wereld"

Meestal gebruiken wetenschappers om deze robots te trainen een van de twee volgende methoden, en beide hebben gebreken:

  • Het "Nepte Tekstboek" (Synthetische Data): Ze vragen een superintelligente AI om zich voor te stellen dat het een shopper is en op te schrijven wat het zou doen.
    • Het Gebrek: De AI schrijft alleen wat het al weet te doen. Het is alsof een student alleen voor een toets studeert door het antwoordmodel te lezen. Het mist de vreemde, moeilijke of creatieve oplossingen die echte mensen vinden.
  • Het "Echte Wereld Logboek" (Productiedata): Ze registreren wat echte robots in het wild doen.
    • Het Gebrek: Deze logboeken zijn rommelig. Veel robots maken gebruik van "shortcuts" (zoals het raden van het antwoord zonder daadwerkelijk te zoeken) om snel een hoge score te halen. Als je je nieuwe robot met deze logboeken leert, leert hij de shortcuts aan in plaats van de werkelijke vaardigheden.

2. De Oplossing: De "Shopping Arena" (SN15)

De auteurs bouwden een speciale digitale arena genaamd SN15 op een netwerk genaamd Bittensor. Zie dit als een 24/7 Shopping Olympiade.

  • De Deelnemers: In plaats van één AI, sturen honderden verschillende teams (miners) hun eigen shopping-robots in om te strijden.
  • De Prijs: De winnaars krijgen digitale tokens (geld). Dit creëert een krachtige prikkel. Omdat ze willen winnen, probeert elk team voortdurend nieuwe en betere manieren om boodschappen te doen te bedenken die hun concurrenten nog niet hebben bedacht.
  • De Scheidsrechter: Elke keer dat een robot iets probeert te kopen, kijkt een speciale "Judge AI" naar het hele proces. Het controleert niet alleen of de robot het juiste item heeft gekocht; het controleert ook hoe de robot dacht. Heeft het robot zorgvuldig gezocht? Heeft het de prijs gecontroleerd? Hoe herstelde het zich toen het vastliep?
  • De Wisselende Test: Om te voorkomen dat robots simpelweg de antwoorden uit het hoofd leren, veranderen de testvragen (shopping-taken) constant en worden ze gegroepeerd, zodat een robot niet kan valsspelen door een licht aangepaste versie van een vraag te zien die hij al eerder heeft opgelost.

3. De Filter: Het Selecteren van de "Echte Atleten"

De arena produceert een enorme vloedgolf aan data (een "firehose"). Maar niet alle data is nuttig.

  • De Filter: De auteurs bouwten een zeef om het kaf van het koren te scheiden.
    • Ze gooiden robots eruit die alleen als "vertellers" optraden (die een verhaal vertellen over een zoekopdracht die eigenlijk door een computerscript werd uitgevoerd).
    • Ze hielden alleen de robots over die daadwerkelijk het werk zelf deden (tools aanriepen, zochend, en redenerend).
    • Ze gooiden ook elke robot eruit die geen hoge score kreeg van de "Judge AI" voor de kwaliteit van de redenering.

4. Het Resultaat: Een Slimere Robot

Ze namen een kleine, open-source robot (Qwen3-4B) en trainden deze alleen op de gefilterde, hoogwaardige data uit deze arena.

  • Vóór de Training: De robot was als een beginnende shopper, die het juiste antwoord slechts 18% van de tijd vond.
  • Na de Training: De robot werd een pro en vond het juiste antwoord 42,7% van de tijd.
  • De Vergelijking: Deze nieuwe robot presteerde bijna net zo goed als de beste robots ter wereld die getraind zijn op enorme, dure synthetische datasets, maar de auteurs deden dit met slechts een fractie van de data (slechts één dag aan output uit de arena).

5. De Addertjes onder het Gras (Wat ze niet hebben opgelost)

Het paper is eerlijk over wat er nog ontbreekt.

  • De "Pass@1" vs. "Pass@8" Kloof: De robot is geweldig als je hem 8 pogingen geeft om het beste antwoord te kiezen (53% succes), maar als hij slechts één poging krijgt, zakt het succespercentage naar 34%.
  • Het Ontbrekende Stuk: De auteurs realiseerden zich dat hun trainingsdata een specif kind van een "oefenronde" mist, waarbij de robot probeert, faalt en stap voor stap leert van de fout. Ze identificeerden dat het toevoegen van dit specifieke type data de sleutel is om de robot naar het volgende niveau te tillen (48,7% succes).

Samenvatting

Het paper betoogt dat in plaats van te proberen betere tekstboeken te schrijven of rommelige logboeken op te schonen, we geïncentiveerde competities moeten bouren waar AI-agents tegen elkaar strijden om problemen op te lossen. Deze competitie genereert van nature de perfecte, diverse en hoogwaardige "trainingsdata" die nodig is om kleinere, goedkopere AI-modellen bekwaam te maken als agenten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →