← Nieuwste papers
💬 NLP

Tmax: A simple recipe for terminal agents

Het artikel introduceert Tmax, een eenvoudig maar krachtig open-source recept voor het trainen van terminal-agenten dat gebruikmaakt van een nieuwe taxonomie voor datageneratie om een grootschalige dataset te creëren, waardoor een model met 9 miljard parameters een state-of-the-art prestatie op Terminal-Bench 2.0 bereikt met behulp van uitsluitend outcome-gebaseerd reinforcement learning.

Oorspronkelijke auteurs: Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Een Robot Leren Hoe Hij een Computer Gebruikt

Stel je voor dat je een zeer slimme robot hebt (een Large Language Model) die code kan schrijven en vragen kan beantwoorden. Maar op dit moment is het als een briljante student die nog nooit een toetsenbord heeft aangeraakt of een computerterminal heeft gebruikt. De robot weet over computers, maar weet niet hoe hij ze daadwerkelijk moet gebruiken om dingen gedaan te krijgen.

Het TMAX-project is een eenvoudige, effectieve "trainingskamp"-methode die ontworpen is om deze robots te leren hoe ze een computerterminal (het zwarte scherm waar je commando's typt) kunnen gebruiken om complexe, real-world problemen op te lossen.

Het Probleem: De "Gym" Was Te Makkelijk

Voordat dit paper verscheen, probeerden onderzoekers deze robots te trainen met bestaande datasets. De auteurs vergeleken deze oude datasets met een sportschool met alleen maar lichte dumbbells.

  • Het Probleen: De taken waren te simpel (zoals "bestanden opnoemen" of "een bestand verplaatsen"). Moderne robots kunnen dit direct oplossen, waardoor ze niets nieuws leerden.
  • De Kloof: Taken in de echte wereld zijn moeilijker. Ze gaan over het opzetten van servers, het debuggen van complexe code en het uitvoiden van lange reeksen commando's. Eerdere trainingsdata bestonden niet uit dit "zware werk".

De Oplossing: Het Bouwen van een Maatgestelde "Obstakelbaan" (TMAX-15K)

Om dit op te lossen, bouwden de auteurs een enorme nieuwe dataset genaamd TMAX-15K. Zie dit als het ontwerpen van een op maat gemaakte, high-tech obstakelbaan voor de robots.

In plaats van elke taak handmatig te schrijven (wat eeuwig zou duren), bouwden ze een receptengenerator:

  1. Mix en Match: Ze creëerden een systeem dat verschillende "ingrediënten" willekeurig combineert:
    • Domein: Gaat dit over beveiliging? Data science? Bestandsbeheer?
    • Persona: Gedraagt de robot zich als een hacker, een systeembeheerder of een data-analist?
    • Moeilijkheidsgraad: Is dit een taak van 3 stappen of een marathon van 30 stappen?
    • Tools: Moet de robot omgaan met audiobestanden, afbeeldingen of complexe code?
  2. De "Docent": Ze gebruikten een super-slimme AI (Gemini-1.5-Pro) om de werkelijke instructies en het "antwoordmodel" voor deze taken te genereren.
  3. Het Resultaat: Ze creëerden 14.600 unieke taken. Cruciaal was dat ze ervoor zorgden dat de moeilijkheidsgraad precies goed was — niet te makkelijk, maar ook niet onmogelijk. Het is als een videogame die de moeilijkheid aanpast zodat de speler altijd uitgedaagd wordt, maar nooit vastloopt.

De Trainingsmethode: Leren door te Doen (Reinforcement Learning)

Zodra ze de obstakelbaan hadden, hadden ze een manier nodig om de robots te trainen. Ze gebruikten een methode genaamd Reinforcement Learning (RL).

  • De Analogie: Stel je voor dat een hond leert om te apporteren. Je legt de hond niet de fysica uit van het gooien van een bal. Je gooit gewoon de bal, en als de hond hem terugbrengt, geef je hem een beloning (een traktatie). Als hij faalt, krijgt hij geen traktatie.
  • Het TMAX-recept:
    • De robot probeert een taak in de terminal op te lossen.
    • Als het lukt, krijgt hij een "beloning".
    • Als het mislukt, krijgt hij niets.
    • De robot probeert het steeds opnieuw en ontdekt langzaam de beste manier om commando's te typen om die beloningen te krijgen.

Belangrijke Innovatie: De auteurs ontdekten dat standaard trainingsmethoden instabiel waren (de robot "vergat" wat hij had geleerd of crashte). Ze pasten de wiskunde aan (door een methode genaamd DPPO te gebruiken en berekeningen nauwkeurig te houden) om de training stabiel te houden, zoals het toevoegen van een schokdemper aan een hobbelige rit.

De Resultaten: Kleine Modellen, Grote Overwinningen

Het meest verrassende deel van het paper is de grootte van de robot die ze hebben getraind.

  • De Underdog: Ze trainden een model met slechts 9 miljard parameters (wat als "klein" wordt beschouwd in de AI-wereld).
  • De Overwinning: Dit kleine model, genaamd TMAX-9B, versloeg bijna alle andere "open" (publiek beschikbare) modellen, inclus_ief sommige die 3 tot 4 keer groter zijn.
  • De Vergelijking: Het presteerde bijna net zo goed als de top-tier, geheime modellen die door grote techbedrijven worden gebruikt (zoals Claude Haiku).

Waarom is dit een groot ding?
Meestal heb je een groter, duurder brein nodig om beter te worden in een moeilijke taak. TMAX liet zien dat met de juiste trainingsdata en een goed recept, een kleiner, goedkoper brein veel grotere modellen kan verslaan.

Blijft de Training Hangen? (Generalisatie)

De auteurs vroegen zich af: "Heeft de robot gewoon de antwoorden op onze specifiek test uit het hoofd geleerd, of heeft hij echt een vaardigheid geleerd?"

  • De Test: Ze plaatsten de getrainde robot in verschillende omgevingen (andere "gym-opstellingen") en gaven hem verschillende soorten problemen (zoals het oplossen van softwarebugs of wiskundige puzzels).
  • Het Resultaat: De robot werd in alles beter. Hij leerde niet alleen om hun specifieke test te halen; hij leerde hoe hij moest denken en tools effectiever kon gebruiken. Het was alsoك een student leren hoe hij moet studeren; zodra ze de methode leerden, konden ze elk examen halen, niet alleen degene waar ze voor geoefend hadden.

Samenvatting

Het TMAX-paper is een "hoe-te-doen"-gids voor het trainen van AI-agents om computers te gebruiken.

  1. Ze bouwden een enorme, diverse en moeilijke dataset (TMAX-15K) met behulp van een slimme generator.
  2. Ze gebruikten een stabiele trainingsmethode om kleine modellen te leren navigeren door deze dataset.
  3. Het resultaat: Een klein, open-source model dat nu het beste in zijn soort is op het gebied van het gebruiken van computerterminals, wat bewijst dat betere trainingsdata belangrijker is dan alleen het model groter maken.

De auteurs hebben al hun code, data en modellen gratis vrijgegeven, in de hoop dat dit de standaard "receptuur" wordt voor toekomstige onderzoekers om nog slimmere terminal-agents te bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →