← Nieuwste papers
💻 computer science

MMTB: Evaluating Terminal Agents on Multimedia-File Tasks

Dit artikel introduceert MultiMedia-TerminalBench (MMTB), een benchmark van 105 taken, en de Terminus-MM-harness om de vaardigheid van terminalagenten te evalueren om audio- en videobestanden te begrijpen en ermee te handelen, waarmee een gat wordt gedicht in bestaande benchmarks die voornamelijk gericht zijn op tekst en code.

Oorspronkelijke auteurs: Chiyeong Heo, Jaechang Kim, Junhyuk Kwon, Hoyoung Kim, Dongmin Park, Jonghyun Lee, Jungseul Ok

Gepubliceerd 2026-05-13
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chiyeong Heo, Jaechang Kim, Junhyuk Kwon, Hoyoung Kim, Dongmin Park, Jonghyun Lee, Jungseul Ok

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: De "Blinde" Robot versus de "Ziehende" Robot

Stel je een zeer slimme robotassistent voor die leeft binnen de commandoregel van een computer (een tekst-only interface). Deze robot is geweldig in het lezen van tekst, het schrijven van code en het organiseren van bestanden. Maar wat gebeurt er als je hem vraagt een video te bewerken, een liedje te knippen of een specifieke spreker te vinden in een opname van een vergadering?

Op dit moment zijn de meeste van deze robots blind voor de werkelijke inhoud van audio- en videobestanden. Ze kunnen alleen de bestandsnamen "zien" (zoals meeting.mp4) of de bestandsgrootte. Om te begrijpen wat erin zit, moeten ze gebruikmaken van "krukken" – speciale tekstgebaseerde tools die proberen te raden wat er gebeurt door video om te zetten in een lijst met getallen of audio in een ruwe transcriptie. Het is alsof je probeert een film te beschrijven door alleen naar de filmposter te kijken en een wazige samenvatting te lezen die is geschreven door iemand die er niet bij was.

Dit artikel introduceert een nieuwe manier om deze robots te testen en een nieuwe set tools om hen te helpen daadwerkelijk te zien en te horen waar ze mee werken.


1. De Nieuwe Test: MMTB (De "Multimedia Obstaclebaan")

De auteurs hebben een nieuwe test ontwikkeld genaamd MMTB (MultiMedia-TerminalBench). Denk hierbij aan een rijexamen, maar in plaats van een auto te besturen, moet de robot multimedia-bestanden bewerken met alleen een toetsenbord en commandoregel-tools.

  • De Taken: Er zijn 105 verschillende uitdagingen. Ze variëren van "knip de video zodat alleen de spreker te zien is" tot "vind het exacte moment waarop een specifiek geluid voorkomt in een podcast."
  • De Bron: Dit zijn geen verzonneerde puzzels. Ze zijn gebaseerd op echte banen die mensen daadwerkelijk doen op freelanceplatforms (zoals Upwork), zoals het bewerken van video's voor YouTube, het transcriberen van vergaderingen of het repareren van audio voor films.
  • Het Doel: De robot moet een eindbestand produceren (zoals een geknipte video of een JSON-lijst met tijdstippen) dat bewijst dat hij de inhoud heeft begrepen.

De Analogie: Stel je voor dat je een chef vraagt een specifiek gerecht te maken.

  • Oude Test: Je geeft de chef een lijst met ingrediënten (tekst) en vraagt hem te koken. Hij kan het eten niet proeven; hij volgt gewoon blindelings het recept.
  • MMTB: Je geeft de chef de daadwerkelijke ingrediënten en zegt: "Proef deze saus en pas het zout aan totdat het perfect is." De robot moet daadwerkelijk "proeven" (waarnemen) van de audio en video om te slagen.

2. De Nieuwe Tool: Terminus-MM (De "Superzintuigen"-harnas)

Om te zien of robots het beter kunnen doen wanneer ze "superzintuigen" hebben, hebben de auteurs een nieuw systeem gebouwd genaamd Terminus-MM.

  • De Oude Weg (Blinde): De robot moest een commando uitvoeren zoals ffmpeg om een video om te zetten in een hoop stilstaande beelden, vervolgens een ander commando om die beelden om te zetten in tekstbeschrijvingen, en daarna proberen een beslissing te nemen. Het was een lange, rommelige keten van gissingen.
  • De Nieuwe Weg (Terminus-MM): Dit systeem geeft de robot een directe "oor" en "oog". Het kan zeggen: "Luister direct naar dit audiobestand" of "Bekijk direct dit videofragment" zonder het eerst om te zetten in tekst.

De Analogie:

  • Blinde Robot: Proberen een nummer te identificeren door een tekstuele beschrijving van de lyrics en het tempo te lezen.
  • Terminus-MM: Hoofdtelefoon opzetten en het nummer direct beluisteren.

3. Wat Ze Vonden (De Resultaten)

De auteurs testten verschillende versies van robots om te zien welke de MMTB-test konden halen.

  • De "Blinde" Robots Faalden: Robots die alleen tekst konden lezen of bestanden naar tekst konden converteren (zoals de standaard Codex CLI of Terminus-2) hadden moeite. Ze losten slechts ongeveer 16% van de taken op. Ze verdwaalden in de lange ketens van commando's die nodig waren om de inhoud te "raden".
  • De "Ziehende" Robots Wonnen: Wanneer de robots directe toegang hadden tot audio en video (Terminus-MM), steeg hun slagingspercentage aanzienlijk (tot 37% met de beste modellen).
  • Efficiëntie Is Belangrijk: De "blinde" robots faalden niet alleen vaker; ze waren ook langzamer en duurder. Omdat ze zo veel conversietools moesten draaien om de inhoud te raden, verbruikten ze meer geld en tijd. De "ziehende" robots kwamen direct tot de kern.

De Analogie:
Stel je voor dat je een specifieke rode auto in een parkeergarage moet vinden.

  • Blinde Robot: Maakt een foto van elke auto, schrijft een beschrijving van elke auto op en leest vervolgens de beschrijvingen om de rode te vinden. Het duurt eeuwen en er worden fouten gemaakt.
  • Ziehende Robot: Kijkt gewoon naar de parkeergarage en wijst direct naar de rode auto.

4. Het "Goudlokje"-Probleem: Te Veel Tools Is Slecht

Een van de meest interessante bevindingen ging over hoe de tools aan de robot worden gepresenteerd.

  • De Fout: Als je een robot elke mogelijke tool geeft (een microfoon, een camera, een vergrootglas), zelfs wanneer de taak alleen een videobestand betreft, raakt de robot in de war. Hij kan tijd verspillen door te proberen een videobestand zonder apart audiospoor te "luisteren", of hij kan vastlopen in een lus van controleren en hercontroleren.
  • De Oplossing: Het beste systeem (Terminus-MM) is slim over welke tools het aanbiedt. Als een taak alleen videobestanden bevat, verbergt het het audiogereedschap. Als het alleen audio bevat, verbergt het het videogereedschap. Dit voorkomt dat de robot tijd verspillt aan doodlopende wegen.

De Analogie:
Als je een cake bakt, heb je geen hamer of sleutel nodig. Als je een bakker een gereedschapskist geeft met alles erin, kan hij 20 minuten besteden om uit te zoeken of hij het meel moet hameren. Het beste systeem geeft hen alleen de garde en de kom.

Samenvatting

Dit artikel betoogt dat AI-agenten, om echte wereldtaken met video en audio echt te beheersen, niet zomaar "tekstverwerkers" kunnen zijn die raden wat er in een bestand zit. Ze hebben native toegang nodig om de bestanden direct te horen en te zien.

  • Zonder deze toegang: Robots zijn traag, duur en vatbaar voor fouten omdat ze vertrouwen op onhandige omwegen.
  • Met deze toegang: Robots worden veel efficiënter en nauwkeuriger, hoewel ze nog steeds zorgvuldig moeten worden begeleid zodat ze niet afgeleid worden door tools die ze niet nodig hebben.

Het artikel concludeert dat de toekomst van terminal-agenten ligt in het combineren van directe waarneming (horen/zien) met betrouwbare toolgebruik (commando's uitvoeren), in plaats van eerst te proberen alles naar tekst te vertalen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →