← Nieuwste papers
🤖 AI

Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-CodeX

Dit rapport introduceert ATBench-Claw en ATBench-CodeX, twee domeinspecifieke uitbreidingen van het ATBench-raamwerk die een aangepaste veiligheidstaxonomie gebruiken om de veiligheid en diagnose van agenttrajecten te evalueren in respectievelijk de OpenClaw- en OpenAI Codex-omgevingen.

Oorspronkelijke auteurs: Zhonghao Yang, Yu Li, Yanxu Zhu, Tianyi Zhou, Yuejin Xie, Haoyu Luo, Jing Shao, Xia Hu, Dongrui Liu

Gepubliceerd 2026-04-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhonghao Yang, Yu Li, Yanxu Zhu, Tianyi Zhou, Yuejin Xie, Haoyu Luo, Jing Shao, Xia Hu, Dongrui Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar soms wat onvoorspelbare robot-assistent hebt. Deze robot kan van alles: e-mails sturen, bestanden bewerken, code schrijven en zelfs software installeren. Maar wat gebeurt er als deze robot per ongeluk een verkeerde knop indrukt, een kwaadaardig commando uitvoert of per ongeluk geheime gegevens lekt?

Dit is precies waar dit onderzoek over gaat. De auteurs hebben een nieuw "veiligheidstest-systeem" ontwikkeld om te kijken hoe veilig deze robot-assistenten zijn in verschillende situaties. Ze noemen dit ATBench.

Hier is een simpele uitleg van wat ze hebben gedaan, met behulp van een paar creatieve vergelijkingen:

1. Het Probleem: De Robot verandert van werkplek

Stel je voor dat je een rijbewijs hebt. Je hebt eerst geoefend op een lege parkeerplaats (de basis-robot). Maar nu moet je de robot ook laten rijden in een drukke stad (zoals OpenClaw, waar de robot werkt met tools en sessies) én in een bouwput waar hij met zware machines werkt (zoals CodeX, waar de robot met computerbestanden en code werkt).

Elke nieuwe omgeving heeft zijn eigen gevaren. In de stad is het gevaar dat je een fietser overrijdt; op de bouwplaats is het gevaar dat je een muur laat instorten. Een standaard rijtest werkt niet voor beide situaties. Je hebt een specifieke test nodig voor elke omgeving.

2. De Oplossing: Een slimme "Veiligheids-Checklist"

De onderzoekers hebben een slimme Checklist (de Safety Taxonomy) bedacht. Deze checklist heeft drie lagen, net als een goede veiligheidscontrole:

  1. Waar komt het gevaar vandaan? (Bijvoorbeeld: een kwaadaardige gebruiker, een defecte tool, of de robot zelf die een fout maakt).
  2. Hoe faalt de robot? (Bijvoorbeeld: hij luistert naar een verkeerd commando, of hij gebruikt een tool op de verkeerde manier).
  3. Wat is het echte resultaat? (Bijvoorbeeld: iemand verliest geld, privacy wordt geschonden, of er ontstaat chaos).

In plaats van elke keer een hele nieuwe test te bouwen, gebruiken ze deze ene, flexibele checklist. Ze passen de checklist alleen iets aan voor de specifieke omgeving.

3. De Twee Nieuwe Tests: ATBench-Claw en ATBench-CodeX

De paper introduceert twee nieuwe versies van deze test, gebaseerd op dezelfde checklist maar met een andere focus:

  • ATBench-Claw (De "Kantoor-Robot"):

    • De situatie: Hier werkt de robot als een assistent die e-mails stuurt, bestanden opent en met mensen communiceert.
    • Het gevaar: Het is alsof de robot per ongeluk een vertrouwelijk document naar de verkeerde persoon stuurt, of als hij in een vergadering per ongeluk een geheim onthult. De test kijkt specifiek naar risico's zoals "wie is de afzender?" en "mag deze robot dit bericht sturen?".
    • De aanpassing: De checklist krijgt extra vakjes voor "verkeerde afzender" en "geheime sessies".
  • ATBench-CodeX (De "Bouw-Robot"):

    • De situatie: Hier werkt de robot als een programmeur die code schrijft, software installeert en bestanden aanpast op een server.
    • Het gevaar: Dit is alsof de robot per ongeluk een muur laat instorten of een gevaarlijke machine aanzet. Als de robot een verkeerde code-regel installeert, kan de hele computercrashen of kan een hacker binnenkomen.
    • De aanpassing: De checklist krijgt extra vakjes voor "gevaarlijke code", "verkeerde software-installatie" en "bestanden die per ongeluk worden gewist".

4. Wat hebben ze ontdekt? (De Testresultaten)

Ze hebben verschillende robot-modellen op deze tests laten lopen. Het resultaat was verrassend:

  • Speciale bewakers (Guard Models): Sommige modellen zijn speciaal getraind om gevaar te zien (zoals een politieagent). Die deden het goed, maar niet altijd perfect.
  • Algemene slimme robots: De grote, algemene modellen (zoals Qwen3.5 of Llama) deden het vaak beter dan de speciale bewakers. Ze waren slimmer in het begrijpen van de context.
  • De winnaar: Een systeem genaamd AgentDoG (een soort "super-bewaker" die de slimme robot helpt) deed het overal het beste. Het kon zowel in de drukke stad als op de bouwplaats het gevaar het beste zien en voorkomen.

Conclusie: Waarom is dit belangrijk?

Het belangrijkste punt van dit onderzoek is dat je niet elke keer een compleet nieuw veiligheidssysteem hoeft te bouwen als robots nieuwe taken krijgen.

Het is alsof je een universele auto-veiligheidstest hebt. Als je een nieuwe auto met een nieuwe motor krijgt, hoef je niet de hele test op te bouwen. Je past alleen de regels aan: "Voor deze nieuwe motor moeten we extra testen op brandgevaar."

De onderzoekers tonen aan dat hun systeem (ATBench) zo flexibel is dat het mee kan groeien met de technologie. Of de robot nu e-mails schrijft of code bouwt, je kunt dezelfde slimme checklist gebruiken om te zien of hij veilig blijft. Dit maakt het veel makkelijker om AI-systemen veilig te houden terwijl ze steeds slimmer en complexer worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →