← Nieuwste papers
🤖 AI

Ambig-DS: A Benchmark for Task-Framing Ambiguity in Data-Science Agents

Dit artikel introduceert Ambig-DS, een benchmark die bestaat uit twee diagnostische suites die aantonen hoe datawetenschapsagenten stilzwijgend falen door zich vast te leggen op onbedoelde taakformuleringen wanneer ze geconfronteerd worden met ambiguïteit, en benadrukken dat het herkennen van onderspecificatie in plaats van het waarborgen van pijplijnuitvoering de kritieke knelpunt is in huidige evaluaties.

Oorspronkelijke auteurs: Josefa Lia Stoisser, Marc Boubnovski Martell, Sidsel Boldsen, Kaspar Märtens, Robert Kitchen

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Josefa Lia Stoisser, Marc Boubnovski Martell, Sidsel Boldsen, Kaspar Märtens, Robert Kitchen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: De "Stille Fout"

Stel je voor dat je een zeer slimme, geautomatiseerde chef (een AI-agent) huurt om een maaltijd voor je te bereiden. Je geeft hen een receptkaart en een mand met ingrediënten.

In de meeste huidige tests is de receptkaart perfect: er staat bijvoorbeeld "Maak een pittig pastagerecht met tomaten en basilicum". De chef kookt het, serveert het, en de test zegt: "Goed gedaan! De pasta is gaar en correct gepresenteerd."

Maar in de echte wereld zijn receptkaarten vaak rommelig. Je zegt misschien gewoon: "Maak iets met deze ingrediënten", zonder te specificeren wat je moet maken.

  • Het Probleem: De AI-chef ziet de ingrediënten en besluit stilzwijgend: "Oké, ik maak een salade." Ze maken een perfecte, eetbare salade. Maar jij wilde pasta.
  • Het Falen: De test zegt: "Succes! De salade is gaar en gepresenteerd." De test weet niet dat je pasta wilde. De AI vroeg niet: "Wilde je pasta of salade?" Ze gokte gewoon, maakte een perfect verkeerd gerecht en verstopte de fout achter een perfect uitgevoerde taak.

Het paper noemt dit "Ongeflaggde Misframing". De AI is technisch bekwaam (ze kan koken), maar mist de wijsheid om te beseffen dat de instructies vaag waren en om verduidelijking te vragen voordat ze begint.

De Oplossing: Ambig-DS (De "Verwarringstest")

De onderzoekers creëerden een nieuwe benchmark genaamd Ambig-DS om dit specifieke type falen op te sporen. In plaats van de AI perfecte instructies te geven, creëerden ze opzettelijk "tricky" taken waarbij het doel onduidelijk is.

Ze testten twee hoofdtypen van verwarring:

1. De "Welk Getal?"-Verwarring (Doel-Ambiguïteit)

  • De Opzet: Stel je een spreadsheet voor met twee kolommen met getallen. De ene kolom is het "echte" antwoord dat de AI moet voorspellen (bijvoorbeeld "Totale Omzet"), en de andere is een "decoy" (bijvoorbeeld "Totaal Aantal Medewerkers"). Beide lijken erg op elkaar en zijn even makkelijk te voorspellen.
  • De Truc: De instructies zeggen gewoon: "Voorspel de waarde." Ze zeggen niet welke waarde.
  • Het Resultaat: De AI kiest er één (meestal de decoy), bouwt een perfect model en dient het in.
  • De Score: Omdat de AI de verkeerde kolom koos, krijgt het een verschrikkelijke score, zelfs als de code perfect liep.
  • De Bevinding: Zelfs de slimste AI-modellen (de "frontier"-modellen) liepen in deze val 39% tot 63% van de tijd. Ze committeerden zich stilzwijgend aan het verkeerde antwoord.

2. De "Hoe Meten We?"-Verwarring (Doelwit-Ambiguïteit)

  • De Opzet: Stel je een taak voor waarbij je moet raden of een foto een cactus bevat. De instructies zeggen: "Dien je gokken in", maar ze vergeten te zeggen hoe de gokken worden beoordeeld.
  • De Truc: Moet je een "Ja/Nee" (Hard Label) indienen of een "70% kans op Ja" (Kans)?
    • Als de beoordelaar kansen wil, maar jij dient Ja/Nee in, faal je.
    • Als de beoordelaar Ja/Nee wil, maar jij dient kansen in, kun je falen of een vreemde score krijgen.
  • Het Resultaat: De AI gokt. Soms gokt ze het verkeerde formaat. Soms, beseffend dat ze het niet weet, geeft ze gewoon op en dient ze een lui, constant antwoord in (zoals "Ja" voor alles) om de taak gewoon af te ronden.
  • De Bevinding: In deze gevallen gaf de AI 16% tot 62% van de tijd het verkeerde formaat of gaf ze stilzwijgend op.

Het "Magische Vraag"-Experiment

De onderzoekers wilden weten: Als de AI één vraag mocht stellen, kon ze dan de fout herstellen?

Ze gaven de AI een "Verduidelijkingsoorakel" (een magische knop die één vraag waarheidsgetrouw beantwoordt).

  • Het Resultaat: Wanneer de AI mocht vragen: "Welke kolom is het doel?" of "Wilt u kansen of Ja/Nee?", schoot hun prestatie terug omhoog naar bijna perfecte niveaus.
  • De Haken: De AI is geweldig in het beantwoorden van de vraag als ze vraagt. Maar de AI is slecht in het weten wanneer ze moet vragen.
    • Als je de AI zegt "Je mag alles vragen", stelt ze te veel stomme vragen (zoals "Vind je pittig eten lekker?") bij taken die al duidelijk waren.
    • Als je de AI zegt "Vraag alleen als je vastloopt", blijft ze stil bij de tricky taken en maakt ze toch de verkeerde gok.

De Conclusie

Het paper concludeert dat we AI-agenten momenteel testen alsof we raceauto's testen: we kijken of ze snel kunnen rijden en op het juiste moment kunnen stoppen. Maar we testen niet of ze een kaart kunnen lezen wanneer de verkeersborden ontbreken.

De belangrijkste bottleneck is niet dat de AI geen code kan schrijven of modellen kan trainen; het is dat de AI niet weet wanneer ze het niet weet.

  • Voor Gebruikers: Ga er niet van uit dat de AI je vage instructies begrijpt. Wees zeer specifiek over wat je wilt voorspellen en hoe je succes wilt meten.
  • Voor Bouwers: We moeten AI trainen om beter te zeggen: "Ik ben in de war, kun je verduidelijken?" in plaats van gewoon te gokken en op het beste te hopen.
  • Voor Testers: We moeten stoppen met alleen controleren of de code werkt. We moeten controleren of de AI zich allereerst realiseerde dat de instructies vaag waren.

Kortom: Een AI die een verkeerd plan perfect kan uitvoeren, is een gevaarlijke AI. Ambig-DS is het eerste instrument dat is ontworpen om dit specifieke type stil falen op te sporen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →