Measuring LLM Trust Allocation Across Conflicting Software Artifacts
Dit paper introduceert TRACE, een raamwerk dat aantoont dat huidige LLM's beter zijn in het detecteren van documentatiefouten dan in het herkennen van subtiele afwijkingen in de code, wat leidt tot een slecht gekalibreerde vertrouwensverdeling tussen verschillende software-artefacten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme, maar soms wat naïeve assistent hebt die je helpt bij het bouwen van een huis. Deze assistent (een AI) kijkt naar drie verschillende documenten om te weten wat hij moet bouwen:
- De blauwdruk (de code, wat er echt gebeurt).
- De architect's notities (de documentatie, wat er zou moeten gebeuren).
- De bouwplannen (de tests, hoe het getest moet worden).
Het probleem is: soms kloppen deze documenten niet met elkaar. De architect schrijft "gebruik rode bakstenen", maar de blauwdruk zegt "gebruik blauwe stenen". Wat doet de slimme assistent dan? Kijkt hij kritisch en zegt: "Hé, hier klopt iets niet!" of neemt hij blindelings aan dat de blauwdruk wel goed moet zijn, omdat die eruitziet als een echte bouwtekening?
Dit is precies wat onderzoekers hebben onderzocht in dit paper. Ze hebben een nieuwe manier bedacht om te testen hoe goed deze AI's kunnen vertrouwen aan de juiste bronnen.
De "TRACE"-test: Een detective-spel voor AI
De onderzoekers hebben een spelletje bedacht genaamd TRACE. Het idee is simpel: ze geven de AI een set documenten, maar ze veranderen stiekem een paar dingen. Soms maken ze een foutje in de architect's notities, soms in de blauwdruk, en soms laten ze de twee tegenstrijdig zijn.
Vervolgens vragen ze de AI niet alleen om het huis te bouwen, maar ook om een rapport te schrijven:
- "Hoe goed vind jij deze blauwdruk?"
- "Hoe goed vind jij deze notities?"
- "Kloppen ze met elkaar?"
- "Welke bron moet ik het meest vertrouwen?"
Ze hebben dit 22.000 keer gedaan met verschillende AI-modellen (zoals die van Google, OpenAI, en anderen) en 456 verschillende Java-programma's.
Wat hebben ze ontdekt? (De verrassingen)
Hier zijn de belangrijkste bevindingen, vertaald naar alledaags taal:
1. AI's zijn betere "tekst-detectives" dan "code-detectives"
Als de architect zijn notities verandert (bijvoorbeeld: "gebruik rode stenen" wordt "gebruik groene stenen"), merken de AI's dit heel snel op. Ze zeggen: "Oeps, hier zit een fout in de tekst!"
Maar als de blauwdruk zelf een fout heeft (bijvoorbeeld: de code doet iets anders dan wat logisch is), dan zijn de AI's vaak blind. Ze kijken naar de notities, zien dat die er "netjes" uitzien, en denken: "Ah, de blauwdruk moet wel fout zijn, want de notities zijn duidelijk."
- Analogie: Het is alsof je een vriend vraagt om een verhaal te vertellen. Als de vriend zijn verhaal verandert, merk je dat direct. Maar als de vriend een fout maakt in de feiten van het verhaal, maar het verhaal klinkt nog steeds logisch, dan geloof je hem gewoon.
2. Ze zien het verschil tussen "grote fouten" en "kleine fouten"
De AI's zijn slim genoeg om te zien of een foutje groot is (een hele pagina tekst weggehaald) of klein (een komma verkeerd). Ze geven een lagere "vertrouwensscore" als de fout groter is. Dit is goed nieuws! Het betekent dat ze niet alleen "ja/nee" denken, maar ook kunnen schalen.
3. Ze weten niet altijd welke bron ze moeten vertrouwen
Soms zeggen ze: "Ik zie een conflict!" maar dan wijzen ze de verkeerde bron aan. Ze denken dat de architect de fout heeft gemaakt, terwijl het de blauwdruk was. Dit is gevaarlijk, want dan proberen ze het verkeerde ding te "fixen".
4. Ze zijn vaak te zelfverzekerd
Veel AI's zeggen: "Ik ben 95% zeker dat dit klopt," terwijl ze eigenlijk helemaal niet zeker zijn. Alleen één model (DeepSeek) was eerlijk genoeg om te zeggen: "Ik weet het niet zeker." De rest doet alsof ze alles snappen, zelfs als ze het niet doen.
Wat betekent dit voor de toekomst?
Dit onderzoek leert ons een belangrijke les: Vertrouw niet blind op AI als het gaat om code.
- Gebruik AI als een tekst-editor: Ze zijn fantastisch om te checken of documentatie klopt met elkaar.
- Gebruik AI niet als een code-auditor: Als je wilt weten of de code zelf veilig en correct is, moet je nog steeds een mens (of een speciale code-checker) erbij halen. De AI negeert vaak subtiele fouten in de code als de tekst er "goed" uitziet.
De conclusie in één zin:
Deze slimme assistenten zijn geweldig om te checken of je instructieboekje klopt, maar ze zijn nog niet goed genoeg om te zien of de machine die je bouwt, daadwerkelijk veilig werkt als het boekje een beetje vaag is. We moeten ze dus gebruiken als een eerste filter, niet als de eindverantwoordelijke.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.