Statistically Indistinguishable, Operationally Distinct: A Formal Barrier for Tabular Foundation Models
Dit artikel stelt een formele barrière vast voor tabulaire foundation models door aan te tonen dat zij, zelfs met geavanceerde redeneercapaciteiten, het verschil niet kunnen zien tussen legale en regelovertredende database-toestanden als zij geen toegang hebben tot de operationele regels die de data beheersen, zoals blijkt uit hun onvermogen om de "Operational Turing Test" te passeren waar alleen op regels gebaseerde audits een perfecte nauwkeurigheid bereiken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: Het "Magische Grootboek"-probleem
Stel je voor dat je een grootboek van een bank hebt. Het is een gigantisch spreadsheet dat laat zien wie hoeveel geld heeft, welke transacties er hebben plaatsgevonden en wie wat bezit.
Stel je nu voor dat je een superintelligente AI (een "Tabular Foundation Model") een kopie van dit spreadsheet geeft. Je vraagt de AI: "Is deze pagina van het grootboek legaal, of is er mee geknoeid?"
Het artikel stelt dat de AI zal falen. Zelfs als de AI de slimste ter wereld is, kan hij het verschil niet zien tussen een echte pagina en een nep-pagina die zorgvuldig is aangepast om er echt uit te zien, als de AI alleen naar de cijfers op de pagina kijdt.
Het artikel noemt dit de "Operationele Turingtest." Het bewijst dat zonder te weten welke regels de bank gebruikt om het grootboek te schrijven, de AI wiskundig gezien blind is voor bepaalde soorten fraude.
De Analogie: Het "Perfect Vervalste Bonnetje"
Om te begrijpen waarom de AI faalt, kijken we naar hoe de onderzoekers de "nep" data hebben gemaakt.
Stel je een bonnetje voor van een koffiebar.
- Echt Bonnetje: Je koopt 2 koffies van elk $5. Je krijgt 10% korting. Het totaal is $9,00.
- Nep Bonnetje (De Corruptie): Iemand verandert de berekening. Ze zeggen dat je 2 koffies hebt gekocht, maar het totaal is $9,05. Om dit te verbergen, verlagen ze de prijs van elke andere koffie die die dag in de winkel is verkocht met een fractie van een cent.
Het Resultaat:
- De Cijfers Zien Er Identiek Uit: Als je naar de "Gemiddelde Prijs" of de "Totale Omzet" van de hele dag kijkt, is het nep bonnetje statistisch gezien identiek aan het echte bonnetje. De "1-weg" en "2-weg" cijfers (zoals gemiddelden en paren getallen) komen perfect overeen.
- De Logica is Kapot: De wiskunde op dit specifieke bonnetje klopt niet. 5 minus 10% zou $9,00 moeten zijn, niet $9,05.
Het Dilemma van de AI:
De AI is als een detective die alleen de eindcijfers op het bonnetje ziet. Hij ziet de gemiddelde prijs en de totale omzet. Omdat het nep bonnetje statistisch gezien exact overeenkomt met de echte cijfers, heeft de AI geen enkele manier om te weten dat het een vervalsing is. Hij moet gokken, en hij gokt slechts in 50% van de gevallen goed (zoals bij het opgooien van een muntje).
De "Toegangsladder": Hoe Hoog Kan de AI Klimmen?
De onderzoekers hebben de AI getest op verschillende niveaus van "toegang", zoals het beklimmen van een ladder:
Niveau 1: De "Blinde" AI (Alleen Waarden)
- Wat het ziet: Alleen een lijst met getallen (gemiddelden, aantallen, standaarddeviaties).
- Resultaat: Het faalt volledig. Het kan het verschil niet zien tussen echt en nep. Het gokt 50/50.
- Analogie: Proberen een puzzel op te lossen door alleen naar de kleuren van de stukjes te kijken, niet naar de afbeelding die ze vormen.
Niveau 2: De "Relationele" AI (Het Zien van de Verbindingen)
- Wat het ziet: Het kan zien hoe tabellen met elkaar verbonden zijn (bijv. "Deze bestelling hoort bij Klant X"). Het controleert of de klant bestaat en of het aantal bestellingen logisch is.
- Resultaat: Het wordt beter in het opsporen van sommige fouten (zoals als een klant niet bestaat), maar het faalt nog steeds bij het opsporen van de rekenfouten (de "Value-Transformation" logica).
- Analogie: De AI kan zien dat de klant echt is, maar het kan nog steeds de berekening niet maken om te weten of de korting correct is toegepast.
Niveau 3: De "Regel-lezende" AI (De Oracle)
- Wat het ziet: Het ziet niet alleen de cijfers; het ziet de broncode en de regels (bijv. "Totaal = Prijs × Aantal × (1 - Korting)"). Het voert een controle uit om de wiskunde zelf opnieuw te berekenen.
- Resultaat: Het behaalt 100% nauwkeurigheid. Het ziet het nep bonnetje direct omdat het de wiskunde opnieuw kan uitvoeren en de fout ziet.
- Analogie: Dit is de detective die het originele receptenboek heeft. Hij kan de soep proeven en zeggen: "Dit klopt niet, want je hebt zout gebruikt in plaats van suiker," zelfs als de kleur wel goed is.
De Schokkende Bevinding: Zelfs "Superbreinen" Falen
De onderzoekers namen de meest geavanceerde AI-modellen die beschikbaar zijn (zoals GPT-5.5 en Kimi-K2.6) en gaven ze alles:
- De spreadsheet data.
- De database-structuur (schema).
- De daadwerkelijke code die de regels schrijft.
- De trigger-scripts.
Het Resultaat: Zelfs met al deze informatie faalden de AI-modellen nog steeds.
- Ze konden niet betrouwbaar een legale staat van een illegale staat onderscheiden.
- Ze verwierpen vaak perfect legale staten als "nep".
- Ze konden niet de juiste SQL-query schrijven om de wiskunde te controleren, zelfs toen ze de regels voor hun neus hadden.
Waarom? Het artikel suggereert dat het probleem niet is dat de AI niet "slim" genoeg is of meer data nodig heeft. Het probleem is identificeerbaarheid. Als de data statistisch identiek lijkt aan het echte ding (omdat de vervalser slim was), kan geen enkele hoeveelheid "redeneren" het oplossen, tenzij de AI expliciet geprogrammeerd is om de specifieke regelcontroles uit te voeren.
De Conclusie: Je Hebt het "Regelboek" Nodig
Het artikel concludeert dat voor AI om te werken met echte zakelijke data (zoals bankgegevens of verkoopcijfers), de AI niet alleen de data kan "lezen". De AI moet geworteld zijn in de operationele regels.
- Huidige AI: Kijkt naar de cijfers en gokt. (Faalt).
- Toekomstige AI: Moet verbonden zijn met de daadwerkelijke code die de regels definieert, zodat het de controle kan uitvoeren. (Slaagt).
Kortom: Je kunt een AI niet leren een goede auditor te zijn door het simpelweg een miljoen spreadsheets te laten zien. Je moet het de rekenmachine en het regelboek geven, zodat het zelf de berekening kan uitvoeren. Zonder dat is het slechts gokken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.