TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice
Dit paper introduceert TaxPraBen, het eerste schaalbare benchmark voor de gestructureerde evaluatie van grote taalmodellen in de Chinese fiscale praktijk, dat traditionele taken combineert met realistische scenario's zoals risicopreventie en inspectie-analyse om de prestaties van diverse modellen te meten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme, super-intelligente robot hebt die alles kan lezen en begrijpen. Hij kan gedichten schrijven, code programmeren en zelfs verhaaltjes vertellen. Maar wat gebeurt er als je hem vraagt om een ingewikkelde belastingaangifte voor een Chinees bedrijf te doen? Of om te berekenen hoeveel belasting een ondernemer moet betalen als hij zijn fabriek uitbreidt?
Deze robot (een zogenaamd "Groot Taalmodel" of LLM) loopt dan vaak vast. Hij is slim, maar hij is niet getraind op de specifieke, saaie en complexe regels van de Chinese belastingwereld.
Hier is wat de auteurs van dit paper hebben gedaan om dat probleem op te lossen, vertaald in een eenvoudig verhaal:
1. Het Probleem: De "Alleskunner" die faalt in de praktijk
Tot nu toe waren er tests voor deze robots die keken of ze goed konden lezen of rekenen in het algemeen. Maar dat is als het testen van een Formule 1-auto op een speelgoedcircuit. Het toont niet of de auto echt veilig is op een regenachtige bergweg.
In de echte wereld van belastingen moet je twee dingen tegelijk doen:
- De regels begrijpen (wat zegt de wet?).
- De cijfers kloppen (hoeveel geld is dat precies?).
Bestaande tests keken alleen naar het lezen van de regels. Ze negeerden de rekenfouten. Hierdoor dachten we dat de robots beter waren dan ze echt waren.
2. De Oplossing: TaxPraBen (De "Belasting-Testbaan")
De onderzoekers hebben TaxPraBen bedacht. Dit is de eerste echte testbaan specifiek voor Chinese belastingpraktijk.
Stel je voor dat TaxPraBen een gigantisch trainingskamp is voor robots, opgebouwd uit drie niveaus, gebaseerd op hoe mensen leren:
- Niveau 1: Het Uit het Hoofd Leren (Memoriseren)
- De analogie: Net als een student die de wetboeken moet kunnen opzeggen.
- De test: "Wat is het tarief voor belasting op auto's met een cilinderinhoud van 1,5 liter?" De robot moet het antwoord letterlijk uit het hoofd kunnen zeggen.
- Niveau 2: Het Begrijpen (Verstaan)
- De analogie: Een vertaler die een moeilijk artikel samenvat.
- De test: "Lees dit lange nieuwsartikel over nieuwe belastingregels en vertel me in één zin wat het belangrijkste punt is."
- Niveau 3: Het Toepassen (De Werkelijkheid)
- De analogie: Een echte belastingadviseur die een klant helpt.
- De test: Dit is het moeilijkste deel. De robot moet een scenario krijgen (bijvoorbeeld: "Een bedrijf wil zijn machines vervangen") en dan een plan maken. Het plan moet een tekstuele uitleg bevatten én de exacte berekening van hoeveel belasting ze besparen. Als de tekst mooi is maar de berekening fout, is het plan waardeloos.
3. Hoe hebben ze dit gebouwd?
Ze hebben niet zomaar data van internet geplukt. Ze hebben samen gewerkt met echte belastingexperts en studenten.
- Ze hebben boeken, officiële documenten van de overheid en online nieuws verzameld.
- Ze hebben AI gebruikt om de data te schrapen, maar mensen hebben alles handmatig gecontroleerd.
- Ze hebben ervoor gezorgd dat de vragen lijken op wat een belastingadviseur echt tegenkomt: risicopreventie, inspectie-analyses en belastingplanning.
4. Wat hebben ze ontdekt? (De resultaten)
Toen ze 19 verschillende robots op deze testbaan lieten lopen, kwamen ze tot interessante conclusies:
- De "Grote Jongens" winnen: De duurste, gesloten robots (zoals die van OpenAI en Baidu) doen het het beste. Ze hebben enorme kennisbanken.
- Chinees is beter: Robots die specifiek zijn getraind op de Chinese taal en cultuur doen het vaak beter dan internationale robots, omdat belastingregels heel specifiek zijn voor een land.
- Speciale training helpt niet altijd: Er was een robot die speciaal was getraind op belastingdata (YaYi2), maar die deed het verrassend slecht. Het blijkt dat je niet alleen meer data nodig hebt, maar ook de juiste kwaliteit en logica.
- Rekenen is nog steeds een probleem: Zelfs de slimste robots hebben moeite met complexe berekeningen. Ze kunnen een mooi verhaal schrijven over belastingplanning, maar als je vraagt om het exacte bedrag, maken ze vaak fouten.
5. Waarom is dit belangrijk?
TaxPraBen is als een spiegel voor de AI-wereld. Het laat zien dat we niet zomaar kunnen vertrouwen op robots voor belangrijke financiële beslissingen.
Het biedt ook een nieuwe manier om te testen: niet alleen "weet de robot de regels?", maar "kan de robot de regels toepassen en de cijfers kloppen?" Deze methode kan straks ook worden gebruikt voor andere moeilijke vakgebieden zoals advocatuur, geneeskunde en financiën.
Kortom: De onderzoekers hebben een eerlijke, moeilijke test ontwikkeld om te zien of onze slimme robots echt klaar zijn om ons te helpen met onze belastingaangifte, of dat ze nog even moeten blijven oefenen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.