← Nieuwste papers
📈 economics

RT-SIM: A Simulation Framework for Evaluating Large Language Models for Trade Reconstruction and Reconciliation in Financial Operations

Dit artikel introduceert RT-SIM, een simulatieframework dat aantoont dat frontier large language models effectief transacties kunnen reconstrueren uit communicatie van handelaren voor financiële reconciliatie, mits de dialoog expliciet of slechts ruisachtig is, hoewel de prestaties aanzienlijk afnemen onder ambigue of semantisch gedegradeerde omstandigheden.

Oorspronkelijke auteurs: Martin Higgins, Mackenzie Common

Gepubliceerd 2026-08-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Martin Higgins, Mackenzie Common

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je de financiële wereld voor als een enorm, razendsnel spel van ruilkaarten, maar in plaats van papieren kaarten wisselen mensen elke seconde miljarden dollars aan digitale activa uit. In deze chaotische arena zijn twee dingen absoluut cruciaal: ervoor zorgen dat je ook echt de kaarten hebt die je denkt te hebben, en ervoor zorgen dat je tegenstander niet stiekem een deck met neppertjes vasthoudt. Dit is de taak van "trade reconciliation" (handelsreconciliatie), een chique term voor het dubbelchecken of de transactie die je hebt gedaan overeenkomt met de transactie die de computer heeft geregistreerd. Meestal gebeurt dit door twee lijsten met getallen met elkaar te vergelen. Maar hier komt de twist: handelaren typen niet alleen getallen in computers; ze praten met elkaar. Ze chatten, ze maken grapjes, ze discussiëren en ze raken soms in de war. Decennialang werden deze gesprekken genegeerd door de veiligheidssystemen omdat ze te rommelig waren om te lezen. Nu is er een nieuw soort computerbrein gearriveerd: een Large Language Model (LLM). Denk aan een LLM als een superintelligente, onvermoeibare stagiair die duizenden rommelige gesprekken kan lezen en probeert uit te vogelen welke transactie er precies heeft plaatsgevonden, zelfs als de handelaren door elkaar heen praatten of straattaal gebruikten. De grote vraag is: kan deze superstagiair het werk daadwerkelijk doen, of raakt hij verdwaald in de ruis?

Dit is precies wat Martin Higgins en Mackenzie Common uit probeerden te zoeken in hun paper, "RT-SIM." Ze hebben niet alleen gegokt; ze hebben een simulatie die lijkt op een videogame gebouwd, genaamd RT-SIM, om deze AI-breinen in een gecontroleerde omgeving te testen. Stel je voor dat ze een virtuele handelsvloer creëerden waarin ze handelaren konden programmeren om perfect, licht afgeleid, totaal verward of zelfs complete onzin uit te kramen. Daarna vroegen ze verschillende AI-modellen om naar deze chats te luisteren en de transacties op te schrijven die ze hoorden.

De resultaten waren verrassend duidelijk. Wanneer de handelaren duidelijk spraken, was de AI geweldig. Modellen zoals GPT-4o-mini en Claude Haiku 4.5 konden de transacties met meer dan 95% nauwkeurigheid reconstrueren, zelfs als de handelaren veel irrelevante praatjes over het weer of de lunch erdoorheen gooiden. Het blijkt dat de AI heel goed is in het negeren van de "ruis" om het signaal te vinden. Echter, op het moment dat de handelaren in raadsels spraken, zichzelf tegenstreden of in de war raakten, stortte de prestatie van de AI in. In het "verwarde" scenario daalde de nauwkeurigheid voor sommige modellen van bijna perfect naar minder dan 10%. En wanneer de handelaren complete onzin (gibberish) spraken, probeerde de AI niet dingen te verzinnen; het gaf simpelweg toe dat het nul transacties had gevonden, wat eigenlijk een goede zaak is, want het betekent dat de AI geen nepdeals uit het niets verzint (hallucineren).

De onderzoekers keken ook naar de kosten en snelheid. Ze ontdekten dat het gebruik van deze AI-modellen ongelooflijk goedkoop is — ongeveer $0,0002 per transactie, wat betekent dat je 10.000 transacties kunt verwerken voor slechts $2,00. De snelheid was ook snel genoeg om nuttig te zijn in real-time. De belangrijkste conclusie is niet dat AI alle financiële problemen heeft opgelost, maar dat het wijst op een krachtig nieuw hulpmiddel: als we naar de gesprekken van de handelaren kunnen luisteren, kunnen we fouten of zelfs fraude waarschijnlijk veel sneller opmerken dan we vandaag de dag doen. De studie waarschuwt echter dat dit hulpmiddel alleen werkt als de gesprekken daadwerkelijk ergens op slaan. Als de handelaren te vaag of tegenstrijdig zijn, kan de AI niet helpen. Dus, hoewel de technologie klaar en betaalbaar is, hangt het volledig af van de kwaliteit van de menselijke gesprekken die het probeert te ontcijferen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →