← Nieuwste papers
💬 NLP

Capital Markets LLM Reliability Score (CM-LRS): From Plausible to Bankable

Dit artikel introduceert de Capital Markets LLM Reliability Score (CM-LRS), een nieuw zevendimensionaal evaluatiekader ontworpen om de "bankability" van outputs van grote taalmodellen in gereguleerde financiële workflows te beoordelen, waarbij wordt onthuld dat hoewel frontier-modellen nauw bij elkaar liggen qua algehele prestaties, er aanzienlijke hiaten blijven bestaan in retrieval- en synthesecapaciteiten vergeleken met open-weight baselines.

Oorspronkelijke auteurs: Prerit Ahuja

Gepubliceerd 2026-07-28
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Prerit Ahuja

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je in een gigantische bibliotheek bent waar een superintelligente robot is aangenomen om rapporten te schrijven voor een bank. Deze robot, een Artificial Intelligence (AI) genaamd een Large Language Model (of LLM), is ongelooflijk getalenteerd in schrijven. Het kan klinken als een ervaren expert, perfect grammaticaal correct zijn en een verhaal vertellen dat prachtig vloeit. Maar hier is de crux: in de wereld van de hooggespannen financiële sector is goed klinken niet genoeg. Als de robot een getal verzint, vergeet zijn bronnen te controleren of een stap in een complexe berekening overslaat, kan dit de bank miljoenen kosten of hen in de problemen brengen met toezichthouders. De grote vraag is niet: "Kan de robot een vloeiende zin schrijven?", maar: "Kan de robot een zin schrijven die een menselijke expert kan vertrouwen met hun carrière?" Dit artikel duikt in exact dat probleem, waarbij het verder gaat dan eenvoudige tests van "heeft het het juiste antwoord gegeven?" naar een veel diepere controle van "is dit antwoord veilig om te gebruiken?".

De auteurs introduceren een nieuwe tool genaamd de CM-LRS (Capital Markets LLM Reliability Score). Denk aan dit als een "veiligheidsinspecteur" voor AI-rapporten. In plaats van alleen een voldoende of onvoldoende te geven, controleert de inspecteur het rapport op zeven verschillende niveaus: Is het verhaal waar? Kun je de exacte pagina in het brondocument aanwijzen waar de feit afkomstig is? Komen de rekenkundige getallen overeen? Heeft de robot de hele klus geklaard, of heeft hij een stap overgeslagen? Heeft hij feiten verzonnen om gaten op te vullen? Is het rapport daadwerkelijk nuttig voor het nemen van een beslissing? En tot slot, kan een mens het werk van de robot gemakkelijk controleren? De onderzoekers testten vier verschillende AI-modellen op vijf real-world banktaken, zoals het extraheren van getallen uit obligatiecontracten, het vinden van vergelijkbare eerdere deals en het schrijven van bedrijfsprofielen.

Dit is wat zij ontdekten. Ten eerste presteren de drie meest geavanceerde, dure "closed-source" AI-modellen (van bedrijven zoals Anthropic en OpenAI) allemaal op een zeer vergelijkbaar, hoog niveau van betrouwbaarheid. Ze liggen qua score zo dicht bij elkaar dat het moeilijk is om te zeggen dat de één duidelijk beter is dan de anderen voor deze specifieke taken. Er is echter een duidelijke kloof tussen deze topmodellen en één "open-source" model (Llama 3.3 70B). Het open-source model scoorde aanzienlijk lager, vooral op taken die vereisten dat er door veel documenten werd gegraven of informatie uit verschillende bronnen werd gecombineerd. Het was goed in eenvoudige taken, zoals het kopiëren van getallen van een enkele pagina, maar het worstelde wanneer het bewijs moest vinden of een samenvatting moest schrijven.

De meest verrassende ontdekking ging over een specifiek onderdeel van de score genaamd "Decision Usefulness" (Besluitvormingsnut). Dit meet of een menselijke bankier de rapportage daadwerkelijk zou willen gebruiken zonder de helft ervan te hoeven herschrijven. Bij één specifieke taak (het schrijven van een bedrijfsprofiel) varieerden de scores voor deze enkele factor enorm tussen de modellen, met een spreiding van 4,0 punten op een schaal van 5. Dit suggereert dat, hoewel veel AI's vloeiend kunnen schrijven, alleen de allerbeste modellen werk kunnen produceren dat echt "bankable" is — wat betekent dat het klaar is om in de echte wereld te worden gebruikt zonder dat een mens de fouten hoeft te herstellen. Het artikel concludeert dat we voor banen met hoge inzet niet alleen moeten kijken naar hoe goed een AI praat; we hebben een strikte checklist nodig zoals de CM-LRS om ervoor te zorgen dat de wiskunde klopt, de bronnen echt zijn en het werk veilig is om te vertrouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →