Can Open-Weight Models Compete on Financial Text Comprehension?
Dit artikel evalueert bijgewerkte Financial Touchstone-benchmarks met twintig modellen, waarbij wordt onthuld dat open-weight modellen zoals Kimi K2.6 in staat zijn om propriëtaire systemen te evenaren in financiële tekstbegrip, ondanks hardnekkige knelpunten in informatie-extractie en inconsistent geopolitiek weigeringsgedrag in Chinese modellen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin computers leren lezen, schrijven en redeneren zoals mensen. Dit vakgebied, genaamd Kunstmatige Intelligentie (AI), is onlangs geëxplodeerd met nieuwe modellen die kunnen chatten, wiskundige problemen kunnen oplossen en zelfs code kunnen schrijven. Maar er is een addertje onder het gras: veel van deze superintelligente computers zijn "black boxes". We weten dat ze werken, maar we weten niet precies hoe ze zijn gebouwd of welke geheimen ze in hun code bewaren. Onlangs is er een nieuwe golf van deze modellen verschenen uit Chinese laboratoria die "open-weight" zijn, wat betekent dat hun blauwdrukken publiek toegankelijk zijn voor iedereen om te bestuderen, in tegen tegenstelling tot de geheime, op slot gezette versies van grote Amerikaanse technologiebedrijven. De grote vraag die iedereen bezighoudt is: kunnen deze open, publieke modellen daadwerkelijk het harde, saaie, maar superbelangrijke werk doen van het lezen van financiële rapporten en het vinden van de waarheid, of zijn ze alleen goed in het slim klinken?
Dit artikel is als een enorme, inzetvolle test voor twintig van deze AI-modellen. De onderzoekers hebben een "Financial Touchstone"-uitdaging opgezet, wat in fe 됩니다 een gigantische bibliotheek is van 495 echte jaarverslagen van bedrijven over de hele wereld, gekoppeld aan 2.967 lastige vragen over deze rapporten. Denk eraan als het geven van een stapel van 495 tekstboeken aan een student en vragen: "Hoeveel winst maakte Bedrijf X in 2022?" of "Wat zijn de drie belangrijkste bedrijfstakken?". Het doel was om te zien welk AI de juiste antwoorden kon vinden zonder dingen te verzinnen (een probleem dat "hallucinatie" wordt genoemd) en zonder vast te lopen omdat het de juiste pagina in het boek niet kon vinden.
De resultaten waren een totale plotwending. Lange tijd dachten mensen dat je een speciaal "redeneerbrein" of een geheim, eigendomsrechtelijk model nodig had om complexe financiële wiskunde aan te kunnen. Maar deze studie vond dat open-weight modellen snel inhalen. Sterker nog, het open-weight model genaamd Kimi K2.6 kwam op de derde plaats overall, waarmee het verschillende beroemde, geheime Amerikaanse modellen versloeg! Het best presterende model was eigenlijk een model genaamd Claude Opus 4.6, dat 88,4% van de antwoorden goed had. Echter, er is een wending in het verhaal: terwijl sommige modellen geweldig waren in het vinden van het juiste antwoord, waren anderen verbazingwekkend goed in het niet verzinnen van zaken. Google's Gemini 2.5 Pro had het laagste percentage liegen, met een hallucinatiepercentage van slechts 0,08%, maar het was niet de beste in het vinden van de antwoorden zelf.
De onderzoekers ontdekten ook dat het grootste probleem voor al deze AI-modellen niet hun breinen waren, maar hun ogen. Bijna de helft van alle fouten (48,9%) gebeurde omdat de computer simpelweg niet de juiste pagina in het enorme rapport kon vinden om te lezen. Het is alsof je een genie hebt dat het boek niet op de plank kan vinden. Een andere vreemde bevinding was dat sommige Chinese modellen een "veiligheidsfilter" hadden die plotseling weigerde normale financiële vragen te beantwoorden als het rapport bepaalde politieke figuren of gebeurtenissen noemde, zoals een student die weigert een toets te maken omdat het onderwerp hen herinnert aan een regel die ze niet zouden mogen breken.
Dus, wat is de essentie? Het artikel suggereert dat open-weight modellen nu sterk genoeg zijn om te concurreren met de beste geheime modellen ter wereld bij het begrijpen van financiën. Ze hebben geen "redeneer"-supercomputers nodig om een goede indruk te maken; soms werkt een eenvoudiger, open model net zo goed. Maar de studie waarschuwt ook dat we nog een lange weg te gaan hebben. De computers worden beter in lezen, maar ze worstelen nog steeds met het vinden van de juiste informatie in enorme documenten, en soms worden ze geblokkeerd door veiligheidsregels die te gevoelig zijn. De auteur concludeert dat we er dichtbij zijn om AI-assistenten te hebben die echte financiële rapporten kunnen afhandelen, maar dat we nog steeds moeten oplossen hoe ze informatie zoeken voordat we ze volledig met ons geld kunnen vertrouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.