← Nieuwste papers
💻 computer science

Categorizing Mathematical Concepts with LLM Voting Ensembles in Mathswitch

Dit artikel evalueert de effectiviteit van een stemensemble van Large Language Models bij het filteren van ruis uit de door Wikidata afgeleide wiskundige conceptrecords van het Mathswitch-project, waarbij specifieke onenigheidspatronen worden geïdentificeerd om toekomstige remediatiestrategieën te informeren.

Oorspronkelijke auteurs: Katja Berčič, Slobodan Stanojevikj

Gepubliceerd 2026-06-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Katja Berčič, Slobodan Stanojevikj

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een enorme, chaotische bibliotheek voor genaamd Mathswitch. Het doel ervan is om elk boek, elke notitie en elke diagram over wiskunde van over het hele internet te verzamelen — van formele tekstboeken tot informele Wikipedia-artikelen — en ze allemaal op één plank te leggen, zodat je ze allemaal tegelijk kunt vinden.

Het probleem? De bibliotheek probeert deze boeken te halen van een gigantisch, publiek prikbord genaamd Wikidata. Dit prikbord wordt door iedereen bewerkt, dus het is een beetje een rommeltje. Soms raakt een bericht over een "boom" (het soort waar je in kunt klimmen) vermengd met een bericht over een "boom" (het soort wiskundige structuur). Soms raakt een bericht over een "functie" (een baan die je uitoefent) vermengd met een bericht over een "functie" (een wiskundige formule).

Als de bibliotheek gewoon alles zou pakken dat een beetje op wiskunde lijkt, zouden de planken vol liggen met niet-wiskundige troep, wat het moeilijk maakt om de echte zaken te vinden.

De Oplossing: Een Panel van AI-rechters

Om de chaos op te ruimen, hebben de auteurs van dit artikel een stempanel van AI-rechters gebouwd. Denk aan een rechtszaal met drie verschillende rechters (specifiek: drie verschillende AI-modellen: DeepSeek, Gemma en Qwen).

Zo werkt het proces:

  1. De Rechtszaak: Wanneer een nieuw item van Wikidata binnenkomt, wordt het item getoond aan alle drie de AI-rechters.
  2. Het Bewijsmateriaal: De rechters zien de naam van het item, een korte beschrijving, enkele trefwoorden en een fragment van de tekst van het artikel.
  3. Het Vonnis: Elke rechter vraagt zich af: "Is dit een echt wiskundig concept?" Ze stemmen Ja of Nee en geven een betrouwbaarheidsscore (hoe zeker ze ervan zijn).
  4. De Meerderheidsregel: Als twee van de drie rechters "Ja" zeggen, mag het item op de wiskundige plank blijven staan. Als twee "Nee" zeggen, wordt het weggegooid.

Hoe ze het hebben getest

De auteurs wilden weten of hun AI-rechters daadwerkelijk goed zijn in hun werk. Ze hebben hiervoor een paar tests uitgevoerd:

  • De "Makkelijke" Test (Positieve Controle): Ze namen 1.000 items die al bekend stonden als wiskunde omdat ze een speciale "MathWorld" ID-tag hadden (zoals een gouden zegel van goedkeuring). Ze vroegen de AI-rechters om deze items te classificeren.

    • Resultaat: De AI-rechters waren ongelooflijk nauwkeurig en identificeerden 98,2% van deze items correct als wiskunde. Zelfs toen de auteurs de "MathWorld"-tag voor de rechters verborgen zodat ze niet stiekem naar het zegel konden kijken, kregen de rechters het bijna elke keer goed. Dit bewees dat de rechters daadwerkelijk de inhoud lazen en niet alleen op zoek waren naar afkortingen.
  • De "Moeilijke" Test (Negatieve Controle): Ze namen 500 items over Natuurkunde (zoals "Keplers baan" of "entropie").

    • Resultaat: De rechters zeiden voor de meeste van deze items correct "Nee, dit is geen wiskunde". Echter, voor de 10 items die op de vage grens tussen natuurkunde en wiskunde lagen (zoals complexe vergelijkingen die in beide velden worden gebruikt), zeiden de rechters vol vertrouwen "Ja". Dit liet zien dat de rechters begrijpen dat wiskunde en natuurkunde vaak overlappen, in plaats van blindelings alles af te wijzen dat geen pure wiskunde is.

Waar de rechters in de war raakten

Het artikel keek ook naar de weinige gevallen waarin de rechters fouten maakten of afweken van de "gouden standaard" (MathWorld). Ze vonden drie hoofdoorzaken voor de verwarring:

  1. Het "Lege Beschrijving" Probleem: Soms bevat een Wikidata-item als beschrijving slechts "Wiskundig concept". Het is als een boek met een blanco cover. De rechters hadden geen context en gokten op basis van alleen de titel. Zo dachten ze bijvoorbeeld dat "Wiener sausage" (Wiener worst) voedsel was en "Fence" (Hek) constructie, zonder te beseffen dat dit eigenlijk namen van obscure wiskundige concepten waren. De oplossing? Geef de rechters meer context voordat ze stemmen.
  2. De "Te Nauwe" Bias: Een van de rechters (Gemma) was erg streng. Als een wiskundig concept in de echte wereld werd gebruikt (zoals in de biologie of techniek), dacht deze rechter: "Dat is een toepassing, niet de wiskunde zelf," en stemde op "Nee". De andere rechters waren flexibeler en erkenden het wel als wiskunde.
  3. De "Scope" Mismatch: Soms bevat de MathWorld-encyclopedie dingen die gerelateerd zijn aan wiskunde (zoals instrumenten voor signaalverwerking of historische trivia) die de AI-rechters te ver verwijderd vonden om als "wiskundige concepten" te worden beschouwd. Dit was geen fout van de rechters; het was simpelweg een verschil in mening over hoe strikt men "wiskunde" definieert.

De Kernboodschap

Het artikel concludeert dat het gebruik van een stempanel van AI-rechters een praktische en effectieve manier is om de ruis uit Wikidata te filteren. Het hoeft niet te worden onderwezen met een enorme dataset van gelabelde voorbeelden; de AI weet al hoe wiskunde klinkt.

Door dit systeem te gebruiken, kan Mathswitch zijn bibliotheek automatisch opschonen, de echte wiskundige concepten behouden en de niet-wiskundige troep eruit gooien, terwijl het leert van zijn fouten om in de toekomst nog beter te worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →