← Nieuwste papers
🤖 AI

A Reliability Evaluation of Hybrid Deterministic-LLM Based Approaches for Academic Course Registration PDF Information Extraction

Deze studie concludeert dat een hybride aanpak die deterministische methoden combineert met LLM's, met name de Qwen 2.5:14b-modellen, de meest betrouwbare en computerefficiënte oplossing biedt voor het extraheren van informatie uit academische cursusregistratie-PDF's, zelfs op hardware met beperkte middelen.

Oorspronkelijke auteurs: Muhammad Anis Al Hilmi, Neelansh Khare, Noel Framil Iglesias

Gepubliceerd 2026-04-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Muhammad Anis Al Hilmi, Neelansh Khare, Noel Framil Iglesias

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat een universiteit een enorme berg papieren heeft: de KRS. Dit zijn de "studieplannen" van studenten, een soort digitale menukaart waarop staat welke vakken ze hebben gekozen en welke docenten ze krijgen. Voor de universiteit is het belangrijk om deze papieren snel te kunnen lezen en omzetten in een digitale lijst, zodat ze bijvoorbeeld kunnen zien wie er lesgeeft of hoe de cijfers zijn.

Het probleem? De universiteit heeft geen dure, supersnelle computers (zoals zware grafische kaarten) en wil de data ook niet naar een wolk sturen vanwege privacy. Ze moeten dit dus doen op een gewone laptop, met alleen een gewone processor.

De onderzoekers van dit artikel hebben gekeken hoe je dit het beste kunt doen. Ze hebben drie manieren getest, en ik leg ze uit alsof het drie verschillende manieren zijn om een recept uit een kookboek te halen:

1. De "Alles-Op-Een-Maat" Chef (Alleen LLM)

Stel je voor dat je een superintelligente kok (een LLM, een slimme AI) hebt die alles kan lezen. Je geeft hem het hele kookboek en zegt: "Haal alle ingrediënten eruit."

  • Hoe het werkt: De AI leest de hele pagina en probeert alles te begrijpen.
  • Het nadeel: Deze kok is erg slim, maar ook erg traag op een gewone keukenkastje (een gewone laptop). Het duurt lang (ongeveer 1,5 minuut per pagina) en hij maakt soms kleine foutjes, zoals een letter vergeten in een naam.
  • Resultaat: Het werkt, maar het is te langzaam voor een grote berg papieren.

2. De "Regelmatige" Chef met een Hulpje (Hybride: Regels + AI)

Hier proberen ze slim te zijn. Ze gebruiken een simpele, snelle regel (een regex) voor de vaste dingen, zoals de naam van de student of het semester. Dat is als een robotarm die alleen de vaste plekken in het boek pakt. Voor de moeilijke, veranderlijke delen (de lijst met vakken) roepen ze de slimme AI erbij.

  • Hoe het werkt: De robot doet het snelle werk, de AI doet het moeilijke werk.
  • Het voordeel: Het is sneller dan alleen de AI.
  • Het nadeel: De robotarm is soms te stijf. Als de opmaak van het boek net iets anders is (bijvoorbeeld een andere universiteit), loopt de robot vast. De AI moet dan alsnog alles opnieuw doen, wat weer tijd kost.

3. De "Slimme" Chef met een Valstrik (De Camelot-pijplijn)

Dit was de winnaar in het onderzoek. Stel je voor dat je een systeem hebt dat eerst probeert de pagina te lezen met een speciale bril (de Camelot-software) die perfect ziet waar de lijnen en tabellen zijn.

  • De strategie:
    1. De bril kijkt eerst: "Zie ik een duidelijk rooster?" Als ja, haalt hij de data eruit in een flits (minder dan 1 seconde!).
    2. Als de bril twijfelt (bijvoorbeeld omdat de lijnen vaag zijn), schakelt hij over op een tweede bril (een andere instelling).
    3. Als beide brillen het niet snappen, roepen ze pas de slimme AI (de LLM) als laatste redmiddel.
  • Het resultaat: Dit werkt als een droom. In 99% van de gevallen is het klaar in een seconde. Alleen in heel zeldzame gevallen moet de AI erbij komen, en dat gaat dan ook nog snel.

De Winnaar: Qwen 2.5

Van alle "chefs" (AI-modellen) die ze hebben getest, was Qwen 2.5 de meest betrouwbare. Hij maakte de minste fouten, zelfs als hij op een gewone laptop draaide. De andere chefs (zoals Gemma en Phi) waren soms te slordig of vergeten namen van docenten.

Wat betekent dit voor de wereld?

De onderzoekers concluderen dat je niet hoeft te kiezen tussen "slim" en "snel".

  • Als je alleen maar slimme AI gebruikt, ben je te traag.
  • Als je alleen maar simpele regels gebruikt, ben je te stijf.
  • De oplossing: Gebruik een hybride aanpak. Gebruik snelle, simpele tools voor het meeste werk, en gebruik de slimme AI alleen als "noodhulp" als de simpele tools het niet snappen.

Kortom: Je kunt een hele berg studieplannen digitaal maken op een gewone laptop, zonder dat je privacy in gevaar komt, als je de juiste combinatie van gereedschappen gebruikt. Het is alsof je een snelle robot en een slimme kok samenwerkt: de robot doet het saaie werk, en de kok lost de lastige puzzels op.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →