← Nieuwste papers
💻 computer science

HugSelect: An Explainable Multi-Criteria Decision-Support Framework for foundation-model selection

Dit artikel introduceert HugSelect, een uitlegbaar multi-criteria besluitvormingsondersteunend framework dat een uitgebreide kennisbank van meer dan 71.000 foundation models construeert om auditeerbare, transparante en hoogwaardige aanbevelingen te bieden door functionele capaciteiten en door de gemeenschap waargenomen kwaliteit te prioriteren boven eenvoudige populariteitsmetrieken.

Oorspronkelijke auteurs: Alireza Joonbakhsh (Shiraz University), Arda Canser Adalı (Utrecht University), Slinger Jansen (Utrecht University), Farshad Khunjush (Shiraz University), Siamak Farshidi (Wageningen University,Resear
Gepubliceerd 2026-08-11
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Alireza Joonbakhsh (Shiraz University), Arda Canser Adalı (Utrecht University), Slinger Jansen (Utrecht University), Farshad Khunjush (Shiraz University), Siamak Farshidi (Wageningen University,Research)

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, chaotische bibliotheek binnenloopt waar de planken tot in de wolken reiken en verdwijnen in de mist. Dit is geen bibliotheek van boeken, maar van "foundation models"—de gigantische, herbruikbare hersencircuits die alles aandrijven, van chatbots tot medische diagnostische tools. In de wereld van software engineering zijn deze modellen als de motoren van een auto; je kunt er niet zomaar één kiezen omdat hij er cool uitziet of omdat het het meest populaire merk is. Je moet weten of hij past bij jouw specifieke chassis, of hij rijdt op de brandstof die jij hebt, en of hij niet kapot gaat als je een hobbel overrijdt.

Het probleem is dat deze bibliotheek zo snel groeit dat geen mens elk label kan lezen. Meestal pakken mensen gewoon het meest gedownloade item of vragen ze een superintelligent robot (een AI) om advies. Maar een robot om advies vragen is als een tovenaar om een recept vragen; ze geven je misschien een heerlijk antwoord, maar je hebt geen idee hoe ze het gemaakt hebben, en soms verzinnen ze gewoon dingen aan. Dit artikel, geschreven door een team van onderzoekers, stelt een simpele maar lastige vraag: Hoe kiezen we de juiste motor voor onze auto wanneer de bibliotheek te groot is om te lezen en de tovenaars een beetje te mysterieus zijn? Ze stellen een nieuwe manier van kiezen voor die niet alleen gokt, maar ook uitlegt waarom het heeft gekozen wat het heeft gekozen, waardoor een magische gok verandert in een heldere, controleerbare checklist.


Het Probleen: De "Populariteitswedstrijd"-valstrik

Op dit moment is het vinden van een foundation model op platforms zoals Hugging Face een beetje alsof je een nieuwe telefoon koopt op basis van alleen hoeveel mensen hem hebben gekocht. Je ziet een lijst gesorteerd op "downloads" of "likes". Maar populariteit is niet hetzelfde als prestatie. Alleen omdat een model beroemd is, betekent niet dat het de specifieke taak kan uitvoeren die jij nodig hebt, zoals het vertalen van oude talen of het draaien op een kleine laptop.

De auteurs betogen dat het kiezen van een model geen eenvoudige zoekopdracht met trefwoorden of een populariteitswedstrijd zou moeten zijn. Het is een complexe software engineering-beslissing. Je moet een balans vinden tussen functionele behoeften (kan het code schrijven?), operationele beperkingen (past het in mijn geheugen?) en kwaliteitszorgen (is het betrouwbaar?). Alleen vertrouwen op populariteit of een "black box" AI om advies vragen, laat je in het duister over waarom een model is gekozen.

De Oplossing: HugSelect, de "Verklarende Bibliothecaris"

Maak kennis met HugSelect. Zie HugSelect niet als een magische 8-ball, maar als een supergeorganiseerde, hyperlogische bibliothecaris die elk boek in de bibliotheek heeft gelezen en gedetailleerde aantekeningen heeft gemaakt bij elke pagina.

Zo werkt HugSelect, met behulp van een leuke analogie:

Stel je voor dat je op zoek bent naar een specifiek type auto. Je zegt tegen de bibliothecaris: "Ik wil een auto die op sneeuw kan rijden, een zonnedak heeft en minder dan $20.000 kost."

  • De Oude Manier (Populariteit): De bibliothecaris wijst naar de populairste auto in de showroom, zelfs als het een cabriolet is zonder verwarming.
  • De Oude Manier (Magische AI): De bibliothecaris zegt: "Ik denk dat deze auto geweldig is!" maar kan je niet vertellen waarom of wat de specificaties van de motor zijn.
  • De HugSelect-Manier: De bibliothecaris pakt een enorme spreadsheet erbij. Ze controleren de kolom "Sneeuw", de kolom "Zonnedak" en de kolom "Prijs" voor elke auto. Ze geven elke auto een score op basis van hoe goed deze aansluit bij jouw behoeften. Vervolgens overhandigen ze je een rapport dat zegt: "Auto A kreeg 90 punten omdat hij een zonnedak heeft en goedkoop is, maar verloor punten omdat hij niet erg goed is in sneeuw. Auto B kreeg 85 punten omdat hij perfect is voor sneeuw, maar duur is."

HugSelect doet precies dit voor AI-modellen. Het bouwt een enorme "kennisbank" van 71.274 modellen. Het kijkt niet alleen naar de titel; het leest de beschrijving van het model, controleert de code en scant zelfs duizenden community-discussies (zoals Reddit-threads en Q&A-sites) om te zien wat echte mensen vinden van de betrouwbaarheid en snelheid van het model.

Hoe het werkt: De Drie Ingrediënten

Om zijn "scorekaart" voor elk model op te stellen, mengt HugSelect drie soorten ingrediënten:

  1. Metadata: De harde feiten, zoals het licentietype (is het gratis te gebruiken?) en de bestandsgrootte.
  2. Functionele Kenmerken: Wat het model daadwerkelijk kan doen. Stond er in de beschrijving dat het afbeeldingen kan verwerken? Kan het redeneren door wiskundige problemen? HugSelect leest de tekst om deze mogelijkheden te vinden.
  3. Waargenomen Kwaliteit: Dit is de "roddelkolom". Het analyseert wat de community zegt. Als mensen steeds klagen dat een model vaak vastloopt, haalt HugSelect punten af voor "Betrouwbaarheid". Als mensen zeggen dat het super snel is, krijgt het een boost op "Prestatie".

Zodra het al deze gegevens heeft, gebruikt het een wiskundige methode genaamd de Weighted Sum Model (WSM). Stel je voor dat je een leerling beoordeelt. Als "Wiskunde" voor 50% meetelt en "Kunst" voor 10%, telt HugSelect de scores op op basis van wat jij het belangrijkst vindt. Als je zegt: "Ik geef niet om snelheid, ik heb alleen een betrouwbaar model nodig," past HugSelect de gewichten aan en rangschikt de lijst direct opnieuw.

Wat ze vonden: De Resultaten

De onderzoekers testten HugSelect om te zien of het daadwerkelijk werkt. Ze gokten niet alleen; ze onderwierpen het aan een reeks tests.

  • De Leestest: Ze controleerden of HugSelect in staat was om modelbeschrijvingen en community-reviews correct te lezen. Het had het ongeveer 80% van de tijd bij de functies en 84% van de tijd bij de kwaliteitskenmerken goed. Dat is behoorlijk goed voor een robot die rommelige menselijke tekst leest!
  • De Confrontatie: Ze vergeleken HugSelect met vier beroemde commerciële AI-systemen (zoals ChatGPT, Claude en Gemini). Ze gaven ze allemaal 44 verschillende scenario's, zoals: "Vind een model voor een medische Q&A-bot."
    • HugSelect vond de juiste familie van modellen 91% van de tijd.
    • Het vond het exacte model 61% van de tijd.
    • Dit was concurrerend met de grote commerciële AI's (sommigen waren iets beter in het vinden van het exacte model, anderen iets slechter), maar HugSelect had één groot voordeel: Transparantie. De commerciële AI's gaven alleen een antwoord. HugSelect gaf het antwoord plus de wiskunde erachter, waarbij precies werd getoond welke kenmerken ervoor zorgden dat het model punten won of verloor.

De "Waarom het ertoe doet"-factor

Het belangrijkste wat HugSelect doet, is de beslissing controleerbaar maken. In software engineering kun je niet simpelweg zeggen: "De AI zei dat ik dit moest gebruiken." Je moet weten waarom, zodat je het aan je baas, je klant of een veiligheidsinspecteur kunt uitleggen.

De onderzoekers voerden ook een "gebruikersstudie" uit met 10 mensen die verstand hebben van AI. Deze mensen vonden HugSelect nuttig en gemakkelijk in gebruik. Ze vonden het prettig dat ze de afwegingen konden zien. Bijvoorbeeld: ze konden zien dat Model A sneller was maar minder betrouwbaar, terwijl Model B langzamer was maar zeer solide. Dit helpt mensen om betere beslissingen te nemen in plaats van blind te vertrouwen op een black box.

De Conclusie

Dit artikel suggereert dat we moeten stoppen met het behandelen van AI-modelselectie als een spel van kans of een populariteitswedstrijd. Door een systeem te bouelt dat de kleine lettertjes leest, luistert naar de community en zijn wiskunde uitlegt, biedt HugSelect een manier om met vertrouwen het juiste gereedschap voor de klus te kiezen. Het beweert niet perfect te zijn — de onderzoekers geven toe dat community-feedback soms rommelig is en dat de "ground truth" van wat het "beste" model is, lastig kan zijn. Maar het bewijst dat we met de juiste mix van data en heldere logica de chaotische bibliotheek van AI-modellen kunnen veranderen in een goed georganiseerde, uitlegbare gereedschapskist.

Kortom: HugSelect is de bibliothecaris die niet alleen naar het populairste boek wijst, maar het opent, de beste delen markeert en je precies vertelt waarom het de juiste keuze is voor jouw verhaal.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →