← Nieuwste papers
🤖 machine learning

FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering

Het FAU-team behaalde de derde plaats in Visual MCQ en de eerste plaats in Visual OpenQA bij ImageCLEF 2026 door prioriteit te geven aan robuuste inference engineering—zoals directe kandidaat-scoring, scorefusie en strikte outputcontrole—boven taakspecifieke modeltraining om meertalige visuele redenering en antwoordformattering te verbeteren.

Oorspronkelijke auteurs: Mohamed Basem, Vincent Christlein

Gepubliceerd 2026-08-04
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mohamed Basem, Vincent Christlein

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je in een examenzaal zit met een hoge inzet, maar in plaats van alleen woorden op een pagina te lezen, is de test een chaotische collage van dichte tekstboeken, complexe diagrammen, gekrabbelde formules en grafieken in zes verschillende talen. Jouw taak is om naar deze visuele chaos te kijken en lastige vragen erover te beantwoorden. Dit is de wereld van "Multimodale Redenering", een vakgebied waar computers proberen te fungeren als menselijke studenten die zowel een afbeelding kunnen "zien" als de tekst erin kunnen "lezen". Lange tijd was de grote vraag: "Hoe slim moet het brein van de computer zijn om te slagen?" Maar er is een addertje onder het gras. Zelfs als een superintelligente computer de wiskunde en de wetenschap perfect begrijpt, kan hij nog steeds de test niet halen als hij te veel praat, de verkeerde taal gebruikt of zijn antwoord in een slordig formaat schrijft dat de beoordelingsmachine van de docent niet kan lezen. Het is alsof je een geniale student hebt die een briljant essay schrijft, maar vergeet zijn naam op de juiste regel te zetten, waardoor hij een nul krijgt.

Dit artikel vertelt het verhaal van een team uit Duitsland (FAU) dat deelnam aan een wedstrijd genaamd ImageCLEF 2026 om precies dit probleem op te lossen. Ze bouwden niet alleen een slimmer brein; ze bouwden een strengere docent. Hun belangrijkste ontdekking is dat hoe je de computer vraagt om antwoord te geven net zo belangrijk is als de computer zelf. Ze ontdekten dat het voor meerkeuzevragen beter is om de computer te stoppen met het "schrijven" van een antwoord en hem in plaats daarvan de opties te laten "scoren" als een rechter. Voor open vragen leerden ze dat de computer gedwongen moet worden om beknopt en schoon te zijn, waarbij alle "hardop denkprocessen" worden weggehaald voordat het uiteindelijke resultaat wordt ingeleverd. Ze probeerden ook enkele populaire trucjes, zoals het geven van een referentieblad met tekst (OCR) of het aanleren van nieuwe dingen (fine-tuning), maar verrassend genoeg maakten die trucjes de computer juist slechter. Door zich te concentreren op strikte regels en het opschonen van de antwoorden, klom hun systeem naar de top van de ranglijst, wat bewees dat een beetje engineering-discipline een krachtige maar slordige AI kan veranderen in een betrouwbare examendeur.

De Uitdaging: Het Visuele Examen

De wedstrijd had twee hoofdtypen vragen. De eerste was Visuele Meerkeuze (Visual MCQ). Stel je een biologievraag voor in het Bulgaars met een tabel met gegevens en vijf opties gelabeld A tot en met E. De computer moet de juiste letter kiezen. De tweede was Visuele Open Vraagbeantwoording (Visual OpenQA). Hier zijn geen opties. De computer moet naar een diagram kijken (misschien een economische grafiek) en een kort, direct antwoord schrijven in dezelfde taal als de vraag.

Het lastige deel is dat deze afbeeldingen vol zitten met "dichte" informatie. Het zijn niet alleen plaatjes van katten; het zijn pagina's uit wetenschappelijke artikelen met formules, eenheden en piepkleine tekst. Als de computer in de war raakt door de lay-out of een lange uitleg geeft terwijl er alleen een getal nodig is, verliest hij punten.

De Strategie: De "Score, Niet Schrijf" Truc

Voor het meerkeuzedeel realiseerde het team zich dat het gevaarlijk was om de computer een zin te laten schrijven als "Het antwoord is A omdat...". De computer zou de juiste letter kunnen kiezen, maar deze in te veel extra tekst verpakken, wat het beoordelingssysteem in de war brengt.

In plaats daarvan veranderden ze het spel. Ze vroegen de computer om naar de opties A, B, C, D en E te kijken en simpelweg aan elke optie een "score" te geven op basis van hoe waarschijnlijk het is dat deze correct is. Denk eraan als een sportrechter die een score van 9,5 geeft aan een gymnastiekroutine in plaats van een paragraaf erover te schrijven. De computer hoefde geen tekst te genereren; hij hoefde alleen te berekenen welke letter de hoogste score had. Dit maakte de antwoorden ongelooflijk schoon en gemakkelijk te combineren. Als ze de test draaiden met drie verschillende computerbreinen, konden ze de scores van alle drie nemen, de scores middelen en de winnaar kiezen. Deze "scorefusie" hielp hen een zeer hoge nauwkeurigheid van 0,7108 te behalen, waarmee ze op de derde plaats eindigden.

De Opruimploeg: De Pratende AI Temmen

Voor de open vragen was het probleem precies het tegenovergestelde. De computers waren te praatziek. Ze hielden ervan om hun redenering uit te leggen, te zeggen "Hier is het antwoord," of fancy XML-tags zoals <answer> te gebruiken. Het beoordelingssysteem wilde echter alleen het ruwe antwoord.

Het team behandelde dit als een strikte redacteur. Ze gebruikten een "beknopte prompt" die de computer vertelde: "Stop met hardop denken. Geef me gewoon het antwoord." Daarna lieten ze de antwoorden door een "opruimploeg" (een set regels) gaan die alle extra woorden, redeneringssporen of opmaakfouten verwijderde. Ze combineerden ook de antwoorden van verschillende computermodellen. Als één model "50 kg" zei en een ander "50 kilogram", begreep het systeem dat ze hetzelfde waren en koos het beste antwoord. Deze zorgvuldige schoonmaak en combinatie hielpen hen om op de eerste plaats te eindigen in de categorie open vragen met een score van 0,6488 (gemeten met een metriek genaamd COMET).

De Verrassende "Niet Doen's": Wat Niet Werkte

Het team probeerde twee dingen die veel mensen denken dat zouden helpen, maar die de scores juist omlaag brachten.

  1. Het Referentieblad (OCR): Ze probeerden de computer een teksttranscript van de afbeelding te voeren (met behulp van een OCR-tool) om het hem makkelijker te maken de tekst te lezen. Maar dit werkte averechts. Het transcript bevatte vaak typefouten, kapotte formules of een verkeerde volgorde van woorden. Het was alsof je een student een referentieblad gaf dat vol fouten zat; het maakte de computer meer in de war dan de afbeelding zelf.
  2. De Crashcursus (Fine-Tuning): Ze probeerden de computer specifiek op de examenvragen te "onderwijzen" met een methode genaamd LoRA fine-tuning. Ze dachten dat dit de computer een expert zou maken. In plaats daarvan maakte het de computer slechter. Het artikel suggereert dat de computer al slim genoeg was om de afbeeldingen te lezen, en dat het proberen te hertrainen op een kleine, rommelige dataset juist zijn natuurlijke vermogens verstoorde.

De Les

De grote les van dit artikel gaat niet over het uitvinden van een nieuw, superintelligent brein. Het gaat over inference engineering — wat een chique manier is om te zeggen: "hoe we de computer vragen om zijn werk te doen." De auteurs ontdekten dat een krachtig computermodel, wanneer het strikte regels, schone inputs en een goed opruimproces krijgt, beter kan presteren dan een iets slimmer model dat de ruimte krijgt om slordig te zijn.

Ze toonden aan dat je de AI niet altijd groter hoeft te maken of harder hoeft te trainen. Soms moet je de computer gewoon vertellen dat hij stil moet zijn, de juiste letter moet kiezen en een schoon antwoordblad moet inleveren. Door zich te concentreren op deze praktische details, transformeerden ze sterke visuele taalmodellen in betrouwbare wedstrijdwinnaars, waarmee ze bewezen dat de beste manier om een probleem op te lossen soms is om de output te beheren, en niet alleen de motor te upgraden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →