← Nieuwste papers
💻 computer science

CompAgent: An Agentic Framework for Visual Compliance Verification

CompAgent is het eerste agentische raamwerk dat multimodale grote taalmodellen verrijkt met visuele hulpmiddelen en een planningsagent om complexe visuele nalevingsregels nauwkeuriger en schaalbaarder te verifiëren dan bestaande methoden.

Oorspronkelijke auteurs: Rahul Ghosh, Baishali Chaudhury, Hari Prasanna Das, Meghana Ashok, Ryan Razkenari, Long Chen, Sungmin Hong, Chun-Hao Liu

Gepubliceerd 2026-03-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Rahul Ghosh, Baishali Chaudhury, Hari Prasanna Das, Meghana Ashok, Ryan Razkenari, Long Chen, Sungmin Hong, Chun-Hao Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek beheert, maar in plaats van boeken, zitten er miljoenen foto's en video's in. Elke dag komen er duizenden nieuwe beelden binnen. Je taak? Kijken of deze beelden veilig zijn of niet. Moet er een waarschuwing bij? Is het gevaarlijk, haatdragend of gewoon ongepast?

Vroeger deden mensen dit handmatig. Dat is als proberen een oceaan leeg te scheppen met een theelepel: te langzaam en te duur.

Vervolgens kwamen er slimme computers (AI) die dit voor hen deden. Maar deze computers hadden twee grote problemen:

  1. Ze waren vaak te dom voor specifieke regels. Ze zagen een mes, maar wisten niet of het een gevaarlijk wapen was of een kok die een salade snijdt.
  2. Ze waren te stijf. Als de regels veranderden (bijvoorbeeld: "vandaag mogen we geen messen zien, maar morgen wel als het een kok is"), moest je de hele computer opnieuw leren. Dat kost tijd en geld.

CompAgent is de nieuwe oplossing uit dit paper. Het is geen enkele, enorme robot, maar een slimme teamleider met een team van specialisten.

Hier is hoe het werkt, vertaald in een verhaal:

1. De Teamleider (De "Planning Agent")

Stel je voor dat je een detective bent die een moordzaak onderzoekt. Je kijkt niet zomaar naar de foto en zegt "oh, dat is verdacht". Nee, je denkt na: "Wat moet ik hier zoeken? Is er een wapen? Is er bloed? Wat staat er op de borden?"

De Planning Agent is die detective. Hij krijgt de regels (het "handboek") en de foto. Hij denkt na: "Oké, deze foto heeft een mens op. Volgens de regels moet ik controleren of die mens een wapen vasthoudt of of hij verdacht gedraagt. Ik ga dus eerst een 'Object Detector' roepen, en daarna een 'Tekst Lezer'."

Hij kiest niet zomaar, maar denkt strategisch na over welke hulpmiddelen hij nodig heeft.

2. Het Team van Specialisten (De "Tool Suite")

De teamleider heeft geen superkrachten zelf, maar hij heeft een gereedschapskist vol met gespecialiseerde robots:

  • De Object Detector: Ziet precies wat er in de foto staat (een hond, een mes, een auto).
  • De Tekst Lezer (OCR): Leest alle borden en teksten in de foto.
  • De Emotie-analist: Kijkt naar gezichten en houding.
  • De Veiligheidscontroleur: Een AI die specifiek getraind is om gevaarlijke inhoud te herkennen.

In plaats van dat één robot alles probeert te doen, roept de teamleider de juiste specialisten aan. Als de foto een hond toont, roept hij de hondenspecialist. Als er een bordje staat, roept hij de tekstlezer.

3. De Rechter (De "Compliance Verification Agent")

Alle specialisten sturen hun bevindingen naar de teamleider, die ze weer doorgeeft aan de Rechter.
De Rechter kijkt naar:

  • De foto zelf.
  • De verslagen van de specialisten (bijv. "Er is een mes gevonden, maar het is een keukenmes").
  • De regels (bijv. "Keukengerei is veilig, maar een mes in een donkere hoek is verdacht").

De Rechter weegt alles af en zegt dan pas: "Dit is veilig" of "Dit is onveilig, en hier is waarom."

Waarom is dit zo slim? (De Analogie)

Stel je voor dat je een recept (de regel) hebt voor het maken van een taart.

  • De oude manier (Directe AI): Je geeft het recept aan één kok. Die kok probeert alles uit het hoofd te onthouden. Als het recept verandert ("geen suiker meer, maar honing"), moet je de kok opnieuw trainen. Soms vergeet hij details.
  • De CompAgent manier: Je hebt een Chef-kok (de teamleider). Hij leest het recept. Hij roept de Suikermeester (als er suiker nodig is), de Eierkraker (als er eieren nodig zijn) en de Ovenwachter aan.
    • Als het recept verandert naar "geen suiker", roept de Chef-kok gewoon geen Suikermeester meer aan. Hij past zijn plan direct aan zonder de hele keuken opnieuw te hoeven bouwen.
    • Hij controleert of de Eierkraker de juiste eieren heeft gekraakt en of de Ovenwachter de juiste temperatuur heeft.

Wat levert dit op?

  • Sneller en goedkoper: Je hoeft geen duizenden foto's handmatig te labelen om de computer te leren. Het werkt direct met bestaande tools.
  • Slimmer: Omdat het team werkt, ziet het meer details. Een oude AI zag misschien alleen "bloed" en dacht "gevaar!". CompAgent ziet "bloed" + "verpleegster" + "opleidingsschool" en denkt: "Oh, dit is een educatieve foto, dat is veilig."
  • Flexibel: Als morgen een nieuwe regel komt, hoeft niemand de software opnieuw te programmeren. De teamleider leest de nieuwe regel en past zijn plan direct aan.

Kortom: CompAgent is geen enkele, stijve robot die probeert alles te onthouden. Het is een slimme, flexibele manager die een team van experts aanstuurt om samen de juiste beslissing te nemen over of een foto veilig is of niet. Het is de overgang van "één grote hersenloze machine" naar "een slim team dat samenwerkt".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →