← Nieuwste papers
🤖 AI

Unification of Closed-Open Industrial Detection Scenarios: New Large-Scale Benchmarks,Challenges and Baselines

Dit artikel introduceert MMIOC-1M, de eerste grootschalige unificerende benchmark voor zowel open-vocabulary als closed-set industriële defectdetectie, en stelt RTVPNet voor, een nieuw netwerk met expert-geassisteerde domeenprojectie, energie-gebaseerde ijle bemonstering en bidirectionele tekst-visuele interactie om state-of-the-art prestaties te behalen terwijl de afhankelijkheid van handmatige prompts wordt geëlimineerd.

Oorspronkelijke auteurs: Zekai Zhang, Jinglin Zhang, Qinghui Chen, Gang Li, Da Chen, Shuainan Jing, He Wang, Dagang Li, Cong Liu, Cong Bai, Shengyong Chen

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zekai Zhang, Jinglin Zhang, Qinghui Chen, Gang Li, Da Chen, Shuainan Jing, He Wang, Dagang Li, Cong Liu, Cong Bai, Shengyong Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer intelligente, veelgereisde kunstcriticus (een Large Visual-Language Model) probeert te leren hoe hij minuscule barstjes in een automotor of krasjes op een smartphone-scherm kan opsporen.

Het probleem is dat deze criticus alleen maar prachtige landschappen, katten en zonsondergangen heeft gezien (natuurlijke afbeeldingen). Wanneer je hem een fabrieksvloer laat zien, raakt hij in de war. De verlichting is vreemd, de texturen zijn industrieel en de "defecten" lijken totaal niet op de gebroken takken of gescheurde kleding waar hij aan gewend is.

Dit artikel introduceert een oplossing voor twee grote problemen: gebrek aan trainingsdata en verwarrende instructies.

1. De Nieuwe "Trainingssportschool": MMIOC-1M

Denk aan de oude manier van computers trainen als het leren rijden door alleen te oefenen op een rustige, lege parkeerplaats. Het artikel stelt dat industriële fabrieken meer lijken op een chaotische, regenachtige snelweg met wegwerkzaamheden.

Om dit op te lossen, hebben de auteurs MMIOC-1M gebouwd.

  • Wat het is: Een enorme digitale bibliotheek met meer dan één miljoen afbeeldingen van industriële defecten.
  • De Variëteit: Het is niet slechts één type fabriek. Het beslaat 29 verschillende "scènes" (zoals staalfabrieken, textielfabrieken, elektronica-assemblage) en 351 specifieke soorten defecten (zoals "roestige bouten", "gescheurde stof" of "kortsluitingen").
  • De Twist: Het leert de computer op twee manieren te leren:
    1. Closed-Set: "Hier zijn de 50 specifieke defecten die je moet vinden."
    2. Open-Vocabulary: "Vind alles wat er niet goed uitziet, zelfs als ik het nog niet benal."
  • Waarom het ertoe doet: Voorheen moesten onderzoekers kleine, rommelige datasets bij elkaar rapen. Dit is de eerste "alles-in-één" sportschool die AI voorbereidt op de echte, chaotische industriële wereld.

2. De Nieuwe "Coach": RTVPNet

Zelfs met een geweldige sportschool heb je een goede coach nodig om de AI te leren hoe hij moet kijken. De auteurs hebben een nieuw systeem ontwikkeld genaamd RTVPNet (Refined Text-Visual Prompt Network).

Zo werkt het, met drie creatieve trucs:

A. De "Expert Vertaler" (Domain Projection)

Stel je voor dat de AI een algemene arts is die alles weet over mensen, maar nog nooit een paard heeft gezien. Als je hem vraagt een paard te diagnosticeren, zal hij misschien falen.

  • De Oplossing: Het artikel gebruikt een "Expert Model" (een specialist die kennis heeft van industriële defecten) om als vertaler te fungeren. Het neemt de algemene kennis van de AI en "projecteert" deze naar de industriële wereld. Het is also� of je de algemene arts een gespecialiseerd veterinair handboek geeft voordat hij een paard ziet. Dit helpt de AI om snel aan te passen zonder dat hij vanaf nul opnieuw getraind hoeft te worden.

B. De "Zaklamp in het Donker" (Refined Visual Prompts)

In een fabriek is de achtergrond vaak luidruchtig (glanzend metaal, complexe texturen). Als je de AI alleen maar zegt "kijk hier", kan hij afgeleid worden door een glinstering en denken dat het een defect is.

  • De Oplossing: In plaats van een mens die met een vinger wijst (wat traag en subjectief is), gebruikt de AI een "Energy Flashlight". Het scant de afbeelding om gebieden met hoge "onzekerheid" of hoge frequentie-details te vinden (de onderdelen die er vreemd uitzien). Vervolgens creëert het automatisch een precieze, verfijnde highlight rond het eigenlijke defect, waarbij de achtergrondruis wordt genegeerd. Het is alsof de AI een nachtzichtbril opzet die alleen de barsten verlicht, en niet het stof.

C. De "Tweerichtingsgesprek" (Text-Visual Interaction)

Normaal gesproken kijkt AI naar een plaatje en leest dan een tekstuele beschrijving, maar ze praten niet echt met elkaar.

  • De Oplossing: RTVPNet zorgt ervoor dat de tekst en de afbeelding een tweerichtingsgesprek voeren.
    • De tekst vertelt de afbeelding: "Zoek naar een barst."
    • De afbeelding vertelt de tekst: "Ik zie een barst hier, maar het lijkt op een kras daar."
    • Ze verfijnen elkaars begrip totdat ze het eens zijn over precies waar het defect zit en wat het is. Dit voorkomt dat de AI in de war raakt door woorden die te vaag zijn of afbeeldingen die te wazig zijn.

3. De Resultaten: Wie won de race?

De auteurs hebben hun nieuwe systeem (RTVPNet) getest tegen de beste bestaande AI-modellen op hun nieuwe dataset (MMIOC-1M) en andere beroemde datasets (zoals COCO en LVIS).

  • De Score: RTVPNet won. Het vond defecten nauwkeuriger dan de andere modellen, zelfs wanneer de defecten minuscuul waren, de achtergrond luidruchtig was, of het type defect iets was dat de AI nog nooit eerder had gezien.
  • Efficiëntie: Dit deed het met veel minder computerkracht dan de enorme "Large Language Models" die normaal gesproken dit werk doen. Het is alsof je een race wint met een lichte sportwagen in plaats van een zware tank.

Samenvatting

In eenvoudige bewoordingen zegt dit artikel:

  1. We hebben de grootste, meest diverse trainingshandleiding ooit gebouwd voor industriële defecten (MMIOC-1M).
  2. We hebben een slimmere coach gebouwd (RTVPNet) die een expert-vertaler, een slimme zaklamp en een tweerichtingsgesprek gebruikt om AI te leren hoe hij fabrieksdefecten kan opsporen.
  3. Deze nieuwe coach is beter, sneller en nauwkeuriger dan alles wat er momenteel beschikbaar is.

Het artikel concludeert dat deze combinatie ervoor zorgt dat AI eindelijk de rommelige, complexe realiteit van industriële fabrieken kan begrijpen, waardoor het verder gaat dan alleen het kijken naar mooie plaatjes van de natuur.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →