VTO: Visual Tool Orchestration for Video Anomaly Detection
Het artikel stelt VTO voor, een proces-gesuperviseerd reinforcement learning-framework dat een op een foundation model gebaseerde cognitieve evaluator en fijnmazige stapgewijze supervisie benut om multimodale agenten in staat te stellen gespecialiseerde visuele tools dynamisch te orkestreren voor verbeterde video-anomaliedetectie, gevalideerd door een nieuwe benchmark en toolset genaamd VAD-Tool.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een mysterie probeert op te lossen in een drukke, chaotische stad. Je hebt een notitieblok en een pen, maar de stad is vol bewegende auto's, vallende objecten en vechtende mensen. Om de zaak op te lossen, kun je niet gewoon naar de hele scène kijken en gokken; je moet specifieke hulpmiddelen gebruiken. Misschien heb je een vergrootglas nodig om een specif으로 persoon te volgen, een snelheidsmeter om te controleren of een auto te hard rijdt, of een rookmelder om rook op te sporen. In de wereld van computers wordt dit Video Anomaly Detection genoemd. Het is de taak om machines te leren om vreemde of gevaarlijke dingen in videobeelden te herkennen, zoals een vechtpartij die uitbreekt of iemand die valt.
Lama tijd probeerden computers dit te doen door patronen te memoriseren, zoals een student die voor een toets leert. Ze keken naar een video en zeiden: "Dit lijkt op een vechtpartij!" Maar als de vechtpartij op een nieuwe plek plaatsvond of er iets anders uitzag, raakte de computer in de war en faalde hij. Onlangs probeerden wetenschappers computers een "brein" (een Large Language Model) te geven dat kon praten en denken. Ze hoopten dat de computer zou kunnen uitzoeken welk hulpmiddel hij wanneer moest gebruiken. Maar hier is het probleem: deze slimme computers stoppen vaak met denken en geven hun antwoord onmiddellijk nadat ze één klein probleem hebben gezien. Ze missen het grotere plaatje, zoals hoe een kleine vechtpartij kan uitlopen op een paniekvoetbal of een stampede. Ze hebben een manier nodig om te leren hoe ze stap voor stap onderzoek blijven doen, zonder te vroeg op te geven.
Hier komt het nieuwe onderzoek om de hoek kijken. De onderzoekers, onder leiding van Rui Wang en Mengshi Qi van de Beijing University of Posts and Telecommunications, hebben een nieuw systeem gebouwd genaamd VTO (Visual Tool Orchestration). Denk aan VTO als een strenge maar briljante coach voor een detective-robot. In plaats van de robot gewoon te laten gokken, houdt de coach elke stap die de robot zet in de gaten. Als de robot het verkeerde hulpmiddel kiest, of het onderzoek stopt voordat hij het zeker weet, geeft de coach hem meteen een "duim omlaag". Als de robot een perfect logische keten volgt en aanwijzing na aanwijzing controleert, geeft de coach hem een "duim omhoog".
Het team heeft een speciale trainingsgrond gecreëerd genaamd VAD-Tool, wat een soort enorme speeltuin is met 12 verschillende "magische hulpmiddelen" voor de robot om van te leren. Deze hulpmiddelen kunnen dingen doen zoals menigten tellen, gezichten herkennen, wapens opsporen of brand detecteren. De onderzoekers hebben hun robot getraind met een methode genaamd "process-supervised reinforcement learning". In eenvoudige bewoordingen betekent dit dat ze de robot niet alleen beoordeelden op het uiteindelijke antwoord; ze beoordeelden het proces. Ze zorgden ervoor dat de robot leerde dat te vroeg stoppen een fout is. Ze gebruikten zelfs een super slimme AI (een model met 72 miljard parameters) om als rechter op te treden, om te controleren of de redenering van de robot bij elke stap logisch was.
De resultaten waren indrukwekkend. Toen ze hun nieuwe VTO-systeem testten, bleken ze veel beter te zijn in het oplossen van deze complexe, meerstaps-mysteries dan de oude methoden. Waar andere systemen vaak opgaven nadat ze één aanwijzing hadden gevonden, ging VTO door en verbond de punten om het hele verhaal te vinden. In hun tests verbeterde het nieuwe systeem de nauwkeurigheid bij het kiezen van de juiste hulpmiddelen en de juiste volgorde met wel 10,2% vergeleken met de voorheen beste methoden. Het versloeg zelfs enkele van de grootste, krachtigste AI-modellen, wat bewijst dat het leren aan een computer hoe hij stap voor stap moet denken belangrijker is dan alleen het groter maken van de computer. Het onderzoek suggereert dat door de AI te dwingen een strikt, logisch pad te volgen en het te belonen voor niet op te geven, we veiligere, slimmere systemen kunnen bouwen om toezicht te houden op onze steden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.