VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance
Dit artikel introduceert VIABench, een uitgebreide video-benchmark afgeleid van eerste-persoonsopnames door visueel beperkte individuen om Multimodale Grote Taalmodellen te evalueren over drie kernondersteuningstaken—Proactieve Herinnering, Visuele Beantwoording van Vragen en Visie-gestuurde Interactie—waarbij significante tekortkomingen worden onthuld in de realtime responsiviteit en contextuele redenering van huidige modellen voor praktische ondersteuning aan blinden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: VIABench
Probleemstelling
Visueel beperkte personen (VBP's) worden geconfronteerd met aanzienlijke dagelijkse uitdagingen door de beperkte toegang tot visuele informatie. Hoewel Multimodale Grote Taalmodellen (MLLM's) indrukwekkende prestaties hebben getoond op algemene visie-taakprestaties, blijft hun praktische bruikbaarheid in de praktijk van blindenassistentie grotendeels onverkend. Bestaande benchmarks en datasets voor assistentiële visie lijden vaak aan kritieke beperkingen:
- Domeinkloof: Datasets zoals WAD vertrouwen op gecureerde reisvlogs bedoeld voor zienden, waardoor ze de rauwe, ongefilterde aard van de werkelijke ervaringen van VBP's niet vastleggen.
- Taakbeperkingen: Datasets zoals EgoBlind richten zich primair op passieve, door de gebruiker geïnitieerde Visual Question Answering (VQA), waarbij de behoefte aan proactieve, autonome assistentie wordt verwaarloosd.
- Temporele Beperkingen: Veel bestaande video-benchmarks maken gebruik van korte clips (bijv. 3 seconden), die de temporele rijkdom missen die vereist is voor langdurige redenering en navigatie.
- Evaluatie-mismatch: Huidige online evaluatiepipelines zijn vaak computationeel zwaar en vertrouwen op schaarse annotaties, waardoor ze minder geschikt zijn voor het beoordelen van "reminder-stijl" taken die continue monitoring en tijdige waarschuwingen vereisen.
Consequentelijk is er een gebrek aan een uitgebreide, veelzijdige video-benchmark die door blinden is verzameld en die MLLM's evalueert over het volledige spectrum van assistentiële behoeften, inclusief proactieve anticipatie en interactieve begeleiding.
Methodologie
1. Constructie van de VIABench Dataset
De auteurs hebben VIABench geconstrueerd, een grootschalige, tijd-uitgelijnde, egocentrische video-benchmark die specifiek is afgestemd op assistentie bij visuele beperking. De dataverzameling volgde een vijffasen-pipeline:
- Bronvermelding: Video's werden verzameld uit twee stromen: (1) Real-world video's van VBP's op platforms zoals YouTube, Bilibili en DouYin, en (2) geïnformeerde gesimuleerde video's opgenomen door getrainde annotatoren om specifieke scenario's van "Visueel Gestuurde Interactie" te dekken die schaars zijn in publieke data.
- Annotatie: De dataset bevat 761 video's met een totaal van 46,9 uur, met 14.526 handmatig gecureerde annotaties. De gemiddelde videoduur is 222 seconden (maximaal 1959s), wat aanzienlijk langer is dan voorheen bekende datasets.
- Kwaliteitscontrole: Een rigoureus proces bestaande uit pilot-annotatie, samenwerking met professionele leveranciers en meerfasige kwaliteitscontrole zorgde voor hoogwaardige, fijnmazige labeling.
2. Taakdefinities
VIABench definieert drie kerntaken die een toenemend niveau van assistentiële complexiteit weerspiegelen:
- Proactieve Reminder: Het model moet de videostroom autonoom monitoren en proactief aankomende navigatiekritische gebeurtenissen beschrijven (bijv. obstakels, trappen) zonder expliciete gebruikersprompts. Dit vereist nauwkeurige anticipatie en real-time responsiviteit.
- Visual Question Answering (VQA): Het model beantwoordt door de gebruiker gestelde vragen over de omgeving op basis van de huidige en voorgaande visuele context, wat spontane vragen tijdens navigatie simuleert.
- Visueel Gestuurde Interactie: Een multi-turn, closed-loop taak waarbij het model iteratieve, contextbewuste begeleiding biedt om de gebruiker te helpen het gezichtspunt of de fysieke bewegingen aan te passen om een specifiek doel te bereiken.
3. Evaluatiekader: Token-Level Prompt Activation Decoding (TPAD)
Om de uitdaging aan te pakken bij het evalueren van proactieve waarschuwingen in offline modellen (die doorgaans expliciete prompts vereisen), stellen de auteurs TPAD voor, een nieuw twee-fasen evaluatiekader:
- Mechanisme: TPAD transformeert een vooraf getraind MLLM in een frame-wijze proactieve detector zonder fine-tuning. Het concateneert een vaste forced-choice prompt (bijv. "Moet de gebruiker gewaarschuwd worden? (A) Ja; (B) Nee") met de volledige videosequentie.
- Scoring: Voor elk frame wordt de verborgen staat van het laatste token geprojecteerd door de taalmodelleringkop om de waarschijnlijkheid van het uitgeven van een waarschuwing te berekenen.
- Voordeel: Dit maakt een enkele forward pass mogelijk om frame-wijze waarschuwing-kansen over de gehele video te genereren, wat een efficiënte en contextbewuste evaluatie van offline modellen onder streamingcondities mogelijk maakt.
Belangrijkste Bijdragen
- VIABench Dataset: De introductie van een grootschalige, real-world video-benchmark voor blindenzorg, met langdurige egocentrische video's en diverse inhoud. Het is de eerste die Proactive Reminder, VQA en Vision-Guided Interaction taken binnen één enkele benchmark verenigt.
- TPAD Framework: De voorstel van een lichtgewicht, twee-fasen evaluatiemechanisme dat een efficiënte beoordeling van proactieve waarschuwing-generatie in lange, continue video's mogelijk maakt, waardoor de kloof tussen offline MLLM's en real-time assistentiële vereisten wordt overbrugd.
- Uitgebreide Evaluatie: Een systematische evaluatie van leidende open-source, propriëtaire en online streaming MLLM's op VIABench, wat inzichten biedt in hun huidige beperkingen in real-world assistentiële toepassingen.
Experimentele Resultaten
De auteurs evalueerden een breed scala aan modellen, waaronder open-source fundamentele modellen (bijv. InternVL, Qwen, LLaVA), propriëtaire modellen (GPT-5, GPT-4o, Gemini) en online streaming modellen.
- Algemene Prestaties: Huidige MLLM's vertonen slechts beginnende capaciteiten in real-world visuele assistentie. Zelfs het sterkste model, GPT-5, behaalde een gemiddelde score van slechts 28,8 op de benchmark.
- Taakverschillen: Prestaties op Proactive Reminder en Vision-Guided Interaction taken zijn opvallend lager dan op standaard VQA-taken.
- Proactive Reminder: Modellen falen vaak in het anticiperen op navigatiekritische gebeurtenissen of het genereren van begeleiding die overeenkomt met de grondwaarheid-intervallen. Ze worstelen met de dynamische vereiste om tijdige waarschuwingen uit te geven terwijl ze stil blijven wanneer er geen relevante informatie aanwezig is.
- Vision-Guided Interaction: Modellen geven vaak generieke instructies (bijv. "pak het op") in plaats van ruimtelijk specifieke begeleiding, waarbij ze geen rekening houden met het unieke perspectief en de beperkingen van VBP's.
- Streaming Modellen: Bestaande online streaming modellen presteren extreem slecht op de Proactive Reminder taak. De auteurs schrijven dit toe aan een beperkte blootstelling aan complexe, real-world begeleidingsinstructies in hun trainingsdata (vaak beperkt tot dichte captions of narraties) en een gebrek aan robuustheid tegenover kwalitatief lage, ongecontroleerde visuele inputs.
Betekenis en Toekomstige Richtingen
Het artikel beweert dat VIABench dient als een uitdagende en realistische testomgeving om toekomstig onderzoek te stimuleren naar de ontwikkeling van op maat gemaakte MLLM's voor real-world assistentie. De auteurs benadrukken dat huidige modellen nog niet klaar zijn voor inzet in veiligheidskritische blindenzorgscenario's.
Het artikel schetst drie specifieke paden voor toekomstig werk:
- Architecturale Verbetering: Het ontwikkelen van modelarchitecturen die in staat zijn tot betrouwbare, contextbewuste, real-time proactieve reacties.
- Dataverrijking: Het integreren van rijkere video-tekst datasets die diverse instructietypes, complexe interacties en real-world scenario's omvatten om proactieve redenering te verbeteren.
- Blinden-Centrische Optimalisatie: Het finetunen van modellen specif voor het unieke perspectief en de intenties van blinde gebruikers, waarbij problemen zoals lage-resolutie inputs, camerainversie en de behoefte aan ruimtelijk specifieke begeleiding worden aangepakt.
Uiteindelijk heeft het werk als doel de autonomie en veiligheid van visueel beperkte personen te verbeteren door de ontwikkeling van meer capabele en betrouwbare assistentiële technologieën te bevorderen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.