VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models
Het artikel introduceert VideoHarness-RSI, een recursief zelfverbeteringsframework dat uitvoerbare context-constructieprogramma's optimaliseert voor video-begrip van lange video's rondom een bevroren visie-taalmodel, waarbij wordt aangetoond dat het verfijnen van de harness alleen al significante prestatiewinsten oplevert en effectief overdraagbaar is naar benchmarks.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: VideoHarness-RSI
Probleemstelling
Begrip van lange video's blijft een aanzienlijke uitdaging voor Vision-Language Models (VLM's), zelfs wanneer de onderliggende modellen krachtig zijn. De kernbottleneck is niet noodzakelijkerwijs het inferentievermogen van het model, maar eerder de contextconstructie: hoe selecteer en organiseer je een beperkte set visuele observaties uit een video die duizenden irrelevante frames bevat.
Bestaande benaderingen pakken dit aan via compressie, retrieval, geheugen of agentic evidence-verwerving. Deze systemen modificeren echter doorgaans meerdere componenten tegelijkertijd (bijv. het model, het retrieval-mechanisme en de redeneerworkflow tegelijk veranderen). Dit maakt het moeilijk om een specifieke vraag te isoleren: Hoeveel prestatiewinst kan er louter worden behaald door het uitvoerbare programma dat de context construeert te verbeteren, terwijl de VLM en de interface volledig ongewijzigd blijven?
Methodologie: VideoHarness-RSI
Het artikel introduceert VideoHarness-RSI (Recursive Harness Self-Improvement), een gecontroleerd framework voor het recursief zoeken naar optimale uitvoerbare context-constructors (harnesses) rondom een bevroren VLM.
Kernframework
Het systeem behandelt de harness als een programma dat een video-vraagpaar mapt naar een begrensde multimodale context , die vervolgens wordt gevoed aan een bevroren VLM om een antwoord te genereren.
Het optimalisatiedoel is het maximaliseren van de ontwikkelingsnauwkeurigheid over de ruimte van uitvoerbare programma's , onderworpen aan een vaste contextrestrictie .
De Decompositie van de Harness
De auteurs deconstrueren elke harness analytisch in drie functionele stadia, hoewel dit geen afzonderlijk te optimaliseren doelstellingen zijn, maar eerder een pad voor programmamutatie:
- Schrijven (): Construeert een adresseerbare representatie van de video (bijv. een stream, een lijst met captions of een embedding index).
- Lezen (): Haalt bewijs op (retrieval) geconditioneerd op de vraag .
- Verpakken (): Ordonneert en formatteert de begrensde context voor de VLM.
Recursief Zoekprotocol
De zoekopdracht werkt via een outer loop die harness-mutaties voorstelt, uitvoert en evalueert:
- Proposer: Een LLM-gebaseerde proposer (Claude Opus 4.6) genereert kandidaat-harness-code op basis van een frontier van de huidige beste programma's () en een archief () van historische code, scores en executietraces.
- Evaluatie: Kandidaten worden onderworpen aan een "smoke test" en end-to-end geëvalueerd op een ontwikkelingsset ().
- Selectie: De update-regel is strikt. Een kandidaat wordt pas gepromoveerd naar de frontier als de ontwikkelingsnauwkeurigheid de nauwkeurigheid van de huidige frontier strikt overtreft.
- Restricties: De VLM (Qwen3-VL-8B-Instruct), de decoding-configuratie en de evaluatiemetrieken blijven gedurende het hele proces vast. De zoekopdracht raakt de modelparameters niet aan.
Experimentele Opzet
- Dataset: LVBench (1.232 QA-paren na filtering). 350 vragen gebruikt voor zoekopdracht/ontwikkeling; 882 gereserveerd voor held-out evaluatie.
- Baselines: Vergeleken met vooraf gespecificeerde uniforme sampling, door literatuur geïnspireerde handmatige harnesses (bijv. AKS, WorldMM-stijl, Homer-stijl) en propriëtaire VLM's onder uniforme sampling.
- Kostenmetriek: De input-zijde contextkosten worden gemeten als de som van visuele en aanvullende teksttokens per vraag, exclusief offline indexing kosten.
Belangrijkste Resultaten
1. Prestatiewinst door Zoekopdrachten
Recursieve zoekopdrachten verbeteren de prestaties consistent ten opzichte van zowel zwakke als sterke baselines:
- Van Uniforme Sampling: Startend vanaf een random uniforme sampling baseline (36,3% nauwkeurigheid), ontdekte de zoekopdracht EMBEDNAVIGATE-HYBRID, die 45,4% behaalde op de held-out set.
- Van Sterke Handmatige Baselines: Startend vanaf een sterke handmatige baseline (AKS, 46,5%), ontdekte de zoekopdracht TIMESTAMPED-AKS, wat de held-out nauwkeurigheid verbeterde naar 50,3%.
- Cross-Benchmark Transfer: De gekozen harnesses op LVBench werden bevroren en direct toegepast op Video-MME en MLVU zonder verdere zoekopdracht of adaptatie. Ze presteerden beter dan uniforme sampling op beide benchmarks (bijv. 61,5% vs. 59,9% op Video-MME), wat suggereert dat de ontdekte policies overdraagbaar zijn.
2. Mechanisme van Verbetering
Analyse van de ontdekte harnesses onthult verschillende strategieën:
- Navigatie versus Retrieval: De zoekopdracht ontdekte dat het combineren van temporele navigatie (het gebruik van captions om sampling te focussen op relevante tijdsgebieden) met visuele gelijkenis-retrieval (gebruikmakend van CLIP embeddings) betere resultaten oplevert dan elk afzonderlijk.
- Zichtbaarheid van Bewijs: De hybride harness verbeterde de nauwkeurigheid niet alleen door meer geannoteerde bewijsintervallen bloot te leggen (het vergroten van "zichtbare" frames), maar ook door de prestaties te verbeteren in gevallen waar bewijs gemist werd, wat wijst op een betere contextorganisatie en -densiteit.
- Gevoeligheid voor Vraagtype: Navigatiestrategieën waren bijzonder effectief voor temporele en redeneervragen, terwijl visuele retrieval hielp bij entiteits- en sleutelinformatievragen.
3. Kosten-Nauwkeurigheid Trade-offs
De zoekopdracht onthulde een Pareto-front tussen nauwkeurigheid en input-tokenkosten.
- EMBEDNAVIGATE-HYBRID behaalde een hoge nauwkeurigheid maar veroorzaakte een aanzienlijke tekstuele overhead door een extra navigatiepass.
- TIMESTAMPED-AKS behaalde de hoogste nauwkeurigheid met een kleinere input-voetafdruk, wat aantoont dat zoekopdrachten efficiënte configuraties kunnen vinden die handmatige baselines mogelijk missen.
Betekenis en Claims
Het artikel positioneert VideoHarness-RSI als een gecontroleerde baseline voor het bestuderen van geautomatiseerd harness-ontwerp. De belangrijkste bijdragen en claims zijn:
- Isolatie van Variabelen: Het stelt vast dat de uitvoerbare contextconstructie een onderscheidbare optimalisatielaag is. Significante winsten kunnen worden behaald door de "harness" (het programma dat beheert wat het model ziet) te optimaliseren zonder het model te hertrainen of de interface te veranderen.
- Reproduceerbaarheid: De auteurs bieden een auditeerbaar archief van kandidaat-code, afstamming, executietraces en scores, wat een reproduceerbare baseline biedt voor toekomstig onderzoek.
- Overdraagbaarheid: De resultaten tonen aan dat harnesses die op één benchmark zijn ontdekt, kunnen worden overgedragen naar andere benchmarks zonder nieuwe zoekopdrachten, wat aangeeft dat de zoekopdracht generaliseerbare context-constructie policies ontdekt in plaats van te overfitten op specifieke dataset-eigenaardigheden.
- Beperkingen: De auteurs merken bescheiden op dat de zoekfrontier vaak stagneert na vroege verbeteringen en dat de "strikte" punt-schatting selectie niet statistisch garandeert dat er gegeneraliseerd wordt, hoewel empirische resultaten op held-out sets de aanpak ondersteunen. Ze verduidelijken ook dat hun kostenmetingen betrekking hebben op de input-tokenvolumes, niet op end-to-end latentie of monetaire kosten, aangezien offline indexing kosten variëren.
Samenvattend betogen zij dat voor begrip van lange video's het "systeem" rondom een bevroren VLM een kritieke, optimaliseerbare component is die verbeterd kan worden door middel van recursieve, geautomatiseerde programmazoekopdrachten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.