← Nieuwste papers
💻 computer science

INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning

Dit paper introduceert Inst-IT, een methode die Large Multimodal Models verbetert in het begrijpen van specifieke objecten door middel van expliciete visuele prompts en instructie-tuning, wat leidt tot superieure prestaties op zowel gespecialiseerde benchmarks als algemene beeld- en videobegrijpingsopdrachten.

Oorspronkelijke auteurs: Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

Gepubliceerd 2026-03-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme robot hebt die naar foto's en video's kan kijken en erover kan praten. Dit zijn de "Grote Meerdere Modellen" (LMMs) waar de paper over gaat. Tot nu toe waren deze robots goed in het begrijpen van het geheel. Ze konden zeggen: "Ah, dit is een feestje met veel mensen" of "Dit is een auto die rijdt."

Maar ze hadden een groot probleem: ze waren slecht in het detail. Als je vroeg: "Wat doet die ene man in het rode shirt precies?" of "Hoe beweegt die hond tussen frame 1 en frame 3?", dan raakten ze in de war. Ze zagen de hele scène, maar misten de specifieke personages waar jij naar keek.

De auteurs van dit paper (Inst-IT) hebben een oplossing bedacht om deze robot te trainen om echt goed naar specifieke dingen te kijken. Hier is hoe het werkt, vertaald naar alledaagse taal:

1. Het Probleem: De "Wazige" Camera

Stel je voor dat je een robot vraagt om een video te bekijken. De robot kijkt naar de video alsof hij door een wazige bril kijkt. Hij ziet een menigte, maar hij kan niet goed onderscheiden wie wie is. Als je vraagt: "Wat doet de vrouw met de blauwe hoed?", denkt de robot misschien: "Oh, er is een vrouw, en er is een hoed, maar ik weet niet zeker of het dezelfde is."

2. De Oplossing: De "Magische Stempel" (Visual Prompts)

De auteurs hebben een slimme truc bedacht. Ze geven de robot een visuele hulpmiddel.
Stel je voor dat je op de foto's en video's kleine, gekleurde nummertjes plakt op elk object dat interessant is (bijv. een '1' op de man, een '2' op de vrouw, een '3' op de hond). Dit noemen ze "Set-of-Marks".

  • Voor de robot: Het is alsof je een leraar bent die met een stift op een bord tekent. Je wijst met je vinger (of stempel) precies aan waar je naar kijkt.
  • Het effect: De robot zegt: "Ah! Nu weet ik het! De vraag gaat over '1', niet over de hele menigte!"

3. De Oefeningen: Het Nieuwe Leerplan (Inst-IT Dataset)

Om de robot dit te leren, hebben de auteurs een enorm nieuw leerplan gemaakt, genaamd Inst-IT Dataset.
In plaats van alleen maar te zeggen "Dit is een foto van een park", hebben ze de robot duizenden oefeningen gegeven die er zo uitzien:

  • "Kijk naar nummer 1 (de man). Wat draagt hij?"
  • "Kijk naar nummer 2 (de vrouw). Wat deed ze in het vorige plaatje en wat doet ze nu?"
  • "Wat is het verschil tussen nummer 1 en nummer 3?"

Ze hebben dit gedaan met behulp van een super-slimme AI (GPT-4o) die als een strenge leraar fungeerde. Deze AI keek naar de video's, plakte de nummertjes erop, en schreef vervolgens gedetailleerde vragen en antwoorden over precies die nummertjes.

4. Het Resultaat: Van "Algemeen" naar "Specifiek"

Na deze training gebeurde er iets magisch:

  • De robot werd een detective: Hij kon nu niet alleen zeggen "er is een feestje", maar ook "de man met nummer 1 geeft een cadeau aan de vrouw met nummer 2".
  • Hij werd ook slimmer in het algemeen: Het verrassende deel is dat door te leren kijken naar de details, de robot ook beter werd in het begrijpen van de hele foto. Het is alsof een student die veel oefent met lastige wiskundige formules, daardoor ook beter wordt in het begrijpen van de basiswiskunde.

Samenvatting in één zin

Inst-IT is een nieuwe manier om slimme beeld-robots te trainen door ze nummertjes te laten zien op de objecten waar je naar kijkt, zodat ze niet meer door de hele menigte dwalen, maar precies weten wie je bedoelt – en daardoor uiteindelijk alles beter begrijpen.

Waarom is dit belangrijk?
In de echte wereld willen mensen vaak niet weten wat er "over het algemeen" gebeurt, maar wat er met hun auto, hun huisdier of hun favoriete speler gebeurt. Deze technologie maakt die robots veel nuttiger voor ons dagelijks leven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →