← Nieuwste papers
🤖 AI

MolmoPoint: Better Pointing for VLMs with Grounding Tokens

Het paper introduceert MolmoPoint, een nieuw mechanisme voor Vision-Language Modellen dat punten genereert door visuele tokens direct te selecteren in plaats van coördinaten te tekstueel te beschrijven, wat leidt tot state-of-the-art prestaties op benchmarks voor afbeeldings-, GUI- en videopointing met verbeterde sample-efficiëntie.

Oorspronkelijke auteurs: Christopher Clark, Yue Yang, Jae Sung Park, Zixian Ma, Jieyu Zhang, Rohun Tripathi, Mohammadreza Salehi, Sangho Lee, Taira Anderson, Winson Han, Ranjay Krishna

Gepubliceerd 2026-03-31
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Christopher Clark, Yue Yang, Jae Sung Park, Zixian Ma, Jieyu Zhang, Rohun Tripathi, Mohammadreza Salehi, Sangho Lee, Taira Anderson, Winson Han, Ranjay Krishna

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🎯 Het Probleem: De "Coördinaat-Boodschappenlijst"

Stel je voor dat je een slimme robot hebt die naar een foto kijkt en je vraagt: "Wijs me de rode auto links."

Tot nu toe deden slimme modellen (VLM's) dit op een heel omslachtige manier. Ze moesten een coördinatenlijst genereren, alsof ze een boodschappenlijstje schreven: "Ga 342 pixels naar rechts en 120 pixels naar beneden."

  • Het probleem: Dit is als proberen een doelwit te raken door te zeggen: "Loop 500 stappen, draai 12 graden, loop nog 200 stappen." Het is veel tekst (tokens), het kost tijd om te berekenen, en de robot moet eerst een ingewikkeld "ruimtelijk systeem" leren begrijpen voordat hij überhaupt kan wijzen.

💡 De Oplossing: De "Magische Wijsvinger"

De auteurs van dit paper (van het Allen Institute for AI) hebben een nieuwe manier bedacht: MolmoPoint.

In plaats van coördinaten te berekenen, laat het model direct wijzen door een speciaal "wijs-token" te gebruiken. Het is alsof je in plaats van te zeggen "loop naar de deur", gewoon met je vinger naar de deur wijst.

Hoe werkt het? (De Drie-Stappen-Strategie)

Het model wijst niet in één keer perfect. Het doet het in drie stappen, net als wanneer je iemand iets in een grote stad laat vinden:

  1. De Grove Wijs (De Buurt): Het model kijkt naar de hele foto en zegt: "Ik denk dat het in deze grote wijk zit." (Dit is het <PATCH> token).
  2. De Fijne Wijs (De Straat): Binnen die wijk zoomt het in en zegt: "Nee, het zit niet in de hele wijk, maar in deze specifieke straat." (Dit is het <SUBPATCH> token).
  3. De Precieze Wijs (Het Huisnummer): Tot slot wijst het precies naar het raam of de deur. "Hier, op dit exacte punt." (Dit is het <LOCATION> token).

De magische truc: Het model gebruikt de "geheugenstukjes" (visual tokens) van de foto zelf om te wijzen. Het is alsof het model een vinger op de foto legt en zegt: "Dit stukje hier is het antwoord." Het hoeft geen getallen te bedenken; het kiest gewoon het juiste stukje uit de foto.

🚀 Waarom is dit zo goed?

  1. Snelheid en Efficiëntie: Omdat het geen lange coördinatenlijst hoeft te typen, is het veel sneller. Het is als het verschil tussen het opschrijven van een adres (straat, huisnummer, stad) en gewoon met je vinger naar het huis wijzen.
  2. Geen Leren van Getallen: Het model hoeft geen "ruimtelijke wiskunde" te leren. Het leert gewoon: "Als ik dit woord hoor, moet ik naar dit stukje van de foto kijken." Dit maakt het slimmer in het vinden van kleine details.
  3. Stoppen op het juiste moment: Het model heeft een speciale knop: "Geen punten meer." Zonder deze knop zouden sommige robots blijven wijzen tot ze de hele foto vol hebben staan met pijlen. Nu weten ze precies wanneer ze klaar zijn.

🌍 Waarvoor is het gebruikt?

De onderzoekers hebben drie speciale versies van dit model getraind:

  • MolmoPoint-8B (De Alleskunner): Werkt goed op gewone foto's en video's. Het is nu de beste in het openbare domein om objecten te vinden en te tellen.
  • MolmoPoint-GUI-8B (De Computer-Gebruiker): Deze is getraind op schermafbeeldingen van computers en telefoons. Hij kan precies zien waar je moet klikken op een knop in een programma (bijv. "Klik op de 'Opslaan'-knop"). Dit is cruciaal voor AI-agenten die je computer voor je moeten bedienen.
  • MolmoPoint-Vid-8B (De Video-Tracker): Deze kan objecten volgen in video's. Als een bal wegrolt en even achter een boom verdwijnt, weet dit model nog steeds waar hij is.

🏆 De Resultaten

Het resultaat is indrukwekkend:

  • Bij het wijzen op gewone foto's is het de beste ter wereld (State-of-the-Art).
  • Bij het bedienen van computerschermen (GUI) is het de beste open-source oplossing, veel beter dan modellen die coördinaten gebruiken.
  • Het leert sneller en heeft minder voorbeelden nodig om het goed te doen.

🎓 Conclusie in één zin

MolmoPoint vervangt de saaie, getallen-gebaseerde instructies ("ga naar x, y") door een natuurlijke, visuele wijsbeweging, waardoor AI-modellen veel sneller, slimmer en nauwkeuriger kunnen wijzen naar wat ze zien op een scherm of in een video. Het is alsof we de robot eindelijk een echte vinger hebben gegeven in plaats van alleen maar een rekenmachine.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →