← Nieuwste papers
💻 computer science

GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention

Dit artikel introduceert GRAMformer, een nieuwe multimodale transformer-architectuur die Volumetric Multimodal cross-Attention (VMA) gebruikt om efficiënt interacties van elke volgorde te modelleren door aandachtsscores te berekenen op basis van het gezamenlijke geometrische volume van query- en key-vectoren, waardoor de beperkingen van bestaande paarwijze of geconcateneerde benaderingen worden overwonnen.

Oorspronkelijke auteurs: Giordano Cicchetti, Eleonora Grassucci, Danilo Comminiello

Gepubliceerd 2026-06-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Giordano Cicchetti, Eleonora Grassucci, Danilo Comminiello

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een complex verhaal te begrijpen dat door drie vrienden tegelijkertijd wordt verteld: de één spreekt, de ander laat een video zien en de derde speelt muziek af.

De Oude Manier: Het "Eén-op-Eén" Interview
Huidige AI-modellen (zoals die in de meeste smartphones van vandaag) proberen dit verhaal te begrijpen door elke vriend apart te interviewen.

  • Eerst vraagt de AI aan de spreker: "Wat vind je van de muziek?"
  • Daarna vraft de AI aan de spreker: "Wat vind je van de video?"
  • Ten slotte vraagt de AI aan de spreker: "Wat vind je van de video en de muziek samen?"

Het probleem is dat de AI de muziek en de video behandelt alsof het vreemden zijn. De AI vraagt nooit: "Hoe veranderen de muziek en de video samen de betekenis van wat de spreker zegt?" Het mist de magie die ontstaat wanneer alle drie de elementen op exact hetzelfde moment samenkomen. Bovendien, als je een vierde vriend toevoegt (zoals een temperatuursensor), moet de AI nog meer aparte interviews afleggen, waardoor het trager wordt en meer geheugen nodig heeft, zoals een manager die probeert vergaderingen voor een groeiend team één-op-één in te plannen.

De Nieuwe Manier: De "Groepsbespreking" (GRAMformer)
De auteurs van dit artikel, Giordano Cicchetti en zijn team, hebben een nieuw systeem gebouwd genaamd GRAMformer. In plaats van aparte interviews te houden, hebben ze een "Groepsbespreking"-mechanisme ontwikkeld genaamd Volumetric Multimodal Cross-Attention (VMA).

Zo werkt het met behulp van een eenvoudige analogie:

1. De "Vorm" van het Gesprek

Stel je voor dat de spreker, de video en de audio drie stokken zijn die in de ruimte zweven.

  • Oude AI: Meet alleen hoe dicht de spreker bij de video staat en hoe dicht de spreker bij de audio staat. Het negeert de vorm die door alle drie de stokken wordt gevormd.
  • GRAMformer: Het kijkt naar de 3D-vorm (een volume) die ontstaat wanneer je alle drie de stokken met elkaar verbindt.
    • Als de stokken allemaal in dezelfde richting wijzen (uitgelijnd), is de vorm plat en heeft deze bijna geen volume.
    • Als de stokken in verschillende richtingen wijzen maar toch een samenhangende structuur vormen, heeft de vorm een specifiek volume.
    • De AI gebruikt dit "volume" als een score. Het vraagt: "Vormen deze drie stukken informatie samen een solide, betekenisvolle vorm?"

Dit stelt de AI in staat om direct de gezamenlijke relatie tussen alle drie (of meer) vrienden te begrijpen, in plaats van te gokken op basis van paren.

2. Waarom is het Slimer en Lichter?

  • Geen Meer "Kwadratische" Chaos: In de oude manier, als je een nieuwe vriend toevoegt, moet de AI dubbel zoveel werk doen. Het is alsof je iemand toevoegt aan een feestje en plotseling voor elk paar mensen een afspraak moet inplannen.
  • De GRAMformer Oplossing: Omdat het naar het "groepsvolume" tegelijkertijd kijkt, explodeert de wiskunde niet wanneer je meer vrienden toevoegt. Het blijft efficiënt, zoals een groepschat waar iedereen tegelijkertijd spreekt, in plaats van een telefoonboom waarbij je iedereen individueel opbelt.

3. Wat Hebben Ze Getest?

Het team heeft dit nieuwe "Groepsbespreking"-systeem getest op taken waarbij computers menselijke emoties en acties moeten begrijpen. Ze gebruikten datasets die te maken hebben met:

  • Sentimentanalyse: Bepalen of een videoclip blij, verdrietig of boos is door tekst, stem en gezichtsuitdrukkingen samen te bekijken.
  • Humor en Sarcasme: Achterhalen of een grap echt grappig is of sarcastisch bedoeld is.
  • Robotica: Robots helpen om kracht- en raaktsensoren naast visuele gegevens te begrijpen.

Het Resultaat:
In deze tests was GRAMformer in staat om de "groepsvibe" beter te begrijpen dan de oude systemen. Het behaalde hogere scores in het raden van emoties en sarcasme, en deed dit terwijl het minder computergeheugen en minder parameters (minder "hersencapaciteit" nodig) gebruikte dan de zware, complexe modellen waarmee het werd vergeleken.

Samenvatting

Beschouw de oude AI als een detective die verdachten één voor één ondervraagt en probeert de waarheid te raden. GRAMformer is een detective die alle verdachten tegelijkertijd in een kamer zet en kijkt naar hoe zij met elkaar interageren om zo direct het hele plaatje te zien. Het is sneller, lichter en veel beter in het begrijpen van hoe verschillende stukken informatie samenwerken als een team.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →