← Nieuwste papers
🤖 AI

Tiled Prompts: Overcoming Prompt Misguidance in Image and Video Super-Resolution

Dit paper introduceert Tiled Prompts, een unificerend kader voor beeld- en videosuperresolutie dat promptmisleiding oplost door voor elk latente tegel een specifieke tekstprompt te genereren, wat leidt tot verbeterde perceptuele kwaliteit en minder artefacten vergeleken met methoden die een enkel globaal caption gebruiken.

Oorspronkelijke auteurs: Bryan Sangwoo Kim, Jonghyun Park, Jong Chul Ye

Gepubliceerd 2026-04-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Bryan Sangwoo Kim, Jonghyun Park, Jong Chul Ye

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: De "Tegel-Strategie" voor Super-Hoge Beeldkwaliteit

Stel je voor dat je een oude, wazige foto of een onscherpe video hebt en je wilt deze veranderen in een haarscherp meesterwerk van 4K-kwaliteit. Dit is wat Super-Resolution (super-resolutie) doet.

In de afgelopen jaren hebben slimme computers (AI) dit gedaan door te "gokken" hoe de details eruit zouden moeten zien, gebaseerd op een korte beschrijving (een prompt) van de hele afbeelding. Maar er zit een groot probleem in deze methode, en dit papier lost dat op.

Hier is de uitleg in simpele taal:

1. Het Probleem: De "Grote Beschrijving" die te breed is

Stel je voor dat je een gigantische muur hebt met honderden verschillende tegels. Op elke tegel staat iets anders: op de ene een bordje met tekst, op de andere een hond, en op een derde een auto.

Om deze muur te schilderen, geef je de AI één enkele, korte beschrijving voor de hele muur, bijvoorbeeld: "Een straat met gebouwen, bomen en voertuigen."

Dit is wat de huidige methoden doen. Ze gebruiken één "globale prompt" voor het hele beeld.

  • Het probleem: De AI is verward. Als ze naar de tegel met het bordje kijkt, zegt de beschrijving "straat met gebouwen". De AI denkt: "Ah, ik moet een gebouw schilderen!" en schildert een raam op het bordje. Fout!
  • Het resultaat: De tekst op het bordje wordt onleesbaar, de hond krijgt een auto-lichaam, en de details worden vaag of verzonnen (hallucinaties). De AI weet niet precies wat er op die specifieke kleine plek moet staan.

2. De Oplossing: "Tegel-Prompts" (Tiled Prompts)

De auteurs van dit papier, Bryan Sangwoo Kim en zijn team, hebben een slimme oplossing bedacht: Tiled Prompts (Tegel-Prompts).

In plaats van één beschrijving voor de hele muur, laten ze de AI eerst de muur in kleine stukjes (tegels) knippen. Voor elk klein stukje laten ze een slimme "observator" (een Vision-Language Model of VLM) kijken en een specifiek verslag maken.

  • Voor het bordje: De observator zegt: "Dit is een rood bordje met witte tekst 'STOP'."
  • Voor de hond: De observator zegt: "Dit is een bruine hond die rent."
  • Voor de auto: De observator zegt: "Dit is een blauwe taxi."

De AI krijgt nu voor elk stukje van de muur een perfecte, specifieke instructie.

  • Het resultaat: De AI schildert het bordje met de tekst "STOP", de hond krijgt zijn eigen vorm, en de auto wordt blauw. Alles klopt perfect.

3. Waarom werkt dit zo goed?

De paper noemt dit het oplossen van twee soorten fouten:

  1. Vergeten details (Errors of Omission): De grote beschrijving vergeet vaak kleine details (zoals de tekst op het bordje). De tegel-prompt vergeet niets omdat hij zich alleen op dat kleine stukje focust.
  2. Verkeerde details (Errors of Commission): De grote beschrijving geeft informatie die op dat stukje niet hoort (zoals "auto" op de plek van het bordje). De tegel-prompt zorgt dat de AI alleen kijkt naar wat er echt is.

4. Video's? Geen probleem!

Dit werkt niet alleen voor foto's, maar ook voor video's. Bij video's is het nog lastiger omdat dingen bewegen.

  • Zonder tegel-prompt: De AI denkt misschien dat een draaiend wiel een vast object is, omdat de algemene beschrijving "auto" zegt.
  • Met tegel-prompt: De AI ziet in dat specifieke stukje van de video dat het wiel draait en beschrijft het als "draaiende wielen". Hierdoor blijft de video scherp en logisch, zonder rare bewegingen of vervormingen.

Samenvatting

Stel je voor dat je een enorme puzzel moet maken.

  • De oude manier: Je krijgt één zinnetje voor de hele puzzel: "Een landschap." Je probeert dan elk stukje te raden op basis van die ene zin. Veel fouten.
  • De nieuwe manier (Tiled Prompts): Je krijgt voor elk puzzelstukje een eigen kaartje met de exacte beschrijving van dat stukje: "Dit stukje is de blauwe lucht linksboven."

Het resultaat? Scherpere beelden, betere tekstherkenning, en minder gekke fouten, allemaal zonder dat de computer veel langzamer wordt. Het is alsof je de AI niet meer laat raden, maar haar precies vertelt wat ze moet doen, stukje bij beetje.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →