← Nieuwste papers
🤖 AI

Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing

Het artikel introduceert Kontinuous Kontext, een instructiegebaseerd model voor beeldbewerking dat vloeiende, continue controle over de sterkte van de bewerking mogelijk maakt door een lichtgewicht projector te trainen om een scalaire sterkte-waarde en tekstinstructie naar de modulatieruimte van het model te mappen, waardoor gebruikers bewerkingen kunnen aanpassen van subtiel tot volledig gerealiseerd over diverse operaties heen zonder attribuut-specifieke training.

Oorspronkelijke auteurs: Rishubh Parihar, Or Patashnik, Daniil Ostashev, R. Venkatesh Babu, Daniel Cohen-Or, Kuan-Chieh Wang

Gepubliceerd 2026-07-22
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Rishubh Parihar, Or Patashnik, Daniil Ostashev, R. Venkatesh Babu, Daniel Cohen-Or, Kuan-Chieh Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een toverstaf vasthoudt die afbeeldingen kan veranderen door er alleen maar tegen te praten. Je zegt: "Maak van de hond een kat," en poef, het gezicht van de hond verandert in dat van een kat. Dit is de wereld van instructiegebaseerde beeldbewerking, een superkracht gebouwd op generatieve AI. Dit zijn computerbreinen die getraind zijn op miljarden foto's en bijschriften, die hebben geleerd om nieuwe plaatjes te schilderen vanuit het niets of bestaande plaatjes aan te passen op basis van jouw woorden. Een lange tijd konden deze tovenaars slechts één ding: je bevel letterlijk opvolgen. Als je vroeg om een "blauwe jas," gaven ze je een jas die 100% blauw was. Als je om "sneeuw" vroeg, werd de hele scène een sneeuwstorm. Maar wat als je maar een beetje sneeuw wilde? Of een jas die grotendeels rood was, maar met een vleugje blauw? Tot nu toe was de toverstaf een beetje onhandig; het was een aan/uit-schakelaar, geen dimmer.

Hier begint het verhaal van Kontinuous Kontext. De onderzoekers wilden die onhandige aan/uit-schakelaar veranderen in een soepele, glijdende dimmer. Ze stelden een simpele vraag: Kunnen we een AI leren niet alleen te begrijpen wat er moet veranderen, maar ook hoeveel er moet veranderen? Ze wilden niet alleen dat de AI de juiste hoeveelheid raadde; ze wilden dat een gebruiker een schuifregelaar kon slepen en de afbeelding geleidelijk kon zien transformeren, zoals het harder zetten van het volume van een liedje of het aanpassen van de helderheid van een scherm. Dit papier introduceert een nieuwe manier om AI die fijnmazige controle te geven, waardoor we een bewerking kunnen instellen van "niets gebeurd" naar "volledig getransformeerd" in één vloeiende beweging.


Het Probleem: De "Alles-of-Niets" Toverstaf

Stel je voor dat je een chef bent met een magisch receptenboek. Als je vraagt om "pittige soep," geeft het boek je een kom die zo heet is dat je tong brandt. Als je vraagt om "milde soep," geeft het je een kom die naar water smaakt. Je kunt niet vragen om "slechts een klein beetje pit." Dat is precies hoe de huidige beeldbewerkende AI werkt. Je geeft het een tekstinstructie, zoals "verander de jas in bont," en het doet ofwel niets, of het gaat helemaal door naar een volle, pluizige transformatie. Er is geen middenweg.

Eerdere pogingen om dit op te lossen waren alsojd je voor elke ingrediënt een nieuwe keuken probeerde te bouwen. Sommige wetenschappers probeerden speciale modellen te trainen die alleen bedoeld waren voor het veranderen van haarkleur, anderen voor het veranderen van het weer, en anderen voor het veranderen van de vorm van objecten. Het was alsof je voor elk gerecht een andere chef had. Het werkte, maar het was traag, duur, en je kon niet gemakkelijk combineren. Je had één universele chef nodig die elke aanvraag kon afhandelen en je de intensiteit van elke enkele verandering liet controleren.

De Oplossing: De "Volumeknop" voor AI

Het team achter Kontinuous Kontext (een speelse naam die "Continuous" en "Context" mengt) bouwde een systeem dat fungeert als een universele volumeknop voor beeldbewerking. In plaats van alleen te luisteren naar de instructie "Maak het blauw," luistert de AI nu naar de instructie plus een getal dat zegt hoe blauw.

Denk aan de AI als een muzikant die een liedje speelt. De tekstinstructie is de bladmuziek, die de muzikant vertelt wat hij moet spelen. De nieuwe "schuifregelaar" is de volumeknop. In het verleden kon de muzikant het liedje alleen op vol volume spelen of in stilte. Nu, met Kontinuous Kontext, kun je de knop draaien van nul naar tien. Bij nul is het liedje stil (de afbeelding is ongewijzigd). Bij vijf is de muziek zacht en teder (een subtiele bewerking). Bij tien is het een rockconcert (een volledige transformatie). De magie is dat de overgang tussen nul en tien perfect vloeiend is, zonder plotselinge sprongen of glitches.

Hoe ze de AI leerden te schuiven

Je vraagt je misschien af: "Waar hebben ze de data vandaan gekregen om de AI dit te leren?" Want echte mensen maken meestal niet een foto, bewerken deze een beetje, bewerken deze nog een beetje meer, en bewerken deze vervolgens volledig, waarbij ze elke stap onderweg opslaan. Dat soort data bestaat niet in de wildernis.

Dus werden de onderzoekers datamagiers. Ze creëerden een synthetische dataset—een nep maar realistische bibliotheek van voorbeelden. Zo deden ze het:

  1. De Opzet: Ze namen 110.000 willekeurige foto's.
  2. Het Commando: Ze gebruikten een slimme AI-assistent om voor elke foto een unieke instructie te schrijven, zoals "Verander de auto in een ruimteschip."
  3. De Volledige Bewerking: Ze gebruikten een krachtige bestaande AI (genaamd Flux Kontext) om de volledige bewerking uit te voeren, waarbij de auto in een ruimteschip werd veranderd.
  4. De Brug: Dit was het lastige deel. Ze moesten de AI laten zien hoe de auto eruitzag bij 10%, 20%, 50% en 90% ruimteschip-achtigheid. Ze gebruikten een speciale "morphing"-tool om deze tussenliggende afbeeldingen te maken, zoals een video die van de ene scène naar de andere vervaagt.
  5. De Opschoning: De morphing-tool was niet perfect. Soms maakte het vreemde artefacten, zoals een auto met een half wiel of een ruimteschip dat op een klodder leek. De onderzoekers bouwden een strikt filter om alle "slechte" voorbeelden weg te gooien waar de overgang niet vloeiend was of de afbeelding kapot leek. Ze eindigden met 64.000 hoogwaardige "edit trajectories" (vloeiende paden van begin tot eind).

Het Geheime Recept: De "Translator" Projector

De kernuitvinding is een klein, lichtgewicht netwerk dat ze een projector noemen. Denk aan het hoofd-AI-model als een groot, complex orkest. De tekstinstructie vertelt het orkest wat het moet spelen. De nieuwe projector is een kleine vertaler die tussen de schuifregelaar en het orkest zit.

Wanneer je de schuifregelaar naar "0.5" (halverwege) schuift, roept de vertaler niet simpelweg "HALF!" naar het orkest. In plaats daarvan fluistert de vertaler een zeer specifieke, gekalibreerde instructie aan de dirigent van het orkest (de modulatieruimte). Het zegt: "Oké, voor deze specifieke instructie over een blauwe jas, pas deze exacte hoeveelheid blauw toe."

Het onderzoek toonde aan dat als ze simpelweg het getal in de tekstwoorden zouden voeren (zoals het toevoegen van een "half" token), de muziek schokkerig en vreemd zou worden. Maar door het getal in de modulatieruimte te voeren—een verborgen laag waar de AI de "vibe" van de afbeelding beheert—konden ze de veranderingen vloeiend en precies maken. Het is alsof je beseft dat om het volume te veranderen, je niet tegen de zanger moet schreeuwen; je moet direct de gain-knop van de versterker aanpassen.

Wat ze vonden (en wat ze niet vonden)

De resultaten waren indrukwekkend. Wanneer ze hun systeem testten tegen andere methoden, was Kontinuous Kontext de duidelijke winnaar op het gebied van vloeiendheid.

  • De Competitie: Andere methoden waren als een defecte lift. Ze gingen van de begane grond naar de 10e verdieping, maar soms sloegen ze de 5e verdieping volledig over, of de deuren gingen open op de verkeerde verdieping. Sommige methoden probeerden simpelweg twee afbeeldingen samen te "morphen", maar dat resulteerde vaak in vreemde, wazige monsters in de tussenstappen.
  • De Winnaar: Kontinuous Kontext bewoog als een soepele lift. Terwijl de schuifregelaar van 0 naar 1 ging, veranderde de afbeelding geleidelijk en logisch. Een jas werd niet plotseling blauw; hij kreeg langzaam meer blauw. Een besneeuwd tafereel verscheen niet zomaar; de sneeuwvlokken verschenen langzaam en de grond werd langzaam wit.

Het paper toonde ook aan dat deze methode voor alles werkt, niet alleen voor één ding. Of je nu de kleur van een jurk verandert, het materiaal van een rots (om het eruit te laten zien als goud), de vorm van een auto, of het hele weer in een scène, dezelfde schuifregelaar werkt. Dit is enorm belangrijk omdat het betekent dat je niet voor elk type bewerking een ander model nodig hebt. Eén universeel model kan het allemaal aan.

De auteurs zijn echter eerlijk over de beperkingen. Het systeem is geweldig in "continue" bewerkingen, zoals het veranderen van kleuren of materialen. Maar als je om een zeer specifieke, harde geometrische verandering vraagt—zoals een auto precies 90 graden draaien—heeft het systeem soms moeite, omdat de basis-AI waarop het is gebouwd (Flux Kontext) daar ook moeite mee heeft. Ook als je probeert de schuifregelaar voorbij het maximum te duwen (zoals vragen om "120% blauw"), weet het systeem niet wat het moet doen; het stopt gewoon bij 100% of raakt in de war. Het is een dimmer, geen tijdmachine.

Waarom dit ertoe doet

Dit paper suggereert dat we voorbij de era van "ja of nee" AI gaan. We treden het tijdperk binnen van "hoeveel?". Door gebruikers een schuifregelaar te geven, overbrugt Kontinuous Kontext de kloof tussen de rommelige, creatieve menselijke behoefte aan nuance en de rigide, binaire aard van computercode. Het verandert beeldbewerking van een gokspel—waarbij je hoopt dat de AI de juiste hoeveelheid verandering raadt—in een precies instrument waarmee je het resultaat precies afstemt op je smaak.

De onderzoekers hebben niet alleen een beter hulpmiddel gebouwd; ze hebben aangetoond dat de "knop" voor het controleren van intensiteit al verborgen zit in deze AI-modellen, wachtend om gevonden te worden. Ze moesten alleen de juiste sleutel bouwen om het te ontgrendelen. Nu kun je in plaats van een AI te vragen om "het perfect te maken," eindelijk zeggen: "Maak het bijna perfect," en hem in plek zien glijden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →