← Nieuwste papers
💻 computer science

ASemConsist: Adaptive Semantic Feature Control for Training-Free Identity-Consistent Generation

ASemConsist is een trainingsvrij framework dat hoogwaardige identiteits-consistente beeldgeneratie bereikt over diverse scènes door selectief tekst-embeddings te modificeren en adaptieve feature-sharing toe te passen, waardoor de afweging tussen identiteitsbehoud en per-afbeelding prompt-alignement wordt opgelost.

Oorspronkelijke auteurs: Shin Seong Kim, Minjung Shin, Hyunin Cho, Youngjung Uh

Gepubliceerd 2026-08-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shin Seong Kim, Minjung Shin, Hyunin Cho, Youngjung Uh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een verhaal te vertellen met plaatjes, waarbij het hoofdpersonage in elk frame exact hetzelfde moet blijven, zelfs als de achtergrond verandert van een regenachtige straat naar een zonnig park. Dit is de kern van een groeiende uitdaging in kunstmatige intelligentie: computers leren om consistente personages te genereren. Jarenlang waren de meest geavanceerde beeldvormende tools in staat om verbluffende visuals te creëren op basis van eenvoudige tekstbeschrijvingen. Echter, wanneer ze wordt gevraagd om een reeks afbeeldingen te genereren met dezelfde persoon of hetzelfde dier, hebben deze tools vaak moeite. Het personage kan van haarkleur veranderen, een kenmerkend litteken verliezen, of de gezichtsstructuur kan van het ene naar het andere plaatje verschuiven. Deze inconsistentie verbreekt de illusie van een doorlopend verhaal, wat het gebruik van deze tools voor animatie, strips of interactieve narratieven bemoeilijkt.

De kern van de moeilijkheid ligt in de manier waarop deze modellen voor kunstmatige intelligentie taal begrijpen. Wanneer een gebruiker om een specifiek personage vraagt, zoals "een kleine hond met korte vacht", vertaalt de computer deze zin naar een complexe wiskundige representatie. Het probleem ontstaat wanneer de computer deze personagebeschrijving probeert te combineren met een nieuwe scènebeschrijving, zoals "springend over een plas". In veel bestaande systemen raken de instructies voor het personage en de instructies voor de scène met elkaar verstrengeld. De computer kan niet gemakkelijk het deel van de instructie dat de identiteit van de hond definieert, scheiden van het deel dat de sprong over de plas beschrijft. Als gevolg daarvan, wanneer de computer de volgende afbeelding probeert te tekenen, verandert hij vaak per ongeluk de kenmerken van de hond terwijl hij probeert de nieuwe scène-instructies op te volgen, of hij negeert de nieuwe scène om de hond er hetzelfde uit te laten zien.

Een team van onderzoekers aan de Yonsei Universiteit heeft een nieuwe methode ontwikkeld genaamd AsemConsist om dit specifieke probleem op te lossen zonder de onderliggende kunstmatige intelligentie-modellen opnieuw te hoeven trainen. In plaats van de computer te dwingen een nieuwe manier van tekenen te leren, werkt hun aanpak als een bekwame editor die de instructies zorgvuldig aanpast voordat de computer begint met tekenen. Ze ontdekten dat de wiskundige codes die tekst representeren geen solide blokken informatie zijn, maar bestaan uit vele verschillende lagen, of componenten. Sommige van deze lagen helpen de identiteit van het personage te definiëren, terwijl andere de scène beschrijven of zelfs de look van het personage tegenspreken. Eerdere methoden probeerden het hele blok instructies in één keer aan te passen, wat er vaak toe leidde dat de computer de identiteit van het personage verloor of er niet in slaagde de scènebeschrijving op te volgen.

De oplossing van de onderzoekers omvat een driestappenproces dat automatisch gebeurt telkens wanneer een afbeelding wordt gegenereerd. Eerst scheiden ze de instructies in hun individuele componenten. Ze identificeren welke delen van de code essentieel zijn voor het behoud van de consistentie van het personage en welke delen noodzakelijk zijn voor het beschrijven van de specifieke scène. Vervolgens versterken ze de delen die de identiteit van het personage ondersteunen, terwijl ze tegelijkertijd de delen die de scène beschrijven een boost geven, om ervoor te zorgen dat beide sterk en duidelijk zijn. Ten tweede ontdekten ze een verborgen ruimte binnen het geheugen van de computer, bekend als 'padding', die normaal gesproken wordt genegeerd. Ze realiseerden zich dat deze ruimte gebruikt kon worden als een container om extra details over de scène te bevatten zonder de identiteit van het personage te verstoren. Door de scènegegevens in deze container te schrijven, voorkomen ze dat de scènebeschrijving per ongeluk de kenmerken van het personage overschrijft.

Ten slotte beslist het systeem wanneer het extra hulp moet toepassen. Als een gebruiker een zeer gedetailleerde beschrijving geeft van een personage, zoals "een 16-jarig meisje met golvend blond haar en blauwe ogen", kan de computer haar meestal uit zichzelf hetzelfde houden. Echter, als de beschrijving vaag is, zoals "een man", heeft de computer een sterker anker nodig om te voorkomen dat het personage gaat afwijken. De nieuwe methode detecteert automatisch hoe vaag de beschrijving is en past alleen extra beperkingen toe wanneer dat nodig is. Dit voorkomt dat het systeem te rigide is wanneer dat niet nodig is, waardoor er meer natuurlijke variatie in houdingen en achtergronden mogelijk is terwijl het personage nog steeds herkenbaar blijft.

Om hun werk te testen, creëerden de onderzoekers een nieuwe manier om succes te meten die kijkt naar zowel de consistentie van het personage als de mate waarin de scène wordt beschreven, in plaats van ze afzonderlijk te beoordelen. Ze vonden dat hun methode aanzienlijk beter werkt dan de huidige state-of-the-art tools op twee van de krachtigste beschikbare modellen voor beeldgeneratie. In hun tests behield hun nieuwe aanpak de identiteit van het personage over diverse scènes heen, terwijl ze nauwkeurig de specifieke instructies voor elke afbeelding volgde—een balans waar vorige methoden moeite mee hadden. De resultaten suggereren dat door de interne structuur van hoe computers taal verwerken te begrijpen, we ze kunnen sturen om meer coherente visuele verhalen te vertellen zonder dat er volledig nieuwe systemen vanaf nul gebouwd hoeven te worden. Deze vooruitgang brengt ons dichter bij een toekomst waarin kunstmatige intelligentie betrouwbaar de visuele narratieven kan genereren die nodig zijn voor films, games en digitale storytelling.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →