← Neueste Arbeiten
💻 computer science

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

Um den Mangel an hochwertigen Benchmarks für die skizzenbasierte Bildbearbeitung auf Pixelebene zu beheben, führt diese Arbeit den SI-Data-Datensatz und das SI-Edit-Framework ein, welche multimodale große Sprachmodelle nutzen, um instruktionsgesteuerte Quadruplets zu synthetisieren und durch einen kollaborativen räumlich-semantischen Lernansatz präzise, semantisch ausgerichtete lokale Deformationen zu erreichen.

Ursprüngliche Autoren: Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

Veröffentlicht 2026-08-11
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem magischen Künstler eine sehr spezifische, winzige Anweisung zu geben, der alles malen kann, was Sie wollen. Sie könnten sagen: „Lass den Stiel dieser Blume in eine geschmeidige S-Form biegen.“ Aber hier liegt das Problem: Der Künstler ist ein wenig ein Tagträumer. Er hört „S-Form“ und biegt den Stiel vielleicht an der falschen Stelle oder verwandelt die ganze Pflanze in eine Schlange, statt nur den Stiel zu krümmen. Dies ist die Herausforderung der Bildbearbeitung mittels künstlicher Intelligenz. Wissenschaftler haben leistungsstarke „generative Modelle“ entwickelt – denken Sie an digitale Künstler, die auf Millionen von Bildern trainiert wurden –, die Bilder basierend auf Text verändern können. Aber wenn Sie eine winzige, präzise Änderung verlangen, wie etwa ein einzelnes Blatt zu biegen oder eine Flamme zu strecken, werden diese digitalen Künstler oft verwirrt. Sie verändern möglicherweise den falschen Teil des Bildes oder sie verstehen nicht genau, wie Sie die Änderung haben wollen.

Um dies zu beheben, haben Forscher zwei Haupttricks ausprobiert. Der eine ist, dem Künstler eine Skizze zu geben, wie etwa das Zeichnen einer Linie auf dem Bildschirm, um genau zu zeigen, wo gebogen werden soll. Der andere ist, Textanweisungen zu geben, wie zum Beispiel „biege es hier“. Aber jeder Trick hat einen Makel. Wenn Sie nur eine Skizze geben, weiß der Künstler nicht, was er tun soll (wollen Sie das Blatt kopieren, bewegen oder nur biegen?). Wenn Sie nur Text geben, weiß er nicht, wo er es tun soll. Dieses Paper, SI-Edit, versucht dies zu lösen, indem es den Künstler lehrt, sowohl der Skizze als auch dem Text gleichzeitig zuzuhören, und so wie ein superpräziser digitaler Bildhauer agiert, der ein Bild bis auf den letzten Pixel umgestalten kann.

Das Problem: Der „Lost in Translation“-Künstler

Stellen Sie sich vor, Sie spielen ein Spiel, bei dem Sie einem Freund ein Bild beschreiben müssen, der nur das zeichnen kann, was Sie sagen. Wenn Sie sagen: „Lass den Ast des Baumes krümmen“, krümmt Ihr Freund vielleicht den falschen Ast oder er zeichnet einen ganz neuen Baum. Dies ist das, was mit aktuellen KI-Tools passiert, die nur auf Textanweisungen hören. Sie sind großartig bei großen Änderungen, wie „mach den Himmel blau“, aber schrecklich bei winzigen, präzisen Änderungen. Ihnen fehlt ein „räumlicher Anker“ – eine Möglichkeit zu wissen, welchen Pixel genau man bewegen muss.

Wenn Sie hingegen nur eine Skizze geben (eine Linie, die auf den Bildschirm gezeichnet wurde), weiß die KI zwar, wo sie zeichnen soll, aber nicht, was sie tun soll. Ist diese Linie dazu gedacht, ein Blatt zu bewegen? Es zu kopieren? Oder es nur zu bücken? Oh\ne klare Anweisung könnte die KI falsch raten, was zu seltsamen Ergebnissen führt, wie etwa einem Blatt, das plötzlich zu einer Kopie seiner selbst wird, oder einem Stiel, der verschwindet.

Die Autoren dieses Papers erkannten, dass man für eine perfekte Kontrolle auf Pixelebene beides braucht: eine Karte (die Skizze) und ein Ziel (den Text). Aber es gab eine große Hürde: Niemand hatte jemals ein Trainingshandbuch erstellt, das diese beiden Dinge perfekt kombiniert.

Die Lösung: Ein neues Trainingshandbuch und ein neuer Künstler

Um dies zu beheben, musste das Team zuerst einen massiven, hochwertigen Trainingsdatensatz namens SI-Data erstellen. Denken Sie an dies als ein riesiges Kochbuch für die KI. Anstatt der KI nur „Vorher“- und „Nachher“-Bilder mit einer Textbeschreibung zu zeigen, erstellten sie Quadruplets – Sätze aus vier Dingen, die zusammengehören:

  1. Das Originalbild (der Ausgangspunkt).
  2. Das Zielbild (wie es nach der Bearbeitung aussehen sollte).
  3. Eine Skizze (eine einfache Linie, die die genaue Formänderung zeigt).
  4. Eine Anweisung (der Text, der der KI sagt, was sie tun soll).

Sie haben diese nicht von Hand gezeichnet; das hätte ewig gedauert. Stattdessen nutzten sie eine clevere automatisierte Pipeline. Sie nahmen schöne Fotos, baten eine intelligente KI (Qwen3-VL), eine spezifische Bearbeitsanweisung zu erfinden (wie „strecke das Zelt“), und nutzten dann eine andere KI (Nano Banana Pro), um die Änderung tatsächlich vorzunehmen. Dann verwendeten sie einen mathematischen Trick namens Optical Flow, um die „Skizze“ automatisch zu zeichnen, indem sie beobachteten, wie sich die Pixel vom Original zum neuen Bild bewegten. Dies lieferte ihnen 6.500 perfekte Beispiele dafür, wie man eine Skizze und eine Textanweisung kombiniert, um eine präzise Bearbeitung vorzunehmen.

Wie SI-Edit funktioniert: Der „Same Position“-Trick

Mit diesem neuen Datensatz bauten sie ein neues Bearbeitungswerkzeug namens SI-Edit. Dieses Werkzeug ist darauf ausgelegt, ein „kollaborativer“ Künstler zu sein. Es schaut nicht nur auf den Text oder die Skizze; es betrachtet sie gemeinsam.

Das Paper führt zwei Haupttricks ein, um dies zu ermöglichen:

  1. Das „Task-Trigger“-Token: Sie fügten ein spezielles geheimes Codewort, geschrieben als <sk>, am Anfang jeder Anweisung hinzu. Denken Sie an dies wie an eine Glocke, die läutet, bevor der Künstler mit dem Malen beginnt. Wenn die KI das „Glockenwort“ (<sk>) hört, weiß sie: „Oh, ich muss besonders auf die Skizzenlinien achten, die ich gleich sehen werde.“ Dies hilft der KI zu verstehen, dass die Skizze nicht nur eine Dekoration ist, sondern eine strikte Regel.
  2. Same Position Encoding (SPE): Dies ist der wichtigste Teil. Stellen Sie sich vor, Sie zeichnen ein Bild auf einem Stück Glas nach. Sie haben das Originalbild darunter und Ihre Skizze obenauf. Wenn Sie sie nicht perfekt ausrichten, wird Ihre Zeichnung daneben liegen. Die KI behandelt die Skizze und das Originalbild normalerweise als zwei separate Dinge, was dazu führt, dass sie „auseinanderdriften“. SI-Edit zwingt die KI, die Skizze und das Originalbild so zu behandeln, als befänden sie sich am exakt gleichen Ort in ihrem Gehirn. Es legt die Skizze über das Bild und sagt der KI: „Diese beiden Dinge befinden sich an denselben Koordinaten.“ Dies verhindert, dass die KI verwirrt wird, wo die Biegung stattfinden soll.

Was sie fanden: Präzision auf Pixelebene

Das Team testete SI-Edit gegen andere populäre Tools wie SketchEdit, MagicQuill und FramePainter. Die Ergebnisse waren eindeutig: SI-Edit war viel besser darin, den Regeln zu folgen.

  • Geometrische Präzision: Wenn gemessen wurde, wie genau die KI den Skizzenlinien folgte, erreichte SI-Edit einen Wert von 4,292 (niedriger ist besser), während das nächstbeste Tool, MagicQuill, 7,434 erreichte. Das bedeutet, dass die Biegungen und Kurven von SI-Edit viel näher an dem waren, was der Benutzer tatsächlich gezeichnet hatte.
  • Semantisches Verständnis: Beim Testen, ob die KI tatsächlich das getan hat, was der Text sagte (wie „strecken“ vs. „kopieren“), schnitt SI-Edit mit einem Wert von 0,0174 auf einer Metrik namens Δ\DeltaCS besser ab als alle anderen Methoden.
  • Nutzerpräferenz: Wenn echte Menschen die Ergebnisse betrachteten, bevorzugten sie SI-Edit in 81,3 % bis 94,8 % der Fälle, je nachdem, worauf sie acht gaben (visuelle Konsistenz, Genauigkeit oder Bildqualität).

Das Paper zeigte auch, dass dieses Werkzeug mehr konnte als nur Dinge zu biegen; es konnte sogar die Pose einer Person verändern, wie etwa einen Kampfsportler, der seine Stellung verändert, während Gesicht und Kleidung exakt gleich bleiben.

Das Fazendatum

Die Autoren schlagen vor, dass wir durch die Kombination einer klaren Karte (der Skizse) mit einem klaren Ziel (dem Text) und indem wir die KI lehren, beide als eine einheitliche Führung zu betrachten, endlich Bildbearbeitungswerzeuge erhalten können, die präzise genug sind, um winzige, komplexe Änderungen vorzunehmen, ohne den Rest des Bildes zu ruinieren. Sie haben nicht nur ein besseres Werkzeug gebaut; sie haben den ersten öffentlichen Datensatz erstellt, der der KI beibringt, wie dies funktioniert, und damit die Tür für zukünftige Forscher öffnet, noch intelligentere digitale Künstler zu erschaffen. Das Paper kommt zu dem Schluss, dass, während das Problem der „räumlichen Ambiguität“ (nicht zu wissen, wo man bearbeitet) und der „semantischen Blindheit“ (nicht zu wissen, was man bearbeitet) ein großes Hindernis war, dieser kollaborative Ansatz erfolgreich den Weg ebnet.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →