← Neueste Arbeiten
💻 computer science

Do Transformers Understand Ancient Roman Coin Motifs Better than CNNs?

Dieses Paper präsentiert die erste Anwendung von Vision Transformern (ViT) auf die automatisierte Identifizierung semantischer Elemente auf antiken römischen Münzen unter Verwendung multimodaler Daten und zeigt auf, dass ViT-Modelle herkömmliche CNNs in der Genauigkeit übertreffen.

Ursprüngliche Autoren: David Reid, Ognjen Arandjelovic

Veröffentlicht 2026-01-15
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: David Reid, Ognjen Arandjelovic

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie besitzen eine riesige, staubige Bibliothek mit antiken römischen Münzen. Einige sind glänzend, andere abgenutzt und viele sind mit Schmutz bedeckt. Jahrhundertelang konnten nur wenige Experten mit jahrzehntelanger Erfahrung auf eine Münze schauen, die winzigen Abbildungen musterichtig betrachten und sagen: „Ah, diese hier hat ein Pferd“ oder „Diese hier zeigt einen Schild“.

In dieser Arbeit geht es darum, Computern genau diese Aufgabe beizubringen, aber mit einem Twist: Die Forscher wollten sehen, ob eine neue Art von „Computergehirn“, ein Vision Transformer (ViT), besser darin ist als der alte Standard, das Convolutional Neural Network (CNN).

Hier ist die Geschichte ihres Experiments, in einfachen Worten aufgeschlüsselt.

Das Problem: Eine Bibliothek von 100.000 Münzen

Die Forscher begannen mit einer riesigen Sammlung von 100.000 Münzbildern und deren Beschreibungen, die von einer Online-Auktionsseite stammen. Denken Sie an einen riesigen Haufen Puzzleteile.

  • Die Herausforderung: Antike Münzen sind knifflig. Sie sind oft zerkratzt, die Bilder sind stilisiert (nicht realistisch) und dieselbe Art von Münze kann je nach verwendetem Stempel (Matrize) leicht unterschiedlich aussehen.
  • Das Ziel: Anstatt nur eine Münze mit einer anderen zu vergleichen (wie ein „Finde den Zwilling“-Spiel), wollten sie, dass der Computer die Bedeutung der Bilder versteht. Kann der Computer ein „Füllhorn“ (Cornucopia) erkennen? Kann er unterscheiden, ob eine Figur „stehend“ oder „sitzend“ dargestellt ist?

Die Kontrahenten: Die alte Garde gegen den Neuling

Um dies zu lösen, ließen sie zwei verschiedene Computerarchitekturen gegeneinander antreten:

  1. Das CNN (Der „Lokale Detektiv“):
    Stellen Sie sich einen Detektiv vor, der ein Bild untersucht, indem er winzige Ausschnitte nacheinander prüft. Er schaut auf die obere linke Ecke, dann auf die obere rechte, dann in die Mitte. Er ist sehr gut darin, lokale Muster zu erkennen, wie etwa eine bestimmte Kurve oder Linie. Er kann jedoch manchmal einen Tunnelblick entwickeln, indem er sich zu sehr auf einen kleinen Punkt konzentriert und dabei das große Ganze übersieht.

  2. Das ViT (Der „Globale Beobachter“):
    Der Vision Transformer ist der Neuling auf dem Block. Anstatt Bilder Stück für Stück zu betrachten, stellen Sie sich einen Detektiv vor, der das gesamte Bild auf einmal betrachtet und sofort versteht, wie die obere linke Ecke mit der unteren rechten Ecke zusammenhängt. Er behandelt das Bild wie einen Satz, bei dem jeder Teil mit jedem anderen verbunden ist. Dies ermöglicht es ihm, „langreichweitige“ Verbindungen zu erkennen, die der lokale Detektiv vielleicht übersehen würde.

Das Experiment: Die Gehirne trainieren

Die Forscher mussten zuerst ihre Daten bereinigen. Die Originalfotos zeigten oft beide Seiten der Münze (Vorder- und Rückseite) oder mehrere Münzen in einem Haufen. Sie schrieben ein Programm, das nur die Rückseite („Revers“) der Münze ausschneidet, da sich auf dieser meist die interessantesten Bilder befinden.

Diese bereinigten Bilder wurden dann in beide Arten von Computern eingespeist.

  • Das CNN wurde auf jeweils ein spezifisches Konzept pro Trainingsschritt trainiert (z. B. „Finde alle Adler“).
  • Das ViT war ein Multitasker; es lernte, alle Konzepte (Adler, Schilde, Pferde usw.) gleichzeitig in einem einzigen Modell zu finden.

Die Ergebnisse: Wer hat gewonnen?

Nachdem das Training abgeschlossen war, testeten sie die Computer an Münzen, die diese noch nie zuvor gesehen hatten.

  • Der Gewinner: Der Vision Transformer (ViT) gewann im Allgemeinen. Er war genauer bei der Identifizierung der semantischen Elemente (der Bilder) als das CNN.
  • Die Geschwindigkeit: Das CNN war viel schneller im Training (wie ein Sprinter), während das ViT viel länger brauchte (wie ein Marathonläufer), aber am Ende eine bessere Endzeit in Bezug auf die Genauigkeit erreichte.
  • Das „Warum“: Die Forscher fanden heraus, dass das ViT besser mit der unordentlichen, abgenutzten Natur der Münzen umgehen konnte. Es ließ sich nicht so leicht verwirren, wenn ein Bild etwas anders aussah als erwartet.

Das „Röntgenbild“ (Saliency Maps)

Um zu verstehen, wie die Computer dachten, nutzten die Forscher ein Werkzeug namens „Saliency Mapping“. Dies ist wie das Strahlen eines Röntgenbildes auf das Bild, um zu sehen, auf welche Teile der Computer bei seiner Entscheidung geschaut hat.

  • Das CNNs Röntgenbild: Das CNN neigte dazu, sich auf einen spezifischen, winzigen Punkt zu konzentrieren. Wenn es beispielsweise nach einem Adler suchte, starrte es fast immer auf die untere rechte Ecke der Münze, wo Adlerflügel oft erscheinen. Es war wie ein Schüler, der auswendig lernte, dass „Adler immer unten rechts sind“, anstatt tatsächlich den Vogel zu erkennen.
  • Das ViTs Röntgenbild: Der Fokus des ViT war viel breiter gestreut und variabler. Manchmal schaute es auf die Federn des Adlers, manchmal auf den Hintergrund, manchmal auf den daneben stehenden Text. Es war schwieriger vorherzusagen, wohin genau es blickte, aber dies deutete darauf hin, dass es tatsächlich die gesamte Szene „verstand“, anstatt nur einen Ort auswendig zu lernen.

Der Haken: Verrauschte Labels

Das Paper gibt einen wesentlichen Mangel des Experiments zu: Die „Antworten“, die sie den Computern gaben, waren unordentlich. Die Computer wurden mit Textbeschreibungen von der Auktionsseite trainiert. Diese Beschreibungen sprachen jedoch oft über beide Seiten der Münze.

  • Beispiel: Eine Beschreibung könnte lauten: „Vorderseite: Kopf des Kaisers. Rückseite: Ein stehendes Pferd.“
  • Der Fehler: Dem Computer wurde nur die Rückseite (das Pferd) gezeigt, aber das Label sagte „Stehend“. In manchen Fällen bezog sich die Beschreibung „Stehend“ jedoch auf die Vorderseite der Münze, obwohl auf der Rückseite gar keine stehende Figur vorhanden war.
  • Das Ergebnis: Die Computer lernten teilweise aus den falschen Hinweisen. Die Forscher merkten an, dass dieses „Rauschen“ die Leistung beider Modelle, insbesondere bei Konzepten wie „stehend“ oder „sitzend“, wahrscheinlich einschränkte.

Das Fazit

Das Paper kommt zu dem Schluss, dass Vision Transformer ein vielversprechendes neues Werkzeug für die Untersuchung antiker Münzen sind. Sie übertrafen die älteren CNN-Modelle in der Genauigkeit, was darauf hindeutet, dass der „Globale Beobachter“-Ansatz besser für die komplexe, unordentliche Welt der antiken Geschichte geeignet ist.

Die Forscher warnen jedoch davor, dass wir für noch bessere Ergebnisse sauberere Daten benötigen. Wenn wir den Computer lehren können, den „Text der Vorderseite“ beim Betrachten der „Rückseite der Münze“ zu ignorieren, könnten diese digitalen Historiker noch mächtiger werden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →