1. Problemstellung
Herkömmliche OCR-Systeme (Optical Character Recognition) stehen vor einem Dreieck aus Kosten, Genauigkeit und Fähigkeiten.
- Pipeline-Systeme: Traditionelle Ansätze nutzen mehrstufige Pipelines (Layout-Erkennung → Texterkennung → Nachverarbeitung). Diese bieten hohe Durchsatzraten und explizite Layout-Analyse, leiden jedoch unter Fehlerfortpflanzung zwischen den Stufen und dem irreversiblen Verlust des visuellen Kontexts während der Textextraktion.
- Allgemeine Vision-Language-Modelle (VLMs): Diese Modelle bieten breite multimodale Fähigkeiten, sind jedoch oft nicht für strukturierte Dokumentenparsing-Aufgaben optimiert, weisen höhere Inferenzkosten auf und verlieren bei der Erhaltung präziser Layouts (z. B. Tabellenstrukturen) an Genauigkeit.
- End-to-End-Lücken: Bisherige End-to-End-Modelle verzichten oft auf eine explizite Layout-Analyse, was für Aufgaben wie die Lokalisierung von Elementen oder die Klassifizierung von Typen in komplexen Dokumenten (z. B. mehrspaltige Texte, verschachtelte Abbildungen) problematisch ist.
Das Ziel von Qianfan-OCR ist es, diese Lücke zu schließen, indem ein einheitliches, end-to-end Modell entwickelt wird, das Layout-Analyse, Texterkennung und semantisches Verständnis vereint, ohne die Nachteile von Pipelines oder die Ineffizienz reiner VLMs.
2. Methodik und Architektur
Modellarchitektur:
Qianfan-OCR ist ein 4-Milliarden-Parameter-Modell (4B), das auf einer Vision-Language-Architektur basiert:
- Vision Encoder: Nutzt Qianfan-ViT mit einem „AnyResolution"-Design, das Bilder dynamisch in Patches (448x448) unterteilt und Eingaben bis zu 4K Auflösung unterstützt. Dies ist entscheidend für dichten Text und kleine Schriftarten.
- Sprachmodell-Backbone: Basiert auf Qwen3-4B mit 36 Layern und einem Kontextfenster von 32K (erweiterbar auf 131K). Es nutzt Grouped-Query Attention (GQA) für effizienten Speicherverbrauch.
- Adapter: Ein leichter MLP-Adapter verbindet die visuellen Merkmale mit dem Sprachmodell.
Schlüsselinnovation: „Layout-as-Thought"
Um das Problem des fehlenden expliziten Layouts in End-to-End-Modellen zu lösen, führt das Paper den Mechanismus Layout-as-Thought ein:
- Funktionsweise: Das Modell kann durch spezielle Tokens (⟨think⟩) in einen optionalen „Denk"-Modus versetzt werden. In dieser Phase generiert das Modell strukturierte Layout-Repräsentationen (Bounding-Box-Koordinaten, Element-Typen, Lesereihenfolge) bevor es die finale Ausgabe (z. B. Markdown) erstellt.
- Zweck:
- Funktionalität: Nutzer erhalten direkt strukturierte Layout-Ergebnisse (Lokalisierung, Typisierung) aus einem End-to-End-Modell.
- Leistungssteigerung: Die expliziten strukturellen Priors helfen, Mehrdeutigkeiten in komplexen Dokumenten (z. B. mehrspaltige Zeitungen, Formeln in Tabellen) aufzulösen.
- Adaptivität: Für einfache Dokumente ist dieser Schritt optional und kann deaktiviert werden, um Latenz zu sparen. Für komplexe Dokumente verbessert er die Genauigkeit signifikant.
Trainingsdaten und -strategie:
Das Modell wurde mit einem mehrstufigen, progressiven Trainingsansatz trainiert, der auf einer großen Menge synthetisierter Daten basiert:
- Daten-Synthese: Sechs Pipelines generieren Daten für Dokumentenparsing, KIE (Key Information Extraction), komplexe Tabellen, Diagrammverständnis, Formelerkennung und multilinguales OCR (192 Sprachen).
- Phasen:
- Cross-Modal Alignment (nur Adapter).
- Fundamentales OCR-Training (große Datenmenge, gemischte OCR-Aufgaben).
- Domänenspezifische Verbesserung (Fokus auf Tabellen, Formeln, Diagramme).
- Instruction Tuning und Reasoning-Verbesserung.
3. Wichtige Beiträge
- Einheitliches End-to-End-Modell: Qianfan-OCR ist das erste Modell, das Layout-Analyse, Texterkennung und semantisches Verständnis in einem einzigen 4B-Parameter-Modell vereint, das sowohl für reine OCR als auch für komplexe Dokumentenverständnis-Aufgaben geeignet ist.
- Layout-as-Thought: Ein neuartiger Mechanismus, der die Lücke zwischen End-to-End-Modellen und Pipeline-Systemen schließt, indem er strukturierte Layout-Reasoning als optionalen Zwischenschritt integriert. Dies ermöglicht räumliches Grounding und verbessert die Genauigkeit bei komplexen Layouts.
- Skalierbare Daten-Synthese: Entwicklung hochspezialisierter Pipelines zur Generierung von Trainingsdaten für schwierige Szenarien wie mehrspaltige Tabellen, wissenschaftliche Formeln und Diagramme, was die Robustheit des Modells erhöht.
- Effiziente Inferenz: Trotz der Komplexität erreicht das Modell durch End-to-End-Verarbeitung und Quantisierung (W8A8) einen hohen Durchsatz, der mit traditionellen Pipeline-Systemen konkurrieren kann.
4. Ergebnisse
Qianfan-OCR wurde auf einer breiten Palette von Benchmarks evaluiert und erzielt State-of-the-Art-Ergebnisse:
Spezialisierte OCR-Benchmarks:
- OmniDocBench v1.5: Erreicht 93,12 Punkte und rangiert damit Platz 1 unter allen End-to-End-Modellen (sogar besser als einige Pipeline-Systeme wie MinerU2.5).
- OlmOCR Bench: Erzielt 79,8 Punkte (Platz 1 unter End-to-End-Modellen).
- Das Modell schließt die Lücke zu den besten Pipeline-Systemen (z. B. PaddleOCR-VL 1.5 mit 94,50) erheblich.
Allgemeine OCR-Benchmarks:
- OCRBench: 880 Punkte (höchster Wert aller Modelle, auch höher als Qwen3-VL-4B).
- Starke Leistung bei mehrsprachigem OCR (CCOCR) und Handschrifterkennung.
Dokumentenverständnis (Document Understanding):
- Übertrifft Pipeline-Systeme (OCR + LLM) drastisch bei Aufgaben, die räumliches Verständnis erfordern.
- ChartQA / ChartBench: Pipeline-Systeme scheitern hier oft (nahezu 0 Punkte bei ChartXiv), da sie Layout-Kontext verlieren. Qianfan-OCR erreicht hier hohe Werte (z. B. 88,1 auf ChartQA_TEST).
- Bei reinen Text-Verständnis-Aufgaben (DocVQA) liegt es knapp hinter großen allgemeinen VLMs, übertrifft aber spezialisierte OCR-Modelle deutlich.
Key Information Extraction (KIE):
- Erzielt den höchsten Durchschnittswert (87,9) auf fünf öffentlichen KIE-Benchmarks und übertrifft damit kommerzielle Modelle wie Gemini-3.1-Pro und Seed-2.0 sowie große Open-Source-Modelle (Qwen3-235B).
Inferenz-Durchsatz:
- Mit W8A8-Quantisierung erreicht Qianfan-OCR 1,024 Seiten pro Sekunde (PPS) auf einer A100 GPU. Dies ist vergleichbar mit PaddleOCR-VL (1,224 PPS) und deutlich schneller als andere End-to-End-Modelle, da es CPU-Engpässe bei der Layout-Vorverarbeitung vermeidet.
5. Bedeutung und Ausblick
Qianfan-OCR demonstriert, dass End-to-End-Architekturen für Dokumentenintelligenz nicht nur konkurrenzfähig, sondern in vielen Aspekten überlegen sein können.
- Paradigmenwechsel: Das Paper zeigt, dass die Aufrechterhaltung des visuellen Kontexts während des gesamten Verarbeitungsprozesses entscheidend ist, insbesondere für Aufgaben, die räumliches und strukturelles Verständnis erfordern (z. B. Diagramme, komplexe Tabellen).
- Praktische Anwendbarkeit: Durch die Einführung von „Layout-as-Thought" wird das traditionelle Dilemma gelöst, dass End-to-End-Modelle oft keine expliziten Layout-Informationen liefern. Dies macht das Modell für industrielle Anwendungen (Vertragsprüfung, Rechnungsanalyse) attraktiv, wo sowohl Text als auch Struktur wichtig sind.
- Effizienz: Das Modell beweist, dass ein 4B-Modell mit moderner Quantisierung und End-to-End-Design einen hohen Durchsatz erreichen kann, was die Deployment-Kosten senkt.
Zukünftige Arbeiten sollen die „Layout-as-Thought"-Mechanismen durch Reinforcement Learning weiter verfeinern, um das Modell flexibler in der Entscheidung zu machen, wann strukturelles Reasoning notwendig ist, und die Modellgröße für Edge-Geräte weiter zu optimieren.
Das Modell ist öffentlich über die Baidu AI Cloud Qianfan-Plattform verfügbar.