← Neueste Arbeiten
💻 computer science

Qianfan-OCR: A Unified End-to-End Model for Document Intelligence

Das Paper stellt Qianfan-OCR vor, ein 4-Milliarden-Parameter-Vision-Language-Modell, das durch eine neue „Layout-as-Thought"-Methode Dokumentenparsing, Layoutanalyse und Verständnis in einer einzigen Architektur vereint und dabei Spitzenleistungen auf mehreren Benchmark-Datensätzen erzielt.

Ursprüngliche Autoren: Daxiang Dong, Mingming Zheng, Dong Xu, Chunhua Luo, Bairong Zhuang, Yuxuan Li, Ruoyun He, Haoran Wang, Wenyu Zhang, Wenbo Wang, Yicheng Wang, Xue Xiong, Ayong Zheng, Xiaoying Zuo, Ziwei Ou, Jingnan Gu
Veröffentlicht 2026-03-17
📖 2 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Daxiang Dong, Mingming Zheng, Dong Xu, Chunhua Luo, Bairong Zhuang, Yuxuan Li, Ruoyun He, Haoran Wang, Wenyu Zhang, Wenbo Wang, Yicheng Wang, Xue Xiong, Ayong Zheng, Xiaoying Zuo, Ziwei Ou, Jingnan Gu, Quanhao Guo, Jianmin Wu, Dawei Yin, Dou Shen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

`), um zuerst eine Art „Gedankenprotokoll" zu schreiben. In diesem Protokoll listet es auf:

  • Wo ist die Tabelle? (Koordinaten)
  • Was ist das für ein Element? (Überschrift, Bild, Text)
  • In welcher Reihenfolge soll ich lesen?

Erst nachdem es diese Struktur im Kopf hat, gibt es die finale Antwort.

  • Vorteil: Bei einfachen Texten (wie einem Brief) braucht es diesen Modus nicht – es ist schnell. Bei komplexen Dokumenten (wie einer Mathe-Klausur mit Formeln und Diagrammen) hilft dieser „Denk-Schritt", Fehler zu vermeiden, weil das Modell genau weiß, wo was steht.

Warum ist das so wichtig? (Die Ergebnisse)

Die Forscher haben das Modell an vielen Tests gemessen:

  1. Bei komplexen Dokumenten: Qianfan-OCR ist der König. Es schlägt fast alle anderen Modelle, die nur „End-to-End" (direkt vom Bild zur Antwort) arbeiten, und holt sogar die alten Fließband-Systeme ein.
  2. Bei Diagrammen und Tabellen: Hier ist der Unterschied riesig. Wenn man ein Diagramm erst in Text umwandelt und dann fragt: „Wie hoch war der Wert im März?", verlieren die alten Systeme den Zusammenhang. Qianfan-OCR sieht das Diagramm noch „live" und kann die Frage beantworten.
  3. Geschwindigkeit: Obwohl es ein großes Modell ist, ist es durch cleveres Design (es läuft alles auf der Grafikkarte, nicht auf der langsamen CPU) fast so schnell wie die alten, komplizierten Systeme.

Zusammenfassung in einem Satz

Qianfan-OCR ist wie ein hochintelligenter Assistent, der nicht nur blindliest, sondern erst kurz „nachdenkt", um die Struktur des Dokuments zu verstehen, bevor er die Antwort gibt – und das alles in einem einzigen Schritt, ohne dass Informationen auf dem Weg verloren gehen.

Es ist ein großer Schritt weg von der „Rostigen Fließband-Fabrik" hin zu einem „intelligenten Einzelkämpfer", der Dokumente so versteht, wie ein Mensch sie lesen würde.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →