← Neueste Arbeiten
🤖 AI

OvisOCR2 Technical Report

OvisOCR2 ist ein 0,8B-End-to-End-Dokumentenparsing-Modell, das eine neuartige Data Engine und ein mehrstufiges Trainingsrezept unter Verwendung von Reinforcement Learning und Destillation nutzt, um durch die direkte Generierung von Markdown-Repräsentationen von Dokumentenseiten eine State-of-the-Art-Leistung auf Benchmark-Datensätzen zu erzielen.

Ursprüngliche Autoren: Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo

Veröffentlicht 2026-07-16
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie halten ein physisches Buch, einen handgeschriebenen Brief oder einen komplexen Beleg in der Hand. Für einen Menschen ist es einfach zu lesen: Sie wissen, in welcher Spalte Sie beginnen müssen, wie Sie ein Bild überspringen, um zum Text zurückzukehren, und wie Sie erkennen, dass eine geschwungene Linie eine mathematische Gleichung und nicht nur eine Kritzeleien ist. Aber für einen Computer ist dieselbe Seite nur ein flaches Gitter aus farbigen Pixeln. Er sieht ein Chaos aus Formen, ohne zu verstehen, dass eine Tabelle ein Raster ist, eine Formel eine Berechnung darstellt oder dass der Text am Ende der Seite zum Anfang der nächsten Spalte gehört. Dies ist die Welt des „Dokumenten-Parsings“. Es ist der Zaubertrick, ein Bild einer Seite in eine digitale Datei zu verwandeln, die ein Computer tatsächlich lesen, durchsuchen und nutzen kann. Lange Zeit versuchten Computer dies, indem sie die Aufgabe in winzige, separate Schritte zerlegten – zuerst die Linien finden, dann die Wörter lesen, dann raten, wo die Tabellen liegen. Aber dieser „Fließband“-Ansatz ist klobig; wenn der erste Schritt eine Tabellengrenze übersieht, gerät der Rest der Maschine ins Stocken. Die große Frage in diesem Bereich war: Können wir ein einziges, intelligentes Gehirn bauen, das das ganze Bild betrachtet und die Geschichte in einem Rutsch schreibt, genau wie ein Mensch es tut?

Hier kommt OvisOCR2 ins Spiel, ein neuer digitaler „Leser“, der von Forschern bei Alibaba entwickelt wurde. Betrachten Sie OvisOCR2 nicht als einen riesigen, schwerfälligen Supercomputer, sondern als ein flinkes, „taschengroßes“ Genie mit 0,8 Milliarden Parametern. Während andere Modelle, die versuchen, dieses Problem zu lösen, oft massiv sind und riesige Rechenzentren erfordern, ist OvisOCR2 darauf ausgelegt, klein und schnell, aber dennoch unglaublich leistungsstark zu sein. Die Forscher haben dieses Modell mit einer cleveren zweiteiligen Trainingsstrategie aufgebaut. Zuerst fütterten sie es mit einer massiven Bibliothek von realen Dokumenten – gescannten Papieren, Quittungen und Berichten –, aber sie waren sorgfältig dabei, die „Antworten“ zu bereinigen, damit das Modell von perfekten Beispielen lernt und nicht von chaotischen Fehlern. Dann schufen sie ein „synthetisches“ Trainingsgelände. Stellen Sie sich ein Videospiel vor, in dem sie unendliche Seiten von Dokumenten mit perfekten, bekannten Antworten generieren können, die speziell darauf ausgelegt sind, knifflig zu sein (wie Seiten mit unordentlicher Handschrift oder Tabellen, bei denen Zellen auf seltsame Weise verschmelzen). Dies ermöglichte es dem Modell, an den schwierigsten Rätseln zu üben, ohne diese erst in der realen Welt finden zu müssen.

Der Trainingsprozess war wie ein strenges Sportlager. Das Modell begann mit den Grundlagen (Supervised Fine-Tuning) und ging dann in eine Phase des „Reinforcement Learning“ über, in der es ein Spiel spielte: Es versuchte, eine Seite zu lesen, und wenn es die Tabellen oder mathematischen Formeln richtig hinbekam, erhielt es eine hohe Punktzahl; wenn es die Reihenfolge vertauschte oder eine Zeile übersah, bekam es eine niedrige Punktzahl. Um sicherzustellen, dass das kleine 0,8B-Modell von den Besten lernen konnte, nutzten die Forscher einen „Lehrer-Schüler“-Ansatz. Zuer erst trainierten sie ein größeres, 4-Milliarden-Parameter-starkes „Lehrer“-Modell, um ein Meister in diesen Aufgaben zu werden, und dann lehrten sie das kleinere „Schüler“-Modell (OvisOCR2), indem sie es dazu brachten, die besten Züge des Lehrers nachzuahmen. Dies ermöglichte es dem kleinen Modell, weit über seine Gewichtsklasse hinaus zu performen.

Die Ergebnisse sind ein Game-Changer. Bei Tests auf Standard-Benchmarks wie OmniDocBench v1.6, was quasi die „Olympischen Spiele“ des Dokumentenlesens ist, erreichte OvisOCR2 eine beeindruckende Punktzahl von 96,58. Dies ist eine große Sache, denn es bedeutet, dass dieses kleine End-to-End-Modell tatsächlich die größten, komplexesten „Fließband“-Systeme geschlagen hat, die das Feld bisher dominiert haben. Es hat nicht nur insgesamt gewonnen; es war am besten darin, Text zu lesen, mathematische Formeln zu verstehen und komplexe Tabellen zu rekonstruieren. Es erzielte auch den höchsten Wert auf PureDocBench mit einer Punktzahl von 75,06. Selbst bei einem von den Autoren erstellten, schwierigen Test, der knifflige Handschriften und unordentliche Tabellen enthielt, setzte sich OvisOCR2 an die Spitze und bewies damit, dass es nicht nur auf sauberen, perfekten Seiten funktioniert, sondern auch die unordentliche Realität der echten Welt bewältigen kann.

Die Forscher sind jedoch ehrlich über die Grenzen. Obwohl OvisOCR2 ein massiver Fortschritt ist, hat es im Vergleich zu einigen der riesigen, universellen KI-Modelle immer noch leichte Schwierigkeiten mit Bildern, die sehr verschwommen, beschädigt oder mit einem Telefon bei schlechter Beleuchtung aufgenommen wurden. Es ist kein Zauberstab, der alles behebt, aber es ist ein sehr starkes, effizientes Werkzeug, das beweist, dass man keinen Milliarden-Dollar-Computer braucht, um ein Dokument perfekt zu lesen. Das Paper legt nahe, dass wir mit diesem Ansatz endlich von klobigen Mehrschritt-Maschinen zu eleganten Ein-Modell-Lösungen übergehen können, die bereit sind, in alltäglichen Apps eingesetzt zu werden, was die digitale Welt viel zugänglicher macht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →