← Ultimi articoli
🤖 AI

OvisOCR2 Technical Report

OvisOCR2 è un modello di parsing di documenti end-to-end da 0,8B che sfrutta un nuovo motore di dati e una ricetta di addestramento multistadio che coinvolge l'apprendimento per rinforzo e la distillazione per raggiungere prestazioni allo stato dell'arte sui dataset di benchmark generando direttamente rappresentazioni Markdown delle pagine dei documenti.

Autori originali: Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo

Pubblicato 2026-07-16
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate di tenere in mano un libro fisico, una lettera scritta a mano o una ricevuta complessa. Per un essere umano è facile da leggere: sapete in quale colonna iniziare, sapete come saltare sopra un'immagine per tornare al testo, e sapete distinguere che una linea sinuosa è un'equazione matematica e non un semplice scarabocchio. Ma per un computer, quella stessa pagina è solo una griglia piatta di pixel colorati. Esso vede un groviglio di forme senza capire che una tabella è una griglia, che una formula è un calcolo o che il testo in fondo alla pagina appartiene alla parte superiore della colonna successiva. Questo è il mondo del "document parsing" (analisi dei documenti). È il trucco magico che trasforma l'immagine di una pagina in un file digitale che un computer può effettivamente leggere, cercare e utilizzare. Per molto tempo, i computer hanno cercato di farlo scomponendo il lavoro in piccoli passaggi separati: prima trovare le linee, poi leggere le parole, poi indovinare dove si trovassero le tabelle. Ma questo approccio a "catena di montaggio" è goffo; se il primo passaggio sbaglia il confine di una tabella, il resto della macchina si blocca. La grande domanda in questo campo è stata: possiamo costruire un unico cervello intelligente che guardi l'intera immagine e scriva la storia in un colpo solo, proprio come fa un essere umano?

Entra in scena OvisOCR2, un nuovo "lettore" digitale sviluppato dai ricercatori di Alibaba. Pensate a OvisOCR2 non come a un enorme e lento supercomputer, ma come a un genio agile, "tascabile", da 0,8 miliardi di parametri. Mentre altri modelli che cercano di risolvere questo problema sono spesso massicci e richiedono enormi data center, OvisOCR2 è progettato per essere piccolo e veloce, pur essendo incredibilmente potente. I ricercatori hanno costruito questo modello utilizzando una strategia di addestramento intelligente in due parti. Per prima cosa, lo hanno nutrito con una vasta libreria di documenti reali — documenti scansionati, ricevute e rapporti — ma sono stati attenti a pulire le "risposte" in modo che il modello imparasse da esempi perfetti, non da errori disordinati. Poi, hanno creato un campo di addestramento "sintetico". Immaginate un videogioco in cui possono generare infinite pagine di documenti con risposte perfette e note, progettate specificamente per essere difficili (come pagine con calligrafia disordinata o tabelle con celle unite in modi strani). Ciò ha permesso al modello di esercitarsi sui puzzle più difficili senza doverli trovare prima nel mondo reale.

Il processo di addestramento è stato come un rigoroso campo di allenamento sportivo. Il modello ha iniziato imparando le basi (Fine-Tuning Supervisionato), per poi passare a una fase di "Reinforcement Learning" (Apprendimento per Rinforzo) dove giocava a un gioco: cercava di leggere una pagina e, se sbagliava le tabelle o le formule matematiche, riceveva un punteggio basso; se sbagliava l'ordine o perdeva una riga, riceveva un punteggio basso. Per garantire che il piccolo modello da 0,8B potesse imparare dai migliori, i ricercatori hanno utilizzato un approccio "insegnante-studente". Prima hanno addestrato un modello "insegnante" più grande, da 4 miliardi di parametri, per diventare un maestro in questi compiti, e poi hanno insegnato al modello "studente" più piccolo (OvisOCR2) facendo in modo che imitasse le mosse migliori dell'insegnante. Questo ha permesso al piccolo modello di rendere molto più di quanto ci si aspetterebbe dalle sue dimensioni.

I risultati sono una svolta. Quando testato su benchmark standard come OmniDocBench v1.6, che è come le "Olimpiadi" della lettura di documenti, OvisOCR2 ha ottenuto un impressionante 96,58. Questo è un grande passo avanti perché significa che questo piccolo modello end-to-end ha effettivamente battuto i sistemi più grandi e complessi a "catena di montaggio" che hanno dominato il campo. Non ha vinto solo nel complesso; è stato il migliore nel leggere il testo, nel comprendere le formule matematiche e nel ricostruire tabelle complesse. Ha inoltre ottenuto il punteggio più alto su PureDocBench con un punteggio di 75,06. Anche su un test personalizzato e difficile creato dagli autori, che includeva calligrafia complicata e tabelle disordinate, OvisOCR2 è arrivato in cima, dimostrando di non funzionare solo su pagine pulite e perfette, ma di poter gestire la disordinata realtà del mondo reale.

Tuttove, i ricercatori sono onesti riguardo ai limiti. Sebbene OvisOCR2 sia un enorme salto in avanti, fatica ancora un po' con immagini molto sfocate, danneggiate o scattate con un telefono in condizioni di scarsa illuminazione rispetto ad alcuni dei giganti modelli di IA generalisti. Non è una bacchetta magica che risolve tutto, ma è uno strumento molto forte ed efficiente che dimostra che non serve un computer da un miliardo di dollari per leggere un documento perfettamente. L'articolo suggerisce che con questo approccio possiamo finalmente allontanarci dalle macchine goffe e multi-step verso soluzioni eleganti a modello singolo, pronte per essere utilizzate nelle applicazioni quotidiane, rendendo il mondo digitale molto più accessibile.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →