OCR : Baidu fait tenir des dizaines de pages en mémoire en imitant l'oubli humain
D'après Article original - The Decoder, relayé par The Decoder
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- Le mécanisme R-SWA (attention à fenêtre glissante de référence) garde toujours accès à l'image du document, mais « oublie » activement le texte déjà généré au-delà des 128 derniers jetons (unités de texte).
- Résultat : la mémoire technique (cache clé-valeur) reste de taille quasi fixe même si le document s'allonge, alors qu'un OCR classique voit sa mémoire grossir avec chaque page ajoutée.
- Baidu rapporte environ 93 % de précision sur le banc d'essai OmniDocBench v1.5 et 93,92 % sur la version 1.6, avec une vitesse d'environ 5580 jetons par seconde contre 4951 pour le modèle de base DeepSeek OCR.
- Le modèle (3 milliards de paramètres, dont environ 500 millions actifs à la fois) est publié en code source ouvert sous licence MIT sur GitHub et Hugging Face (baidu/Unlimited-OCR).
- La limite reste réelle : la fenêtre de contexte totale plafonne à environ 32 000 jetons, donc le nombre de pages traitables dépend encore de la résolution des images et de la compression des jetons visuels.
Pourquoi ça compte
Les outils d'OCR (reconnaissance de texte dans une image) classiques ralentissent et consomment de plus en plus de mémoire à mesure qu'un document s'allonge, ce qui limite leur usage sur de gros documents administratifs, juridiques ou de recherche. En bornant la mémoire technique sans perdre l'accès au document source, Baidu propose une piste concrète pour traiter des dizaines de pages sans le compromis habituel entre longueur et vitesse - et le publie en code source ouvert, ce qui permet à d'autres équipes de le vérifier et de l'adapter.
Chiffre-clé
Le modèle atteint environ 5580 jetons traités par seconde en mode Base, contre 4951 pour le modèle de référence DeepSeek OCR, selon le document technique publié le 22 juin 2026 (arXiv:2606.23050).
Action concrète
Pour vulgariser : l'OCR sert à transformer une photo ou un scan en texte modifiable et cherchable. Les équipes qui numérisent de gros documents (contrats, rapports, archives) peuvent consulter le dépôt Hugging Face ou GitHub de baidu/Unlimited-OCR pour évaluer s'il traite leurs documents multi-pages plus rapidement qu'un pipeline OCR page par page classique.
Repères datés
- 22 juin 2026 - Baidu publie le document technique « Unlimited OCR Works » ainsi que le dépôt GitHub et le modèle Hugging Face du même nom.
Fondée sur la source originale
Sources
- Article original - The Decoder : Relais journalistique en anglais
- Document technique - arXiv, « Unlimited OCR Works » : Source primaire, publiée le 22 juin 2026
- Dépôt GitHub - baidu/Unlimited-OCR : Code source et poids du modèle, licence MIT
- Modèle sur Hugging Face - baidu/Unlimited-OCR
- Relais média : The Decoder → · Lire en français