FineBooks améliore l'OCR pour l'IA générative
FineBooks, une collaboration entre Hugging Face et EleutherAI, a évalué 14 modèles OCR sur 2165 pages de livres historiques. Le meilleur modèle (dots.mocr) atteint 97,6% de précision pour 1,94$/1000 pages. Ces résultats permettront d'améliorer les datasets d'entraînement des IA.
« a language model trained on OCR text learned at only 30 percent the efficiency of one trained on human transcriptions of the same books. » - The Decoder
Que faut-il retenir ?
- 14 modèles OCR open-source testés sur 2165 pages de livres historiques
- Le meilleur modèle (dots.mocr) atteint 97,6% de précision caractère
- Coût inférieur à 2 dollars pour 1000 pages traitées
- Objectif : retraiter 200 000 documents du Biodiversity Heritage Library
Pourquoi cette nouvelle compte-t-elle ?
La qualité des données OCR historiques impacte directement l'efficacité des modèles de langage. Une étude montre qu'un modèle entraîné sur du texte OCR n'atteint que 30% de l'efficacité d'un modèle utilisant des transcriptions humaines. L'amélioration des pipelines OCR ouvre l'accès à des millions de documents publics pour l'entraînement IA.
97,6% de précision caractère pour le modèle dots.mocr
Public concerné : développeurs
Quel est l'impact des erreurs OCR sur l'entraînement des modèles de langage ?
Une étude montre qu'un modèle entraîné sur du texte OCR n'atteint que 30% de l'efficacité d'un modèle utilisant des transcriptions humaines. Les erreurs de reconnaissance dégradent significativement les performances.