Boîte à outils pour linéariser les PDF pour les ensembles de données/formation LLM
Convertissez des PDF et des images en texte propre et lisible pour entraîner des modèles d'IA.
Revendiquez sa page : indexée quel que soit son rang, traduite en six langues, et enrichie de vos propres mots.
Recevez une alerte par e-mail à sa prochaine version ou quand il décolle — ne ratez plus rien.
Gratuit · sans carte · désinscription à tout momentBoîte à outils pour linéariser les PDF pour les ensembles de données/formation LLM
olmocr compte 19.2k étoiles sur GitHub. Il a été forké 1.6k fois. olmocr est écrit principalement en Python. Il est développé activement depuis 2024. olmocr est disponible sous licence Apache-2.0.
Read the full guideBoîte à outils pour linéariser les PDF pour les ensembles de données/formation LLM
olmocr est un projet open source. Il est distribué sous licence Apache-2.0.
Oui. olmocr est gratuit et open source — vous pouvez l'utiliser, le modifier et l'héberger vous-même.
olmocr est disponible sous licence Apache-2.0.
olmocr est écrit principalement en Python.
Ajoutez ce badge en direct à votre README — vos étoiles GitHub et votre classement dans le répertoire, actualisés quotidiennement.
[](https://opensourceai.tech/project/allenai-olmocr.html)