Herramienta para linearizar PDFs para conjuntos de datos/entrenamiento de LLM
Convierte PDFs e imágenes en texto limpio y legible para entrenar modelos de IA.
Reivindica su pagina: indexada sea cual sea su posicion, traducida a seis idiomas y enriquecida con tus propias palabras.
Recibe una alerta por correo en su próximo lanzamiento o cuando despegue — no te pierdas nada.
Gratis · sin tarjeta · cancela cuando quierasHerramienta para linearizar PDFs para conjuntos de datos/entrenamiento de LLM
olmocr tiene 19.2k estrellas en GitHub. Se ha bifurcado 1.6k veces. olmocr está escrito principalmente en Python. Se desarrolla activamente desde 2024. olmocr está disponible bajo la licencia Apache-2.0.
Read the full guideHerramienta para linearizar PDFs para conjuntos de datos/entrenamiento de LLM
olmocr es un proyecto de código abierto. Se distribuye bajo la licencia Apache-2.0.
Sí. olmocr es gratuito y de código abierto: puedes usarlo, modificarlo y alojarlo tú mismo.
olmocr está disponible bajo la licencia Apache-2.0.
olmocr está escrito principalmente en Python.
Agrega este distintivo en vivo a tu README — tus estrellas de GitHub y rango en el directorio, actualizados diariamente.
[](https://opensourceai.tech/project/allenai-olmocr.html)