Datos y herramientas para generar e inspeccionar datos de preentrenamiento de OLMo.
Accede a un gran conjunto de datos de texto diverso para entrenar modelos de lenguaje y utiliza herramientas para la curación de conjuntos de datos.
Reivindica su pagina: indexada sea cual sea su posicion, traducida a seis idiomas y enriquecida con tus propias palabras.
Recibe una alerta por correo en su próximo lanzamiento o cuando despegue — no te pierdas nada.
Gratis · sin tarjeta · cancela cuando quierasDatos y herramientas para generar e inspeccionar datos de preentrenamiento de OLMo.
dolma tiene 1.5k estrellas en GitHub. Se ha bifurcado 202 veces. dolma está escrito principalmente en Python. Se desarrolla activamente desde 2023. dolma está disponible bajo la licencia Apache-2.0. Sus temas principales son: data-processing, large-language-models, llm, machile-learning.
Datos y herramientas para generar e inspeccionar datos de preentrenamiento de OLMo.
dolma es un proyecto de código abierto. Se distribuye bajo la licencia Apache-2.0.
Sí. dolma es gratuito y de código abierto: puedes usarlo, modificarlo y alojarlo tú mismo.
dolma está disponible bajo la licencia Apache-2.0.
dolma está escrito principalmente en Python.
Agrega este distintivo en vivo a tu README — tus estrellas de GitHub y rango en el directorio, actualizados diariamente.
[](https://opensourceai.tech/project/allenai-dolma.html)
Medido a partir de los topics de GitHub comunes a ambos proyectos, ponderados por su rareza.