Dados e ferramentas para gerar e inspecionar dados de pré-treinamento OLMo.
Acesse um grande conjunto de dados de texto diversificado para treinar modelos de linguagem e use ferramentas para curadoria de conjuntos de dados.
Reivindique a sua pagina: indexada seja qual for a posicao, traduzida em seis linguas e enriquecida com as suas palavras.
Receba um alerta por e-mail no próximo lançamento ou quando começar a bombar.
Grátis · sem cartão · cancele quando quiserDados e ferramentas para gerar e inspecionar dados de pré-treinamento OLMo.
dolma tem 1.5k estrelas no GitHub. Foi bifurcado 202 vezes. dolma é escrito principalmente em Python. Está em desenvolvimento ativo desde 2023. dolma está disponível sob a licença Apache-2.0. Os seus principais temas são: data-processing, large-language-models, llm, machile-learning.
Dados e ferramentas para gerar e inspecionar dados de pré-treinamento OLMo.
dolma é um projeto de código aberto. É distribuído sob a licença Apache-2.0.
Sim. dolma é gratuito e de código aberto — você pode usá-lo, modificá-lo e hospedá-lo por conta própria.
dolma está disponível sob a licença Apache-2.0.
dolma é escrito principalmente em Python.
Adicione este badge ao vivo ao seu README — suas estrelas do GitHub e classificação no diretório, atualizadas diariamente.
[](https://opensourceai.tech/project/allenai-dolma.html)
Medido a partir dos topics do GitHub comuns aos dois projetos, ponderados pela sua raridade.