Home Progetti dolma
dolma

dolma

di allenai · GitHub

Dati e strumenti per generare e ispezionare i dati di pre-addestramento OLMo.

Visualizza su GitHub
In parole semplici

Accedi a un ampio dataset di testi diversi per addestrare modelli di linguaggio e utilizza strumenti per la curatela del dataset.

⭐ Stelle
🍴 Fork
🔥 Tendenze
📜 Licenza
Uso commerciale consentito
📅 Creato
🔄 Ultimo commit
🏷️ Categoria
💻 Lingua
Mantieni questo progetto?

Rivendica la sua pagina: indicizzata qualunque sia il rango, tradotta in sei lingue e arricchita con le tue parole.

Rivendica questa pagina →
dolma — GitHub preview card
📈 Storia delle stelle
1 5281 526
2026-07-202026-07-29
📈 Segui dolma

Ricevi un avviso via email alla prossima release o quando decolla — non perderti nulla.

Gratis · senza carta · disdici quando vuoi
Ricevi avvisi via email →
📄 Informazioni

Dati e strumenti per generare e ispezionare i dati di pre-addestramento OLMo.

dolma ha 1.5k stelle su GitHub. È stato forkato 202 volte. dolma è scritto principalmente in Python. È in sviluppo attivo dal 2023. dolma è disponibile con licenza Apache-2.0. I suoi temi principali sono: data-processing, large-language-models, llm, machile-learning.

Frequently asked questions

Che cos'è dolma?

Dati e strumenti per generare e ispezionare i dati di pre-addestramento OLMo.

dolma è open source?

dolma è un progetto open source. È rilasciato con licenza Apache-2.0.

dolma è gratuito?

Sì. dolma è gratuito e open source: puoi usarlo, modificarlo e ospitarlo autonomamente.

Con quale licenza è dolma?

dolma è disponibile con licenza Apache-2.0.

In quale linguaggio è scritto dolma?

dolma è scritto principalmente in Python.

🏅 Manutentore di questo progetto?
OpenSourceAI badge — dolma

Aggiungi questo badge live al tuo README — le tue stelle GitHub e il ranking della directory, aggiornati quotidianamente.

[![OpenSourceAI](https://opensourceai.tech/badge.php?tool=allenai-dolma)](https://opensourceai.tech/project/allenai-dolma.html)
Altre opzioni di badge →
🧬 Condivide il DNA con🧬 Vedi la mappa del DNA →

Misurato dai topic GitHub comuni a entrambi i progetti, ponderati per la loro rarita.