Codice utilizzato per la raccolta e la pulizia del corpus BigScience ROOTS
Rivendica la sua pagina: indicizzata qualunque sia il rango, tradotta in sei lingue e arricchita con le tue parole.
Ricevi un avviso via email alla prossima release o quando decolla — non perderti nulla.
Gratis · senza carta · disdici quando vuoiCodice utilizzato per la raccolta e la pulizia del corpus BigScience ROOTS
data-preparation ha 318 stelle su GitHub. È stato forkato 43 volte. data-preparation è scritto principalmente in Jupyter Notebook. È in sviluppo attivo dal 2022. data-preparation è disponibile con licenza Apache-2.0. I suoi temi principali sono: dataset, large-language-models, multilingual.
Codice utilizzato per la raccolta e la pulizia del corpus BigScience ROOTS
data-preparation è un progetto open source. È rilasciato con licenza Apache-2.0.
Sì. data-preparation è gratuito e open source: puoi usarlo, modificarlo e ospitarlo autonomamente.
data-preparation è disponibile con licenza Apache-2.0.
data-preparation è scritto principalmente in Jupyter Notebook.
Aggiungi questo badge live al tuo README — le tue stelle GitHub e il ranking della directory, aggiornati quotidianamente.
[](https://olud.ai/project/bigscience-workshop-data-preparation.html)
Misurato dai topic GitHub comuni a entrambi i progetti, ponderati per la loro rarita.