Daten und Werkzeuge zur Generierung und Inspektion von OLMo-Vortrainingsdaten.
Greifen Sie auf einen großen Datensatz mit vielfältigem Text für das Training von Sprachmodellen zu und nutzen Sie Tools zur Datensatzkurierung.
Beanspruchen Sie die Seite: indexiert unabhangig vom Rang, in sechs Sprachen ubersetzt und mit Ihren eigenen Worten erganzt.
Erhalten Sie eine E-Mail-Benachrichtigung beim nächsten Release oder wenn es durchstartet.
Kostenlos · ohne Karte · jederzeit abbestellbarDaten und Werkzeuge zur Generierung und Inspektion von OLMo-Vortrainingsdaten.
dolma hat 1.5k Sterne auf GitHub. Es wurde 202-mal geforkt. dolma ist hauptsächlich in Python geschrieben. Es wird seit 2023 aktiv entwickelt. dolma ist unter der Apache-2.0-Lizenz verfügbar. Die Hauptthemen sind: data-processing, large-language-models, llm, machile-learning.
Daten und Werkzeuge zur Generierung und Inspektion von OLMo-Vortrainingsdaten.
dolma ist ein Open-Source-Projekt. Es wird unter der Apache-2.0-Lizenz veröffentlicht.
Ja. dolma ist kostenlos und Open Source — Sie können es nutzen, anpassen und selbst hosten.
dolma ist unter der Apache-2.0-Lizenz verfügbar.
dolma ist hauptsächlich in Python geschrieben.
Fügen Sie dieses Live-Abzeichen zu Ihrem README hinzu — Ihre GitHub-Sterne und Verzeichnisrang, täglich aktualisiert.
[](https://olud.ai/project/allenai-dolma.html)
Ermittelt aus gemeinsamen GitHub-Topics beider Projekte, gewichtet nach ihrer Seltenheit.