Whisper ist OpenAIs offenes Sprach-zu-Text-Modell mit offenen Gewichten und Referenzimplementierung, das weit verbreitet als Baseline für selbstgehostete Transkription verwendet wird.
| Kategorie | Sprache (STT / TTS) |
| Typ | Spracherkennung-Modell |
| Lizenz | MIT |
| Läuft lokal | Ja |
| Hergestellt mit | Python |
| Fähigkeitsstufe | Mittelstufe |
| Am besten für | Die Referenzbasislinie für Transkription |
Weitere Open-Source-Sprachtools (stt / tts), die einen Vergleich wert sind:
faster-whisperWhisper, viel schneller und leichter
WhisperXWhisper plus Wort-Zeitstempel und Diarisierung
PiperSchnelle, lokale neuronale Text-zu-Sprache
Coqui TTSDeep-Learning TTS mit Sprachklonierung
BarkText-zu-Audio mit Stimmen und Effekten
F5-TTSZero-Shot-Sprachklonierung, die tatsächlich überzeugt
KokoroKleines 82M TTS mit erstaunlicher Qualität
whisper.cppWhisper in reinem C/C++, läuft überall
OpenVoiceKlonen Sie eine Stimme und steuern Sie ihre Emotionen
StyleTTS 2Menschliches Sprachsynthese
pyannote.audioWissen, wer wann gesprochen hat
Silero VADErkennen Sie Sprache in Audio, sofortWhisper ist kostenlos und Open-Source (MIT-Lizenz), sodass Sie es ohne Kosten verwenden, selbst hosten und modifizieren können.
Ja. Whisper ist dafür ausgelegt, auf Ihrem eigenen Computer oder Server zu laufen und Ihre Daten privat zu halten.
Beliebte Open-Source-Alternativen sind faster-whisper, WhisperX, Piper. Siehe die obenstehenden Vergleiche zur Auswahl.
Durchsuchen Sie das vollständige Verzeichnis von Open-Source-AI-Tools, Modellen und Projekten – täglich aktualisiert.
Alle Tools durchsuchen →