pip install whisperx

Extraits du README du projet sur GitHub. Le droit d'auteur et les licences restent la propriété des auteurs respectifs.
WhisperX ajoute des horodatages précis au niveau des mots et une diarisation des locuteurs sur Whisper, idéal pour les sous-titres et les transcriptions multi-locuteurs.
| Catégorie | Reconnaissance vocale (STT / TTS) |
| Type | STT avec alignement |
| Licence | BSD-2-Clause |
| S'exécute localement | Oui |
| Construit avec | Python |
| Niveau de compétence | Intermédiaire |
| Meilleur pour | sous-titres et transcriptions multi-locuteurs |
D'autres outils de reconnaissance vocale (stt / tts) open-source à comparer :
WhisperLa base de référence open-source d'OpenAI pour la reconnaissance vocale
faster-whisperWhisper, beaucoup plus rapide et léger
PiperTTS neural local et rapide
Coqui TTSTTS par apprentissage profond avec clonage de voix
BarkTexte en audio avec voix et effets
F5-TTSClonage vocal zéro-shot qui convainc réellement
KokoroTTS minuscule de 82M avec une qualité étonnante
whisper.cppWhisper en pur C/C++, fonctionne partout
OpenVoiceClonez une voix et contrôlez son émotion
StyleTTS 2Synthèse vocale de niveau humain
pyannote.audioSachez qui a parlé quand
Silero VADDétectez la parole dans l'audio, instantanémentWhisperX est gratuit et open-source (licence BSD-2-Clause), vous pouvez l'utiliser, l'héberger vous-même et le modifier sans frais.
Oui. WhisperX est conçu pour fonctionner sur votre propre machine ou serveur, gardant vos données privées.
Les alternatives open-source populaires incluent Whisper, faster-whisper, Piper. Consultez les comparaisons ci-dessus pour choisir.
Parcourez le répertoire complet des outils, modèles et projets d'IA open-source — mis à jour quotidiennement.
Parcourez tous les outils →