¿Está buscando reemplazar ElevenLabs con algo gratuito y open-source? Estas 17 herramientas son las mejores alternativas open en 2026 — la mayoría son self-hostable, para que usted mantenga el control total de sus datos y sin pagar suscripción.

















Haz clic en una columna para ordenar — la mejor depende de lo que te importe.
| Alternativa | Estrellas | Lenguaje | Licencia | Último commit | En una línea |
|---|---|---|---|---|---|
| Voicebox | ★ 52.4k | TypeScript | MIT | 1 hace meses | Estudio de voz AI local-first: clonar voces, dictar, crear. |
| Voice-Pro | ★ 12.7k | Python | GPL-3.0 | 2 hace meses | Suite de voz para podcasters y creadores: clonación, doblaje, subtítulos. |
| OmniVoice Studio | ★ 12k | Python | AGPL-3.0 | 14 hace días | Clonación de voz local, doblaje, dictado y creación de audiolibros. |
| Coqui TTS | ★ 46k | Python | MPL-2.0 | 2 hace años | Kit de herramientas de texto a voz probado en batalla con clonación de voz y más de 1100 idiomas. |
| Piper | ★ 11.3k | C++ | MIT | 1 hace años | TTS neural rápido que se ejecuta localmente, incluso en una Raspberry Pi. |
| F5-TTS | ★ 15.2k | Python | MIT | 2 hace meses | TTS basado en difusión con impresionante clonación de voz en cero disparos. |
| OpenVoice | — | — | MIT | — | Clonación de voz instantánea por MIT y MyShell. Modelo de audio base. |
| VoxCPM | — | — | Apache-2.0 | — | VoxCPM2: TTS sin tokenización para generación de habla multilingüe, diseño de voz creativa y clonación fiel a la vida |
| CosyVoice | — | — | Apache-2.0 | — | Modelo de generación de voz grande multilingüe, proporcionando capacidad de inferencia, entrenamiento y despliegue de pila completa. |
| index-tts | — | — | — | — | Un sistema de texto a voz controlable y eficiente de nivel industrial Zero-Shot |
| dia | — | — | Apache-2.0 | — | Un modelo TTS capaz de generar diálogos ultra-realistas en una sola pasada. |
| supertonic | — | — | MIT | — | TTS multilingüe, ultrarrápido y en dispositivo — ejecutándose de forma nativa a través de ONNX. |
| PaddleSpeech | — | — | Apache-2.0 | — | Kit de herramientas de voz fácil de usar que incluye modelo de Aprendizaje Auto-Supervisado, ASR SOTA/Streaming con puntuación, TTS Streaming con interfaz de texto, Sistema de Verificación de Hablantes, Traducción de Voz de extremo a extremo y Detección de Palabras Clave. Ganó el Premio a la Mejor Demostración de NAACL2022. |
| TTS | — | — | MPL-2.0 | — | 🤖 💬 Aprendizaje profundo para Texto a Voz (Foro de discusión: https://discourse.mozilla.org/c/tts) |
| MeloTTS | — | — | MIT | — | Biblioteca de texto a voz multilingüe de alta calidad por MyShell.ai. Soporta inglés, español, francés, chino, japonés y coreano. |
| dograh | ★ 5.6k | Python | BSD-2-Clause | 7 hace días | Plataforma de voz de IA de código abierto. Alternativa autoalojada a Vapi y Retell. En Prem, BYOK a través de Speech to Speech o LLM/STT/TTS, con un constructor de flujo de trabajo visual, soporte nativo de MCP y telefonía. |
| MOSS-TTS | — | — | Apache-2.0 | — | La familia MOSS‑TTS es una familia de modelos de generación de voz y sonido de código abierto de MOSI.AI y el equipo de OpenMOSS. Está diseñada para escenarios del mundo real de alta fidelidad, alta expresividad y complejidad, cubriendo voz estable de larga duración, diálogo multi-hablante, vo |
Estudio de voz AI local-first: clonar voces, dictar, crear. Su licencia MIT es permisiva: libre para usar comercialmente, incrustar y modificar. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
Suite de voz para podcasters y creadores: clonación, doblaje, subtítulos. Su licencia GPL-3.0 mantiene el proyecto y sus bifurcaciones de código abierto para siempre, y se permite el uso comercial. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
Clonación de voz local, doblaje, dictado y creación de audiolibros. Su licencia AGPL-3.0 mantiene el proyecto y sus bifurcaciones de código abierto para siempre, y se permite el uso comercial. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
Kit de herramientas de texto a voz probado en batalla con clonación de voz y más de 1100 idiomas. Su licencia MPL-2.0 es permisiva: libre para usar comercialmente, incrustar y modificar. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
TTS neural rápido que se ejecuta localmente, incluso en una Raspberry Pi. Su licencia MIT es permisiva: libre para usar comercialmente, incrustar y modificar. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
TTS basado en difusión con impresionante clonación de voz en cero disparos. Su licencia MIT es permisiva: libre para usar comercialmente, incrustar y modificar. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
Clonación de voz instantánea por MIT y MyShell. Modelo de audio base. Su licencia MIT es permisiva: libre para usar comercialmente, incrustar y modificar. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
VoxCPM2: TTS sin tokenización para generación de habla multilingüe, diseño de voz creativa y clonación fiel a la vida Su licencia Apache-2.0 es permisiva: libre para usar comercialmente, incrustar y modificar. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
Modelo de generación de voz grande multilingüe, proporcionando capacidad de inferencia, entrenamiento y despliegue de pila completa. Su licencia Apache-2.0 es permisiva: libre para usar comercialmente, incrustar y modificar. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
Un sistema de texto a voz controlable y eficiente de nivel industrial Zero-Shot Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
Un modelo TTS capaz de generar diálogos ultra-realistas en una sola pasada. Su licencia Apache-2.0 es permisiva: libre para usar comercialmente, incrustar y modificar. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
TTS multilingüe, ultrarrápido y en dispositivo — ejecutándose de forma nativa a través de ONNX. Su licencia MIT es permisiva: libre para usar comercialmente, incrustar y modificar. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
Kit de herramientas de voz fácil de usar que incluye modelo de Aprendizaje Auto-Supervisado, ASR SOTA/Streaming con puntuación, TTS Streaming con interfaz de texto, Sistema de Verificación de Hablantes, Traducción de Voz de extremo a extremo y Detección de Palabras Clave. Ganó el Premio a la Mejor Demostración de NAACL2022. Su licencia Apache-2.0 es permisiva: libre para usar comercialmente, incrustar y modificar. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
🤖 💬 Aprendizaje profundo para Texto a Voz (Foro de discusión: https://discourse.mozilla.org/c/tts) Su licencia MPL-2.0 es permisiva: libre para usar comercialmente, incrustar y modificar. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
Biblioteca de texto a voz multilingüe de alta calidad por MyShell.ai. Soporta inglés, español, francés, chino, japonés y coreano. Su licencia MIT es permisiva: libre para usar comercialmente, incrustar y modificar. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
Plataforma de voz de IA de código abierto. Alternativa autoalojada a Vapi y Retell. En Prem, BYOK a través de Speech to Speech o LLM/STT/TTS, con un constructor de flujo de trabajo visual, soporte nativo de MCP y telefonía. Su licencia BSD-2-Clause es permisiva — libre para usar comercialmente, incrustar y modificar. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
La familia MOSS‑TTS es una familia de modelos de generación de voz y sonido de código abierto de MOSI.AI y el equipo de OpenMOSS. Está diseñada para escenarios del mundo real de alta fidelidad, alta expresividad y complejidad, cubriendo voz estable de larga duración, diálogo multi-hablante, vo Su licencia Apache-2.0 es permisiva: libre para usar comercialmente, incrustar y modificar. Debido a que es autoalojable, tus datos pueden permanecer completamente en tu propia infraestructura.
La mejor alternativa open-source es Voicebox — Estudio de voz AI local-first: clonar voces, dictar, crear. La lista completa clasificada está arriba.
Sí. Cada herramienta listada es de código abierto y gratuita; la mayoría puede ser autoalojada, así que mantienes el control total de tus datos.
La mayoría de estas herramientas están diseñadas para ejecutarse en tu propio servidor o máquina, brindándote privacidad y sin tarifas de suscripción.
Explora reemplazos de código abierto para docenas de herramientas populares — diseño, productividad, desarrollo, análisis y más.
Ver todas las alternativas →