audio-generation

21 progetti condividono questo topic GitHub

audio-generation — LocalAI ★48kaudio-generationCosyVoice — ★22.5kAmphion — ★10kYuE — ★6.3kvllm-omni — ★5.7kTTS-WebUI — ★3.2kaudio-diffusion-pytorch — ★2.1kaudio-ai-timeline — ★1.9ksoundstorm-pytorch — ★1.5kChatterbox-TTS-Server — ★1.4ktango — ★1.2kTTS-Audio-Suite — ★1.1kmuapi-cli — ★1kaudio-ai-hub — ★950vui — ★737genblaze — ★488MM-Diffusion — ★453Dia-TTS-Server — ★352AudioStory — ★301flatkey-cli — ★143Qwen3-TTS-EasyFinetuning — ★115CosyVoice★ 22.5kAmphion★ 10kYuE★ 6.3kvllm-omni★ 5.7kTTS-WebUI★ 3.2kaudio-diffusion-pytorch★ 2.1kaudio-ai-timeline★ 1.9ksoundstorm-pytorch★ 1.5kChatterbox-TTS-Server★ 1.4ktango★ 1.2kTTS-Audio-Suite★ 1.1kmuapi-cli★ 1kaudio-ai-hub★ 950vui★ 737genblaze★ 488MM-Diffusion★ 453Dia-TTS-Server★ 352AudioStory★ 301flatkey-cli★ 143Qwen3-TTS-EasyFinetuning★ 115

Le linee collegano membri che sono misurabilmente correlati tra loro. La dimensione dei punti riflette le stelle.

🧬 Membri
LocalAI
LocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No…
★ 48k
CosyVoice
Multi-lingual large voice generation model, providing inference, training and deployment full-stack ability.
★ 22.5k
Amphion
Amphion (/æmˈfaɪən/) is a toolkit for Audio, Music, and Speech Generation. Its purpose is to support…
★ 10k
YuE
YuE: Open Full-song Music Generation Foundation Model, something similar to Suno.ai but open
★ 6.3k
vllm-omni
A framework for efficient model inference with omni-modality models
★ 5.7k
TTS-WebUI
A single Gradio + React WebUI with extensions for ACE-Step, OmniVoice, Kimi Audio, Piper TTS, GPT-SoVITS,…
★ 3.2k
audio-diffusion-pytorch
Audio generation using diffusion models, in PyTorch.
★ 2.1k
audio-ai-timeline
A timeline of the latest AI models for audio generation, starting in 2023!
★ 1.9k
soundstorm-pytorch
Implementation of SoundStorm, Efficient Parallel Audio Generation from Google Deepmind, in Pytorch
★ 1.5k
Chatterbox-TTS-Server
Self-host the powerful Chatterbox TTS model. This server offers a user-friendly Web UI, flexible API…
★ 1.4k
tango
A family of diffusion models for text-to-audio generation.
★ 1.2k
TTS-Audio-Suite
A ComfyUI custom node integration for local multi-engine multi-language Text-to-Speech and Voice Conversion.…
★ 1.1k
muapi-cli
Official CLI for muapi.ai — generate images, videos & audio from the terminal. MCP server, 14 AI models,…
★ 1k
audio-ai-hub
The hub for audio AI research: papers, open models, benchmarks & datasets across audio LLMs, speech…
★ 950
vui
Real-time voice assistant — WebRTC streaming, faster-whisper ASR, local LLM, Vui Nano (300M) TTS. OpenAI…
★ 737
genblaze
Genblaze is an open source Python SDK for orchestrating generative AI media pipelines across video, audio,…
★ 488
MM-Diffusion
[CVPR'23] MM-Diffusion: Learning Multi-Modal Diffusion Models for Joint Audio and Video Generation
★ 453
Dia-TTS-Server
Self-host the powerful Dia TTS model. This server offers a user-friendly Web UI, flexible API endpoints…
★ 352
AudioStory
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
★ 301
flatkey-cli
Flatkey media generation CLI for images, videos, audio, text, credits, and model discovery.
★ 143
Qwen3-TTS-EasyFinetuning
Easy fine-tuning for Qwen3-TTS: Fast voice cloning and high-quality multilingual speech synthesis.
★ 115
🔗 Famiglie affini

Misurato dai temi di GitHub condivisi da entrambi i progetti, ponderato in base a quanto è raro ciascun tema.