大厅 / 🌍 国外 / 音频语音
音频语音 AUDIO · GLOBAL 收录 184 今日新增 0 数据源 GitHub 每日快照
音频语音(国外)分类当前收录 184 个 AI Skill,按 S-Score 排名靠前的有 whisper (S·91)、whisper.cpp (S·89) 、OmniVoice-Studio (S·86) 。S-Score 基于 GitHub 星标量级与维护活跃度算法计算,每小时重排、付费不影响排名,数据每日快照。
旗舰产品 FLAGSHIP · 官方 闭源产品 · 不评 S-Score # SKILL · 摊位 S-SCORE STARS ★ 7D 趋势
1 whisper OpenAI 开源语音识别,多语种转写与翻译 S·91 — ★ 109.1k+397 ☆ 2 whisper.cpp Whisper 语音识别的 C/C++ 移植,纯本地推理 S·89 — ★ 53.7k+160 ☆ 4 VoxCPM 免 tokenizer 的多语言 TTS:创意声音设计与逼真克隆 S·86 — ★ 37.4k+576 ☆ 5 whisperX Whisper 增强版:词级时间戳 + 说话人分离 S·84 — ★ 24.0k+111 ☆ 6 index-tts 工业级可控高效的零样本 TTS 系统 S·84 — ★ 24.0k+161 ☆ AD ◧ 广告位招商中 —— 你的产品出现在这里 自助投放 · 周结算 · 广告内容与榜单排序无关 了解 → 广告 AD 7 TTS 深度学习文本转语音工具箱,多语种声音克隆 S·83 — ★ 46.0k+25 ☆ 9 leon 开源个人语音助手 S·83 — ★ 17.5k+15 ☆ 11 bark 文本直接生成带情绪的语音/音效/笑声 S·82 — ★ 39.3k+8 ☆ 12 CosyVoice 多语言语音大模型:推理/训练/部署全栈 S·82 — ★ 23.6k+118 ☆ 15 espnet 端到端语音处理工具包,覆盖识别与合成 S·80 — ★ 10.0k+11 ☆ 18 vosk-api 离线语音识别 API,手机/树莓派/服务器全平台 S·80 — ★ 15.1k+14 ☆ 20 edge-tts 免密钥调用微软Edge在线语音合成 S·79 — ★ 11.9k+59 ☆ 21 mlx-audio Apple MLX 上的 TTS/STT/语音转换库 S·79 — ★ 7.9k+37 ☆ 22 voice-pro 创作者的 Gradio 语音工作台:TTS + 零样本声音克隆 S·79 — ★ 12.8k+50 ☆ 24 dia 一次生成多角色超真实对话的TTS模型 S·78 — ★ 19.4k+6 ☆ 26 Amphion 音频、音乐与语音生成研究工具包 S·78 — ★ 10.3k+10 ☆ 28 kaldi 经典开源语音识别工具包Kaldi S·77 — ★ 15.5k+6 ☆ 29 dograh 可自托管的开源语音AI平台 S·77 — ★ 5.7k+40 ☆ 31 wenet 面向生产环境的端到端语音识别工具包 S·76 ▼1 ★ 5.2k+2 ☆ 34 annyang 为网站提供语音识别功能的JS库 S·76 — ★ 6.8k☆ 36 abogen 将电子书PDF一键转为带字幕有声书 S·76 ▼1 ★ 6.0k+82 ☆ 39 TTS Mozilla出品的深度学习语音合成库 S·75 — ★ 10.2k+1 ☆ 41 Applio 简单易用的高音质AI变声工具 S·75 — ★ 3.7k+25 ☆ 42 MOSS-TTS-Nano A 100M-parameter multilingual TTS model for real-time CPU inference, voice cloning, and 48 kHz stereo generation S·75 — ★ 4.4k+60 ☆ 43 vits 端到端语音合成模型,生成自然流畅的语音 S·74 — ★ 7.9k+3 ☆ 44 MeloTTS MyShell出品的多语言高质量语音合成库 S·74 — ★ 7.6k+15 ☆ 47 ml-road 机器学习与智能体AI学习资源合集 S·74 — ★ 4.9k+4 ☆ 49 MOSS-TTS OpenMOSS团队开源的高保真语音生成模型家族 S·74 — ★ 4.1k+32 ☆ 51 qwen-audio-agent A realtime voice runtime that keeps Agents talking, working, and present. Real-time Voice Runtime for AI Agents S·73 — ★ 2.6k+239 ☆ 53 TTS-WebUI 整合多种语音合成引擎的Gradio+React WebUI S·73 ▼1 ★ 3.3k+8 ☆ 54 willow 开源本地自托管语音助手系统 S·73 — ★ 3.1k☆ 55 audio.cpp An all-in-one, pure C++ inference engine for audio models, powered by ggml. Supports TTS, STT, VAD, voice conversion, music generation, and S·73 — ★ 2.7k+369 ☆ 58 aeneas 音频与文本自动强制对齐工具 S·72 — ★ 2.9k+5 ☆ 59 GPA 单一小模型实现语音多功能处理 S·72 — ★ 3.1k☆ 60 whishper 基于Whisper的本地语音转字幕工具 S·72 — ★ 3.1k+3 ☆ 展示前 60 名 · 完整榜单见 每日热榜 →