∴ GitHub / 趋势仓库
debpalash / VoiceStudio
本地优先的开源语音克隆与配音工具
- 语言
- Python
- Star
- 50.8k
- Fork
- 5.6k
- 当日新增(10-01)
- +3,483
- 累计在榜
- 8 天
- 最高名次
- 第 1 名
- 首次上榜
- 2026-09-14
∴ 是什么
VoiceStudio 是一个开源的语音工具,支持语音克隆、语音设计、视频配音、听写、转录和有声书创作,覆盖 646 种语言。它提供基于 Electron 的桌面应用和 Web UI,默认使用 k2-fsa/OmniVoice 引擎,也支持其他引擎。核心功能包括克隆或设计声音、带时间轴的视频配音、本地 API 和 MCP 集成等。它既可以完全在本地硬件上运行,也支持可选的远程服务。
∴ 解决什么问题
- 语音克隆和设计需要专有工具或云服务
- 视频配音需要与语音时间轴同步的流程
- 本地语音处理和模型管理缺少统一入口
- 跨语言语音相关任务(转录、翻译、有声书)需要多工具切换
∴ 怎么上手
- 01在 macOS/Linux 上执行 `curl -fsSL https://voicestudio.sh/install | sh` 进行一键安装
- 02在 Windows 上以 PowerShell 运行 `irm https://voicestudio.sh/install | iex`
- 03或者从 Releases 页面下载安装包(macOS .dmg、Windows .exe、Linux .AppImage 或 .deb)
- 04打开 Voice Cloning 工作区,选择或添加干净的参考录音,输入文本并生成
- 05如提示,安装所需模型
∴ 适合谁
需要本地语音克隆、配音、听写或有声书创作的开发者、内容创作者和研究者,重视数据本地性和离线可用性。
∴ 要点
- 支持 646 种语言
- 可克隆或设计声音
- 支持视频配音、听写、转录和有声书创建
- 本地 API 和 MCP 集成,可对接代理
- 硬件支持:NVIDIA GPU (CUDA)、Apple Silicon (Metal)、无 GPU 时可用 CPU(较慢)
- 许可证为 AGPL-3.0,模型有其自有许可,需要商业使用时审查
许可证 AGPL-3.0aiaudiobookcudadubbingelevenlabs-alternativehuggingfacelocal-firstmlxomnivoice-studiospeech-to-texttauritext-to-speechtranscriptiontranslatettsvoice-aivoice-cloningvoice-generationvoicestudioworkflow
解读由 AI 依据项目 README 生成,生成于 2026-10-06,以 GitHub 原文为准。
∴ 在榜记录
GitHub Trending 今日榜的每日存档,日期按北京时间。2026-09-14 首次上榜,累计在榜 8 天,最高第 1 名。