找回密码
立即注册
搜索
发回帖 发新帖

6227

积分

0

好友

784

主题
发表于 2 小时前 | 查看: 5| 回复: 0

做视频的人应该都懂这种痛:配音要么按字数给平台交钱,一条三五块,批量产出直接烧钱;要么把稿子和素材传到云端 API,隐私全交出去。想给自己克隆一个音色长期用,海外服务价格更不友好。

GitHub 上这周爆火的 VoiceStudio 把这件事整个搬到了本地:52K Star,配音、克隆、转写、有声书一条龙,646 种语言,全程不联网也能跑。

VoiceStudio 浅蓝色闪电图标

项目速览

项目 信息
定位 本地优先的开源语音工作台
GitHub https://github.com/debpalash/VoiceStudio
Star 52K(单日新增超 3000,Trending 榜首梯队)
协议 AGPL-3.0
最新版本 v0.5.6(Electron 桌面版)
平台 macOS / Windows / Linux / Docker,支持 CUDA 与 Apple Silicon 加速
创建时间 2026 年 4 月

一句话定位:一个跑在自己电脑上的语音工厂,音色克隆、视频配音、听写转写、批量有声书全部本地完成,还能通过 MCP 接给你的编码 Agent。

VoiceStudio 几何图形设计

为什么值得看

市面上语音工具分两类:云端 SaaS 按字符计费,用得越多烧得越多;本地开源项目往往只有个命令行脚本,配环境比配音还费劲。

VoiceStudio 把两头都补齐了。它是一个正经的桌面应用,界面里点选音色、贴文本、点生成就能出音频;底层全部跑在你自己的硬件上,NVIDIA 卡走 CUDA,苹果芯片走 Metal,没有独显用 CPU 也能跑,只是慢一些。

更关键的是这周它接入了 Agent 生态:官方提供了两个 Skill,一条命令装进 Claude Code、Codex、Cursor 这些编码 Agent,Agent 就能直接调用本地的语音能力,要配音就配音,要转写就转写。对这一类模型工具和 智能 & 数据 & 云 相关的自动化工作流来说,本地语音能力正在变成可编排的一环。

VoiceStudio 浅蓝色闪电图标

五大核心特性

1. 音色克隆与语音设计。

给一段干净的参考录音,就能克隆出对应音色长期复用;没有录音也没关系,用文字描述想要的声音,比如沉稳男声、活泼少女,系统直接设计一个出来。

2. 视频配音闭环。

上传视频,工具按时间轴对齐生成配音语音,输出的就是配好音的成片素材。做搬运本地化、教程多语言版,不用再手动对轨。

3. 有声书与批量任务。

长文本切成章节批量合成,小说、课程讲义、公众号文章转音频,一次排队跑完,睡一觉起来整个专辑就渲染好了。

4. 听写与转写。

悬浮窗实时听写,音视频文件批量转文字,646 种语言覆盖。会议录音、访谈素材出稿都在本地完成。

5. 本地 API 加 MCP 接入。

应用内置本地 API 和 MCP 服务,除了官方 Skill,任何支持 MCP 的 Agent 都能把 VoiceStudio 当成自己的发声器官,自动化流水线里加一环就够。像 Claude、GPT、Gemini 这类模型能力,也常借助 RouteFast.ai 这样的模型 API 中转服务接入不同业务,而 VoiceStudio 更偏向把语音输出留在本地完成。

VoiceStudio 几何图形设计

适用场景

  • 自媒体与视频创作者:批量配音、多语言版本、固定音色 IP,零 API 成本
  • 有声书与播客制作者:长文转音频,章节批量渲染,人声自然流畅
  • 程序员与效率党:通过 MCP 把语音能力挂进 Claude Code,让 Agent 自动产出配音和字幕
  • 对隐私敏感的团队:稿件、录音不出内网,云端服务零依赖

VoiceStudio 浅蓝色闪电图标

怎么装、怎么用

第一步,一键安装桌面版(macOS 和 Linux):

curl -fsSL https://voicestudio.sh/install | sh

Windows 用户去 Releases 页面下载安装包,也有 Docker 镜像可选。

第二步,首次打开会提示下载所需语音模型,按提示装好,默认引擎是 k2-fsa/OmniVoice。

第三步,进语音克隆工作台,传一段参考录音,贴入文本,点生成,几秒后音频就出来了。

想让编码 Agent 也能用,把这条命令丢给 Claude Code:

npx skills add debpalash/VoiceStudio

装完后试一句:用我的默认音色,把这篇公众号文章转成配音音频。Agent 会自动调本地服务完成合成,全程不需要你打开界面。

VoiceStudio 几何图形设计

为什么推荐它

推荐理由:这是把专业配音工作流真正开源化的项目。

52K Star 不是白来的:桌面级的完成度、CI 持续集成、官网文档齐全,还有中文 README,上手门槛几乎为零。

要注意两点:AGPL-3.0 协议对二次分发有约束,商用前读一下各模型的独立许可;克隆他人音色务必拿到本人授权。国庆假期正是囤素材的好时候,给自己克隆一个音色,后面的视频配音就再也不用排队交钱了。


项目地址:https://github.com/debpalash/VoiceStudio

觉得有用,去给作者点个 Star。




上一篇:FPGA 神经网络量化:brevitas 压到 4 bit 只掉 0.18 个点
下一篇:马斯克说未来人人都是大富豪:AI全包后,日子反而更无聊?
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-4 02:33 , Processed in 0.069884 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表