首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Voicebox:把 ElevenLabs 和 WisprFlow 合二为一的开源 AI 语音工作室

Voicebox:把 ElevenLabs 和 WisprFlow 合二为一的开源 AI 语音工作室

作者头像
勇哥AI笔记
发布2026-07-21 16:30:51
发布2026-07-21 16:30:51
130
举报
文章被收录于专栏:技术人生黄勇技术人生黄勇

之前介绍过一些关于语音的Skill 和 自己写代码语音转文字的开发过程:

107 分钟的会议录音,免费转文字+自动标注说话人

开源语音 AI:3 秒克隆声音,支持 9 种语言 — Voxtral TTS

我的 OpenClaw 可以开口说话|NoizAI 技能安装使用教程

今天给朋友们介绍一款可以直接上手用的语音工具: Voicebox。


Voicebox — 开源 AI 语音工作室

克隆任意声音、生成语音、向任意应用口述输入、用你自己的声音与 AI 对话。完整的语音输入输出技术栈,在你自己的机器上本地运行。


Voicebox 是什么?

Voicebox 是一个本地优先的 AI 语音工作室,将 ElevenLabs 和 WisprFlow 合二为一,免费开源。

用几秒钟的音频就能克隆声音,在 7 个 TTS 引擎上用 23 种语言生成语音,通过全局快捷键向任意文本输入框口述,还能让任何支持 MCP 的 AI Agent 用你选定的声音说话。

ElevenLabs 管语音输出,WisprFlow 管语音输入,两家各占语音环路的一半。Voicebox 两端都做,中间用内置的本地大模型做文本润色和角色性格管理,并且全部在你自己的机器上运行。

核心能力:

  • 完全隐私:模型、声音数据、录音文件全都不离开你的机器
  • 7 个 TTS 引擎:Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA、Kokoro
  • 声音克隆与预设音色:用参考样本零样本克隆,或从 Kokoro 和 Qwen CustomVoice 提供的 50+ 个精选预设音色中选择
  • 23 种语言:覆盖英语、阿拉伯语、日语、印地语、斯瓦希里语等
  • 后期效果处理:音高偏移、混响、延迟、合唱、压缩、滤波器
  • 情感语音:Chatterbox Turbo 支持 [大笑][叹气][惊讶] 等副语言标签;Qwen CustomVoice 支持自然语言控制说话方式
  • 无限长度:自动分句加交叉淡入淡出,适合脚本、长文、章节
  • 故事编辑器:多轨时间线,适合对话、播客、故事叙述
  • 语音输入:全局口述快捷键,支持按住说话和切换模式,macOS 无障碍验证自动粘贴,所有文本输入框上都有应用内麦克风按钮,基于 Whisper 的语音转文本
  • Agent 语音输出:一个工具调用 voicebox.speak,任何支持 MCP 的 Agent(Claude Code、Cursor、Cline 等)就能用你克隆的声音跟你说话
  • 角色性格:给声音配置自由格式的性格描述,然后通过内置本地大模型实现"撰写"、"改写"、"回复"三种模式,Agent 也能通过 MCP 调用同样的模式
  • API 优先:REST API 加内置 MCP 服务器,方便把语音输入输出集成到你自己的应用和 Agent 中
  • 原生性能:基于 Tauri(Rust)构建,不是 Electron
  • 全平台运行:macOS(MLX/Metal)、Windows(CUDA)、Linux、AMD ROCm、Intel Arc、Docker

常见问题

Q: 这个工作室是编译好的 App 吗?

Voicebox 同时提供预编译安装包和完整源码。

macOS DMG、Windows MSI、Docker 镜像均可直接下载安装使用;对于想自行构建或二次开发的用户,仓库包含全部源码(backend/app/web/tauri/),按开发指南中的步骤即可从源码构建。

和常规开源桌面应用一样,仓库内容不是编译产物,而是完整的工程源码。

Q: 内部引擎使用的开源模型是内置的吗?

所有 TTS、STT、LLM 模型均为开源(Qwen3-TTS、Chatterbox、Kokoro、Whisper、Qwen3 等),应用启动后自动从 HuggingFace 下载到本地,随后所有推理在本地完成,不需要网络。

Docker 部署时通过 huggingface-cache 卷持久化模型缓存,避免重复下载。这些模型不是编译进安装包的(否则安装包会高达数十 GB),而是在首次使用时按需下载。

Q: 它本质上是一个语音常用使用场景的工程封装项目?

是的。

Voicebox 不训练新模型,它的核心价值是:把多个开源语音模型集成到一个统一的桌面应用中,覆盖"语音克隆 + 语音合成 + 口述输入 + Agent 语音输出"这条完整链路,再配上音频后期效果、多轨故事编辑器、全局快捷键等工程化功能,大幅降低普通用户使用这些模型的门槛。

可以理解为"语音领域的全家桶工程封装"。


功能详解

多引擎声音克隆

7 个 TTS 引擎各有所长,每次生成可切换:

多引擎声音克隆

情感与副语言标签

只有 Chatterbox Turbo 能解读 [大笑][叹气] 这类副语言标签。Qwen3-TTS、LuxTTS、Chatterbox Multilingual 和 HumeAI TADA 会将这些标签当作普通文字读出来。

选中 Chatterbox Turbo 后,在文本输入框中输入 /,即可打开标签插入器,在语音中内联添加情感标签:

[大笑][轻笑][惊讶][咳嗽][叹气][呻吟][抽鼻子][嘘声][清喉咙]

后期处理效果

基于 Spotify 的 pedalboard 库,提供 8 种音频效果。生成后应用,实时预览,可创建可复用的预设方案。

效果

描述

音高偏移

上下最多 12 个半音

混响

可调节房间大小、衰减、干湿比例

延迟

可调节时间、反馈量、混合比例的回声

合唱/镶边

调制延迟,产生金属质感或丰富纹理

压缩

动态范围压缩

增益

音量调节(-40 到 +40 dB)

高通滤波

去除低频

低通滤波

去除高频

内置 4 个预设方案(机器人、收音机、回音室、低沉嗓音),也支持自定义预设。效果可以为每个声音配置单独设默认值。

无限生成长度

文本在句子边界自动切分,每个片段独立生成,然后交叉淡入淡出拼接。所有引擎通用。

  • • 可配置自动切分上限(100–5000 字符)
  • • 交叉淡入淡出滑块(0–200ms)实现平滑过渡
  • • 最大文本长度:50000 字符
  • • 智能切分:正确处理缩写、中日韩标点、[标签]

生成版本

每次生成支持多个版本,含来源追溯:

  • 原始版本:纯净 TTS 输出,始终保留
  • 效果版本:从任意源版本应用不同效果链
  • 重试版本:用新随机种子重新生成变体
  • 来源追踪:每个版本记录其生成谱系
  • 收藏:星标标记,快速访问

异步生成队列

生成不阻塞。提交后马上可以开始输入下一段。

  • • 串行执行队列,防止 GPU 资源争用
  • • 实时 SSE 状态推送
  • • 失败的生成可以重试
  • • 崩溃导致的过期生成在启动时自动恢复

声音配置管理

  • • 从音频文件创建配置,或在应用内直接录制
  • • 导入/导出配置,方便分享或备份
  • • 多彩样支持,提升克隆质量
  • • 每个配置可设置默认效果链
  • • 用描述和语言标签组织管理

故事编辑器

多声音时间线编辑器,适合对话、播客、故事叙述。

  • • 多轨组合,拖拽操作
  • • 内联音频裁剪与分割
  • • 自动播放,同步播放头
  • • 每个轨道片段可锁定版本

全局口述与语音输入

语音输入输出环路的另一半。

在系统任何位置按住快捷键,说话,松手,macOS 上转写结果会自动粘贴到当前焦点文本框中。

或者点击 Voicebox 任意文本输入框上的麦克风直接口述到应用内。

  • 可配置快捷键绑定:按住说话和点击切换两种模式,每种都可以在应用内的快捷键选择器中重新绑定。按住说话时再点一下空格键可以升级为切换模式,中间不中断音频
  • 感知目标的粘贴(macOS):通过无障碍验证注入到焦点文本框,同时原子化保存/恢复剪贴板,不会覆盖你原来复制的内容
  • 首次运行权限引导:应用内逐步引导完成 macOS 辅助功能和输入监控授权,包含直达系统设置的链接
  • 应用内麦克风按钮:Voicebox 的每个文本输入框上都有,生成表单、配置描述、故事标题,任何要输入的地方都可用
  • 大模型润色:可选地在粘贴前清理嗯啊、结巴、自我纠正
  • 屏幕悬浮指示器:浮动小窗显示 录音中转写中润色中朗读中 状态。Agent 说话时用同样的指示器,输入输出环路的视觉体验一脉相承

语音转文本

Voicebox 使用 OpenAI Whisper 做转写,口述功能、录音标签页、/transcribe API 背后都是同一个模型。

根据平台自动选用 MLX(Apple Silicon)或 PyTorch(CUDA / ROCm / DirectML / CPU)。

模型大小

说明

Base/Small/Medium/Large

标准 Whisper 质量梯度

Turbo

比 Whisper Large 快约 8 倍,质量损失极小

录音管理

每次口述、应用内录音和上传的音频文件都会进入录音标签页,原始音频与转写文本配对保存,始终保留。

  • 重播、重新转写、重新润色:用任意 Whisper 模型大小重新跑 STT,或用不同参数(清理填充词、去除自我纠正、保留专业术语)通过本地大模型重新润色文本
  • 内联编辑:直接修改文本,失焦自动保存
  • 作为声音配置播放:一键用克隆的声音朗读任何录音
  • 升级为声音样本:将某条录音的音频+转写作为参考样本添加到任意声音配置
  • 本地存储:原始音频和转写保存在你的 Voicebox 数据目录中,设置中有快捷入口

Agent 语音输出

每个 Agent 都可以有声音。一个工具调用,任何支持 MCP 的 Agent 就能用你克隆的声音跟你说话——任务完成、提问、通知都能语音播报。Agent 说话时用的悬浮指示器和口述时一样,你随时看得见机器在说什么。

同时也暴露为 POST /speak,供不支持 MCP 的场景(ACP、A2A、Shell 脚本、自定义框架)使用。

  • 双向指示器录音中转写中润色中朗读中 都是同一个系统级悬浮窗的状态,口述和 Agent 语音共用同一个视觉界面
  • 按 Agent 绑定声音:在设置 → MCP 中,可以把 Claude Code 绑定给 Morgan,Cursor 绑定给 Scarlett,不用看屏幕就知道哪个 Agent 在说话。每个客户端的 last_seen_at 时间戳确认绑定已生效
  • 始终可见:没有静默后台 TTS;每次 Agent 触发的语音都会弹出指示器,全程显示声音配置名称
  • HTTP + stdio 双传输:Claude Code / Cursor / Windsurf / VS Code MCP 中用 URL 方式安装,只支持 stdio 的客户端则指向应用内置的 voicebox-mcp 二进制文件

角色性格

给任意声音配置附加一段自由格式的性格描述,定义这个声音是谁、怎么说话、关注什么。设置性格后,生成输入框上会出现两个操作按钮,由内置的 Qwen3 大模型本地驱动。

  • 撰写:类似随机按钮,生成一句符合性格的话填入输入框,可编辑后朗读,或再点一次换一句
  • 角色化朗读:一个开关,将你输入的文本先经过性格大模型改写成该角色的说话风格,再送入 TTS

Agent 也能通过 MCP 走同样的改写路径——在 voicebox.speak 中传 personality: true,工具就变成 文本输入 → 性格大模型 → TTS 的管道。口述的润色功能用的也是同一个大模型,整个应用只有一个大模型、一份模型缓存、一份显存占用。

本地大模型选项: Qwen3 0.6B / 1.7B / 4B,与 TTS 共享运行时(Apple Silicon 用 MLX,其他用 PyTorch)。

应用场景: Agent 开发循环(口述提问,听克隆声音回答)、游戏和叙事工具的交互角色、为失语用户提供语音辅助。

Voicebox 提供 REST API,方便把语音输入输出集成到你自己的应用和 Agent 中。主要端点包括:生成语音(POST /generate)、Agent 语音输出(POST /speak)、转写音频文件(POST /transcribe)、列出声音配置(GET /profiles)。

POST /speak 接受 profile 参数(名称不区分大小写或 ID),解析优先级与 MCP 工具相同:显式传参 → 按客户端绑定 → capture_settings.default_playback_voice_id

Voicebox 内置 MCP(Model Context Protocol) 服务器,任何支持 MCP 的 Agent(Claude Code、Cursor、Windsurf、Cline、VS Code MCP 扩展)都能说话、转写、浏览录音和声音配置。

Claude Code 一行安装: 使用 claude mcp add voicebox 命令,指定 HTTP 传输方式,指向 http://127.0.0.1:17493/mcp,并带上 X-Voicebox-Client-Id 头标识客户端身份。

任意 HTTP MCP 客户端(Cursor、Windsurf、VS Code 等):在 MCP 配置中设置 urlhttp://127.0.0.1:17493/mcp,并在 headers 中传入 X-Voicebox-Client-Id 即可。

Stdio 备选方案,适用于不支持 HTTP MCP 的客户端:指向应用内置的 voicebox-mcp 二进制文件(例如 /Applications/Voicebox.app/Contents/MacOS/voicebox-mcp),并设置环境变量 VOICEBOX_CLIENT_ID

内置四个工具:voicebox.speakvoicebox.transcribevoicebox.list_capturesvoicebox.list_profiles

按客户端绑定声音在 Voicebox → 设置 → MCP 中管理。voicebox.speak 支持 profile(可选,未传则使用按客户端绑定的声音)和 personality(可选,先通过该声音的性格大模型改写文本)参数。

使用场景:

Agent 开发循环(口述提问,听克隆声音回答)、游戏对话、播客制作、叙事工具的交互角色、为失语用户提供语音辅助、语音助手、内容自动化。

这款语音工具是你需要的吗?

欢迎评论区留言。


本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-20,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 技术人生黄勇 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • Voicebox 是什么?
  • 常见问题
  • 功能详解
    • 多引擎声音克隆
    • 情感与副语言标签
    • 后期处理效果
    • 无限生成长度
    • 生成版本
    • 异步生成队列
    • 声音配置管理
    • 故事编辑器
    • 全局口述与语音输入
    • 语音转文本
    • 录音管理
    • Agent 语音输出
    • 角色性格
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档