
语音合成、声音转换、AI 配音以及音乐生成逐渐成为内容创作者、开发者和音频爱好者关注的方向。但目前很多 AI 音频工具往往只针对单一场景,例如文字转语音、声音克隆或者音乐生成,用户在不同任务之间需要切换多个工具,操作流程较为分散。
VODER 是一个面向本地运行场景打造的开源 AI 音频处理工具,全称为 Voice Blender 项目定位是一个本地、免费、离线运行的专业级声音处理与转换工具,可以在语音、文本和音乐之间进行转换,并提供高质量语音合成、声音克隆以及音乐生成能力。
VODER 面向创作者、开发者以及音频专业用户设计,通过统一界面整合多种 AI 音频处理能力,让用户能够在同一个工具中完成不同类型的声音创作任务。

与传统 AI 配音工具相比,VODER 的特点在于它强调本地化处理流程,并提供多种音频转换模式,覆盖从文字生成声音,到声音转换,再到文本生成音乐等多个方向。
- 多说话人对话系统 — 编写包含多个角色的剧本,每个角色拥有独特的声音。通过脚本指令控制每句台词的节奏、音量和时长。将音效直接嵌入对话台词中,并自动生成与台词时长匹配的背景音乐。
- 声音设计与克隆 — 用通俗英语描述声音特征,VODER即可生成该声音;或提供参考音频片段克隆说话人的嗓音。设计声音与克隆声音可在同一对话中混合使用。
- 说话人分离 — 从多说话人录音中分离出每个说话人单独的音频文件,并附有标记说话人名称的转录文本。
- 具备视频输入/输出的语音转换 — 将一种声音转换为另一种声音,同时保留词语、情感和节奏。导入MP4视频文件,即可返回经过语音转换后的视频。
- 音乐生成与编辑 — 根据歌词和风格描述生成完整歌曲。支持混音、重绘、续写、提取音轨、构建独立乐器轨道,或替换现有音频/视频中的背景音乐。最多可输出12条独立乐器轨道。
- 智能语音转文字 — 转写音频、视频、图片或直接链接中的语音。通过TranslateGemma翻译成76种语言中的任意一种。识别说话人身份并记录发言时间节点。支持批量处理多个文件。
- 语言配音 — 在保留原说话人声纹特征的前提下,将语音从一种语言翻译为另一种语言。可为完整视频进行分段对齐配音,并保留背景音乐。
- 任意语言互译 — 通过
translate(源语言-目标语言)语法,使用TranslateGemma 12B在76种语言间自由互译,翻译过程与语音识别引擎完全解耦。 - 语音重合成 — 转录语音并使用
tts svc以不同声音重新朗读,可选sts:前缀通过Seed-VC v2实现高保真度语音转换。 - 支线任务 — 独立于主引擎运行的轻量级实用工具任务:URL下载、音频格式转换、剪切/合并/混音/移除片段、静音消除、变速/变调/音量/低音增强/混响/响度归一化等效果处理。运行
python voder.py quest可查看按类别分组的全部可用任务。 - 任务链 — 用户自定义的流水线,可将任意数量的voder任务串联:每条任务链均有名称,其输出暂存至临时文件,后续任务链可引用先前任务链名称作为输入路径。构建歌曲、提取人声、训练语音模型、配音视频——所有操作一键完成。
- 智能输入管道 — 直接粘贴YouTube、TikTok、Bilibili、Snapchat、Instagram、Facebook或X/Twitter的链接作为输入。VODER会在下载前验证链接是否确实指向视频。输入图片时,VODER通过OCR提取文字。自动从多人音频中提取语音片段,实现一键语音克隆。
VODER 的核心功能特点
六种 AI 音频处理模式:一个界面完成多种声音创作任务
VODER 的核心能力集中在六种处理模式中,每种模式对应不同的音频生成和转换需求。
目前支持:
STT+TTS:语音识别与语音合成
该模式首先将输入语音转换为文本,然后再通过文本生成语音,实现语音内容重新合成。
适合:
- 语音内容转写后重新配音;
- 保留内容但更换声音;
- 自动化音频处理流程。
TTS:文本转语音
TTS 模式支持根据输入文本生成语音。
用户可以通过文字内容以及声音设计描述创建对应声音,例如:
- 角色声音;
- 播客旁白;
- 有声内容;
- AI 新闻播报。
TTS+VC:文本生成语音结合声音克隆
该模式结合文本转语音和声音克隆能力。
用户可以输入文本,同时提供参考声音文件,让生成结果拥有目标声音特点。
这种方式适用于:
- 虚拟角色配音;
- 个性化 AI 声音;
- 多角色内容制作。
STS:语音到语音转换
STS(Speech-to-Speech)模式支持输入原始语音和目标声音参考,将已有语音转换为另一种声音。
例如:
- 保留原讲话内容;
- 改变声音风格;
- 实现声音转换实验。
TTM:文本生成音乐
TTM(Text-to-Music)模式支持通过文本描述生成音乐。
用户可以输入歌词和音乐风格描述,让 AI 根据文本内容生成音乐作品。
TTM+VC:音乐生成结合声音转换
该模式结合文本生成音乐和声音转换能力,可以生成音乐内容,并进一步结合目标声音进行转换。
六种模式覆盖了语音识别、语音生成、声音转换和音乐创作等多个 AI 音频方向。
智能对话编辑系统
面向播客、有声书和多角色内容创作
VODER 内置了一套基于行结构的 Dialogue Editor(对话编辑器),主要用于创建多角色音频内容。
该功能适合:
- AI 播客;
- 新闻播报;
- 有声书;
- 多角色故事;
- 对话式音频内容。
用户可以按照脚本形式输入内容,每一行对应一个角色和一句对白。系统会自动识别脚本中的角色,并为不同角色生成对应声音配置。
例如:
James: Welcome to our podcast.
Sarah: Today we discuss AI technology.
VODER 会识别 James 和 Sarah 两个角色,并分别进行声音设置。
对话编辑器支持:
- 每行独立角色和文本字段;
- 自动增加新行;
- 自动识别脚本角色;
- 每个角色独立设置声音提示词;
- TTS+VC 模式下为角色分配参考声音。
自动背景音乐生成 为对话内容加入匹配音乐
VODER 在对话生成流程中加入了自动背景音乐能力。
当用户生成 TTS 或 TTS+VC 对话内容时,可以选择输入音乐描述,例如:
soft piano, cinematic strings
随后 VODER 会:
- 使用 ACE-Step 根据描述生成音乐;
- 自动调整音乐长度,使其匹配对白长度;
- 将音乐音量调整为对白音量的 35%;
- 清理临时文件;
- 输出带有
_m后缀的最终音频文件。
这一功能只会在对话脚本模式下触发,例如多行脚本,或者单行包含角色名称格式的内容。
对于播客、故事 narration 或 AI 新闻类内容来说,这种自动配乐能力可以减少后期音频编辑工作。
AI 模型集成 使用多个开源 AI 模型完成音频处理
VODER 并不是自行训练所有模型,而是整合多个成熟开源 AI 模型完成不同任务。
项目当前集成:
Whisper
用于语音识别。
来源:
openai/whisper
主要负责:
- 音频转文字;
- 语音内容解析。
Qwen 3-TTS
用于文本转语音。
来源:
QwenLM/Qwen 3-TTS
负责生成自然语音。
Seed-VC
用于声音转换。
来源:
Plachtaa/seed-vc
负责语音到语音转换。
ACE-Step
用于音乐生成。
来源:
ace-step/ACE-Step-1.5
负责文本到音乐生成。
通过这些模型组合,VODER 将多个 AI 音频能力整合到了一个工作流中。
本地运行与离线处理 数据处理更加可控
VODER 最大特点之一是本地运行。
项目定位为 Local、Free、Offline 的声音处理工具,用户可以直接在自己的设备上运行,不依赖在线服务。
对于涉及声音素材的用户来说,本地运行具有一定优势:
- 音频文件无需上传第三方平台;
- 可以自行管理模型和运行环境;
- 更适合研究和实验场景。
VODER 安装与使用教程
环境要求
VODER 支持 CPU 运行,不强制要求 GPU。
官方给出的最低配置:
| 硬件 | 要求 |
|---|---|
| CPU | 4-6 核 |
| 内存 | 12 GB+ |
| GPU | 可选 |
| 显存 | 最低 4 GB,推荐 6 GB,最佳 16 GB |
| 存储 | 推荐 SSD |
虽然 GPU 不是必须条件,但拥有足够显存的 GPU 可以提升部分模式的处理速度。
安装 VODER
从源码运行
首先克隆项目:
git clone https://github.com/HAKORADev/VODER.git
cd VODER
安装依赖:
pip install -r requirements.txt
随后升级 protobuf:
pip install --upgrade protobuf==5.29.6
启动图形界面:
python src/voder.py
也可以使用 CLI 模式:
python src/voder.py cli
安装 FFmpeg
由于 VODER 需要进行音频处理,因此需要安装 FFmpeg。
Windows:
winget install FFmpeg
macOS:
brew install ffmpeg
Linux:
sudo apt install ffmpeg
使用 GUI 模式
启动:
python src/voder.py
进入界面后:
第一步,选择六种模式之一。
第二步,根据模式加载输入内容。
例如:
TTS
输入:
- 对话文本;
- 声音设计提示。
TTS+VC
输入:
- 对话内容;
- 参考声音文件。
STS
输入:
- 原始音频;
- 目标声音音频。
TTM
输入:
- 歌词;
- 音乐风格描述。
第三步:
点击:
Generate
或:
Patch
生成结果。
使用 CLI 模式
运行:
python src/voder.py cli
CLI 支持交互式创建对话。
输入:
James: Welcome to the show.
Sarah: Nice to meet you.
系统会自动识别角色,并要求输入:
- TTS 模式下的声音提示;
- TTS+VC 模式下的参考音频。
我的使用体验
体验 VODER 后,我认为它比较适合对 AI 音频有一定需求,同时希望拥有更多控制权的用户。
它最大的特点是功能集中度较高。过去如果想完成 AI 配音、声音转换、音乐生成、多角色播客制作,通常需要组合多个工具,而 VODER 将这些流程放到了同一个界面中。
其中让我印象比较深的是 Dialogue Editor。
对于制作播客、故事内容或者 AI 新闻节目的人来说,多角色管理一直是比较繁琐的环节。VODER 通过脚本形式管理角色,让每个角色对应不同声音配置,降低了多角色音频制作的复杂度。
另外,本地运行模式也比较适合开发者和技术爱好者。音频生成涉及声音素材时,很多用户会关注数据控制问题,本地处理能够提供更明确的运行边界。
当然,VODER 也有一定使用门槛。它并不是一个打开网页即可使用的在线工具,需要用户准备 Python 环境、模型依赖以及一定硬件资源。如果只是偶尔生成一段语音,学习成本可能偏高;但对于长期进行 AI 音频创作的人来说,这种可控性反而是一项优势。
总结
VODER 是一个面向 AI 音频创作场景的开源本地工具,通过六种处理模式、声音克隆、多角色对话系统、AI 音乐生成以及多个开源模型集成,为用户提供了一套完整的声音处理流程。
它适合:
- AI 内容创作者;
- 播客制作人员;
- 音频开发者;
- 研究 AI 声音技术的用户。
一个能够在本地完成语音生成、声音转换和音乐创作的开源工具你好
官方网站
https://github.com/HAKORADev/VODER







