VODER AI音频工具:开源本地语音合成声音克隆与音乐生成平台|支持TTS声音克隆和AI音乐生成

语音合成、声音转换、AI 配音以及音乐生成逐渐成为内容创作者、开发者和音频爱好者关注的方向。但目前很多 AI 音频工具往往只针对单一场景,例如文字转语音、声音克隆或者音乐生成,用户在不同任务之间需要切换多个工具,操作流程较为分散。

VODER 是一个面向本地运行场景打造的开源 AI 音频处理工具,全称为 Voice Blender 项目定位是一个本地、免费、离线运行的专业级声音处理与转换工具,可以在语音、文本和音乐之间进行转换,并提供高质量语音合成、声音克隆以及音乐生成能力。

VODER 面向创作者、开发者以及音频专业用户设计,通过统一界面整合多种 AI 音频处理能力,让用户能够在同一个工具中完成不同类型的声音创作任务。

与传统 AI 配音工具相比,VODER 的特点在于它强调本地化处理流程,并提供多种音频转换模式,覆盖从文字生成声音,到声音转换,再到文本生成音乐等多个方向。

  • 多说话人对话系统 — 编写包含多个角色的剧本,每个角色拥有独特的声音。通过脚本指令控制每句台词的节奏、音量和时长。将音效直接嵌入对话台词中,并自动生成与台词时长匹配的背景音乐。
  • 声音设计与克隆 — 用通俗英语描述声音特征,VODER即可生成该声音;或提供参考音频片段克隆说话人的嗓音。设计声音与克隆声音可在同一对话中混合使用。
  • 说话人分离 — 从多说话人录音中分离出每个说话人单独的音频文件,并附有标记说话人名称的转录文本。
  • 具备视频输入/输出的语音转换 — 将一种声音转换为另一种声音,同时保留词语、情感和节奏。导入MP4视频文件,即可返回经过语音转换后的视频。
  • 音乐生成与编辑 — 根据歌词和风格描述生成完整歌曲。支持混音、重绘、续写、提取音轨、构建独立乐器轨道,或替换现有音频/视频中的背景音乐。最多可输出12条独立乐器轨道。
  • 智能语音转文字 — 转写音频、视频、图片或直接链接中的语音。通过TranslateGemma翻译成76种语言中的任意一种。识别说话人身份并记录发言时间节点。支持批量处理多个文件。
  • 语言配音 — 在保留原说话人声纹特征的前提下,将语音从一种语言翻译为另一种语言。可为完整视频进行分段对齐配音,并保留背景音乐。
  • 任意语言互译 — 通过translate(源语言-目标语言)语法,使用TranslateGemma 12B在76种语言间自由互译,翻译过程与语音识别引擎完全解耦。
  • 语音重合成 — 转录语音并使用tts svc以不同声音重新朗读,可选sts:前缀通过Seed-VC v2实现高保真度语音转换。
  • 支线任务 — 独立于主引擎运行的轻量级实用工具任务:URL下载、音频格式转换、剪切/合并/混音/移除片段、静音消除、变速/变调/音量/低音增强/混响/响度归一化等效果处理。运行python voder.py quest可查看按类别分组的全部可用任务。
  • 任务链 — 用户自定义的流水线,可将任意数量的voder任务串联:每条任务链均有名称,其输出暂存至临时文件,后续任务链可引用先前任务链名称作为输入路径。构建歌曲、提取人声、训练语音模型、配音视频——所有操作一键完成。
  • 智能输入管道 — 直接粘贴YouTube、TikTok、Bilibili、Snapchat、Instagram、Facebook或X/Twitter的链接作为输入。VODER会在下载前验证链接是否确实指向视频。输入图片时,VODER通过OCR提取文字。自动从多人音频中提取语音片段,实现一键语音克隆。

VODER 的核心功能特点

六种 AI 音频处理模式:一个界面完成多种声音创作任务

VODER 的核心能力集中在六种处理模式中,每种模式对应不同的音频生成和转换需求。

目前支持:

STT+TTS:语音识别与语音合成

该模式首先将输入语音转换为文本,然后再通过文本生成语音,实现语音内容重新合成。

适合:

  • 语音内容转写后重新配音;
  • 保留内容但更换声音;
  • 自动化音频处理流程。

TTS:文本转语音

TTS 模式支持根据输入文本生成语音。

用户可以通过文字内容以及声音设计描述创建对应声音,例如:

  • 角色声音;
  • 播客旁白;
  • 有声内容;
  • AI 新闻播报。

TTS+VC:文本生成语音结合声音克隆

该模式结合文本转语音和声音克隆能力。

用户可以输入文本,同时提供参考声音文件,让生成结果拥有目标声音特点。

这种方式适用于:

  • 虚拟角色配音;
  • 个性化 AI 声音;
  • 多角色内容制作。

STS:语音到语音转换

STS(Speech-to-Speech)模式支持输入原始语音和目标声音参考,将已有语音转换为另一种声音。

例如:

  • 保留原讲话内容;
  • 改变声音风格;
  • 实现声音转换实验。

TTM:文本生成音乐

TTM(Text-to-Music)模式支持通过文本描述生成音乐。

用户可以输入歌词和音乐风格描述,让 AI 根据文本内容生成音乐作品。

TTM+VC:音乐生成结合声音转换

该模式结合文本生成音乐和声音转换能力,可以生成音乐内容,并进一步结合目标声音进行转换。

六种模式覆盖了语音识别、语音生成、声音转换和音乐创作等多个 AI 音频方向。

智能对话编辑系统

面向播客、有声书和多角色内容创作

VODER 内置了一套基于行结构的 Dialogue Editor(对话编辑器),主要用于创建多角色音频内容。

该功能适合:

  • AI 播客;
  • 新闻播报;
  • 有声书;
  • 多角色故事;
  • 对话式音频内容。

用户可以按照脚本形式输入内容,每一行对应一个角色和一句对白。系统会自动识别脚本中的角色,并为不同角色生成对应声音配置。

例如:

James: Welcome to our podcast.
Sarah: Today we discuss AI technology.

VODER 会识别 James 和 Sarah 两个角色,并分别进行声音设置。

对话编辑器支持:

  • 每行独立角色和文本字段;
  • 自动增加新行;
  • 自动识别脚本角色;
  • 每个角色独立设置声音提示词;
  • TTS+VC 模式下为角色分配参考声音。

自动背景音乐生成 为对话内容加入匹配音乐

VODER 在对话生成流程中加入了自动背景音乐能力。

当用户生成 TTS 或 TTS+VC 对话内容时,可以选择输入音乐描述,例如:

soft piano, cinematic strings

随后 VODER 会:

  • 使用 ACE-Step 根据描述生成音乐;
  • 自动调整音乐长度,使其匹配对白长度;
  • 将音乐音量调整为对白音量的 35%;
  • 清理临时文件;
  • 输出带有 _m 后缀的最终音频文件。

这一功能只会在对话脚本模式下触发,例如多行脚本,或者单行包含角色名称格式的内容。

对于播客、故事 narration 或 AI 新闻类内容来说,这种自动配乐能力可以减少后期音频编辑工作。

AI 模型集成 使用多个开源 AI 模型完成音频处理

VODER 并不是自行训练所有模型,而是整合多个成熟开源 AI 模型完成不同任务。

项目当前集成:

Whisper

用于语音识别。

来源:

openai/whisper

主要负责:

  • 音频转文字;
  • 语音内容解析。

Qwen 3-TTS

用于文本转语音。

来源:

QwenLM/Qwen 3-TTS

负责生成自然语音。

Seed-VC

用于声音转换。

来源:

Plachtaa/seed-vc

负责语音到语音转换。

ACE-Step

用于音乐生成。

来源:

ace-step/ACE-Step-1.5

负责文本到音乐生成。

通过这些模型组合,VODER 将多个 AI 音频能力整合到了一个工作流中。

本地运行与离线处理 数据处理更加可控

VODER 最大特点之一是本地运行。

项目定位为 Local、Free、Offline 的声音处理工具,用户可以直接在自己的设备上运行,不依赖在线服务。

对于涉及声音素材的用户来说,本地运行具有一定优势:

  • 音频文件无需上传第三方平台;
  • 可以自行管理模型和运行环境;
  • 更适合研究和实验场景。

VODER 安装与使用教程

环境要求

VODER 支持 CPU 运行,不强制要求 GPU。

官方给出的最低配置:

硬件要求
CPU4-6 核
内存12 GB+
GPU可选
显存最低 4 GB,推荐 6 GB,最佳 16 GB
存储推荐 SSD

虽然 GPU 不是必须条件,但拥有足够显存的 GPU 可以提升部分模式的处理速度。

安装 VODER

从源码运行

首先克隆项目:

git clone https://github.com/HAKORADev/VODER.git

cd VODER

安装依赖:

pip install -r requirements.txt

随后升级 protobuf:

pip install --upgrade protobuf==5.29.6

启动图形界面:

python src/voder.py

也可以使用 CLI 模式:

python src/voder.py cli

安装 FFmpeg

由于 VODER 需要进行音频处理,因此需要安装 FFmpeg。

Windows:

winget install FFmpeg

macOS:

brew install ffmpeg

Linux:

sudo apt install ffmpeg

使用 GUI 模式

启动:

python src/voder.py

进入界面后:

第一步,选择六种模式之一。

第二步,根据模式加载输入内容。

例如:

TTS

输入:

  • 对话文本;
  • 声音设计提示。

TTS+VC

输入:

  • 对话内容;
  • 参考声音文件。

STS

输入:

  • 原始音频;
  • 目标声音音频。

TTM

输入:

  • 歌词;
  • 音乐风格描述。

第三步:

点击:

Generate

或:

Patch

生成结果。

使用 CLI 模式

运行:

python src/voder.py cli

CLI 支持交互式创建对话。

输入:

James: Welcome to the show.
Sarah: Nice to meet you.

系统会自动识别角色,并要求输入:

  • TTS 模式下的声音提示;
  • TTS+VC 模式下的参考音频。

我的使用体验

体验 VODER 后,我认为它比较适合对 AI 音频有一定需求,同时希望拥有更多控制权的用户。

它最大的特点是功能集中度较高。过去如果想完成 AI 配音、声音转换、音乐生成、多角色播客制作,通常需要组合多个工具,而 VODER 将这些流程放到了同一个界面中。

其中让我印象比较深的是 Dialogue Editor。

对于制作播客、故事内容或者 AI 新闻节目的人来说,多角色管理一直是比较繁琐的环节。VODER 通过脚本形式管理角色,让每个角色对应不同声音配置,降低了多角色音频制作的复杂度。

另外,本地运行模式也比较适合开发者和技术爱好者。音频生成涉及声音素材时,很多用户会关注数据控制问题,本地处理能够提供更明确的运行边界。

当然,VODER 也有一定使用门槛。它并不是一个打开网页即可使用的在线工具,需要用户准备 Python 环境、模型依赖以及一定硬件资源。如果只是偶尔生成一段语音,学习成本可能偏高;但对于长期进行 AI 音频创作的人来说,这种可控性反而是一项优势。

总结

VODER 是一个面向 AI 音频创作场景的开源本地工具,通过六种处理模式、声音克隆、多角色对话系统、AI 音乐生成以及多个开源模型集成,为用户提供了一套完整的声音处理流程。

它适合:

  • AI 内容创作者;
  • 播客制作人员;
  • 音频开发者;
  • 研究 AI 声音技术的用户。

一个能够在本地完成语音生成、声音转换和音乐创作的开源工具你好

官方网站

https://github.com/HAKORADev/VODER

相关推荐

JameCling

JameCling

我是 格律诗的软件世界 的作者,一名专注于软件工具、AI 技术和数字效率领域的独立研究者。
多年来,我持续关注互联网工具的发展趋势,体验不同平台的软件产品,并研究它们如何帮助用户提升效率。
我的工作不仅是整理软件信息,而是通过实际测试、功能分析和使用场景研究,帮助用户判断一个工具是否真正值得使用。
格律诗的软件世界 的每一篇文章都希望提供真实、有价值的信息,包括工具特点、使用方法、优缺点分析以及适合的人群。
我相信,好的工具能够改变工作方式,而准确的信息能够帮助用户做出更好的选择。