Avatar Forge – 开源数字人视频工作流,照片生成口播视频

Avatar Forge 是一个面向 AI Agent 的开源数字人视频工作流,基于 MIT 协议发布,由 LycheeAILab 团队开发。它的目标很直接:让一张静态的人物照片,配合一段已授权的参考声音和一份口播稿,自动生成一条会开口说话的数字人口播视频。

这类 AI 工具 的出现,把原本需要录制、抠像、对口型和剪辑的复杂流程,压缩成「给素材、说目标」两步。它本质上是一个面向 Agent 的 Skill,由 Codex 这类智能体在后台理解意图并串联各阶段,用户不需要打开额外的操作页面。

在这之前,用户遇到什么问题

做一条数字人口播视频,传统方式要么自己架设备录制再逐帧对齐口型,要么把人物照片和声音上传到闭源付费平台,等待排队生成。前者耗时,后者要权衡素材隐私和数据归属。在内容创作 场景下,很多团队需要批量产出不同文案的口播视频,但现有方案要么门槛高、要么把素材留在第三方服务器。Avatar Forge 把流程搬到了本地 Agent 工作流里,素材只在授权范围内使用,最终只交付一段视频文件。

核心功能

从一张照片到会说话的数字人

输入只有三样:一张人物图片、一段已授权的参考声音、一份口播稿。Avatar Forge 会把它们串成一条可恢复的流水线,默认只向用户交付数字人平台 zeroshot 推理得到的最终 MP 4,中间模板不对外输出。

四段式可恢复流水线

整条链路分为声音克隆、内部模板、数字人快速克隆和 zeroshot 推理四个阶段:

  • 声音克隆:提交已授权参考声音,自动获得并保存 speaker_id
  • 内部模板:用人物图片加上 Skill 内置的固定短音频生成模板,仅供快速克隆,不读取用户口播稿
  • 数字人快速克隆:基于模板得到可复用的数字人身份
  • zeroshot 推理:用数字人身份加上 LycheeTTS 生成的目标音频,产出最终口播视频

长任务会在本地隐藏状态中保留阶段进度,重新运行相同命令即可继续,不必从头再来。生成的成果可继续进入影音编辑 流程做二次加工。

可以只调用其中一项能力

不必走完整流程。用户可以单独提交参考声音做声音克隆,或凭 speaker_id 加文案生成口播音频,也可以用已有图片和音频生成最终视频,甚至让一个已存在的数字人套用指定音频重新推理。

设计原则与凭据隔离

项目强调「明确交付、可恢复、凭据隔离、阶段隔离、Agent 原生」:供应商密钥只保存在 LycheeAILab 服务端的加密凭据库,不进入用户电脑、仓库或日志;RunningHub 只参与内部模板阶段,快速克隆与最终推理不经过它。对关注视频处理 隐私边界的用户,这套隔离设计降低了顾虑。

安全与授权

使用需通过 LycheeAILab 账户完成身份验证。请只上传已获合法授权的人物图片、声音、视频和文案,不得用于冒充他人或生成违法违规内容。

安装与使用

前置条件

  • 已安装 Codex 桌面端
  • 拥有 LycheeAILab 账户(首次使用会打开登录授权页)

安装

让 Codex 协助安装,新建任务发送:

阅读 https://raw.githubusercontent.com/LycheeAILab/avatar-forge/main/INSTALL.md ,帮我安装Avatar Forge。

或手动安装,作为 Codex 的 AI Agent 插件添加:

安装后新建一个 Codex 任务,使插件在新会话中加载。

日常使用

把拥有合法使用权的素材交给 Codex,直接描述目标即可:

使用 Avatar Forge,把这张人物图片、已授权参考声音和口播稿制作成一条完整的数字人口播视频。

Codex 会自动在各阶段之间安全传递结果。对于想做工作流搭建的用户,这种「描述目标、由 Agent 选流程」的方式尤其顺手。

我的使用感受

把一个静态头像变成能念稿的数字人,体验上最直观的收获是「省事」:不必录音、不必对嘴型,给图和稿就能出片。流水线可恢复的设计也很贴心,长任务中断后能接着跑。相对不足是它深度依赖 LycheeAILab 的云端能力(语音克隆、快速克隆、最终推理都在其平台完成),离线本地化有限。把它归为效率工具 毫不为过;如果你在做工具推荐 类内容,它值得被写进清单;在软件发现 维度,它是近期少见的 Agent 原生数字人方案。把它也归到实用软件 同样合适。

官方网站

https://github.com/LycheeAILab/avatar-forge

下载地址

https://pan.quark.cn/s/abfbdc3a88a1

相关推荐

Avatar photo

JameCling

我是 格律诗的软件世界 的作者,一名专注于软件工具、AI 技术和数字效率领域的独立研究者。
多年来,我持续关注互联网工具的发展趋势,体验不同平台的软件产品,并研究它们如何帮助用户提升效率。
我的工作不仅是整理软件信息,而是通过实际测试、功能分析和使用场景研究,帮助用户判断一个工具是否真正值得使用。
格律诗的软件世界 的每一篇文章都希望提供真实、有价值的信息,包括工具特点、使用方法、优缺点分析以及适合的人群。
我相信,好的工具能够改变工作方式,而准确的信息能够帮助用户做出更好的选择。