
Avatar Forge 是一个面向 AI Agent 的开源数字人视频工作流,基于 MIT 协议发布,由 LycheeAILab 团队开发。它的目标很直接:让一张静态的人物照片,配合一段已授权的参考声音和一份口播稿,自动生成一条会开口说话的数字人口播视频。
这类 AI 工具 的出现,把原本需要录制、抠像、对口型和剪辑的复杂流程,压缩成「给素材、说目标」两步。它本质上是一个面向 Agent 的 Skill,由 Codex 这类智能体在后台理解意图并串联各阶段,用户不需要打开额外的操作页面。
在这之前,用户遇到什么问题
做一条数字人口播视频,传统方式要么自己架设备录制再逐帧对齐口型,要么把人物照片和声音上传到闭源付费平台,等待排队生成。前者耗时,后者要权衡素材隐私和数据归属。在内容创作 场景下,很多团队需要批量产出不同文案的口播视频,但现有方案要么门槛高、要么把素材留在第三方服务器。Avatar Forge 把流程搬到了本地 Agent 工作流里,素材只在授权范围内使用,最终只交付一段视频文件。

核心功能
从一张照片到会说话的数字人
输入只有三样:一张人物图片、一段已授权的参考声音、一份口播稿。Avatar Forge 会把它们串成一条可恢复的流水线,默认只向用户交付数字人平台 zeroshot 推理得到的最终 MP 4,中间模板不对外输出。
四段式可恢复流水线
整条链路分为声音克隆、内部模板、数字人快速克隆和 zeroshot 推理四个阶段:
- 声音克隆:提交已授权参考声音,自动获得并保存
speaker_id - 内部模板:用人物图片加上 Skill 内置的固定短音频生成模板,仅供快速克隆,不读取用户口播稿
- 数字人快速克隆:基于模板得到可复用的数字人身份
- zeroshot 推理:用数字人身份加上 LycheeTTS 生成的目标音频,产出最终口播视频
长任务会在本地隐藏状态中保留阶段进度,重新运行相同命令即可继续,不必从头再来。生成的成果可继续进入影音编辑 流程做二次加工。
可以只调用其中一项能力
不必走完整流程。用户可以单独提交参考声音做声音克隆,或凭 speaker_id 加文案生成口播音频,也可以用已有图片和音频生成最终视频,甚至让一个已存在的数字人套用指定音频重新推理。
设计原则与凭据隔离
项目强调「明确交付、可恢复、凭据隔离、阶段隔离、Agent 原生」:供应商密钥只保存在 LycheeAILab 服务端的加密凭据库,不进入用户电脑、仓库或日志;RunningHub 只参与内部模板阶段,快速克隆与最终推理不经过它。对关注视频处理 隐私边界的用户,这套隔离设计降低了顾虑。
安全与授权
使用需通过 LycheeAILab 账户完成身份验证。请只上传已获合法授权的人物图片、声音、视频和文案,不得用于冒充他人或生成违法违规内容。
安装与使用
前置条件
- 已安装 Codex 桌面端
- 拥有 LycheeAILab 账户(首次使用会打开登录授权页)
安装
让 Codex 协助安装,新建任务发送:
阅读 https://raw.githubusercontent.com/LycheeAILab/avatar-forge/main/INSTALL.md ,帮我安装Avatar Forge。
或手动安装,作为 Codex 的 AI Agent 插件添加:
安装后新建一个 Codex 任务,使插件在新会话中加载。
日常使用
把拥有合法使用权的素材交给 Codex,直接描述目标即可:
使用 Avatar Forge,把这张人物图片、已授权参考声音和口播稿制作成一条完整的数字人口播视频。
Codex 会自动在各阶段之间安全传递结果。对于想做工作流搭建的用户,这种「描述目标、由 Agent 选流程」的方式尤其顺手。
我的使用感受
把一个静态头像变成能念稿的数字人,体验上最直观的收获是「省事」:不必录音、不必对嘴型,给图和稿就能出片。流水线可恢复的设计也很贴心,长任务中断后能接着跑。相对不足是它深度依赖 LycheeAILab 的云端能力(语音克隆、快速克隆、最终推理都在其平台完成),离线本地化有限。把它归为效率工具 毫不为过;如果你在做工具推荐 类内容,它值得被写进清单;在软件发现 维度,它是近期少见的 Agent 原生数字人方案。把它也归到实用软件 同样合适。
官方网站
https://github.com/LycheeAILab/avatar-forge
下载地址
https://pan.quark.cn/s/abfbdc3a88a1







