
在短视频内容创作越来越依赖视觉表达的今天,如何快速完成选题策划、脚本撰写、画面设计、动画制作、配音、字幕以及最终剪辑,已经成为很多内容创作者面临的问题。
传统视频制作流程通常需要多个工具配合完成,从文字生成图片,到图片动画化,再到后期剪辑和声音处理,每一个环节都需要人工参与,对于个人创作者来说,制作一条高质量讲解视频往往需要投入大量时间。
Vox Director(拼贴动效导演)尝试解决这一流程问题,它是一款面向编码 Agent 的通用 Agent Skill,通过自动化工作流,将一个简单的选题转换成完整的 Vox 风格拼贴讲解或广告视频。
根据项目介绍,Vox Director 的核心理念是:
一个选题进入,一条成片输出。
用户只需要提供一句话主题,系统即可自动完成脚本、拼贴关键帧、动态效果、旁白、配乐、字幕以及视频合成流程,最终输出 MP 4 文件。
该项目作为一个通用 Agent 技能运行,后端完整依赖 Atlas Cloud API,本地使用 ffmpeg 完成视频合成,支持 Claude Code、Codex 等能够读取工作流并执行脚本的编码 Agent。

Vox Director 是什么?
Vox Director 的核心定位并不是一个传统意义上的视频剪辑软件,而是一套 AI 驱动的视频生产流程。
它借鉴了 Vox 讲解片中的现代编辑风格,将纸质拼贴视觉语言融入 AI 视频生成流程。
项目采用的视觉方向包括:
纸质拼贴风格
Vox Director 的画面风格围绕现代编辑感的纸质拼贴展开,包括:
- 手撕纸片效果;
- 毛边纸张质感;
- 胶带元素;
- 半调网点;
- 报纸剪贴效果;
- 大号剪纸标题;
- 高对比度平涂色块。
每一个镜头都会先生成一张完整的拼贴海报,再通过 AI 动效让画面产生动态变化,使静态设计转变为具有叙事感的视频画面。
这种设计思路与传统视频模板不同,它更强调每一个镜头本身就是一张具有视觉表达能力的海报。
从一个选题自动生成完整视频流程
Vox Director 将整个视频生产过程拆分成多个阶段,并通过 beats.json 文件驱动整个项目流程。
完整流程如下:
1. 分镜脚本生成
用户输入一个主题后,系统首先进行故事结构设计。
这一阶段会:
- 选择叙事弧线;
- 设计镜头节奏;
- 生成 beats.json。
项目设置了第一个人工决策点:
用户需要确认分镜脚本,然后进入后续生成流程。这种设计避免 AI 在完全无人干预情况下生成偏离主题的视频,让创作者仍然掌握内容方向。
2. 风格试片选择
完成脚本后,系统会针对同一个镜头生成 3~4 种不同主题风格的试片。用户可以查看不同视觉方向,并选择最终使用的风格方案。
这也是 Vox Director 保留人工参与的重要环节。创作者不需要从零设计视觉风格,但可以在关键节点做最终选择。
3. AI 生成拼贴关键帧
确定视觉方向后,系统会为每个镜头生成一张拼贴海报作为关键帧。
该阶段使用:
google/nano-banana-2/text-to-image
生成每拍对应的拼贴视觉画面。
项目强调,拼贴风格的核心诞生于生图阶段。
也就是说:
如果关键帧本身没有形成完整的拼贴视觉语言,后续动画处理无法真正补救。因此,撕纸、剪纸、网点、标题文字等视觉元素都会直接融入生成图片中。
多种视频输入模式
除了从零生成视频之外,Vox Director 还支持不同内容输入形式。
项目提供三种工作路径:
B-roll:从一个选题生成完整视频
这是默认的视频生成方式。
用户提供一个主题,系统自动完成:
- 脚本;
- 拼贴画面;
- 动效;
- 旁白;
- 配乐;
- 字幕;
- 视频合成。
最终生成完整 MP 4 文件。
例如:
“制作一条介绍墨西哥街头美食的 Vox 风格视频。”
系统即可围绕该主题完成完整创作流程。
A-roll:已有口播视频转拼贴风
如果用户已经拥有真人口播视频,Vox Director 可以进一步处理。
它会:
- 使用 ASR 自动切分视频;
- 对内容套用拼贴视觉风格;
- 保留真人脸部、口型以及手势。
该流程使用:
gemini-omni-flash/video-edit
如果失败,会自动重试:
seedance-2.0/reference-to-video
这种方式适合:
- 知识类视频;
- 个人 IP 内容;
- 产品介绍视频。
C-roll:静态图片生成动态拼贴视频
如果只有一张照片,例如:
- 自拍照片;
- 产品图片;
Vox Director 可以将主体抠出,并转换成具有摄影质感的贴纸元素。
项目强调:
主体不会被重新绘制,而是保留原始主体,通过拼贴方式融入新的海报画面。
该流程使用:
google/nano-banana-2/edit
同时支持将旁白声音克隆为主体本人的声音。
AI 动效让拼贴海报真正动起来
Vox Director 的动画阶段采用两种方式。
AI 视频模型驱动
默认路径是:
将完整拼贴海报输入 AI 视频模型,让整张海报产生动态效果。
项目称其为:
“活海报”路径。
主要适用于:
- 信息讲解;
- 广告展示;
- 知识内容。
本地关键帧动画引擎
如果需要更加戏剧化的效果,例如:
- 零件逐个飞入;
- 元素拆解组合;
- 精确控制动画位置;
可以使用本地关键帧引擎。
该方式具有:
- 无内容审核;
- 像素级精确控制;
尤其适合真人内容制作。
旁白、配乐、字幕自动完成
视频视觉完成后,Vox Director 会继续处理声音部分。
系统自动生成:
- AI 旁白;
- 背景音乐;
- 字幕;
- 水印。
其中:
旁白使用:
xai/tts-v1
真人声音克隆使用:
bytedance/seed-audio-1.0
背景音乐使用:
minimax/music-2.6
最终通过 ffmpeg 完成:
- 视频拼接;
- 配乐与旁白自动闪避;
- 字幕烧录;
- 水印添加。
输出:
final.mp4
技术架构与模型体系
Vox Director 的整体架构围绕 Agent Skill 工作流设计,通过多个 AI 模型协同完成视频生产流程。项目本身并不提供独立的视频编辑界面,而是作为一个可以被编码 Agent 调用的技能运行。
根据 README 介绍,Vox Director 后端全部运行在 Atlas Cloud API 之上,本地主要负责脚本执行、资源处理以及最终的视频合成工作。它支持 Claude Code、Codex 等能够读取工作流并运行脚本的编码 Agent。
整个系统通过不同模型分别承担不同任务,每个阶段都有明确职责。
关键帧生成模型
google/nano-banana-2/text-to-image
主要用于生成每个镜头对应的拼贴海报关键帧。
在 Vox Director 的工作流中,关键帧是整个视觉风格的核心,因为所有拼贴元素都会在图片生成阶段完成,包括:
- 撕纸纹理;
- 剪纸效果;
- 网点元素;
- 标题文字;
- 色彩布局。
项目强调,风格诞生于生图阶段,后续动画只是让已经完成的海报产生动态效果。
图片转视频模型
google/gemini-omni-flash/image-to-video
用于非真人内容的拼贴海报动画生成。
它负责将静态关键帧转化为动态画面,让原本类似杂志封面的视觉设计拥有运动效果。
kwaivgi/kling-video-o 3-pro/image-to-video
主要用于真人内容或者品牌类视频动效。
相比普通图生视频流程,该模型应用于需要保持人物特征和品牌素材一致性的场景。
视频编辑模型
google/gemini-omni-flash/video-edit
用于 A-roll 模式,也就是已有口播视频转拼贴风格。
该流程能够对真人视频进行风格转换,同时保留:
- 人脸;
- 口型;
- 手势。
图片编辑模型
google/nano-banana-2/edit
用于 C-roll 模式。
当用户只有一张照片时,系统会通过图片编辑能力,将主体融入拼贴视频流程。
声音生成模型
Vox Director 同样将声音制作流程自动化。
xai/tts-v 1
用于普通 AI 旁白生成。
bytedance/seed-audio-1.0
用于声音克隆场景,可以让生成旁白使用真人本人的声音。
音乐生成模型
minimax/music-2.6
用于自动生成视频背景音乐。
素材处理模型
youchuan/v 8.1/remove-background
用于高级路径下的素材抠图处理。
模型自动更新机制
由于 AI 模型版本变化较快,Vox Director 并没有固定所有模型版本。
项目说明,技能运行前会通过:
GET https://api.atlascloud.ai/api/v1/models
获取最新模型列表。
这种设计能够减少因为模型更新导致工作流失效的问题。
安装教程
环境准备
Vox Director 是一个 Agent Skill,因此使用前需要准备对应运行环境。
根据项目要求,需要:
一个编码 Agent
支持:
- Claude Code;
- Codex;
- 或类似能够读取工作流、执行脚本的 Agent。
Atlas Cloud API Key
项目所有 AI 能力均依赖 Atlas Cloud API。
需要提前准备 API Key。
ffmpeg 与 ffprobe
用于最终视频处理和合成。
安装方式:
brew install ffmpeg
Python 3 与 Pillow
用于:
- 字幕叠加;
- 水印处理。
安装:
pip install pillow
安装 Vox Director Skill
项目提供两种安装方式。
方式一:从仓库安装
执行:
git clone https://github.com/Alisa0808/vox-director.git ~/.claude/skills/vox-director
这种方式适合希望直接获取源码,并跟踪项目更新的用户。
方式二:安装打包技能文件
项目提供:
vox-director.skill
用户可以下载该文件,然后在 Claude 技能界面中完成安装。
配置 Atlas Cloud API
安装完成后,需要设置 API Key:
export ATLASCLOUD_API_KEY="sk-..."
配置完成后,Agent 才能够调用后端 AI 服务。
快速开始教程
完成安装后,可以直接向编码 Agent 描述需求。
例如:
做一条 Vox 风格的拼贴视频,介绍墨西哥街头美食——全英文,16:9,15 秒。
随后 Agent 会自动执行:
第一步:生成分镜脚本
系统首先创建视频结构,并生成:
beats.json
用户确认脚本后继续。
第二步:生成风格试片
系统生成多个视觉方向供选择。
用户选择喜欢的风格。
第三步:生成关键帧
AI 根据镜头生成拼贴海报。
第四步:生成动态效果
静态海报转换为动态视频。
第五步:生成声音
自动添加:
- 旁白;
- 配乐。
第六步:视频合成
最终输出:
out/<项目>/final.mp4
我的使用体验
从整个工作流设计来看,Vox Director 最大的特点是把视频制作过程重新拆解成了一个适合 AI Agent 执行的流水线。
过去制作一条知识类或者产品介绍视频,需要人工完成:
选题规划 → 写脚本 → 找素材 → 设计画面 → 制作动画 → 配音 → 剪辑。
而 Vox Director 将这些环节拆成多个 AI 可执行阶段,同时保留两个关键人工节点:
- 确认分镜脚本;
- 选择视觉风格。
这种设计比较符合实际创作需求,因为完全自动化的视频生成往往容易出现内容方向偏差,而 Vox Director 选择在关键节点让创作者参与。
从内容创作者角度来看,它更像一个“AI 视频导演助手”。
创作者负责:
- 提供主题;
- 判断方向;
- 选择风格。
AI 负责:
- 生成素材;
- 制作动画;
- 处理声音;
- 完成合成。
尤其对于需要持续输出内容的自媒体作者来说,这种流程能够明显降低重复制作成本。
不过,根据项目定位,它仍然依赖 Atlas Cloud API 和编码 Agent 环境,因此更适合熟悉 AI 工具链、开发环境或者愿意尝试 Agent 工作流的用户。
对于普通视频用户来说,它目前并不是传统意义上的“一键剪辑软件”,而是一套面向 AI 创作流程的实验型视频生产工具。
总结
Vox Director 将 AI Agent、图像生成、视频生成、声音合成以及自动化脚本流程结合起来,构建了一套完整的 Vox 风格拼贴视频生产体系。
它最大的价值,在于重新定义了视频制作流程:
从人工操作多个软件,转变为通过 Agent 驱动多个 AI 能力协同完成。
通过 B-roll、A-roll、C-roll 三种输入方式,Vox Director 覆盖了从零生成内容、已有口播优化以及图片转视频等不同创作场景。
对于希望探索 AI 自媒体视频生产、自动化内容创作以及 Agent 工作流的人来说,Vox Director 提供了一种值得参考的新方向。
它展示的不只是一个视频生成工具,更是一套未来 AI 内容生产流程的实验方案。
官方网站
https://github.com/Alisa0808/vox-director
下载地址
https://pan.quark.cn/s/1fbd34943f94







