Vox Director AI视频生成工具:自动生成拼贴风自媒体视频完整工作流

在短视频内容创作越来越依赖视觉表达的今天,如何快速完成选题策划、脚本撰写、画面设计、动画制作、配音、字幕以及最终剪辑,已经成为很多内容创作者面临的问题。

传统视频制作流程通常需要多个工具配合完成,从文字生成图片,到图片动画化,再到后期剪辑和声音处理,每一个环节都需要人工参与,对于个人创作者来说,制作一条高质量讲解视频往往需要投入大量时间。

Vox Director(拼贴动效导演)尝试解决这一流程问题,它是一款面向编码 Agent 的通用 Agent Skill,通过自动化工作流,将一个简单的选题转换成完整的 Vox 风格拼贴讲解或广告视频。

根据项目介绍,Vox Director 的核心理念是:

一个选题进入,一条成片输出。

用户只需要提供一句话主题,系统即可自动完成脚本、拼贴关键帧、动态效果、旁白、配乐、字幕以及视频合成流程,最终输出 MP 4 文件。

该项目作为一个通用 Agent 技能运行,后端完整依赖 Atlas Cloud API,本地使用 ffmpeg 完成视频合成,支持 Claude Code、Codex 等能够读取工作流并执行脚本的编码 Agent。

Vox Director 是什么?

Vox Director 的核心定位并不是一个传统意义上的视频剪辑软件,而是一套 AI 驱动的视频生产流程。

它借鉴了 Vox 讲解片中的现代编辑风格,将纸质拼贴视觉语言融入 AI 视频生成流程。

项目采用的视觉方向包括:

纸质拼贴风格

Vox Director 的画面风格围绕现代编辑感的纸质拼贴展开,包括:

  • 手撕纸片效果;
  • 毛边纸张质感;
  • 胶带元素;
  • 半调网点;
  • 报纸剪贴效果;
  • 大号剪纸标题;
  • 高对比度平涂色块。

每一个镜头都会先生成一张完整的拼贴海报,再通过 AI 动效让画面产生动态变化,使静态设计转变为具有叙事感的视频画面。

这种设计思路与传统视频模板不同,它更强调每一个镜头本身就是一张具有视觉表达能力的海报。

从一个选题自动生成完整视频流程

Vox Director 将整个视频生产过程拆分成多个阶段,并通过 beats.json 文件驱动整个项目流程。

完整流程如下:

1. 分镜脚本生成

用户输入一个主题后,系统首先进行故事结构设计。

这一阶段会:

  • 选择叙事弧线;
  • 设计镜头节奏;
  • 生成 beats.json。

项目设置了第一个人工决策点:

用户需要确认分镜脚本,然后进入后续生成流程。这种设计避免 AI 在完全无人干预情况下生成偏离主题的视频,让创作者仍然掌握内容方向。

2. 风格试片选择

完成脚本后,系统会针对同一个镜头生成 3~4 种不同主题风格的试片。用户可以查看不同视觉方向,并选择最终使用的风格方案。

这也是 Vox Director 保留人工参与的重要环节。创作者不需要从零设计视觉风格,但可以在关键节点做最终选择。

3. AI 生成拼贴关键帧

确定视觉方向后,系统会为每个镜头生成一张拼贴海报作为关键帧。

该阶段使用:

google/nano-banana-2/text-to-image

生成每拍对应的拼贴视觉画面。

项目强调,拼贴风格的核心诞生于生图阶段。

也就是说:

如果关键帧本身没有形成完整的拼贴视觉语言,后续动画处理无法真正补救。因此,撕纸、剪纸、网点、标题文字等视觉元素都会直接融入生成图片中。

多种视频输入模式

除了从零生成视频之外,Vox Director 还支持不同内容输入形式。

项目提供三种工作路径:

B-roll:从一个选题生成完整视频

这是默认的视频生成方式。

用户提供一个主题,系统自动完成:

  • 脚本;
  • 拼贴画面;
  • 动效;
  • 旁白;
  • 配乐;
  • 字幕;
  • 视频合成。

最终生成完整 MP 4 文件。

例如:

“制作一条介绍墨西哥街头美食的 Vox 风格视频。”

系统即可围绕该主题完成完整创作流程。

A-roll:已有口播视频转拼贴风

如果用户已经拥有真人口播视频,Vox Director 可以进一步处理。

它会:

  • 使用 ASR 自动切分视频;
  • 对内容套用拼贴视觉风格;
  • 保留真人脸部、口型以及手势。

该流程使用:

gemini-omni-flash/video-edit

如果失败,会自动重试:

seedance-2.0/reference-to-video

这种方式适合:

  • 知识类视频;
  • 个人 IP 内容;
  • 产品介绍视频。

C-roll:静态图片生成动态拼贴视频

如果只有一张照片,例如:

  • 自拍照片;
  • 产品图片;

Vox Director 可以将主体抠出,并转换成具有摄影质感的贴纸元素。

项目强调:

主体不会被重新绘制,而是保留原始主体,通过拼贴方式融入新的海报画面。

该流程使用:

google/nano-banana-2/edit

同时支持将旁白声音克隆为主体本人的声音。

AI 动效让拼贴海报真正动起来

Vox Director 的动画阶段采用两种方式。

AI 视频模型驱动

默认路径是:

将完整拼贴海报输入 AI 视频模型,让整张海报产生动态效果。

项目称其为:

“活海报”路径。

主要适用于:

  • 信息讲解;
  • 广告展示;
  • 知识内容。

本地关键帧动画引擎

如果需要更加戏剧化的效果,例如:

  • 零件逐个飞入;
  • 元素拆解组合;
  • 精确控制动画位置;

可以使用本地关键帧引擎。

该方式具有:

  • 无内容审核;
  • 像素级精确控制;

尤其适合真人内容制作。

旁白、配乐、字幕自动完成

视频视觉完成后,Vox Director 会继续处理声音部分。

系统自动生成:

  • AI 旁白;
  • 背景音乐;
  • 字幕;
  • 水印。

其中:

旁白使用:

xai/tts-v1

真人声音克隆使用:

bytedance/seed-audio-1.0

背景音乐使用:

minimax/music-2.6

最终通过 ffmpeg 完成:

  • 视频拼接;
  • 配乐与旁白自动闪避;
  • 字幕烧录;
  • 水印添加。

输出:

final.mp4

技术架构与模型体系

Vox Director 的整体架构围绕 Agent Skill 工作流设计,通过多个 AI 模型协同完成视频生产流程。项目本身并不提供独立的视频编辑界面,而是作为一个可以被编码 Agent 调用的技能运行。

根据 README 介绍,Vox Director 后端全部运行在 Atlas Cloud API 之上,本地主要负责脚本执行、资源处理以及最终的视频合成工作。它支持 Claude Code、Codex 等能够读取工作流并运行脚本的编码 Agent。

整个系统通过不同模型分别承担不同任务,每个阶段都有明确职责。

关键帧生成模型

google/nano-banana-2/text-to-image

主要用于生成每个镜头对应的拼贴海报关键帧。

在 Vox Director 的工作流中,关键帧是整个视觉风格的核心,因为所有拼贴元素都会在图片生成阶段完成,包括:

  • 撕纸纹理;
  • 剪纸效果;
  • 网点元素;
  • 标题文字;
  • 色彩布局。

项目强调,风格诞生于生图阶段,后续动画只是让已经完成的海报产生动态效果。

图片转视频模型

google/gemini-omni-flash/image-to-video

用于非真人内容的拼贴海报动画生成。

它负责将静态关键帧转化为动态画面,让原本类似杂志封面的视觉设计拥有运动效果。

kwaivgi/kling-video-o 3-pro/image-to-video

主要用于真人内容或者品牌类视频动效。

相比普通图生视频流程,该模型应用于需要保持人物特征和品牌素材一致性的场景。

视频编辑模型

google/gemini-omni-flash/video-edit

用于 A-roll 模式,也就是已有口播视频转拼贴风格。

该流程能够对真人视频进行风格转换,同时保留:

  • 人脸;
  • 口型;
  • 手势。

图片编辑模型

google/nano-banana-2/edit

用于 C-roll 模式。

当用户只有一张照片时,系统会通过图片编辑能力,将主体融入拼贴视频流程。

声音生成模型

Vox Director 同样将声音制作流程自动化。

xai/tts-v 1

用于普通 AI 旁白生成。

bytedance/seed-audio-1.0

用于声音克隆场景,可以让生成旁白使用真人本人的声音。

音乐生成模型

minimax/music-2.6

用于自动生成视频背景音乐。

素材处理模型

youchuan/v 8.1/remove-background

用于高级路径下的素材抠图处理。

模型自动更新机制

由于 AI 模型版本变化较快,Vox Director 并没有固定所有模型版本。

项目说明,技能运行前会通过:

GET https://api.atlascloud.ai/api/v1/models

获取最新模型列表。

这种设计能够减少因为模型更新导致工作流失效的问题。

安装教程

环境准备

Vox Director 是一个 Agent Skill,因此使用前需要准备对应运行环境。

根据项目要求,需要:

一个编码 Agent

支持:

  • Claude Code;
  • Codex;
  • 或类似能够读取工作流、执行脚本的 Agent。

Atlas Cloud API Key

项目所有 AI 能力均依赖 Atlas Cloud API。

需要提前准备 API Key。

ffmpeg 与 ffprobe

用于最终视频处理和合成。

安装方式:

brew install ffmpeg

Python 3 与 Pillow

用于:

  • 字幕叠加;
  • 水印处理。

安装:

pip install pillow

安装 Vox Director Skill

项目提供两种安装方式。

方式一:从仓库安装

执行:

git clone https://github.com/Alisa0808/vox-director.git ~/.claude/skills/vox-director

这种方式适合希望直接获取源码,并跟踪项目更新的用户。

方式二:安装打包技能文件

项目提供:

vox-director.skill

用户可以下载该文件,然后在 Claude 技能界面中完成安装。

配置 Atlas Cloud API

安装完成后,需要设置 API Key:

export ATLASCLOUD_API_KEY="sk-..."

配置完成后,Agent 才能够调用后端 AI 服务。

快速开始教程

完成安装后,可以直接向编码 Agent 描述需求。

例如:

做一条 Vox 风格的拼贴视频,介绍墨西哥街头美食——全英文,16:9,15 秒。

随后 Agent 会自动执行:

第一步:生成分镜脚本

系统首先创建视频结构,并生成:

beats.json

用户确认脚本后继续。

第二步:生成风格试片

系统生成多个视觉方向供选择。

用户选择喜欢的风格。

第三步:生成关键帧

AI 根据镜头生成拼贴海报。

第四步:生成动态效果

静态海报转换为动态视频。

第五步:生成声音

自动添加:

  • 旁白;
  • 配乐。

第六步:视频合成

最终输出:

out/<项目>/final.mp4

我的使用体验

从整个工作流设计来看,Vox Director 最大的特点是把视频制作过程重新拆解成了一个适合 AI Agent 执行的流水线。

过去制作一条知识类或者产品介绍视频,需要人工完成:

选题规划 → 写脚本 → 找素材 → 设计画面 → 制作动画 → 配音 → 剪辑。

而 Vox Director 将这些环节拆成多个 AI 可执行阶段,同时保留两个关键人工节点:

  • 确认分镜脚本;
  • 选择视觉风格。

这种设计比较符合实际创作需求,因为完全自动化的视频生成往往容易出现内容方向偏差,而 Vox Director 选择在关键节点让创作者参与。

从内容创作者角度来看,它更像一个“AI 视频导演助手”。

创作者负责:

  • 提供主题;
  • 判断方向;
  • 选择风格。

AI 负责:

  • 生成素材;
  • 制作动画;
  • 处理声音;
  • 完成合成。

尤其对于需要持续输出内容的自媒体作者来说,这种流程能够明显降低重复制作成本。

不过,根据项目定位,它仍然依赖 Atlas Cloud API 和编码 Agent 环境,因此更适合熟悉 AI 工具链、开发环境或者愿意尝试 Agent 工作流的用户。

对于普通视频用户来说,它目前并不是传统意义上的“一键剪辑软件”,而是一套面向 AI 创作流程的实验型视频生产工具。

总结

Vox Director 将 AI Agent、图像生成、视频生成、声音合成以及自动化脚本流程结合起来,构建了一套完整的 Vox 风格拼贴视频生产体系。

它最大的价值,在于重新定义了视频制作流程:

从人工操作多个软件,转变为通过 Agent 驱动多个 AI 能力协同完成。

通过 B-roll、A-roll、C-roll 三种输入方式,Vox Director 覆盖了从零生成内容、已有口播优化以及图片转视频等不同创作场景。

对于希望探索 AI 自媒体视频生产、自动化内容创作以及 Agent 工作流的人来说,Vox Director 提供了一种值得参考的新方向。

它展示的不只是一个视频生成工具,更是一套未来 AI 内容生产流程的实验方案。

官方网站

https://github.com/Alisa0808/vox-director

下载地址

https://pan.quark.cn/s/1fbd34943f94

相关推荐

Avatar photo

JameCling

我是 格律诗的软件世界 的作者,一名专注于软件工具、AI 技术和数字效率领域的独立研究者。
多年来,我持续关注互联网工具的发展趋势,体验不同平台的软件产品,并研究它们如何帮助用户提升效率。
我的工作不仅是整理软件信息,而是通过实际测试、功能分析和使用场景研究,帮助用户判断一个工具是否真正值得使用。
格律诗的软件世界 的每一篇文章都希望提供真实、有价值的信息,包括工具特点、使用方法、优缺点分析以及适合的人群。
我相信,好的工具能够改变工作方式,而准确的信息能够帮助用户做出更好的选择。