
对做换装短视频的人来说,AI生产力 的瓶颈往往不在模型,而在提示词组织:人物身份、服装方案、拼贴布局、换装触发、动作连续性和声音节点是六件事,却通常要分开想、分开写、分开调试。本文先讲这个 Skill 的定位与默认规则,再展开它内置的 12 种换装机制和工作模式,最后给出安装步骤与上手建议。
女性换装导演 female-outfit-director 是一个面向 Codex 及 Skills 兼容智能体的中文工作流 Skill,由 liyue-aigc 维护并托管在 GitHub 上,归档在 jamecling 的 AI工具 分类下。它的职责是生成「同一位成年女性、多套穿搭拼贴首帧、卡点换装视频」的完整制作方案:把人物设定、服装方案、拼贴布局、换装机制、动作连续性和声音节点整理成可直接投喂给图像与视频生成模型的结构化提示词。
需要说清楚的是,这个仓库只提供提示词导演工作流,本身不包含第三方图像或视频生成服务——产出的是参数锁定结果、首帧图片提示词、逐段视频时间轴、精简视频提示词与负面提示词这五份文本。
项目以 MIT 协议 开源,当前 Skill 版本 1.3,仓库结构很轻:skill/ 下是 SKILL.md、agents/openai.yaml 与 references/,docs/ 下放安装指南与首次使用教程。
场景痛点
做一条换装视频,最耗神的往往不是生成,而是「让生成结果保持一致」:同一张脸要在不同提示词里反复描述,五套服装写进一段话时模型经常把两套衣服叠穿,出了拼贴首帧后视频里的人物飞入又和首帧的小人物位置对不上。
换装机制本身也是麻烦来源。古风大袖与现代街拍适合的转场完全不同,8 秒内做 4 次变装,动作重心得连得上、袖摆裙摆要有重力、卡点音效得落在换装完成那一帧。这些约束散落在提示词里,改一处就要重排整段。对把换装视频当日常内容产出的 效率工具 使用者来说,这类重复劳动最消耗时间。
核心功能
参数锁定与自动补全
用户明确给出的参数一律视为锁定项,不得替换、弱化或删除,可锁定的维度包括角色锚点(脸型、五官、肤色、妆容、发型发色、头饰耳饰、气质)、国籍与族裔外观、五套造型、图片画幅与布局、视频时长比例机位、换装机制、动作基调、卡点时间与声音。
未指定的部分走系统补全并在结果中标记:无参考图且未指定国籍时默认原创中国成年女性(视觉年龄 22–28 岁)、比例 9:16、时长 8 秒、浅灰白无缝影棚背景、柔和漫射棚拍光、小人物白色手绘贴纸虚线描边。整个流程刻意不逐项追问,只有高影响信息完全缺失时才问一个简短问题。这样产出的 提示词 既可被模型直接消费,也便于事后核查哪些是用户锁定的、哪些属于系统补全。
默认五人拼贴版式
除非用户另行指定,首帧采用「中央偏右大型主体人物(约占画面宽度 60%–65%)+ 左上 / 右上 / 左侧中部 / 左下四个小人物、右下留白」版式。硬规则:正好 5 个人物且必须是同一角色、中央人物最大且不描边、四个小人物是沿真实身体轮廓裁切的完整抠像并各自带独立白色虚线描边、禁止第六个人物、禁止矩形缩略图替代抠像。这部分决定了整条视频的 AI绘画 母图结构。
12 种换装机制
references/transition-library.md 内置 12 种机制,覆盖不同服装与风格:
- M1 鼠标点击 + 完整人物飞入重合:默认机制,拼贴图与悬浮人物贴纸
- M2 长袖 / 袖摆遮镜:汉服、大袖袍、宽袖、披帛
- M3 旋身接力:汉服、礼服、优雅角色
- M4 披帛 / 丝带缠绕:神女、仙侠、飘逸长裙
- M5 团扇 / 折扇遮挡:古风贵女、雅致汉服
- M6 花瓣 / 云纹 / 水墨扩散:东方幻想、国风视觉
- M7 镜面 / 倒影同步:清冷、高级时尚、镜面空间
- M8 贴纸翻页 / 人物剪影翻转:lookbook、拼贴、小红书式视觉
- M9 分身归位融合:角色概念短片、多人格衣橱
- M10 步伐 / 跺脚 / 手势卡点:现代穿搭、强节奏内容
- M11 发簪 / 耳饰 / 配饰触发:古风人物、高识别度饰品
- M12 衣纹生长 / 刺绣蔓延:汉服、金线刺绣、东方美学
未指定时按服装类型自动选用:拼贴贴纸互动走 M1,汉服大袖或披帛优先 M2、其次 M5,古风贵女走 M5,强拼贴设计走 M8,强节奏现代穿搭走 M10。组合上有限制——短视频里不要一次混用超过 2 种主机制,8 秒 4 次变装最稳的做法是统一用一种。
M1 的「复制飞入、原位消耗」
默认机制 M1 的顺序是:点击目标小人物 → 复制出完整人物抠像作为飞入副本 → 原位置的目标小人物立即移除并留空 → 副本沿斜线飞向中央并放大 → 白色虚线始终贴合副本轮廓 → 与中央人物的头、肩、腰、动作姿态重合后切换服装,副本与虚线同时消失。规则反复强调:飞入的是完整人物副本而非单独衣服或矩形卡片,原位置不保留也不弹回,重合后不留双影。
时间轴、连续性与镜头
默认 8 秒对应 5 套造型(初始造型 + 4 次换装),换装完成点约在 1.25 / 2.95 / 4.40 / 6.55 秒;时长变化时按相对 8 秒等比例缩放,最后一段必须保留最终造型展示时间。每段时间轴要写全时间范围、当前造型、人物动作、换装触发、运动方向、完成时刻与必要音效。
动作连续性要求换装前后重心、旋转方向、手臂轨迹、头部朝向连续,不因换衣重置姿势;汉服、长裙、披帛、流苏要有自然重力与转身惯性。镜头默认固定高机位(位于人物前上方、向下约 30–35°),全程不推拉、不摇镜、不变焦。声音默认无背景音乐,只保留服务于换装节点的点击与卡点音效。这部分输出直接对应 视频剪辑 阶段的执行脚本,也归档在 jamecling 的 影音编辑 分类下。
四种工作模式
- 模式 A 直接生成:已有参考图或足够信息时,锁定已知参数、补全低风险缺失项、直接输出提示词与脚本
- 模式 B 参数推荐:用户说「推荐几组参数」时,先输出 4–8 组差异明显的组合,选定后再进入模式 A
- 模式 C 参考图提取:上传参考图时提取可见外貌、族裔外观、年龄感、发型头饰耳饰,区分中央主造型与四周造型,图片里已明确的设定不被文字模板覆盖
- 模式 D 换装机制改造:已有脚本只想换变装方式时,保留人物、服装、镜头、时长、布局,只替换触发与动作
安装与使用
前置条件:支持本地 Skills 的 Codex 或兼容智能体。使用参考图时建议搭配具备图像理解能力的模型。它属于 jamecling skill 分类下的 Skills 生态组件。
安装步骤(完整说明见仓库 docs/INSTALLATION.md):
安装后重新打开 Codex 任务,用 $female-outfit-director 触发即可:
首次使用建议先看仓库里的 使用教程 文档 docs/FIRST_USE.md。作为 GitHub精选 里面向提示词编排的 AI自动化 类 工具推荐,它更适合已经明确知道自己要什么风格、只是不想反复调提示词的场景。
我的使用感受
这个 Skill 的价值不在替用户生成视频,而在把换装视频里最容易出错的一致性约束提前写死:五人拼贴硬规则、M1 的原位消耗、动作连续性、衣料物理与卡点时间。最实用的是参数锁定机制——用户给过的设定不会被默认值覆盖,连续改稿时省了不少返工。它不负责出图出片,产出质量仍取决于用户接入的图像与视频模型。
官方网站
项目地址
GitHub:https://github.com/liyue-aigc/female-outfit-director
下载地址
https://pan.quark.cn/s/a4fc8ca938af







