AI产品评测

我给 AI 写了本“导演手册”,它先学会的不是拍,而是停手|Flova Skill 实测

作者:AI Academia4 次浏览 来源:AI Academia
我给 AI 写了本“导演手册”,它先学会的不是拍,而是停手|Flova Skill 实测

第一次测试这个 Skill 时,我没有让 Flova 生成任何画面。

第一次测试这个 Skill 时,我没有让 Flova 生成任何画面。

我给它一份已经锁定的 30 秒短剧剧本,同时写下四个限制:只做素材审计,不创建成片规格,不创建分镜,不生成任何媒体。

文章配图

我提交锁定剧本,并限定本轮只做素材审计,Flova 没有抢跑。它把已经收到、仍然缺失、彼此冲突和不得修改的内容逐项列出来,然后停在「等待用户确认」。

最意外的不是后面生成的画面,而是写进 Skill 的规则改变了 AI 的行为:材料不齐时停,规格没确认时停,分镜没批准时停;当授权扩大到完整成片,它仍要服从预算、模型和剧情边界。

其实,影视 Skill 不是更长的提示词,而是一份让 AI 知道怎么做、何时停、出错后退回哪一步的岗位手册。

如果你正在用 AI 做短剧、广告、MV,或者已经受够了人物漂移、镜头断裂和反复重生,这套写法比继续堆提示词更值得学。

01

先别把 Skill 当成长提示词

最近,导演 Skill、美术 Skill、分镜 Skill 突然多了起来。一个几 KB 的文件,好像就能装下一位导演。

最容易想到的写法,是先给 AI 一个厉害身份:

你是一位世界级电影导演,精通叙事、摄影、美术、表演和剪辑。请用电影级语言完成任务。

这类 Prompt 不是完全没用。它能把回答往影视专业方向推一点,但「世界级」「电影感」「高级」都没有告诉 AI 具体怎样工作。

一场对话戏,什么时候切近景?角色参考图没上传,能不能先生成?镜头做坏了,是重写提示词,还是退回剧本、调度或分镜?这些判断没有写出来,AI 只能继续猜。

标准意义上的 Agent Skill,更像一组可以按需读取的工作文件:

film-direction-skill/

├── SKILL.md # 调用条件、步骤、规则

├── references/ # 视听语言、设定、模型说明

├── scripts/ # 检查、转码或接口调用

└── assets/ # 角色卡、场景卡、审片模板

Prompt 是一次临时交代,工作流规定几个工位如何连接,Skill 则把岗位手册、判断规则和验收表一起交给 AI。

CORE IDEA

Prompt 想要一个答案,Skill 保存的是一套做事方法。

文章配图

Prompt、工作流与 Skill 的区别:从一次任务到可判断、可验收的方法系统

Flova 的官方文档明确把 Skill 定义为 Agent 的「可复用视频创作流程」,并把它接入素材分析、故事板、媒体生成、提示词和剪辑。

这也是目前很多平台开始尝试的方向:影视平台不只提供模型,也开始提供保存创作方法的容器。

02

一个影视 Skill,只需要写清七件事

第一次写 Skill,很容易把剧本、导演、摄影、美术、声音和剪辑全塞进去,再起一个「世界顶级全能电影大师」的名字。

但真正好用的 Skill,通常从一个很小、很烦、反复出现的问题开始。比如:检查角色与道具是否连续;把 30 秒短剧拆成可生成镜头;素材没齐时禁止开工。

接着,把下面七件事写清楚。

01 / 07

它只解决什么

不要写「帮我生成一部电影」,要写「把锁定剧本拆成结构化分镜,并检查人物、场景和道具连续性」。范围越小,越容易验收。

02 / 07

什么时候调用

简介不是广告语。把任务、场景和动作写进去,例如:「当用户需要拆解短剧剧本、规划景别与运镜、绑定角色和场景参考时使用。」

03 / 07

必须收到什么

明确列出剧本、时长、画幅、角色图、场景图、道具图、声音、指定模型、预算和禁用项。资料没收到,就报告缺失,不能假装已经拥有。

04 / 07

按什么顺序判断

先审计材料,再锁定成片规格,之后做分镜、绑定素材、生成媒体、逐镜检查,最后才进时间线。知识要写成判断顺序,不是写成电影教材。

05 / 07

到哪里必须暂停

素材审计后、成片规格完成后、分镜完成后、即将增加成本前,都应该设置确认门。好 Skill 不只知道怎样往前跑,也知道什么时候不能自作主张。

06 / 07

每次交付长什么样

以分镜为例,固定镜头编号、时长、景别、机位、运镜、动作、光线、声音、参考素材、提示词和连续性备注。格式稳定,下游才能接得住。

07 / 07

什么叫做对了

验收要能落地:人物、服装、道具、空间和天气是否连续?每个镜头有没有叙事作用?成本是否超限?失败后还要规定返回路线——叙事不清回剧本,空间混乱回调度,角色漂移检查参考图和绑定,动作畸变才去调模型与提示词。

文章配图

一个能用的影视 Skill 要写清的七件事

把它压缩成一份最小骨架,大概是这样:

---

name: short-drama-production

description: 当用户需要把短剧剧本转成结构化分镜,并检查连续性时使用。

---

# 输入

- 锁定剧本、时长与画幅

- 角色、场景、道具参考

- 模型、预算与禁用项

# 步骤

1. 审计输入,列出缺失与冲突

2. 输出成片规格,等待确认

3. 输出结构化分镜,等待确认

4. 绑定素材,生成并逐镜验收

5. 只有合格镜头才能进入时间线

# 必须暂停

- 缺少关键参考素材

- 需要修改锁定剧情

- 分镜尚未确认

- 生成将明显增加成本

# 验收

- 连续性、叙事作用、素材绑定和成本全部通过

- 不合格任务返回对应的上游步骤

上面这份,是方便理解结构的最小骨架。真正放进 Flova 时,我写得更细:不只规定总流程,还分别约束素材分析、分镜设计、媒体生成、提示词和剪辑模块。

为了不让几千字模板打断后面的实测故事,我把完整可复制版本放在文末附录。后面出现的素材缺失暂停、三道确认门、成本闸门和返工路由,都不是临时口头提醒,而是从这份 Skill 里真正执行出来的。

文章配图

从素材审计到时间线:确认门把暂停、成本和返工写进生产流程

03

三道确认门,是怎样在对话里发生的

为了验证规则不是纸上谈兵,我给 Flova 安排了一支 30 秒悬疑短剧《雨夜来客》。故事只有两个人、一个便利店场景、一张旧照片和一把红伞。

第一轮,我只提交锁定剧本,没有提供角色定妆图、场景图、道具图和声音参考,并明确说:「只执行素材审计,不要创建 Final Video Spec,不要创建分镜,不要生成媒体。」

Flova 先把项目、时长、画幅、剧本、场景、角色和道具列为「已收到 / 已锁定」。

文章配图

Flova 返回素材审计中的已收到与已锁定内容

接着,它把缺失内容按影响程度拆开:两名角色和便利店参考图属于高影响;旧照片、红伞、音色、画外音、视觉风格和 BGM 属于中影响。

文章配图

Flova 把缺失素材及影响等级逐项列出

它没有用文字替我脑补,而是提出三个冲突项:画外音是谁、30 秒是否装得下台词与动作、湿透男人如何命名。

文章配图

Flova 将三个待澄清问题编号为 C-01 至 C-03

最后,它重新声明本轮禁止生成、禁止建规格、禁止建分镜,并明确回复:「审计已完成,现在暂停等待您的确认。」

文章配图

素材审计完成后,Flova 停下并等待用户确认

这就是第一道确认门。它验证的不是 AI 会不会列清单,而是:没有关键素材、没有用户裁决时,它会不会拒绝继续。

第二轮,我逐项解决 C-01—C-03:画外音来自电话另一端的匿名人;30 秒内不得删改剧情,只能控制表演和镜头时长;男性角色暂称「陌生男人」。同时补齐两名角色、便利店、旧照片、红伞、声音、画风和 300 积分测试上限。

但授权仍然只有一句:只创建 Final Video Spec,完成后暂停,不要创建故事板,不要生成媒体。

文章配图

我解决冲突项、补齐临时规格,并限定只创建 Final Video Spec

Flova 建立了约 30 秒、9:16、1080×1920、中文对白、低饱和冷青灰、红伞为唯一高饱和色的成片规格,然后回复:「阶段 2 已完成,Final Video Spec 已建立,现在暂停。」

文章配图

Flova 返回 Final Video Spec 核心参数并再次暂停

第三轮,我才批准进入叙事分析和结构化分镜,并把每镜必须包含的字段一次写清:时长、景别、机位、运镜、构图、表演、光线、声音、叙事作用、参考素材、提示词、连续性和模型。

文章配图

我批准阶段 3 和阶段 4,Flova 随后开始叙事分析与分镜

Flova 给出 8 个镜头,初版时长为 3、3、4、4、3、4、5、4 秒,合计 30 秒;声音层包含雨声、门铃、低频脉冲和三段对白。完成后,它第三次暂停,询问是否进入逐镜素材绑定。

文章配图

8 镜头合计 30 秒,分镜完成后暂停;我随后要求先做预算

到这里,Skill 改变的不是文风,而是推进权:先锁材料,再锁规格,再锁分镜。每通过一层,Agent 才获得下一层权限。

04

完整聊天记录里,藏着五个可复用的方法

方法一:每轮都写「允许、禁止、暂停」

第一轮允许素材审计,禁止规格、分镜和媒体;第二轮允许 Final Video Spec,禁止故事板和生成;第三轮允许叙事分析与分镜,完成后仍要暂停。

目标告诉 AI 往哪里走,禁止项防止它走过头,暂停条件把决定权交还给人。三项缺一,Agent 都可能把「下一步」误解成「全部做完」。

方法二:把模糊问题编号,不在长对话里反复找

画外音归属、时长风险和男性角色命名,被写成 C-01、C-02、C-03。下一轮我只需逐项回答,不必重新解释整份剧本。

编号还有一个好处:没有解决的问题不会悄悄消失。它会留在记录里,直到用户明确裁决。

方法三:区分「临时测试资产」和「正式锁定资产」

我允许 AI 为测试设计角色、场景和道具,但明确写道:这些只用于本轮测试,生成前仍需展示确认。

这句话很重要。允许 AI 试做,不等于把它的第一次答案变成项目设定。影视项目一旦把试验稿误当成锁定资产,后面的镜头越多,返工成本越高。

方法四:先预算,再生成;先单镜,再批量

分镜完成后,我没有直接批准 8 个镜头,而是先让 Flova 列出四张最小参考资产、拟用模型和预计积分,并强调「只做预算,不生成」。参考图通过后,再用 Shot_03 做代表镜头测试。

这套顺序验证的是最贵、最容易漂移的环节:角色和场景能否绑定,动作能否生成,指定模型与分辨率是否可用。单镜跑通后,批量授权才有依据。

方法五:批量授权不是放弃控制,而是改成异常时暂停

完整成片阶段,我一次性批准剩余镜头、声音、时间线和导出,不再要求每个正常镜头都停一次;但只要预计超预算、出现严重连续性冲突,或需要改变剧情、模型、分辨率,就必须暂停。

前期用频繁确认降低试错成本,后期用异常触发提高效率。Skill 不是让 AI 每一步都来请示,而是把必须请示的情况写准。

05

真正开始生成:四张参考图,再测试一个镜头

在阶段 5,我先对 Flova 说:

「列出生成临时参考资产所需的最小清单、拟用模型、每项预计积分和总计。只做预算,不生成。生成完成后也不能自动进入视频生成。」

Flova 返回四张最小清单:林夏、陌生男人、便利店、旧照片与红伞合并道具图;使用 Nano Banana TextToImage,估算单张 5—15 积分、合计 20—60 积分,并明确参考图完成后不会自动生成视频。

我批准的范围也只有这四张图。Flova 生成后回复:「现在强制暂停,等待逐图审阅。」

文章配图

Flova 生成的林夏角色参考图

文章配图

旧照片与红伞合并道具图,红伞握把出现偏差

结果并不完美。林夏和便利店基本守住了冷白光、低饱和方向;陌生男人看起来比设定的 35 岁更老;道具图里的红伞握把也从直柄漂成了弯柄。

我在下一轮对话中把两点偏差写进记录,但选择不重做。原因也写得很清楚:这是测试项目,偏差没有严重到破坏叙事,不值得为了追求完美继续抽卡。

接着,我只批准 Shot_03「男人压下照片」:绑定四张参考图,先生成一张 9:16 首帧,再生成约 4 秒视频;禁止生成其他镜头和音频,完成后必须暂停。

执行记录显示,首帧完成后,高成本分辨率触发了新的确认。我随后要求只比较方案、不生成,并最终批准 Seedance 2.0、MultiModalToVideo、720p,只完成 Shot_03。

文章配图

Shot_03 的视频中段:手掌将旧照片压在柜台上

从画面观察,手掌压下旧照片的动作能够读懂,手和照片没有出现明显畸变。这里我只能把它写成一次可用的代表镜头,不能把单镜成功扩大成「角色连续性已经解决」。

后续完整制作指令中,我确认前期四张参考图、Shot_03 首帧和视频的累计生成消耗为154 积分。这个数字来自用户指令中的阶段确认;它是批量制作前的预算基线,不是平台最终账单。

06

成片做出来了,聊天记录也抓住了两个漏洞

单镜通过后,我把总预算上限提高到 1000 积分,并在完整制作指令里写下:

「前期实际生成消耗 154 积分;新增实际消耗硬上限为 846 积分,总实际生成消耗不得超过 1000。继续生成其余 7 个镜头的首帧和视频,统一 9:16、720p;每镜必须传入所需角色、场景和道具参考。只有预计超预算、严重连续性冲突、需改变剧情、模型或分辨率时才暂停。」

执行记录显示,Flova 随后完成了剩余 7 张首帧、7 段视频和 2 条音频层,加上已经通过的 Shot_03,最终组成 8 个镜头、30 秒、9:16、720p 的 MP4。

文章配图

Flova 完整时间线:8 个视频片段、对白轨和环境声/BGM 轨

这次测试究竟在验证什么?

我们测试的并不是 Flova 能否一键生成一条可以直接发布的精品短剧,而是:当素材审计、制作规格、分镜确认、参考素材绑定、预算控制和逐镜质检都被写进 Skill 后,AI 能否按照一套可控、可确认、可追溯的影视流程完成任务。

文章配图

注:Flova 在完成素材审计、制作规格、分镜确认和素材绑定后,直接生成并组装的第一版测试成片。没有进行人工二次剪辑、调色、补帧或声音精修,因此片中的人物一致性、动作稳定性、镜头衔接、叙事节奏和音画问题均被原样保留。

最终回复把 8 个镜头全部标记为通过,报告「无返工」,并给出文件名雨夜来客_720p_final.mp4。但把用户要求和最终回复对照起来,仍然能看见两个漏洞。

第一个漏洞是成本报告没有闭合

我明确要求完成后报告实际新增积分和累计实际积分,Flova 最终却写道:「后续新增金额需要在界面中核查,助手无法读取实时扣费金额。」因此,本次材料只能确认前期 154 积分和 1000 积分硬上限,不能确认完整成片的最终实际消耗。

这也意味着,不能用余额与奖励变化反推最终实际消耗。V2 应增加一条:读取不到平台账单时,必须标记为未知,并要求用户提供账单截图;禁止自行反推。

第二个漏洞是分镜拆分和每镜时长发生了变化,却没有在组装前单独确认。

初版分镜是 3、3、4、4、3、4、5、4 秒;最终时间线变成 4、4、4、4、3、3、4、4 秒。总长仍然是 30 秒,但镜头内容的拆分和内部节奏已经变化。

这不一定让成片失败,却说明「总时长正确」不能替代「逐镜符合批准版本」。V2 还要再补一条:进入时间线前输出分镜差异表,镜头内容、顺序或时长发生变化时,必须重新确认。

这些瑕疵不是测试之外的“意外”,恰恰也是测试结果。Skill 没有让模型突然拥有导演级审美,但它让我们能够判断流程在哪里失效、问题应该退回哪个环节,以及下一版规则具体应该怎样修改。

所以,这次测试展示的不是最终成片质量的上限,而是 Skill 能否让一次 AI 影视制作变得可控、可查和可迭代。

聊天记录的价值就在这里。它不仅证明 Agent 做过什么,也能把「用户要求了什么、Agent 最后漏了什么」并排放在一起。

TAKEAWAY

每次失败,都应该让 Skill 多长出一条规则。

07

Skill 能管住流程,管不住创作

Skill 适合固定高频步骤、统一交付格式、检查素材缺口、维护角色和场景规则,也能在成本增加时暂停,把失败任务送回正确步骤。

它判断不了一个故事是否值得拍,也不会凭空获得导演的生活经验。它能让镜头接得上,却解释不了为什么非要这样接;能减少低级错误,遇到值得破例的地方,仍然要由人决定。

所以我依然不相信「一键生成电影」。这次实测最有价值的地方,恰恰不是 AI 自动跑完了 30 秒,而是它在关键位置没有自动跑。

未来的创作者交付的,可能不只是一部片,还会有一套让 AI 持续做出这类片的方法。

画面会越来越容易生成。知道为什么这样拍、哪里不能让步、出了问题该回到哪一步,仍然是人的工作。

下一次 AI 镜头出错,先别急着重写提示词。问清楚它错在剧本、分镜、素材绑定,还是模型参数,然后把这次失败写回 Skill。

你最想让 Skill 管住哪一种返工:角色漂移、镜头连续性,还是成本失控?

08

附录|我在 Flova 使用的完整 Skill

下面是我在 Flova 中创建「竖屏连续短剧单集制作」时实际写入的完整内容。字段名保留平台结构,行末的转义符已经整理成正常换行,可以直接复制,再替换成你自己的项目规格。

skill_name: "竖屏连续短剧单集制作"

skill_description: "当用户提供锁定剧本和角色、场景、道具素材,要求制作20–90秒竖屏短剧单集时调用。用于素材审计、制作规格、结构化分镜、参考素材绑定、媒体生成前确认、逐镜质检与剪辑;缺关键素材或未获阶段确认时必须暂停,不用于改写剧情或自由重设计角色。"

<planner>

目标:把锁定剧本和制作素材整理为可确认、可生成、可检查、可剪辑的竖屏短剧单集。不得改写锁定剧情、对白、人物关系和结局;不得重设计已有角色、场景和关键道具。

按以下顺序执行:

1. 素材审计:列出已收到、缺失、冲突、已锁定和待确认内容,并标注缺失项影响。完成后暂停,等待用户确认。

2. 建立 Final Video Spec:写明项目/集数、时长、9:16画幅与分辨率、语言、情绪曲线、可执行视觉规则、角色/场景/道具、模型参数、声音、剪辑节奏、交付格式和预算限制。完成后暂停。

3. 剧本与叙事分析:保持剧情对白不变,识别核心事件、场次目标、人物行动与阻力、权力或情绪转折、关键信息、开场钩子、高潮和结尾悬念;有矛盾则列出并暂停。

4. 结构化分镜:镜头数量与总时长必须符合 Final Video Spec。完成后暂停,只有用户批准才能进入媒体生成。

5. 逐镜素材绑定:角色、场景、道具、首尾帧和声音必须绑定;任何必需参考未绑定时禁止生成该镜头。

6. 媒体生成:按已批准分镜;先测试代表镜头,保留可用版本,不静默换模型。批量前说明镜头数、模型、生成次数及预计积分并等待确认。

7. 逐镜质检:检查叙事、连续性、生成质量、声音与剪辑,结论只能是通过、局部修改、重新生成、返回上游。

8. 返工路由:叙事问题回剧本分析;调度/空间问题回分镜;角色道具漂移回素材绑定;畸变/不稳定回模型、提示词或参数;声音节奏回音频层或时间线。不要把所有失败归因于提示词。

9. 时间线与导出:仅使用通过质检的镜头,核对总时长、节奏、音量层级、同步、开场与结尾;导出前提供最终检查清单并等待确认。

任何明显增加积分、生成次数或项目时长的动作,必须先说明影响并等待确认。

</planner>

<multimodal_analyze_tool>

开始制作前核对:锁定版剧本、目标时长、画幅比例(默认9:16)、对白语言、角色定妆图、场景设定图、关键道具参考、角色声音/配音、BGM与环境音、指定图片/视频/语音/音乐模型、禁用项、预算/生成次数限制、交付格式。

输出五张清单:

1. 已收到材料;

2. 缺失材料及其影响步骤;

3. 相互冲突的材料;

4. 已锁定不得改动的内容;

5. 可以建议但必须等待确认的内容,并按优先级排序。

不得用文字臆造缺失的锁定资产。角色图、场景图或关键道具参考缺失时,明确阻断后续素材绑定与生成,并在素材审计后暂停。

</multimodal_analyze_tool>

<storyboard_designer>

保持原剧情和对白不变,把已确认的 Final Video Spec 转为结构化分镜。每个镜头必须包含:镜头编号、预计时长、场次、景别、机位与高度、镜头运动、构图、角色位置/动作/表演、场景/时间/光线、台词/环境音/音效/音乐、叙事作用、需绑定的角色/场景/道具/首尾帧、图片或视频提示词、与前后镜头的连续性备注、预期生成模型。

镜头数量和时长总和必须与制作规格一致;检查轴线、视线、动作方向、出入画和空间关系。分镜完成后输出汇总表并暂停。只有用户明确批准分镜,才能进入媒体生成。

</storyboard_designer>

<media_generator>

生成前逐镜验证角色定妆图、场景设定图、关键道具、连续镜头首尾帧与声音素材的绑定关系;任何必需参考未绑定则禁止该镜头生成。

优先使用 Final Video Spec 或用户指定模型;未指定时先给出选择、能力限制与理由,等待确认。按批准分镜生成,不擅改剧情、对白、角色设计。先选择1–2个代表镜头做小批测试,再决定是否批量。保留已批准版本,模型能力不足时说明限制并提出替代方案,不静默换模型。

批量前必须报告镜头数、模型、生成次数、预计积分与可能返工成本并等待确认。生成后逐镜检查:叙事作用、人物一致性、道具位置、光线色温、视线轴线、人体手部口型、动作与运镜稳定、无关文字/水印/漂移、音画同步。结论标记为通过、局部修改、重新生成或返回上游。

</media_generator>

<write_the_prompt>

提示词必须服从 Final Video Spec、已批准分镜和已绑定参考,不得用“电影感”“高级感”或单一艺术家姓名代替执行规则。

图片提示词至少写明:主体与身份锚点、场景和时间、动作/表情、景别/机位/构图、光源方向与色温、主辅色、材质与质感、画幅、连续性锚点、必须避免的视觉。

视频提示词至少写明:起始画面、角色动作顺序与幅度、镜头运动、节奏和时长、环境动态、结束状态、需要保持不变的角色/服装/道具/背景,以及负面限制。

每个镜头引用准确的角色、场景、道具或首尾帧;连续镜头复用稳定身份和空间锚点。出现人物漂移优先检查素材绑定,空间错误回分镜,动作畸变再调整模型/参数/提示词。

</write_the_prompt>

<video_assembler>

只有通过质检的镜头才能进入时间线。按批准的分镜顺序组装,核对总时长、镜头节奏、动作衔接、视线与轴线;转场仅在叙事或时间空间变化需要时使用,不用转场掩盖连续性问题。

音频分层管理对白、环境音、音效和音乐:保证对白清晰、音画同步、响度层级合理,音乐不得遮蔽关键信息。检查开场钩子、高潮节奏和结尾悬念。

导出前输出最终检查清单并暂停,等待用户确认。按 Final Video Spec 导出成片与可继续编辑的项目,同时交付素材审计、制作规格、批准分镜、素材绑定记录、逐镜质检和返工记录。

</video_assembler>

文章来自于"AI Academia",作者 "AI Academia"。

相关主题

读完之后

加入 AINRK 交流群

了解加入交流群的方式,与更多 AI 从业者交流。

查看交流群说明(在新窗口打开)