AI产品评测

谁在批量生产你刷到的 AI 短剧?|十字路口实测

作者:GaKi0 次浏览 来源:十字路口Crossing
谁在批量生产你刷到的 AI 短剧?|十字路口实测

模型定上限,Agent 定下限。 在刚刚过去的 2026 WAIC 上,智象未来(HiDream.ai)正式发布了内容创作智能体——vivago R1,这款产品已经在昨天全球上线,国内版本「够搭」 全新升级发布,其核心定位是 3 到 5 分钟完整视频的稳定生成。 该产品的推出,刚好对应了目前 AI 视频技术的快速进步。 从最新的 Artificial Analysis 盲测榜单来看,基础模型的竞争非常激烈,海内外头部科技大厂与 AI 独角兽纷纷入局,在画面质感、运动幅度与生成效率上各展所长。 Foundation Model 的效果越来越好,但模型的画面与最终成片之间的工作流仍有断裂,而这就是

模型定上限,Agent 定下限。

文章配图

在刚刚过去的 2026 WAIC 上,智象未来(HiDream.ai)正式发布了内容创作智能体——vivago R1,这款产品已经在昨天全球上线,国内版本「够搭」全新升级发布,其核心定位是 3 到 5 分钟完整视频的稳定生成。

该产品的推出,刚好对应了目前 AI 视频技术的快速进步。

从最新的 Artificial Analysis 盲测榜单来看,基础模型的竞争非常激烈,海内外头部科技大厂与 AI 独角兽纷纷入局,在画面质感、运动幅度与生成效率上各展所长。

Foundation Model 的效果越来越好,但模型的画面与最终成片之间的工作流仍有断裂,而这就是 Agent 产品发挥价值的位置,也是这次vivago R1 的核心定位

文章配图

🚥

十字路口团队第一时间进行了深度实测,接下来分享实际体验。

实测:直出 5 分钟爆火「天宫巨阙」长片 × 6 条 TikTok 带货短视频

首先,vivago R1 的体验链接是:

https://goudaai.com/home

进入网站之后,直接输入提示词或者调用对应的 Skill,再用 @ 添加素材,就可以开始创作。

文章配图

最近常刷各个社媒平台和短视频平台的同学,肯定会注意到,像下面这种天宫巨阙、中国古风的短视频特别多,甚至快成为 AI 短剧的一个主流分支了。这类 AI 短剧的核心要素是宽景构图和巨物美学。

文章配图

现在 vivago R1 可以一次性直出 5 分钟左右的天宫巨阙 AI 短剧,最后再配上有网感的音乐,味道就很对了。

首先,可以直接用自然语言提示词和 vivago R1 对话,不需要搭建节点,先让它生成 3 张 21:9 电影画幅的东方神话史诗场景图。

文章配图

之后只需要和 vivago R1 的 Agent 简短对话,让它参考这些图片的风格设计一个分镜脚本,它就能全自动完成视觉设计与资产生成,比如解析全部分镜脚本,建立一整套视觉风格。

文章配图

整体架构完全确定之后,它会自动进入下一步,分批串行生成图片资产。剧情分镜里需要的场景、人物角色和物品,全部会被生成为图片资产。

有意思的是,生成人物角色或物品时,它会默认同时生成角色的正面、背面、侧面图,或者物品的多角度视图,用来在后续生成视频时锚定整体风格。

文章配图

之后它会为所有分镜参考图和最终要生成的每一段 AI 视频片段自主写好提示词,再自主列出一个 ToDo List,逐 clip 确认,一共可能有十几个验证阶段。

文章配图

这一步验证得比较细致,因为一旦缺少验证,最后生成出来的视频很可能整部片子都没法用。

比如 vivago R1 会验证所有片段的分镜长度,片段并不固定为 30 秒,也会降到 15 秒、19 秒,与整个分镜计划保持一致。

接着检查全部参考图与资产参考是否对应、所有资产是否全部覆盖,还会检查提示词长度是否会被异常截断。

提示词写得太长时,AI 可能会自动截断,但产品的前端不会显示出来,用户明明写了很长的提示词,却不知道为什么出来的效果特别差。

所以这种细致的内部检查,是非常有必要的。

现在全篇有 17 个分镜,已经映射为 17 个场次,合并成多个片段。所有图片资产都已经做完,7 个视频片段的主题也已经写好。到这一步,它才会让用户确认是否生成视频。

文章配图

从最开始用自然语言输入提示词到这一步之间,我几乎没有和 vivago R1 的 Agent 有过任何交互,全部由 Agent 自主执行。

接下来 Agent 会根据它设定的整体计划、图片资产和提示词,逐一生成视频片段。

每个视频片段都会被列入画布,然后自动把所有片段剪辑成一个完整的成片。

文章配图

展示完整五分钟成片之前,先给大家看一个配好短视频音乐的成品片段,音乐一响起来,整个味道就非常对了(ps. 音乐 BGM 是在剪映中手动添加的,版权来自《壁上观》,原唱张晓涵;其他所有音效和 BGM 都是 vivago R1 生成的)。

文章配图

第一版生成出来的时候,效果已经很完整,能直接出一个 5 分钟的成片。我又想往里面再加一些剧情,所以又生成了一次。

两个视频我稍微剪辑了一下,最后合成了一个 6 分钟左右的小型 AI 短剧《天宫巨阙 归灯》。

一个提着没点亮的灯笼的白衣旅人,用一天时间登上天宫,把灯送到月亮跟前,剧情就这么简单。整部剧使用了多种摄影手法,用来展现天宫巨阙的建筑和风格。

文章配图

整体来看,剧情衔接比较缜密,角色一致性和风格搭建也比较完整,毕竟全流程的风格参考只有最开始那几张图片,其余图片资产都是后来由 Agent 生成的。

成片还是非常写意的。

在实际测试第一个天宫巨阙 AI 短剧的时候,我发现vivago R1 里有一个非常完整的 Skill Hub,里面有 TVC 广告、文字剧本生视频、图片编辑等各类 Skill。

文章配图

其中一些做 TVC 广告的 Skill,尤其适合 TikTok 和 Reels。比如有一个叫 Story AD Director 的 Skill,我用它让 Agent 直接一下做了 6 个 TikTok 风格的剧情产品广告。

这个 Skill 有一个比较固定的结构,比如前 3 秒会出现戏剧冲突,在关键的剧情转折点会自然地放入实体产品,整体架构是比较完善的。

文章配图

使用时直接点击「立即试用」,输入提示词,它就会自动套用这个视频 Skill 的结构,去优化我们的提示词。

我设想的场景是制作一整套男士护肤面霜的 TikTok 和 Reels 转化真人广告。男主是一个黑人,他会在婚礼、机场、红眼航班等多个场景中使用这款面霜。

使用这个 Skill 之后,vivago R1 的 Agent 会直接给主角做定妆造型,比如在一张图里同时生成男主的多种面部表情、搭配各个场景的服装,以及面霜产品的展示效果,还会画出整个场景的分镜。

文章配图

下面这个场景是它做好的一个 30 秒短片,vivago R1 可以直出这种 TVC 广告短视频。

文章配图

这条 30 秒短片采用了经典护肤品广告的叙事结构:前期展示男主乘坐红眼航班后的疲惫与粗糙肤况,中期通过洗脸与涂抹面霜呈现即时修复过程。片尾运用影调冷暖转换强化状态蜕变,并顺畅收束在男士面霜的图文推广与品牌口号上。

这个 Skill 做这类 TVC 广告短视频确实非常方便。因为 TVC 广告短视频投放到 TikTok 这类平台,30 秒已经算比较长的了,而它一次可以直出很多条,所有视频的风格一致性,包括人物角色和产品的一致性,都比较高。

我们正好用 GPT 6 Astra 手搓了一个短视频拼接器,方便给大家展示最终效果。

文章配图

最终的完整视频效果如下:

文章配图

仔细看会明显发现,这 6 个 30 秒的 TikTok TVC 广告视频虽然场景完全不同,整体结构却很一致。比如在 3 秒左右,男主都皱着眉头,表现出一种消极状态,面对某个生活上的问题。

文章配图

之后,6 个 TVC 广告视频几乎在同一时间点让产品出场。比如到第 17 秒,男主会真实地涂抹这款男士面霜。

文章配图

总的来看,虽然我只用了非常简单的自然语言提示词,但搭配这个 Skill 之后,vivago R1 Agent 会根据视频 Skill 和我的提示词列出不同场景,并且在不同场景中保持同一种叙事结构。

这一点在批量制作 TVC 广告时比较重要,因为既要保持一致性,又要避免提示词过于发散导致视频画面崩掉。

所以场景尽量保持一致,叙事结构也保持一致,先有钩子,再解决问题,最后产品积极出场,这样很符合 TVC 广告的调性。

vivago R1 的产品逻辑

实际用下来,vivago R1 的产品思路主要分两层。

【1】交互:纯对话模式

创作全程不需要创建节点,也不需要手动设置画面模型、视频时长等参数。vivago R1 更推荐用户用自然语言与 Agent 对话来创作。

整体用下来,它很重视 Agent 交互,几乎全程由 Agent 拆解脚本、规划镜头、分配角色、组织节奏,最终交付成片。

文章配图

官方用了一个很有意思的比喻,「AI 视频创作的入门级单反」,大致意思是足够简单,让非专业用户也能上手,又足够稳定,让专业创作者能够交付作品。

【2】长任务调度

5 分钟以上的视频通常属于长任务。目前还没有模型能一次生成几分钟的连贯视频,因此需要 Agent 来组织整个创作过程。

R1 将调度工作交给 Agent,由它根据提示词规划故事脉络,保持多个镜头中的角色、产品和场景风格一致。用户也可以通过对话,单独修改某一个镜头。

文章配图

要让 Agent 负责整个创作流程、尽量减少用户的手动操作,Agent 产品就需要理顺整套链路。

R1 能把这条链路衔接起来,也与背后的研发团队智象未来(HiDream.ai)从多模态底层模型研发起步有关。能否贯通这条长链路,很大程度上取决于团队对模型能力的理解深度。

他们此前研发的HiDream-O1-Image 曾进入 Artificial Analysis 图像榜前列,交互式世界模型 HiDream-O1-World 则在 WBench 获得了 80.9 分。

文章配图

所以现在看来,只有厂商自己经历过模型研发中的难题,才会清楚 Agent 产品要如何降低用户的操作门槛。要减少用户反复用 Prompt 生成视频片段、再整理成片的负担,厂商就要知道哪些环节需要工程逻辑来兜底。

🚥

「模型定上限,Agent 定下限」。

这句话很适合形容 2026 年 AI 视频模型及其商业化 Agent 产品的图景。

如果 Agent 的编排和理解能力持续进化,AI 视频创作的边界大概率会进一步拓展。随着商业化潜力得到发掘,AI 视频创作也会成为一门非常「赚钱」的生意,商业回报又会促进 AI 模型能力的提升。

所以,我们很期待看到,AI 视频模型今年究竟能在商业化上产生多大影响,Agent 产品又能进步到什么程度。

文章配图

文章来自于"十字路口Crossing",作者 "GaKi"。

相关主题

读完之后

加入 AINRK 交流群

了解加入交流群的方式,与更多 AI 从业者交流。

查看交流群说明(在新窗口打开)