深入实战过AI编程的程序员们,大多已经深刻领悟到,想要“一句话生成一个软件”的Vibe Coding是不靠谱的,无法完成完整的软件的开发。

被大家认同的解药是:AI Coding Agent和Agentic软件开发方法。

同样的,”一句话生成一部AI剧/一部电影”,现阶段是不可能的。

你可能看到网上一个教程,三下五除二就教你完成一部炫酷的广告视频、MV,甚至大片质感的电影片段,这是幻觉,人家可以在家里苦练半年,从100段里面挑一个最好的给你看。

哪怕播主给你展示各种素材,中间过程,甚至打开生成界面给你看,这也是为了他这段教程优化了八百遍的,换成你自己的剧本,立马崩给你看:剧情逻辑混乱、角色场景不吸引人还是小事,视频里人物乱站、摄像机镜头不受控制,多段视频连起来差的连狗都不想看才是逼疯人的,所以大家叫生成分镜视频的过程是“抽卡”,你就知道这里面水分有多大了,这特么是玄学了。

为什么?因为教程里给你看的都是“手搓大法”,这是作坊式制作流程,完全看个人能力和经验,有人可能一个月出师,有人可能直接从入门到放弃了。

题外话:现在生活节奏太快,什么都要快速出结果,技术圈里的教程,也大多用“一天学会”,“看一眼就会”的噱头吸引人,你先说太多困难,人直接关闭不看了。但技术人要有耐心,贪快嚼不烂,哪怕你用“敏捷”开发的方法学AI剧制作,快速完成一轮学习后也要多次迭代把跳过的知识补上,不然就会在细节里扣、钻牛角尖出不来了。

要实现AI剧的标准化生产流程,可能同样需要AIGC Agent和Agentic影视制作方法。

当然,还有其它的流派:Workflow,以及坚持拆分的大师(保持AI剧制作的每个步骤的工具独立性和专业性)。

软件开发Agent的实现逻辑

通过理解LLM大模型的原理,知道它的能力边界,就能明白为什么是AI Coding Agent才能够越来越完美地自动化完成软件系统的开发。

软件开发从来不是上手就写代码

软件开发是一项现代工程,它有着完整的标准化工业流程,无论具体方法论如何变化,关键的需求分析,设计,编码,测试,发布,部署和维护步骤是一直存在的,可以被简化、被暂时跳过,但重新自创一套新体系,就需要你有开宗立派的能力,而绝大部分人是没有的。

所以现在的AI Coding Agent编程软件,大多设计越来越趋同,需要你输入需求文档或反复与AI进行技术或功能点讨论,形成开发计划、拆解系统架构、分析功能模块,并且AI也会建议你添加技术规范约束,编写测试用例,过程中还会调用各种Skills技能辅助你完成上述工作,最后才是边测试边开发给你输出代码。

AI编程能够成功非常重要的一点就是,能够自我验证。

模型能力的差异

就如同不同程序员能力有高低,模型的能力也有差异,但我不认为到了2026年能上线提供API服务大模型还有哪家编程能力是不及格的。

好的Coding Agent能够把不同模型的表现能力拉到差不多水平,这是工程的力量,背后是大量内置Skills,利用工程的方法在补全你遗漏的细节。

只要是能力及格的程序员,在软件公司里都是能完成编码任务的(因为有资深skill的工程师指导);许多古法编程软件开发项目的失败,更多是系统架构和设计阶段的锅,AI Coding也一样,并且你就是那个架构和设计的人。

网上最近也在争论一点:AI时代,写代码是不是一件很简单的事——这引发了大量经过数年学习和工作的资深程序员的批斗,认为AI抹杀了人的学习价值。

我们这里不作评判,但软件肯定不只是写代码,AIGC也肯定不只是只有生成一张图/一段视频。

AIGC Agent的设计思想

我把AIGC Agent和AI Coding Agent放在一起,本质上就是因为 AI生成 与 AI编程 几乎经历了相同的发展阶段。

  • 第一阶段,一句话生成一个软件,一句话生成一张图/视频。

这完全是依赖模型的能力,是从0到1的阶段,大家不会去深挖细节,只会人人夸一句AI NB。

  • 第二阶段,许多人开始尝试,一边试一边骂

大量人依葫芦画瓢,从网上抄一些”咒语”一样的提示词,这是提示词工程阶段,调教好了,能完成一个功能函数,生成一张漂亮的图片/视频。但更多人直接放弃,这不好玩。

  • 第三阶段,Agent概念提出,许多人看完觉得我又行了

有了大量的Skill大量技能封装,相当于AI有了模板,许多擅长找资源的人,立马领先一步,程序员可以用AI生成完整的网页设计图了,可以出一份完整的数据库定义了;也可以用技能直接生成广告片了,生成周星星搞笑片段了。

但到了这个阶段,并且想继续下去的人,才会理解“工程”的枷锁有多重。我们的设计思想讨论重点在这里展开。

工程的完整性

软件系统从来都不是碎片化的一个界面和一个功能模块,是一个整体,一个环节的失败都可能导致整个项目崩盘。

AIGC也是一样,最终目标是为了生成一部小说,一套图片,一部剧集(下文以最复杂的AI剧集为例)。

AIGC Agent要有剧集的全局目标设定,世界观:故事背景、世界规则、故事主线和关键节点,有画面风格、镜头语言和叙事方法(和软件开发要写PRD和设计文档、有常用的技术框架和编码风格一样),并且贯穿全局。

并对整个剧集进行季-分集-叙事单元-场次-分镜的组织管理(相当于软件中的逻辑结构设计和功能模块分拆、定义),所有单元的制作都要遵守全局设定,高度统一和确保一致性。

工程的可管理性

软件工程领域有各类工具负责文档管理,界面设计,代码仓库,自动化测试等等,而AIGC目前还没有工业标准化,没有哪个行业会像现在这样,有人用Workflow,有人用Excel表格/Word文档,有人用Canvas无限画布……各类资产(剧本,角色设定图,配音文件,视频片段)散落一地,生成图片、视频时甚至还在靠”抽卡“的方式赌运气,中间过程没有历史、存档,更没有版本管理。

AIGC Agent需要统筹全剧资产,按需调用,而不是全凭人的记忆手工搬运,极易出错和遗漏,也根本无法协作。

以一个分镜视频生成为例,就需要关联世界观,角色、场景、道具资产,剧本剧情,分镜脚本,故事板,摄像运镜,甚至配音音效等资源,这全凭人工管理,是非常繁重的脑力和体力活。

工程的可批量复制性

许多高手手搓AI剧非常熟练,但他的经验和能力无法被复制,即使是开课培训,因为不同人的知识背景不同,许多被忽略的细节,往往会决定有人怎么也不开窍,学不会。

AIGC Agent当然要将AI剧制作过程中,碎片化的工作流程进行标准化形成SOP流程,无论是角色和场景的设定,还是分镜脚本的编制,统一了不同水平的人执行SOP时的差异,满足工业标准可批量可复制的刚性要求。

平台类产品的痛点

资产泄密、隐私问题

和其它AI平台一样,哪怕是AI RAG知识库,大多企业都担心公司内部文档资料都发给AI平台了,会导致泄密(而这也的确真实反复发生过了)。

AI剧制作,尤其是精品剧的制作,无论是优秀的剧本、角色设定、场景布置都是花了很多精力和财力的资产。

之前手搓,可能还分散在不同的平台上,剧本用gemini,生成图片用banana,视频用seedance;或者前两步还是人工完成,只用AI生成视频减少拍摄成本。这样风险还在可接受的范围内。

但如果是“一站式”的大平台,你等于把一部作品的所有细节都交出去了,任何人如果拿到这套资产,简单换几个关键词就是复用你的劳动成果,把卡通变3D动漫、变真人……

云计算、Saas服务可以减少IT基础设施投资,可以带来多人协作的便利,但这种可能事关一个公司生存的命脉,可能成为一票否决项。

做壳和做全套

另一篇文章中提到,各类AI模型原厂如今也亲自下场做用户应用场景了,最开始的是AI编程软件,另一个就是AI剧制作平台。

Cursor可以说是第一批下场做AI编程软件的公司,但当Claude Code,OpenAI CODEX,甚至国内字节的TRAE,Deepseek的Harness编程工具陆续出来后,它就非常尴尬;Cursor没有自己的AI模型(或者说也在尝试基于开源模型进行自研,但这也是凑个数),早期的功能亮点主要就是通过Claude们的API来实现的。

这就如同现在AI剧制作工作(包括手搓),大多是依赖Seedance的API能力实现的,许多AI剧制作工具都是在做API的壳。

当大厂陆续亲自下场,如何应对?无论是对模型的能力的理解、资源的优先获取,以及价格,都会落于下风,而你引以为傲的创新,可能也只是大厂产品经理抄袭——哦不,叫借鉴的目标,借鉴能叫抄吗(笑)。

AIGC类产品方向

工具类

以Lovart,即梦,万兴剧厂,RuningHub的RHTV等为例,虽然他们也引入了Agent,但这些Agent还是为单一目标服务的,比如你输入一段话,它帮你补全和关联一些上下文信息帮你生成图片或视频。

大多采用无限画布方式,统一组织管理所有多媒体资产,以可视化方式直观理解全局,所以它的单画布最佳适用场景是一集短剧或一部广告短片的制作,再多就满屏满眼的方块无法有效管理了。

它们是工具思维,集成了所有AI剧制作过程中用到的LLM大语言模型,图片生成模型,音频生成模型,视频生成模型,甚至还有3D世界模型,以及基于WEB的3D编辑器、视频剪辑等小工具。

它们也是“通用“产品思维,不是专为哪个场景设计的,你可以用他们制作各种图片、视频,海报,广告片,搞笑短片,或者正经剧集,不受规则约束,没有流程要求,随便你造,只要你最后能把它们都串连起来形成最终成果。

工作流/工作台

ComfyUI是绝对的王,它的各种工作流在各种网上教程和群里流传非常广泛,技术门槛上到行业天花板,下到小白一键操作都可以。

参考ComfyUI,甚至直接换皮的AI剧制作工作流有许多,它的工作流从技术语言来说,其实就是低代码的UI呈现方式,Coze和Dify也是一样,只不过扣子和Dify是做通用平台,而ComfyUI专注图片、视频生成场景。

基于工作流,可以把一些制作流程固化下来,上面说了,工作流就是低代码,它的背后还是软件思维,只不过不需要编码实现,通过拖拉结点、配置参考来完成软件的开发。

设计实现一套工作流,就是开发一套软件。

许多AI漫剧工作室,特别是一些批量剧,大多是这种方式生产的,通过开发工作流,可以把制作过程流水线化,把生成任务放到服务器上跑批量生成,但基本都是最后剪辑时,才有机会对AI工作流输出的内容进行挑选和剪辑,除了个别特别离谱的,大多数低成本做法就是直出了,这也是许多批量剧大量镜头前言不搭后语,画面乱跳的原因了。

区别与自由画布,工作流虽然界面看上去和自由画布差不多,但它们的差别还是非常明显的。自由画面强调的是内容关联性和平铺式管理思维,而工作流是低代码开发的软件开发思维。

智能体

(更新中……)