上个月我写了一篇文章,聊AI短剧月产4.4万部但爆款率只有0.6%。
里面有段我自己的翻车经历,很多人说看完笑疯了。
我去年自己做了一条AI短剧。跑第一遍的时候,女主角的脸从第一集到第三集一直在变。第一集是圆脸,第二集变瓜子脸,第三集直接不知道变成了谁的脸。
第二遍更离谱。跑一个打斗场景,AI给男主角多生了一条腿。三条腿在那打架。还有一个镜头里凭空多了一只手,悬在半空中,跟恐怖片似的。
我当时在文章里写了句「工具真的不再犯这种傻逼错误了」,说的是今年的情况。
但说实话。
今年的工具确实不犯这种低级错误了。它犯的是另一种,更高级的、更让人头疼的错误。
比如说,剧本写的是「男主角走向窗边,看着窗外的夜景,眼神里有一丝犹豫」。AI跑出来的画面是,男主角确实走向了窗边,但他是从左边走过来的,不是右边。他确实在看窗外,但他的站位不对,整个人挡在窗前,观众根本看不到窗外的夜景。他的眼神确实有犹豫,但角度不对,看不太清。
这些错误放在传统影视行业里,导演现场一看直接喊「卡,重来」。但在AI短剧里,你没法喊卡。你只能接受。
因为传统的AI视频生成,说穿了就是对着一段文字描述随机生成画面。你写Prompt,它出画面,至于出的画面符不符合你对角色站位、机位角度、情绪递进的想象。。。全看运气。
这就是我看到那个东西的时候,愣住的原因。
我们一直在做一个东西。内部叫它「导演Agent」。
名字听起来挺唬人的。但它的逻辑其实很简单。
你想想一个真正的导演在片场干什么。他拿到剧本,想的第一件事不是「这场戏好不好看」。他想的是,这场戏该用几个机位,角色站在什么位置,镜头是从上往下拍还是从侧面拍,角色在说话的时候要不要切特写给反应镜头。
这些事在传统影视行业是常识。但在AI视频生成领域,之前没有任何一个工具在做。
为什么。
因为太难了。
你得让AI理解剧本里每一场戏的空间关系。你得让AI知道哪些画面需要特写,哪些需要全景。你得让AI在切换镜头的时候保持角色一致性。你还得让所有这些东西是可控的,不是「AI随便给你跑一个你觉得还行就用」。
导演Agent做的事情,简单来说就是四步。
第一步,读剧本。
你把剧本扔进去。它会把一场一场的戏拆出来,自动分析这场戏的核心情绪是什么,关键动作是什么,需要几个角色同时对戏。这些在传统影视行业叫「分镜脚本」,导演和摄影师要提前花好几小时一起做的。导演Agent几分钟干完。
第二步,定机位。
这是我觉得最离谱的部分。它会根据这场戏的内容自动判断,这一卡该用中景还是特写,该用推镜头还是跟镜头。比如一场激烈的争吵戏,它会自动建议用肩扛感强一点的中景来拍,因为这样可以制造不稳定的紧张感。一场安静的独白戏,它会建议用缓慢推进的特写,一直推到角色的眼前。
你可能会问,我怎么知道它定的机位好不好。
你可以打开3D导演台,自己调。
这就是第三步。
第三步,进导演台。
导演台是一个720°的全景空间。你可以在里面旋转视角,看到这场戏的完整场景布局。角色站在哪,镜头架在哪,全景图全都在你眼前。
然后你可以自己调。觉得镜头太高了,往下压。觉得站位太靠左了,往右挪。觉得这场戏需要从上一个角色的背后拍过去制造偷窥感,你可以手动把机位切过去。
这个操作的体感怎么说呢。
就像你突然从一个「许愿的人」变成了一个「导演」。
以前你做AI短剧,输入Prompt,双手合十,默念「给我一个好看的」,然后等AI给你结果。给了你接受,不给就再来。你的角色不是创作者,是许愿池边上的投币游客。
现在你进导演台,所有的东西是可见的、可控的、可调的。你不满意,你自己动手,不是等下一次抽奖。
第四步,生成多视角细节。
这是专门解决「角色变脸」和「站位漂移」这两个老问题的。
传统AI视频生成的时候,每生成一个新镜头,AI其实是在重新理解你的角色长什么样。所以才会出现第一集圆脸第二集瓜子脸这种事。
导演Agent的做法是,在生成之前先生成多视角的细节图。正面、侧面、背面、45度角。然后把这些视角图锁定成这个角色在这部剧里的「视觉档案」。后续所有镜头生成的时候,AI不是重新想象这个角色长什么样,而是对着这个档案来生成。
说穿了就是一句话。
先定义好角色长什么样,再生成。而不是边生成边猜角色长什么样。
你想想看,这不就是真人剧组选演员的逻辑吗。你先定了这个演员长什么样,然后所有拍摄都基于这个演员。你不会拍到一半临时把演员换了。
角色变脸的问题,就这么解决了。
站位漂移的问题也是同样的逻辑。导演Agent会先锁定场景的空间坐标,每个角色在这场戏里的站位是被锚定的。镜头怎么切,角色在那个位置不会乱动。
写到这里,我想聊一个更宏观的话题。
为什么「可控」这件事,对AI短剧来说这么重要。
我有一个做MCN的朋友跟我说过一句话,我一直记得。他说,「我做AI短剧最大的痛苦不是画面不够好。是我做了一个月,做出来的东西跟我脑子里想的不一样。」
这句话听起来很普通。但你仔细想想,这是所有AI创作者的共同困境。
你脑子里有一个清晰的画面。角色的长相、情绪的变化、镜头的移动。你全想好了。但当你把这些输入给AI的时候,出来的东西不是你脑子里那个。它可能也不差,甚至有些地方超出你的预期。但它不是你要的那个。
这就导致一个很尴尬的状态。
你到底算不算这部短剧的导演。
如果你连角色站在什么位置都说了不算,如果你连用中景还是特写都掌控不了,如果你的演员拍着拍着自己换了张脸,你不过就是一个高级的Prompt工程师。
真正的导演不是这样的。
真正的导演是,脑子里先有一个完整的世界,然后用一切工具和手段,把这个完整的世界还原出来。
导演Agent在做的事情,就是把这个「还原」的过程还给创作者。
说起来你可能不信。这个东西的灵感来源,其实不是AI行业。
是游戏引擎。
你看Unreal Engine里面,导演工具那一套。你可以自由地在3D空间里移动摄像机,你可以设定每一个镜头的光圈和焦段,你可以给角色标定位、画动线。所有这些工具的目标只有一个,让创作者的意图被精确地传达出来,而不是撞大运。
AI短剧行业现在最缺的,恰恰就是这一套。
不是缺更好的模型。模型已经很好了,Seedance 2.0、可灵3.0、Happy Horse,一个比一个强。
缺的是一个让你从「看AI表演」变成「控制AI表演」的工具。
这就是导演Agent的野心。
不讲什么「颠覆影视行业」这种大话。就讲一个很具体的事。
你有一个故事。这个故事在你脑子里。你信任这个故事。你觉得把它拍出来会好看。
现在,你来导。
最后再说一个细节。
导演Agent内置了一套影视级提示词模板。听起来好像就是个Prompt库对吧。
不是的。
这套模板是按照影视工业的标准来建的。每条提示词不是「好看的古装少女」,而是具体到镜头焦段、光影方向、色彩倾向。比如「使用85mm焦段,主光从左侧45度角打过来,色温偏冷,制造疏离感」。
你可能会说,我不懂焦段和色温怎么办。
你也可以用自然语言描述你想要的画面感,「我想要一个很压抑的画面,让观众感觉到角色很难受」,导演Agent会把你的描述翻译成影视级的精确参数。
这个设计的逻辑很简单。
让专业的人可以用专业的方式工作。让不专业的人可以用直觉的方式工作。
但不专业的人产出的,是接近专业水准的东西。
我有时候觉得,AI短剧这个行业,从诞生到现在,一直在一个误区里打转。
大家比拼的永远是「谁用的模型更好」「谁生成的画面更精美」「谁的产能更高」。但这些说到底都不是创作的维度,是生产的维度。
真正的创作维度是什么。
是我能不能把我的想法变成画面。
是我做的这条短剧,观众看完以后,是觉得「哦,AI做的,挺厉害」,还是完全忘记了它是AI做的,只记得那个故事和那个角色。
可不可控,决定了这个差距。
在导演台上多花一小时,比在多跑几十条成品上多花一整天,更接近后一种结果。
这个行业里做工具的人很多。但真的在解决「创作者控制权」这个问题的人,不多。
我们想做的,就是这件事。
不只是让AI替你干活。
是让你导。
以上就是今天的内容。既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,我们,下次再见。
/ 作者 苏三