全球首部全AI生成电影长片《Hell Grind》的价值350万元完整制作提示词已开源,文章拆解了其AI生成电影的可复用方法,展现AI电影的创作新可能。 ## **1. 电影基础信息公开** 这是一部95分钟的动作奇幻片,由15人团队耗时14天完成AI素材生成,总成本50万美元,大部分开销为算力消耗,每一帧均由AI生成,今年五月已在戛纳电影节同期活动放映。 ## **2. 拆分制作资产保持内容一致性** 将固定不变的角色设定、不同状态的角色、不同环境的场景拆分为独立资产,单个资产附带完整提示词与参考图,可1:1复刻电影,避免AI生成内容漂移。 ## **3. 文字搭建空间解决AI空间混乱问题** 为每场戏编写固定文字空间地图,记录空间不变信息,添加明确视觉锚点统一人物位置表述,建议采用3/4视角场景参考图提供更清晰的空间信息。 ## **4. 拆分时间动作优化生成效果** 将镜头按时间拆分为小段动作,每场开头留1秒让AI确认场景,单个时间节点仅安排两三个核心动作,提示词采用固定结构,总长度可达三四千字。 ## **5. 具象化描述还原真实表演** 不用抽象情绪词,直接描述角色生理动作与内心目标,静态镜头安排微小动态,同一镜头生成十到十五次仍失败则主动拆分简化镜头。
价值350万的“提示词”开源了,揭秘全球首部全AI 生成的电影长片
2026-08-08 11:37

价值350万的“提示词”开源了,揭秘全球首部全AI 生成的电影长片

本文来自微信公众号: APPSO ,作者:发现明日产品的,原文标题:《价值 350 万的「提示词」开源了,揭秘全球首部全 AI 生成的电影长片》


电影发明以后,人类的生命,比以前至少延长了三倍。


AI电影发明以后,人类的生命又能延长多少倍。


350万元,115451个资产文件,95分钟,15人团队,14天的AI生成周期,一部完全由AI生成的电影来了。



没有摄影机,没有演员,也没有实体场景,电影中的每一帧都是由AI生成。视频和对白主要由Seedance 2.0生成,角色与场景使用Soul Cinema,图像修改则调用Nano Banana Pro、Seedream 4.5和GPT Image 2。


今年五月,这部AI电影在戛纳电影节同期的第三方行业活动中放映,是一部包含博物馆盗窃、恶魔、地狱和超能力的动作奇幻片。


完整电影视频来源:X@higgsfield


ROKO、JAXX、LULU和REIN——四个一无所有、无所畏惧的街头孩子。某一天,一座博物馆,一个计划——直到一切在他们于展厅中发现一件没有名字、没有历史的文物时彻底崩塌。


一次触碰——他们每个人都获得了一种从未请求过的力量,唤醒了某种本不该被唤醒的存在。现在,他们必须正面迎战远古邪恶——即使这条路将他们直通地狱。


四个从出生起就被世界抛弃的孩子,如今却成为了世界最后一道防线。


最近,电影的制作团队Higgsfield公开了这部名为《Hell Grind》地狱磨砺的完整制作资料。每一幕每一场,累积十万多个资产,生成的视频不计其数,我们都能在Higgfield公开的项目地址查看。



https://higgsfield.ai/@higgsfield.studio/projects/hell-grind


每一个资产里面,都有完整的提示词和使用的参考图片,如果你有足够的Seedance积分,甚至可以1:1复刻一个同款电影。


里面还有不少中文提示词


官方透露,团队在完成前期资产后,用14天生成了整部电影需要的素材,随后再进入剪辑、修复、调色和声音制作。项目预算虽然「高达」50万美元,但其中大部分都是花在了视频生成消耗的算力上。


我们花了一个半小时看完了这部AI电影,说实话,一部电影该有的元素它全部都有,跌宕起伏的故事与主题、鲜明的人物形象、区别于普通视频的视听语言、以及表演和导演。


在某一瞬间,甚至让我想到了小时候看的「铠甲勇士」。


但社交媒体上还是不少网友表示,如果以后的电影都是这样的话,那电影可以宣告死亡了。


毕竟一旦提到是AI生成的内容,无论文字还是视频,就自动贴上「廉价」、「毫不费力」、「敷衍了事」,甚至是「垃圾」等标签。


Higgsfield这次公开的电影制作流程,似乎和「简单」二字完全没有关系,50万美元的成本也并不廉价,在这份内部手册记录的内容里,更是只让人看到了永无止境的尝试和成篇大段的复杂提示词。


例如一个最简单的问题,如何要让一个没有记忆的模型,连续95分钟记住同一张脸、同一个房间和同一种表演?


答案可能会有一些反常识,为了让角色在不同镜头中保持一致,团队会故意砍掉角色设定图里的脑袋;为了避免人物换位,每个场景开头都要浪费一秒钟,让AI重新认识房间;为了生成一段十几秒的镜头,一份提示词甚至能写到三四千字。



这份指南像一把手术刀,把如何用AI制作一部电影的具体方法、可能踩到的坑,以及各种干货资讯全部公开出来。它让我们看到一个普通观众几秒钟看完的镜头,到了AI面前究竟要被拆成多少部分?等于多少个提示词?


我们也把这套复杂流程拆成五个普通创作者也能复用的方法:先做资产、给空间画地图、把情绪写成动作、用提示词充当场记、在十几次失败后主动简化镜头。




用提示词解构电影


解构一部电影,首先要区分两类信息;一类会随着剧情变化:角色走进房间、拿起武器、说出一句话。另一类需要在整部电影里保持稳定:角色长什么样、怎样走路、使用哪种口音、紧张时会做什么。


《Hell Grind》把后一类信息做成了角色资产。每名主要角色都有一段固定的外貌描述,以及三张参考图:面部特写、正面全身和背面全身。正面全身图甚至会被故意去掉头部,避免模型在生成远景时读取那张过小、模糊的脸。


这些参考图也被刻意做得很朴素:灰色背景、平光、清晰毛孔,没有胶片颗粒和戏剧化灯光。角色图的存在,只负责回答一个问题:这个人究竟是谁;而后续的电影感应该留给具体的场景再做决定。


外貌之外,声音和行为也要被固定。比如,一个角色的声音可以被写成:低沉、沙哑的男中低音;语速缓慢,带伦敦街头口音;始终保持具有威胁感的平静,从不提高音量。


他的行为则会被总结成另一段文字:走路的节奏、手部习惯、眼神如何移动、受到压力时怎样掩饰、情绪崩溃前会出现什么动作。


角色坐下后,原本来回踱步的焦虑也不会消失,而会转移到摇晃身体、敲击手指和突然加快的手势上。


一部电影中的「角色」,由此被拆成了四组可以反复调用的数据:一张脸、一套身体和服装、一种不会漂移的声音,以及一组贯穿全片的行为习惯。


电影中的人物还会受伤、淋雨、换衣服。传统拍摄可以让演员换一套服装继续表演,AI模型却容易把角色的多个状态混在一起。


电影中的男主角获得超能力后会变身,变身的每一种状态都需要一个资产文件


因此,《Hell Grind》里的每种状态都被拆成独立资产:@roco是普通状态,@roco_wet是淋雨后的状态,@roco_blood是受伤后的状态。白天、夜晚和雨天的同一个地点,也会被当作三个不同场景管理。


一件关键道具甚至有三个版本:正常展示的完整版本、放在手掌里的染血版本,以及藏在拳头里的隐藏版本。


这套方法背后的逻辑就是:与其期待模型理解一个资产的所有变化,不如把每种变化都变成确定答案。


把电影场景写成一张平面图


角色之外,AI电影最容易崩坏的是空间。


人类看到一个房间的正面,通常可以推测房间背后和侧面有什么。


但视频模型换一个机位,门窗、家具和灯光都有可能重新排列。上一镜头中,角色站在桌子左边。切到近景后,他可能瞬间出现在另一侧;两个人的站位也可能互换,摄影机甚至会突然越过轴线。


《Hell Grind》的解决方法,是给每场戏编写一份固定的空间地图,例如


圆形训练垫位于房间中央;


房门在画面左侧的远墙上,距离训练垫八米;


五个损坏的人偶散落在画面右侧;


长椅距离训练垫两米;


摄影机始终停留在房门一侧,不越过这条轴线。


这段地图里不存在人物和剧情,只记录空间里永远不变的东西。同一场戏的每个镜头,都要逐字复制这份地图。


团队还会在场景里寻找一个视觉锚点,像是如果用「角色站在房间里」给了模型太多选择,但「角色站在灯旁,面向房门」则把人物、空间和视线固定在了一起。


人物位置也统一使用「画面左侧」「画面右侧」和具体距离。因为「站在角色左边」会随着人物转身改变,「画面左侧」却始终只有一个答案。


传统片场里,这些信息存在于布景、地面标记、演员走位和场记照片中。到了AI电影里,物理空间消失了,整个片场又被人用文字重新搭了一遍。


还有一个小建议是场景参考图则尽量选择3/4视角。正面构图看起来像一张漂亮壁纸,提供的空间信息却很少。3/4视角能让模型读到墙面、纵深和转角,换机位时更容易推测房间的其他方向。


把十二秒切成可以执行的动作


接下来,镜头需要被拆成时间。


以一场训练室的戏为例,12秒的动作大致会被写成:


0—1秒:整个房间保持当前状态,一个损坏的人偶仍在摇晃。


1—4秒:房门打开,两个人走进训练室,在训练垫边缘停下。


4—8秒:主角先用眼睛发现他们,随后转头;胸口急促起伏,下巴绷紧一次。


8—12秒:主角说出台词,三个人脸上的笑容同时出现裂痕,没有人继续向前。


每场戏的开头,一定是先花一秒让AI认路。通过在每场戏开头安排一个约一秒钟的全景镜头,人物不说重要台词,也不执行复杂动作,只负责站在正确的位置上;让模型确认现场的情况。


完成这次确认后,后面的动作和对白才正式开始。


为了让不同生成片段衔接得更自然,团队还会把上一段对白的结尾放进新镜头的第一秒。演员先接住上一句话的尾音,再说自己的台词,嘴型、语气和反应就更容易连在一起。


《Hell Grind》的一条视频提示词可以达到三四千字。长度来源于一套固定结构:


场景里有几个人,禁止复制;


每个角色和场景分别参考哪项资产;


房间的固定空间地图;


第一帧里每个人站在哪里;


镜头时长、焦段和摄影机运动;


每几秒发生一个动作;


道具的重量、接触和惯性;


唯一的光源与阴影方向;


对白、声音和环境音;


每个角色的行为状态;


画面中必须成立的数量与关系。


虽然提示词很长,单个动作段落却要尽量短。


团队发现,一个时间节点最好只容纳两三句话。模型可以阅读三千字的整体规则,却很难在同一秒完成开门、转身、说话、挥拳和改变表情。动作塞得越多,人物越容易在画面里犹豫、瞬移或者直接停住。


复杂动作还要从生成的第一帧直接开始。


如果角色需要撞破一扇门,提示词会写成「他已经处于挥拳中段,门板已经开始裂开」。如果用「走到门前、抬起手臂等准备动作」会被拆成另一个镜头。


AI视频的镜头设计因此也越来越接近漫画分镜:每一格只解决一个最重要的动作。谁又说这不算是另一种「古法」呢?


删掉「愤怒」,写下他的下巴


角色表演是整套流程里最反直觉的部分。直接告诉模型「他很悲伤」「他非常愤怒」,通常只能得到夸张、浅层的表情。团队更愿意描述身体正在发生什么:


他的下巴绷紧后松开两次;


鼻血流到嘴唇,但没有抬手擦掉;


一次缓慢眨眼,紧接两次快速眨眼,再用力闭眼;


目光先落在地上的碎片上,随后才转向门口。


角色的内心OS也会写进提示词:他想在别人进门前再完成一次攻击;他想隐藏手臂正在失控;门被推开的瞬间,他重新挂上一点勉强的笑。


这些内容不会直接出现在台词里,却会改变角色的呼吸、眼神和动作节奏。


指南里还提到静态镜头最好每一两秒出现一个微小事件:胸口随着呼吸起伏,鼻翼轻轻移动,手指敲击桌面,眉毛收紧后放松。


而「所有人保持不动」之类的提示词,很容易让模型真的冻结画面。更有效的表达是「人物用力维持静止,呼吸仍然没有恢复」。


对白也被严格限制在声音模块中。每个角色只能说引号里的句子,没有台词的人必须保持安静。声音描述、口音、语速和说话习惯会像角色外貌一样,逐字复制到每一个镜头。


在这套系统里,表演变成一连串可以被摄像机看见的生理变化。



《Hell Grind》采用逐场景生成的方式。每一次修改只改变一行,其余提示词完全保留。团队同时记录提示词版本、修改内容和生成结果,确保偶然出现的好镜头能够被复现。


他们还设定了一条「十到十五次规则」:同一个镜头连续生成十到十五次仍然无法成立,问题大概率已经超出措辞范围。


此时继续往提示词里添加限制,往往只会让模型更混乱。有效的方法是把镜头拆成两段、删掉一个动作、缩小人物活动范围,或者更换机位。


怎样把任意一场电影翻译成提示词


沿着这套方法,我们也可以尝试反向解构任何一场电影。


选择一段30秒到两分钟的片段,先暂停剧情,只记录画面里能够被验证的事实。


建立资产表:谁出现在画面中?哪些外貌、服装、声音和行为特征需要贯穿每个镜头?角色在这场戏里是否受伤、淋雨或者换过衣服?


画出空间地图:门、窗、桌子、光源和主要道具分别位于哪里?人物距离地标多远?摄影机位于轴线哪一侧?


逐镜头记录摄影信息:景别、机位、焦段、景深、构图、运镜和光线分别是什么?摄影机在跟随人物,还是等待人物进入画面?


把动作放进时间轴:第0—2秒发生什么,第2—5秒又发生什么?每个时间段只留下一个主要动作。


把情绪翻译成身体动作:角色的目光落在哪里?呼吸是否改变?哪块肌肉先绷紧?手里原本正在做的事,是否因为一句话突然停止?


列出连续性约束:人物数量、站位、衣服、道具、光源方向和伤口位置,哪些内容在下一个镜头里绝对不能变化?


最终得到的提示词,大概会呈现这样的结构:


场景背景:发生了什么,画面中有几个人


角色资产:外貌、服装、声音、行为习惯


空间地图:门窗、地标、人物和摄影机位置


第一帧:画面开始时每个人正在做什么


摄影:景别、焦段、构图、景深和运镜


动作时间线:每几秒发生一个可见动作


物理关系:重量、接触、惯性和受力


光线:唯一主光源及阴影方向


声音:对白、环境声和空间混响


角色表演:目标、隐藏信息、身体节奏和变化


连续性:人数、方向、数量和不可改变的关系


看完这份指南,我只觉得好难。所谓的AI电影,也不是大多数人口中仅凭一句提示词,就能做出来的东西。


尤其是看到复杂的镜头设计时,优秀的画家可以用手画出自己脑海中想象的镜头,但AI电影创作者则必须要用文字把它们描述出来。


在社交媒体上发酵了两天,《Hell Grind》最容易被传播的内容,还是开头那几个数字,95分钟、15个人和14天。


但每一份三四千字的提示词,确实给我们提供了另一种理解AI电影的角度。


我们也很难因为一部AI电影的公开就说未来都会是AI电影的天下,更乐观的情况,大概是希望AI电影和动画片、纪录片、剧情片等是作为同一个分类,它们有机会做到各美其美,美美与共。


而这份指南也就有了它存在的价值,让我们入门一个新的电影类别,AI电影。

AI创投日报频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP