MiniMax H3与字节Seedance 2.5同日上线,分走开源开放、闭源工业化两条路线,实测二者能力同属第一梯队,产品性格差异明显,给视频创作者提供了不同顶级选择。 ## **1. 三轮同题PK未分出胜负** 奇幻短片测试中,H3守住空间一致性和电影质感但遗漏多数分镜指令,Seedance 2.5完成运镜要求但空间结构混乱;广告测试中,H3视觉更接近商业成片但动作和镜头落点不准,Seedance 2.5完成度更高但质感稍弱;多机位机器人数据生成任务,两款模型均失败。 ## **2. MiniMax H3优先保障成片整体质感** H3擅长呈现电影质感与连贯细节,面对复杂任务会选择砍掉部分指定要求,优先保障人物、场景、光线的整体统一性,官方定价0.8元/秒(2K),即将开放权重,价格更低且支持生态适配。 ## **3. Seedance 2.5指令执行精度更突出** Seedance 2.5主打闭源工业化路线,对写进Prompt的镜头动作、时间轴控制执行更准确,支持原生30秒直出和大规模素材参考,适合依赖密集镜头调度的商用生产,使用成本显著高于H3。 ## **4. 当前视频生成赛道进入多元竞争阶段** 两款顶级模型路线、能力侧重不同,可匹配不同创作需求,中国视频生成已从单一追赶国际SOTA,进入多路线竞争阶段,开源模型入局将让后续多模态竞争更活跃。
实测MiniMax H3 VS Seedance2.5 :旗鼓相当,性格迥异
2026-08-01 12:14

实测MiniMax H3 VS Seedance2.5 :旗鼓相当,性格迥异

本文来自微信公众号: 硅星人Pro ,作者:黄小艺,原文标题:《实测MiniMax H3 VS Seedance 2.5 :旗鼓相当,性格迥异》


7月31日,视频模型终于也有了自己的“撞车日”。


MiniMax H3和字节Seedance 2.5在同一天上线。一个宣布即将开放权重,把文字、图片、视频和音频统一成一段可以自由调用的上下文;一个沿着闭源工业化路线,接替上一代SOTA Seedance 2.0的位置,用30秒直出、更大规模的素材参考和更精确的镜头控制,一次性生成长篇叙述。


它很像LLM竞争最热闹时才会出现的场面:两条路线,两个最能打的选手,正面撞进了同一个擂台。


所以我们也不绕了,直接让它们开打。


我们把同一组长Prompt、参考图和参考视频分别喂给两款模型,安排了三轮同题PK,再加两轮单项加试:既让它们拍电影、拍广告,也把它们推向多机位机器人训练数据这种几乎不允许犯错的任务。


测到最后的结论是,两者都很强,谁都没完全把对方打趴下。而更有意思的是它们在处理任务里体现出的不同思路,让人觉得这两个模型有着明显不同的“性格”:


MiniMax H3更知道片子最后应该“像什么”,Seedance 2.5更知道导演刚才具体要求它“做什么”。


这也意味着,视频创作者终于有得选了,而且是两个完全不同的顶级选择。


1


三轮同题PK:各有取舍


为了尽量公平,我们把两款模型都跑过的案例放在一起,主要看:复杂指令能不能听懂,镜头和动作有没有执行,人物与空间能不能保持一致,画面有没有成片质感,以及声音、文字、商品等细节能不能稳定下来。


需要说明的是,本轮Seedance 2.5通过小云雀创作Agent测试,产品端可选输出为720P;H3的测试入口和输出规格不同。因此,我们可以比较审美倾向和任务完成方式,不能把清晰度差异全部归因于底层模型。


第一轮导演级的指令跟随,运镜、打光


第一轮,我们先给两款模型塞了一份高难度的奇幻短片脚本。


场景是一座午夜闭馆后的自然博物馆:一只狐狸闯进大厅,撞见正在苏醒的霸王龙骨架,最后还要用鼻尖轻轻碰上去。


模型既要凭空搭起一个稳定的博物馆空间,又要处理狐狸奔跑、骨架苏醒这些完全不同的运动结构;而“一镜到底”又封住了它通过切镜掩盖人物变形和空间漂移的退路。


在这15秒里,我们还塞进了摇臂俯冲、低机位跟拍、甩镜、焦点转移、270度环绕和快速升高拉远五段运镜,同时要求倒影、遮挡、冷暖光线和声音准确配合。


Prompt:


    prompts:生成一段电影级奇幻短片。场景是午夜闭馆后的自然博物馆大厅,高大的玻璃穹顶洒下冷白色月光。大厅中央陈列着一具巨大的霸王龙骨架,两侧是玻璃展柜和古老石柱。地面光滑,可以产生克制、准确的倒影。主角是一只体型真实的成年红狐狸,橙红色毛发、白色胸口、黑色四肢。狐狸的体型、毛色和外观全程保持一致。全片一镜到底,通过连续运镜完成,不能剪辑或突然换景。0~3秒,摇臂俯冲:镜头从博物馆穹顶下方开始,缓慢掠过一具悬挂在空中的巨大蓝鲸骨架。随后摄影机像摇臂一样向下俯冲,穿过鲸鱼肋骨之间的空隙。摄影机下降过程中逐渐向前倾斜,从俯拍大厅转为平视,最后发现红狐狸正从一扇半开的木门中走出来。前景骨架、石柱和远处狐狸形成明显、准确的空间视差。3~6秒,超低机位跟拍:狐狸听见声音,突然向大厅深处奔跑。摄影机迅速降低到距离地面约20厘米的位置,在狐狸左侧平行跟拍。狐狸奔跑动作符合真实动物运动规律,四肢落点准确,尾巴随身体自然摆动。镜头掠过石柱和玻璃展柜,近处物体快速划过,远处霸王龙骨架移动较慢,产生强烈纵深感。狐狸在光滑地面上的倒影必须与动作同步。6~8秒,甩镜与焦点转移:狐狸突然停住,抬头看向上方。摄影机沿狐狸视线快速向右上方甩动,运动模糊自然,准确停在霸王龙巨大的头骨上。焦点先落在前景的一排尖牙上,再平滑转移到头骨空洞的眼窝。一束月光扫过眼窝。霸王龙骨架的头部轻微转动,落下一点灰尘。8~12秒,环绕运镜:摄影机迅速后退并下降,重新找到站在骨架下方的红狐狸,随后围绕狐狸和霸王龙骨架顺时针环绕270度。环绕开始时是狐狸面部近景,可以看见耳朵转动和呼吸。镜头运动过程中逐渐拉远,露出整具霸王龙骨架正在缓慢苏醒:脊椎依次伸展,肋骨轻微张开,尾骨扫过地面,但每一块骨骼仍然保持正确连接。狐狸始终站在原地,警惕地注视骨架。摄影机经过石柱后方时产生短暂、真实的遮挡;重新出现后,狐狸和霸王龙的位置、朝向完全连续。12~15秒,快速拉远与垂直升高:霸王龙骨架突然低下头,将巨大的头骨靠近狐狸。狐狸没有逃跑,而是向前一步,用鼻尖轻轻碰了一下霸王龙的鼻骨。接触瞬间,整座大厅的灯光依次亮起。摄影机立即高速向后拉远,同时垂直升高,从近距离互动变成整个大厅的对称大全景。红狐狸和霸王龙骨架逐渐缩小,蓝鲸骨架重新进入画面上方。最后一秒,博物馆里所有动物骨架同时缓慢转头,看向镜头。摄影机准确停住,画面保持稳定。摄影要求:真实电影摄影,冷色月光与暖色展柜灯形成对比;开头使用24毫米广角,狐狸跟拍接近35毫米视觉,面部近景具有浅景深;运镜有自然加速、减速和惯性;固定空间结构,光源方向一致,遮挡关系准确。声音设计:空旷大厅的环境回声、狐狸爪子接触地面的轻响、骨骼摩擦声、灰尘落下声和电灯逐盏亮起的声音。不要音乐,最后只保留狐狸轻微的呼吸声。负面要求:不要剪辑,不要闪白,不要镜头瞬移,不要让建筑旋转冒充环绕运镜,不要狐狸变形或变色,不要出现多条尾巴,不要让动物脚掌滑行,不要骨骼断裂或数量异常,不要霸王龙长出皮肤,不要错误倒影,不要穿模,不要背景漂移,不要焦点抽搐,不要突然改变镜头焦段,不要卡通风格。


    MiniMax H3输出效果:


    Seedance 2.5输出效果:


    两个结果的差异,第一眼就非常明显:


    H3的电影感首先来自画面本身。狐狸、霸王龙、展柜和穹顶始终待在同一个稳定空间里,没有随着镜头移动胡乱换位;地面倒影基本同步,狐狸的毛色、体型和尾巴也保持了一致。最后狐狸靠近霸王龙,灯光依次亮起,摄影机快速拉远并升至大全景,全程一镜到底,很像一部奇幻电影的结尾。


    但如果逐条核对机位分镜,完成度就没那么高了。开场的蓝鲸骨架俯冲完全消失,低机位侧面跟拍变成背后跟随,狐狸也没有真正奔跑。结尾进入画面的还是一条完整蓝鲸,并非骨架。


    而Seedance 2.5的电影感来自于运镜表现,它几乎把H3漏掉的分镜摄影指令都补了回来:镜头穿过骨架,机位平切到狐狸侧面,掠过石柱和展柜,狐狸真的奔跑起来,地面倒影与本体方向也正确。


    可它的问题正好在另一面。压根没管“一镜到底”的要求,每个镜头单拿出来都像按Prompt拍的,剪到一起却不像发生在同一座博物馆,比如最后的ending大视角下,石柱直接消失了,结尾的几具骨架变成了有皮有肉的真实动物。


    两者的不足之处,恰好是对方的优点。


    AI视频除了做一些创意视频外,真正商用较多的还是广告和短剧,能做好这两个部分,视频模型才能真正进入生产中,而不只是创造者的玩具。


    Prompt:


      图片参考输入素材:


      MiniMax H3输出效果:


      Seedance 2.5输出效果:


      H3保住了两罐产品的大部分关键元素。舞者从罐身走出、触发舞台、重新回到包装,创意形成了完整闭环。开场瓶身扫光、水珠、气泡、开罐声和鼓点都踩在画面节奏上;结尾广告语也准确清晰。


      问题出在精确动作和镜头落点。舞者没有清楚完成后滑步,脚下的蓝色液体波纹没有出现;回到罐身时,立体舞者曾与包装上的平面舞者短暂共存;最后本应推向右侧罐体的镜头,也给到了左侧。


      Seedance 2.5的画面少了一点商业广告式的精致布光,舞者的后滑步同样变成了几步小跑。但它更准确地完成了二维到三维的转化,并在Ending把镜头交给了指定的右侧产品。


      如果只看第一眼,H3更像广告,但如果拿着分镜一条条验收,Seedance 2.5完成得更准。


      还是没分出胜负。


      第三轮:四机位机器人训练,两边都翻车了


      前三轮还在内容创作领域,最后一轮我们把难度推到了“世界模型”。


      多摄像头Ego数据,是今年机器人训练中很流行的一类数据。它把相机安装在机器人的头部、胸前和左右手腕,从机器人自己的视角,同时记录“看到了什么”和“手是怎么操作的”。


      相比固定在房间角落的第三方机位,Ego数据更接近机器人执行任务时真正获得的视觉输入,多个摄像头还能补上手臂遮挡、物体离开视野等信息,让模型理解同一次抓取、交接和装配动作在不同视角下的对应关系。


      从结果上来看,两款模型都失败了,各打一板。


      Prompt:


        生成一段双臂机器人操作训练视频。视频用于检查多摄像头Ego数据的同步性、空间一致性与接触物理,不要拍成电影或产品宣传片。画面采用固定的2×2四宫格,四个画面从第一帧到最后一帧始终同时存在,不得切换位置:左上:机器人头部第一人称相机,100度广角,可以看到双臂、夹爪和完整桌面。右上:左腕部相机,固定在左夹爪上方,镜头方向与夹爪朝向一致。左下:右腕部相机,固定在右夹爪上方,镜头方向与夹爪朝向一致。右下:工作台正上方的外部相机,仅用于核对动作和物体位置。前三个画面属于Ego视角,右下画面是验证视角。四路画面必须表现同一个空间、同一台机器人和完全同步的同一次动作。不得在不同画面中分别重新生成动作。场景是一张带有5厘米方格的工业工作台。桌面上只有一个边长10厘米的红色立方体、一个绿色目标托盘和一根固定不动的蓝色圆柱。机器人是一台固定结构的双臂机器人,左右机械臂、夹爪尺寸和关节数量全程保持一致。0~3秒:机器人保持头部不动。右臂接近红色立方体,右夹爪保持张开。左臂停在桌面左侧。四个画面中,立方体的位置、朝向和机器人动作必须相互对应。3~6秒:右夹爪到达立方体两侧,先接触物体,再闭合并垂直抬起。夹爪不得穿入立方体,立方体不得提前移动。右腕部相机必须跟随右手同步移动,不能像固定机位一样停在原处。6~9秒:右手把立方体移动到双臂之间。左夹爪从另一侧接触立方体并闭合。只有在左夹爪稳定夹住之后,右夹爪才能松开,完成一次真实的双手交接。交接过程中立方体不能复制、消失、悬浮或突然改变方向。9~12秒:左臂把立方体移动到绿色托盘上方并缓慢下降。立方体接触托盘后,左夹爪才松开。物体自然稳定,不得弹跳、穿透、滑出托盘。12~15秒:双臂返回初始位置,红色立方体留在绿色托盘内。蓝色圆柱、桌面、相机位置和环境光线保持不变。多摄像头要求:四路画面必须逐帧同步。同一个接触、抬升、交接和释放事件,在不同视角中的发生时间误差不得超过两帧。同一时刻,立方体只能处于一个空间位置;不同视角中的遮挡关系、朝向、夹爪开合程度和阴影必须符合各自相机的位置。腕部相机必须与机械臂刚性连接。机械臂转动时,腕部画面应产生对应的旋转和位移,不能独立漂移。头部相机和外部相机保持固定,不得自动跟拍。采用真实机器人训练数据质感,光线均匀,所有物体清晰。不要景深虚化、电影调色、慢动作、剪辑、字幕、界面、背景音乐或夸张运动模糊。负面要求:不要生成不同步的四段动作,不要复制立方体,不要左右手混淆,不要交换腕部视角,不要改变机器人结构,不要夹爪穿模,不要物体瞬移,不要违反重力,不要让未接触的物体移动。


        MiniMax H3输出效果:


        Seedance 2.5输出效果:


        H3生成的四个画面都是一个视角;Seedance 2.5有视角差异,但是不管机器人主体还是运动都和Prompt的要求关系不大。


        内容视频只要“看起来连续”就可能过关,机器人训练数据却要求每一帧都满足空间、时间、接触和相机几何约束。今天的通用视频模型已经很会拍戏,但距离可靠地模拟世界,还有一道很厚的墙。


        1


        H3的强项:复杂的细节呈现


        共同测试看完,这两款模型各自的能力还非常值得拆开看。


        H3最有辨识度的地方,是电影质感和丰富连贯的细节能力。它试图打破生成、参考和编辑之间的边界,图片给身份,视频给运动,声音给音色,文字给创作意图,模型把这些东西放进同一段上下文里理解。


        我们来看一组500字的超长、复杂提示词表现。


        Prompt:


          prompts:傍晚下过雨的东京街头,一位穿深绿色风衣、短黑发的年轻亚洲女性站在便利店门口。镜头从她右手拿着的一枚透明玻璃弹珠特写开始,弹珠准确倒映出街道上红色霓虹招牌“MOON 24”。她将弹珠从右手递到左手,手指数量和关节运动必须自然,弹珠始终保持同一个物体的外观和大小。镜头缓慢向后移动,并绕人物顺时针旋转约120度。她同时撑开一把透明雨伞,走下两级湿润的台阶。鞋底踩进浅水洼,水花按照真实物理规律向外溅开,风衣下摆受到微风影响轻微摆动。雨伞和玻璃橱窗中都能看到与人物动作同步、方向正确的倒影。一辆黄色出租车从画面左后方驶过,车身短暂遮挡人物,但车辆离开后,她的脸、服装、发型和手中弹珠必须与遮挡前完全一致。镜头最终停在中景。她抬头看向镜头,露出克制的微笑,然后把弹珠举到眼前。此时夕阳从云层中出现,环境光由冷蓝色自然过渡为暖金色,玻璃弹珠在她脸上投下一个微小而真实的彩色光斑。整体采用真实摄影质感,35毫米镜头,浅景深但主体始终清晰,运镜稳定流畅,皮肤保留自然纹理,湿地反光准确,动作连续,没有慢动作,没有镜头跳跃。负面要求:不要剪辑,不要人物变脸,不要改变服装,不要增加或减少手指,不要让物体突然出现或消失,不要错误倒影,不要文字乱码,不要画面闪烁,不要肢体穿模,不要不符合物理规律的水花,不要过度磨皮,不要卡通感。


          MiniMax H3输出效果:


          H3对这段长Prompt的整体理解很好。东京街头的大背景下,生成的人物角色非常日系,还原了弹珠特写中的“Moon 24”光斑细节,完全超出了预期。


          另外,左右手交接、开伞、出租车经过、人物抬头和光线由冷转暖,基本按照顺序出现。人物面孔、服装和发型也保持稳定了。


          但逐条对照就能看到它在精确执行上的取舍。镜头并没有真正绕人物旋转120度,更多是在用画面倾斜制造运动感;出租车经过后,雨伞和弹珠悄悄换了手;橱窗里的同步倒影也没有做出来。


          只要你不拿着放大镜看,单看视频效果艺术感十足,值得被称赞一句开源SOTA。


          1


          Seedance 2.5的强项:准确的镜头运动


          而Seedance 2.5最值得单独测试的是30秒直出。它的意义并不只是把生成时长翻倍,而是要求模型在更长时间内持续记住人物、空间和运动状态。在和H3同题PK时,也能明显感觉到,Seedance对镜头运动的执行更准确。


          30秒真正增加的,是时间翻倍之后所有可能出错的东西。我们在新的Prompt里塞进了航拍俯冲、低机位跟拍、正面后退、固定俯拍、甩镜、环绕和车辆追踪,人物还要连续完成奔跑、翻越、滑行、起跳、上车和转弯。


          Prompts:


            一位约27岁短发亚洲女性,穿黑色防水夹克、深灰色工装裤和黑色运动鞋,斜挎带亮橙色肩带的黑色防水邮差包,包始终固定在身体左侧。写实犯罪动作电影短片,深夜暴雨中的工业港口集装箱通道。通道左侧是蓝色集装箱,右侧是红色仓库墙,通道尽头有一道正在缓慢下降的金属卷帘门。低饱和青蓝色环境光,橙红色港口警示灯局部对比,湿地反光、雨滴、水花符合真实物理规律。全程正常速度,无慢动作。第0-4秒画面:运镜:俯冲下降,镜头从港口上方约20米处快速但平稳向下俯冲,由垂直俯拍逐渐倾斜为约45度视角,画面掠过起重机钢架和堆叠的集装箱,最终找到从红色仓库门冲出的女性,她落地后立即沿通道向出口奔跑。远处卷帘门已经开始缓慢下降。近处钢架移动更快,远处集装箱移动较慢,形成真实空间视差。<暴雨声持续低沉><远处港口汽笛声>第4-8秒画面:硬切到距离地面约40厘米的侧面跟拍镜头。运镜:侧面跟拍,镜头与女性平行移动,她从画面左侧向右侧奔跑。前方出现一道约80厘米高的金属护栏,她不减速,右手撑住护栏,收起双腿从护栏上方连续翻越,手掌先接触护栏,身体重心越过,双脚依次落地,膝盖弯曲,鞋底踩进浅水洼,水花向运动方向后方飞溅。背包固定在左侧自然晃动。<手掌拍击金属声><脚步踩水声>第8-12秒画面:硬切到正面广角镜头。运镜:迎面跟拍,镜头位于她前方约两米,使用稳定器快速向后移动,她朝镜头方向奔跑但不直视镜头。港口探照灯从她身后地面横向扫过。她短暂回头确认身后情况,随后重新看向前方,头部转动不改变奔跑方向,脚步和手臂摆动保持自然。镜头轻微上下起伏但不剧烈摇晃。<急促呼吸声><脚步踩水声>第12-16秒画面:硬切到卷帘门正上方固定垂直俯拍镜头。运镜:固定机位,镜头位置和方向保持不变。卷帘门距离地面约一米并继续稳定下降。女性跑到门前主动降低重心,先屈膝再向前滑行,双腿、身体和背包依次从门下通过,身体完全通过后卷帘门才接触地面。她利用滑行惯性越过门槛,双手短暂撑地后起身继续向前移动。<卷帘门电机嗡鸣声><衣料摩擦声><手掌撑地声>第16-20秒画面:硬切到卷帘门外侧贴地近景。画面拍到她的右手和鞋底接触地面,她用右脚蹬地起身再次加速奔跑。运镜:甩摇,镜头沿她的运动方向完成一次水平甩镜,从手脚近景追到她的侧后方,甩镜过程出现自然运动模糊,结束时恢复清晰。摄影机稳定跟随她奔向前方的哑光黑色摩托车。她跨过一条约半米宽的积水沟,起跳腾空落地连续,水面只在落地位置产生真实波纹和水花。<脚步蹬地声><水花飞溅声>第20-25秒画面:女性跑到摩托车左侧,先用左手握住车把,以左脚为支点将右腿从车座后方跨过坐到摩托车上。运镜:环绕拍摄,镜头围绕人物和摩托车顺时针环绕约140度,从左侧中景移动到右后方低机位,环绕过程中摩托车、人物和背景位置保持连续。她坐稳后用右手启动摩托车,圆形车灯点亮,后轮开始转动,摩托车启动前保持完全静止。她转动车把驶离原位,轮胎压过积水向后甩出扇形水雾。<摩托车引擎启动声><轮胎压水声>第25-28秒画面:硬切到摩托车左后方高速追踪镜头。运镜:跟随拍摄,镜头与摩托车保持约三米距离沿同一方向平行加速。女性俯低身体,摩托车在两排集装箱之间快速前进。她绕过道路中央一个静止的木箱,摩托车先向右倾斜转向避开木箱后自然回正,车轮始终接触地面。背景灯光快速划过,集装箱本身不移动。<摩托车引擎加速声><风声>第28-30秒画面:摩托车驶出集装箱通道穿过港口出口。运镜:拉升离场,镜头在跟随过程中迅速升高向后拉远,从车辆追踪镜头连续变成港口大全景。黑色摩托车沿湿润公路驶向远处,红色尾灯逐渐缩小,港口起重机、集装箱通道和已关闭的卷帘门同时进入画面。最后半秒镜头稳定停住不继续旋转。<远处港口汽笛声><摩托车引擎声渐远>声音设计:低沉快速的原创打击乐节奏贯穿全片,节拍与切镜和关键动作基本同步。保留清晰的暴雨声、急促呼吸声、脚步踩水声、手掌接触金属护栏声、卷帘门电机声、衣料摩擦声、摩托车启动声、轮胎压过积水声和远处港口汽笛声。无对白。写实电影摄影,2.39:1电影画幅构图。人物面孔、发型、身材、服装和背包全程保持一致,背包只能按惯性自然晃动,不能消失、复制或换边。每次切镜延续上一镜头的动作方向、人物姿态和空间位置。运镜有自然加速减速惯性,不突然瞬移。不要追兵、路人或第二位主角。五官清晰不变形,人体结构正常,服装发型一致,4K超高清,画面稳定,电影质感。不要生成水印,不要生成logo,保持无字幕。时长:30秒,比例:16:9。


            Seedance 2.5输出效果:


            原本写进Prompt的八段镜头基本全部出现了,运动表现也很好,声音跟着动作走,脚步踩水、金属碰撞、卷帘门电机和摩托车启动声分别落在对应镜头里。


            但致命的问题在于,镜头的最后,一艘本该在水面上的远洋货船,出现在了水泥地上。


            1


            开源搅动竞争,接下来更热闹


            直接的对比之后,会发现两个模型有很不同的“性格”。


            Seedance 2.5完成了更多明确写进Prompt里的镜头动作,在时间轴控制、原生30秒和大规模素材参考上,也依然有非常清晰的优势。


            但有时更重要的是,当一个任务复杂到无法全部完成时,它们分别选择牺牲什么。


            H3的错误大多是“少做”,例如在博物馆测试里,它漏掉了蓝鲸骨架俯冲和侧面跟拍,却守住了一镜到底、角色形象和空间连续;在其他测试里,它也会删掉部分动作,但会优先保证人物、场景、光线和音画关系仍然属于同一条片子。


            而Seedance 2.5的问题则更容易变成“做错”。它可以完成更多指定运镜,却会通过切镜绕开一镜到底;可以拍完30秒的动作大片,却在最后把本应位于水面上的远洋货船放到水泥地上;可以调用更多素材,但对素材在整个任务里究竟承担什么作用,有时理解得并不牢靠。


            在能力对比之外,价格也是一个很重要的因素。


            H3官方2K定价为0.8元每秒,同时宣布即将开放权重;Seedance 2.5继续采用闭源产品路线,其上一代公开价格和我们此次的实际使用成本也明显更高,2.0 720P定价接近1元每秒,1080P超过2元每秒。



            开源和低价不会凭空让一个模型变强,但当它的生成能力已经进入第一梯队,这两件事会让优势迅速从一次评测扩散到部署、适配、微调和整个开发者生态。


            Seedance 2.5仍然很强。如果任务依赖明确的时间点、密集的镜头调度、原生30秒和大量参考素材,它依然是一个强大的执行工具,把视频生成推向一套更长、更大、更明确的工业化生产。


            毕竟视频创作,并不是只有唯一答案的Benchmark,它同时包含审美、运镜、人物一致性、素材理解、时间控制、制作成本和工作流适配,不同任务对这些能力的排序完全不同,而MiniMax H3和Seedance 2.5已经明显处在同一个能力梯队,并在解决两种不同层次的问题。


            两年前,我们还在问中国视频模型什么时候才能追上Sora。那时似乎只有一个标准、一个方向,以及一个需要追赶的答案。


            而现在,这样强的视频模型,创作者们有了多个选择,甚至有开源选择了。接下来多模态领域的竞争会因此出现更有趣的变化,会变得更加热闹。

            AI原生产品日报频道: 前沿科技
            本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
            如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
            正在改变与想要改变世界的人,都在 虎嗅APP