找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4201

积分

0

好友

553

主题
发表于 2 小时前 | 查看: 4| 回复: 0

7月31日,抢在 Seedance 2.5 发布之前,MiniMax H3 提前交卷了。

一上线,它就以 1130 的 Elo 分数超过 Gemini Omni Flash,登顶 Artificial Analysis 全球带音频视频编辑榜首位。

Artificial Analysis视频编辑排行榜,MiniMax H3以1138分位列第一

价格也被压到了新低。会员生成 2K 视频最低约 0.4 元/秒,768P 版本更是低至 0.23 元/秒。作为对比,按同样的会员套餐折算,Seedance 2.0 生成视频约为 2.97 元/秒。

也就是说,H3 的 2K 价格还不到 Seedance 的七分之一,768P 更是压到了十分之一。只花 Seedance 的零头,就可以做出同一档的商业视效!

下面这些是网友生成的案例,效果已经相当炸裂:

[视频无法嵌入,请至原文查看]

[视频无法嵌入,请至原文查看]

[视频无法嵌入,请至原文查看]

更狠的是,H3 还直接开源了。现在就可以把模型部署进自己的工作流。

云栈社区,大家这几天也都在热议这个话题:能力能打,价格又压到了这个水平,生成内容生产的门槛确实肉眼可见地在降低。说实话,我也坐不住了,赶紧上手尝了个鲜。

一、我的实测

所有实测视频的提示词我都已经放在文末,大家可以直接复制粘贴去体验。

这是用 H3 跑的 GTA 实机画面。

[视频无法嵌入,请至原文查看]

生成时,我把视频分成了三个部分。第一部分是 GTA 里经典的街头抢车。角色从背后视角跑向汽车,完成上车后,镜头自然切入驾驶视角。

说实话,这个把驾驶员拽下来的动作很有那味儿了...

游戏角色将驾驶员从红色跑车中拽出的动态过程

第二部分是人物选择界面。

很多游戏美宣视频都会用这种方式展示角色,让人物依次进入画面,再通过鼠标完成选择。这里我没有提前设计人物的运动轨迹,只给了提示词和参考图,H3 就自己补全了角色的登场动作,界面也能根据选择做出反馈。

游戏角色选择界面,展示角色依次起立展示招牌动作的全过程

第三部分是一段游戏内的银行枪战,主要测试模型能不能理解“任务推进”的含义。角色进入银行后,NPC 会根据枪声做出反应,通缉等级也随剧情发生变化。

整条视频跑下来,可以看到 H3 对“游戏镜头”的理解很到位。它知道第三人称视角应该怎么跟随角色,也知道进入任务后还要主动加入游戏 UI。

很多镜头转换都贴近 GTA 的实机操作。比如这里上车的镜头运动,整个过程衔接得很自然,保留了玩家操控时特有的跟随感。

游戏角色上车并驾驶红色跑车的连续动态过程

抢钱跑出去的时候,这个视角转动也非常丝滑。

角色持枪携款从银行逃离的动态过程

然后,我又用 H3 跑了一支 Kpop MV 和一支跑酷广告片,实测它处理复杂视觉图层的能力。

MV 走的是千禧年 Y2K 路线。复古 Windows 弹窗贯穿了整支视频,画面会跟随歌手的表演不断变化。

[视频无法嵌入,请至原文查看]

视频中,歌手还会举起手和画面的特效弹窗互动,手部动作能够准确落在弹窗的位置上,接触关系也很稳定,没有出现物理错乱。

镜头从全身切到嘴唇特写后,人物特征依然保持稳定。中间出现的金属花字也能准确显示,整支 MV 的包装相当完整。

跑酷广告片的灵感来源于蜘蛛侠多元宇宙,整体来说对运动能力的要求更高,因为人物始终处在高速移动中,镜头还要同步跟随。

我设计的动线是人物从地铁隧道开始冲刺,列车出现后完成闪避,最后跳到空中完成收尾。加入漫画箭头和速度线,自然过渡到彩色漫画画面,并用“KEEP RUNNING”花字作为收尾背景。

真人版:
[视频无法嵌入,请至原文查看]

动漫版:
[视频无法嵌入,请至原文查看]

真人版最大的亮点是现场感。

隧道灯光会随着人物移动不断扫过身体,列车靠近时,画面的亮度和压迫感也随之增强。高速运动下,黄色外套始终充当视觉焦点,让观众能够牢牢跟住人物,整个广告的节奏很快,画面却不会乱。

而动漫版的视觉语言更夸张。人物冲刺时,背景透视被大幅拉伸,鲜艳色块也会跟随动作爆开,整支广告的情绪始终保持在高点。风格从头到尾非常统一,也更容易形成鲜明的品牌记忆。

中间还有一段 2D 到 2.5D 的转换,让整个跑酷过程更有层次,有点多元宇宙的感觉了。

两个版本放在一起,你觉得哪一个更带感?

我又用 H3 跑了一支真人香水广告,测试它处理强影调氛围的商业广告的能力。

[视频无法嵌入,请至原文查看]

开场 H3 先用剪影隐藏模特面容,通过聚光灯建立神秘感。随后镜头进入人物特写,香水瓶穿插出现。最后,模特完成喷香动作,画面回到产品定妆镜头。

这条片的快切密度很高,15 秒内切换了十多次。镜头频繁改变景别,还要在人物与产品之间保持统一的情绪,还是比较考验模型对画面节奏的控制。

最终效果挺惊艳的。

香水广告视频的分镜与提示词说明,展示氛围与镜头设计

人物部分我给了参考图。但视频里的侧脸和背影需要根据参考图,让模型自己补全,强逆光下的人物轮廓也要重新建立。

H3 在这些变化中保持住了人物特征,回到正脸特写时没有明显漂移。个人感觉,H3 的人物一致性已经控得比较成熟了,足以支撑这种高密度的商业快切。

说到人物一致性,我又测试了 H3 在电商带货场景里的表现。

[视频无法嵌入,请至原文查看]

视频开头,主播拿着粉底液对镜介绍,表情和口播状态都很自然。大约 5 秒后,画面切到产品特写,再直接进入粉底上脸的环节,结构很符合短视频带货的节奏。

后半段的难度更高。人物的脸几乎占满画面,手指还要连续经过脸颊,模型需要在大面积遮挡下维持五官。实际生成中,眼睛和鼻子的结构基本没有变化,手指也没有突然变形。粉底从点状逐渐被推开,最后还能自然过渡到完整妆效。

不过也有不足的地方:粉底从铺开到完全贴合皮肤的过程没有完整呈现,画面直接切到了最终妆效。像这类细腻且连续的物理交互,在 人工智能 驱动的视频生成领域,仍然是个需要持续攻克的难题。

最后,我又让 H3 跑了一段旅行 App 的 UI 交互动效,主要想测试它能不能理解不同页面之间的层级关系,并把静态设计稿还原成一套完整的操作流程。

[视频无法嵌入,请至原文查看]

我只给了四张界面图,H3 就自动补出了按钮反馈和页面转场,把首页、行程规划、地图导航一路串到旅行回顾。进入新页面时,原有的视觉元素会自然退场,地图中的底部卡片也能按照正常的交互逻辑弹出,整个过程没有打乱原本的信息层级。

四张旅行App界面截图及其对应的UI交互动效提示词

这类视频很适合用在产品提案和功能演示中。设计师做好核心页面后,可以先用 AI 快速跑出交互效果,提前判断页面之间怎么衔接、动效节奏是否舒服,也方便客户更直观地理解产品最终会怎么使用。H3 效果很好,用来展示产品概念,已经相当够用了。

二、如何使用

打开链接下载 MiniMax Hub:

https://hub.minimaxi.com/

MiniMax Hub官网首页截图,展示H3发布及下载入口

点击视频生成对话框,在左下角可以切换模型,试用 H3。

模型选择界面,当前选中MiniMax H3,右侧为动漫跑酷示例

目前支持12张图片参考,有全能参考首/尾帧参考角色参考三种模式。

视频生成参考模式选择面板,提供全能参考、首尾帧等选项

比例支持自动适配,以及 21:9、16:9、4:3、1:1、3:4 和 9:16,横屏、方屏和竖屏场景基本都覆盖了。分辨率支持 768p 和 2K,生成时长可以从 4 秒自由选择到 15 秒。

建议大家可以大胆尝试 15 秒视频的生成。据我实测,H3 在长时生成中的稳定性相当不错,废片率很低。

视频参数设置弹窗,显示2K分辨率与15秒时长选项

工作界面是这样的:

MiniMax工作界面截图,显示四宫格MV片段预览及提示词

一次可以抽卡 4 个视频,15s 的视频,抽一个在 3 分钟左右。

三、极致性价比

做 AI 视频的人都懂,最烧钱的往往是反复抽卡。前面提到,H3 的废片率极低,这让它的账面价格更接近实际生产成本。

  • 按照年度 Pro 会员的额度折算,H3 生成 2K 视频最低约 0.4 元/秒,一条 15 秒视频大约需要 6 元;768P 版本低至 0.23 元/秒,同样时长只需要 3.45 元。
  • 即梦网页端使用 Seedance 2.0 生成一条 15 秒、1080P 视频需要 495 积分。按照标准连续包月会员 199 元、包含 2210 积分计算,一条视频约为 44.6 元,折合约 2.97 元/秒。

把数量放大以后,差距会更加明显。生成 100 条 15 秒视频,Seedance 2.0 的折算价格约为 4455 元,H3 的 2K 版本约为 600 元,768P 版本约为 345 元。

一只指向镜头的猫,表情仿佛在表达对H3价格的难以置信

也就是说,对于需要批量制作广告素材的团队来说,同一笔预算可以多跑出数倍成片,测试创意时也不用再对着积分精打细算。这个价格,很难不让人心动。尤其对于更新频率高的内容团队,H3 很适合拿来长期跑素材。

四、所有case的提示词

最后,我附上所有实跑 case 的提示词。大家如果对其中某种效果感兴趣,可以直接复制对应提示词,去官网体验。

GTA 6 复刻

需要用图片生成模型(即梦或者 GPT Image 2.0)先生成首帧参考图,然后使用视频提示词。

第一部分:抢车

@参考图,第三人称越肩游戏视角,镜头始终跟随女主背影。女主以富有力量感的姿态向前奔跑,靠近前方一辆红色汽车后,迅速打开车门,将驾驶员拽下车,随即俯身坐进驾驶位并关上车门。整个过程保持连续的游戏跟随镜头。

第二部分:游戏人物选择

@参考图,游戏画面第一阶段选择角色,鼠标依次划过角色,同时镜头推进特写,每个角色依次起立展示自己的招牌动作pos,掏枪或者说英文台词。最后选择金发女性角色,她立刻摆pos说台词,进入加载页面。

第三部分:

@参考图,主角背对镜头,手持黑色狙击步枪推门进入银行。两名敌对 NPC 在前方举枪阻拦,主角开枪将其击倒,只有枪口火光和环境碎屑,无鲜血。警报响起,红色警示灯闪烁,主角冲向柜台,将现金装进黑色旅行袋。随后转身冲向出口,门外停了一辆警车。整体呈现逼真的次世代游戏质感,动作连贯,节奏紧张。

Kpop MV

15 秒千禧年 Y2K 多巴胺风格说唱 MV。年轻女歌手身穿亮粉短夹克、银色低腰工装裤,戴彩色窄框墨镜,在未来复古电脑房中自信说唱。镜头跟随鼓点快速推进、甩动和旋转,在广角全身、鱼眼近景与低机位之间切换。Windows 98 风格弹窗不断出现,歌手会推开窗口、穿过界面,并与弹窗特效互动。画面采用荧光粉、电光蓝和柠檬黄,加入像素爱心、CD、镭射贴纸与巨大花字。整体高饱和,带有 DV 噪点和扫描线。结尾窗口瞬间崩溃铺满屏幕,歌手从蓝屏中探出头,镀铬花字砸向镜头。

跑酷广告

真人版:

15 秒,16:9,真人地铁跑酷高燃片头。仅出现一名原创年轻男性跑者,保持真实五官、皮肤和服装质感。跑者在三条地铁轨道间冲刺,镜头高速后退跟拍,他连续变道躲避列车,翻越护栏,滑铲穿过障碍,最后跃上行驶中的列车顶部。镜头在正面、侧面和俯视角度间快速切换。画面融合高饱和美漫电影风格,加入粗黑描边、半调网点、CMYK 错版、RGB 偏移、跳帧残影和速度线。花字“RUN!”“DODGE!”“JUMP!”随动作闪现。结尾跑者跃在半空定格,巨大“KEEP RUNNING!”砸向画面,白色爆闪后切黑。

动漫版:

15 秒,16:9,动漫地铁跑酷高燃片头。画面中仅有一名原创年轻男性跑者,采用粗黑轮廓与清晰色块阴影,二维手绘角色与三维城市融合。跑者在地铁轨道间高速冲刺,连续变道躲避列车,翻越护栏,滑铲穿过障碍,最后跃上列车顶部奔跑。镜头高速后退跟拍,并在正面、侧面和俯视视角间快速切换。画面加入半调网点、CMYK 错版、RGB 偏移、跳帧残影和漫画分格,花字“RUN!”“DODGE!”“JUMP!”跟随动作闪现。结尾跑者跃入漫画色块组成的空间裂缝,在空中定格,巨大“KEEP RUNNING!”砸向画面,爆闪后切黑。

真人香水广告

需要用图片生成模型(即梦或者 GPT Image 2.0)先生人物图片和产品图片,然后使用视频提示词。

15 秒,16:9,神秘奢华的真人香水广告。韩系冷艳女模 @图片1 置身深蓝舞台,强逆光和聚光灯勾勒人物轮廓。画面跟随电子舞曲快速切换:低角度剪影、侧脸转头、甩发回眸、身体局部与嘴唇特写,女模戴上黑色墨镜,冷酷地直视镜头。香水 @图片2 穿插出现,展示瓶身旋转、光泽轮廓和喷洒瞬间。快切过程中加入闪光、烟雾和背影镜头,人物特征与香水外观始终保持一致。结尾女模在聚光灯下走向舞台深处,画面切至黑底香水定妆特写。女模台词:“我的气味,由我定义。”整体电影感强,运镜流畅,卡点干净有力。

海外电商带货

需要用图片生成模型(即梦或者 GPT Image 2.0)先生人物图片和产品图片,然后使用视频提示词。

9:16,15 秒,真实北美 TikTok 美妆带货视频。漂亮女主播坐在公寓梳妆台前,下午自然光侧照,保留真实毛孔。0—4 秒,她将 LUMERA Skin Veil Foundation 举在脸旁:“Wait until you see this finish.”4—7 秒切至瓶身微距,品牌与液体清晰稳定:“Lightweight and made to look like skin.”7—12 秒切脸部近景,粉底已点在脸颊,她用两根手指连续打圈抹匀:“No streaks, no cakiness.”12—15 秒侧脸展示妆前妆后差异:“Smooth and completely natural.”全程保持产品一致,省略开盖、取液和点涂过程,避免美妆工具、手部畸形、塑料皮肤及文字变化。

UI 界面动效

需要用图片生成模型(即梦或者 GPT Image 2.0)先生成 4 张 UI 界面,然后使用视频提示词。

9:16,15 秒,旅行 App UI 交互动效,正面平视,界面全屏,不出现手机外框、鼠标或手指。严格保持参考图的字体、配色、英文文字和页面布局。0—3 秒展示图 1 首页,卡片依次浮现,点击“Plan this trip”。3—7 秒进入图 2 行程页,“Day 2”自动选中,时间轴展开并触发“Optimize day”。7—11 秒时间轴自然转为图 3 地图,路线逐段绘制,定位点移动,底部导航卡弹出。11—15 秒切换至图 4 回顾页,照片展开,数据递增,Day 1—5 依次点亮,最后按钮微微发光。整体动效克制流畅,避免文字变形、元素漂移和布局错乱。

五、总结

两年前,在生视频这个领域,AI 还在新手村打怪练级。生成的视频转场非常生硬,画面还莫名有种油腻感。

但今年,情况已经彻底变了。不知不觉间,AI 成了创作中的常用工具,从广告片、电商物料,到游戏画面和 UI 设计,它的应用越来越广,效果越做越好,成本反而越来越低。

可当生成效果跨过“能用”这条线以后,行业真正缺少的东西也变了。当团队手里已经有产品图、人物素材和品牌视觉时,模型能否真正理解这些内容,一次性生成能用的商业级成片?

H3 瞄准的,正是这条更务实的赛道:让 AI 视频真正进入生产流程

它的优势在于,能够把不同素材理解成同一个完整的视觉任务。产品应该怎样展示,人物如何进入画面,Logo、UI 和视效应该以什么节奏出现,它都能统一组织。生成的也不再是漂亮的单镜头,而是一支具备商业视频应有结构和包装的成片。

开源则又给这条路线增加了一层想象空间。团队可以围绕自己的内容需求部署模型,逐渐沉淀专属素材和制作方法,让同一套能力持续服务于业务。

所以,H3 并未和 Seedance 争抢长时叙事的高地,而是专注于商业视频规模化生产。画质和电影感的上限仍会继续被刷新,而 H3 想解决的问题,是让更多团队能够稳定、持续地把视频做出来。

最后说下如何体验,在 HailuoMiniMax Hub 上都能直接体验,如果你是 Hub 用户,还能免费体验 3 次 H3 视频生成。




上一篇:EDUSRC实战:AI辅助挖掘SSRF、JWT伪造与信息泄露漏洞案例
下一篇:SparkyLinux 8 深度测评:基于 Debian 的轻量级发行版如何同时做到极度精简与功能全面
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-4 05:51 , Processed in 1.293648 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表