找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4601

积分

0

好友

595

主题
发表于 1 小时前 | 查看: 2| 回复: 0

Wan3.0正式上线主视觉

近一个月来,视频模型赛道格外热闹。

一方面,各大厂商密集发布最新模型。7月31日,MiniMax H3 和 Seedance 2.5 同日发布。前者支持 15 秒 2K 原生音视频和多模态统一输入;后者将单次生成提升至 30 秒,并强化多模态参考和时间戳编辑。

8月24日,阿里 Wan 3.0 结束公测并正式上线。截至8月27日,Wan 3.0 位列 Artificial Analysis 有声文生视频和有声视频编辑双榜全球第一,最长支持 30 秒生成,并将文字、图片、视频、音频、文件和网页统一纳入视频创作流程。

可以看到,AI 视频模型正迎来性能井喷,升级方向也高度一致:视频更长、音画一体、参考素材更多、修改更精准,生成结果越来越接近实拍质感。

这轮发布潮并非偶然。短剧、广告、教育和企业内容等市场正在形成稳定需求,视频模型也在时长、控制和一致性上集体提升。技术开始接住更复杂的任务,足够大的市场则容纳了更多技术路线和产品选择。

另一方面,优质模型的加速供给,也正在催化市场价格体系趋同。

7月31日,MiniMax H3 发布,768P 分辨率每秒价格低于主流模型二分之一,为 0.5 元/秒。之后,Wan 3.0 公测,720P 价格维持在上一版模型 Wan 2.7 的水平——0.6 元/秒;Seedance 2.0 fast 限时折扣,也来到 0.6 元/秒。

AI 视频由此更大规模进入生产流程,行业也需要一套不同于“Demo 时代”的评价标准。以 Wan 3.0 为代表的模型涌现,似乎正逐渐成为 AI 视频领域新的斩杀线,划出一条“生产级基准线”,搅动行业格局。

AI视频“一家独大”格局松动

AI 视频行业长期处在供给决定需求的状态,价格被推得很高。据说,有创作团队为了避开高峰,把白天的生成任务挪到深夜提交,工作时间开始围着模型的算力窗口调整。

这种情况如今有了很大改善,由少数供给决定市场规模的格局开始松动。优质模型第一次集中以更低价格争夺开发者、创作者平台和企业客户。

H3 以最高 2K、原生音频、开放权重路线和较低成本进入市场;Wan 3.0 正式上线当天,LibTV、Flova AI、TapNow、Pollo.ai 等企业也同步公布接入或使用情况。市场欢迎的不只是一个新模型,更是同等能力区间内新增的选择。

优质供给的增加很快反馈在价格上:Wan 3.0 将 720P 标准 API 价格定在 0.6 元/秒,H3 也把不同分辨率下的调用成本压到主流模型的一半甚至三分之一。

与此同时,全球视频模型的能力格局也在变化。在 Artificial Analysis 有声文生视频和视频编辑榜单前列,中国厂商推出的模型已经占据多数席位。国内模型的角色正从追赶者变成全球 AI 视频 API 市场的重要供给方。

Artificial Analysis视频编辑排行榜:Wan3.0位居第一

(视频编辑排行榜,数据来源:Artificial Analysis,近一个月排名)

Artificial Analysis文生视频模型排行榜:Wan3.0排名榜首

(文生视频模型排行榜,数据来源:Artificial Analysis,近一个月排名)

这轮变化里,排在 Artificial Analysis 榜首的 Wan 3.0 有一定标志性。它把能力推到生产级,同时将 720P API 价格维持在上一版模型水平,这让市场看到,优质 AI 视频不必继续与高价格、低供给绑定。

买方与供应商的关系也在重建。市场出现了 WeToken 这样的视频模型 API 聚合平台,他们处在基础模型厂商与内容团队之间,一头采购模型 API,一头承接企业的创作任务,再根据场景、预算和服务情况调度模型。过去,客户围绕一个强势模型设计工作流;现在,多模型路由开始成为越来越多平台的基础能力。

这是因为对企业来说,多一个优质模型并不只是多一个选项。接入某款模型后,团队还要围绕它建立提示词、审核、后期和交付流程。一旦业务完全绑定于单一供应商,价格调整、接口排队或服务波动都会传导至整条生产线。

因此,市场天然需要多个头部模型相互补位,也需要更稳定的多模型供应体系。

Wan 3.0划出了一条怎样的“生产级基准线”?

如果说 DeepSeek 为文本大模型划出了一条性能与成本的“斩杀线”,Wan 3.0 带给 AI 视频行业的,则是一把面向真实生产的标尺。一款模型能否进入企业工作流,至少要看四项指标:效果上限、结果稳定性、成片经济性和工程服务能力。

效果上限首先体现在真实感,这是最难、也最容易被感知的指标。最新的 Seedance 2.5 和 Wan 3.0 都将其作为本轮升级重点。

WeToken 技术负责人 Lu Zhao 认为,许多 AI 视频之所以一眼就能被识别,往往是因为人物过于“塑料”,微表情和动作不自然。视频越长、人物越多,需要模型持续维持的时空关系越复杂,真实感也越难保持。

所以,当模型精准还原真实世界后,市场感到欣慰。广州筷子信息科技有限公司 CTO 陈龙认为,Wan 3.0 让商品、人物保持稳定,口播自然,接近真实广告拍摄水平。“这意味着我们能帮客户更快、更高效地出爆款,加速商业价值的传播与转化。”

Wan3.0生成蒸汽朋克风格角色视频演示

视频来源:三代科技

进入生产线,模型还要接受真实项目的检验。Lu Zhao 的团队会用同一份 Brief 和参考图同时测试多个模型,比较第一次生成的可用程度、达到交付标准所需的轮次,以及客户修改、人力和时间成本。

在这套以交付为目标的测试中,不同模型已经呈现出各自的长项:复杂动作、大场面、打斗和特效镜头,Seedance 整体表现更稳;人物对话、中近景特写和剧情推进等场景,团队会更多使用 Wan 3.0,后者在角色一致性、人物表情和皮肤质感方面表现突出。按照镜头类型分配模型,已经开始进入实际生产流程。

到了生产流程,稳定则成为基本要求。稳定性可以拆成一组具体问题:人物跨镜头会不会漂移,人与道具的空间关系能否保持,30 秒视频进入后半段是否崩坏,同一套提示词批量生成时能维持多高的成功率。比如,在短剧与影视业,井英科技 CTO 王健提到,Wan 3.0 成片细腻稳定、可用率高。巨日禄联合创始人斯宇认为,Wan 3.0 在视听质感与稳定性全面升级,这些稳定性指标,最终都指向了规模化生产。

Wan3.0生成复杂交通事故驾驶场景视频演示

视频来源:LibTV

规模化生产后,模型的稳定性直接关联成片账本。一个单次价格较低、却要生成十次才能获得可用结果的模型,综合成本可能高于一个尝试三次便能完成任务的模型。

除了稳定,优质模型和创作者平台还在突出性价比。模型你追我赶,限时优惠不止一家:8月7日,Seedance 2.5 API 上线后,Seedance 2.0 fast 限时 75 折;8月24日,Wan 3.0 正式上线后限时七折,在各大创作者平台,优惠力度还能更大。

性价比有了,规模化调用构成最后一道检验。阿里云官方文档显示,Wan 3.0 API 目前覆盖华北、新加坡、日本、德国和美国等区域,各区域每分钟请求上限为 300 次。对于平台和企业,API 吞吐、接入效率、服务稳定性和客户支持,同样会影响模型选型。

Wan 3.0 划出的“生产级基准线”,由第一梯队的效果、稳定的出片率、可计算的成片成本和规模化服务能力共同构成。它让行业判断一款视频模型能否进入生产,有了一把更加具体的尺子。

AI视频跳出内容生产

第一梯队模型陆续增加以后,竞争激烈,但整体市场反而在扩大:优质模型的出现降低了调用成本和使用门槛,加速了行业应用落地。

首先是海外市场正在不断扩大。据 WeToken 提供的数据,成立后的 3 个月内,其 ARR 已经突破 1 亿元人民币,海外市场收入是国内的 7 倍,付费意愿更高。Lu Zhao 认为,海外市场的 ROI 更容易计算。传统广告制作涉及摄影、演员、场地和后期,项目周期可能持续数天甚至数周;一些内容转由 AI 生成后,还能同时制作不同语言和地区的版本,批量生产带来的价值足以覆盖模型费用。

视频生成的应用边界也在不断扩展。当前人们谈论 AI 视频,首先想到的仍是短剧、广告和社交内容,但下一阶段的增量,首先可能来自更广泛的企业内容。 企业内部沉淀着大量 PDF、PPT、操作规范、产品说明和培训材料,过去需要专业团队重新编写脚本、拍摄和剪辑。

例如,化工企业可以将安全手册转化为设备操作、风险识别和应急处置视频;制造企业可以把装配规范变成流程演示;产品团队可以依据商品资料和品牌手册批量生成营销内容;教育机构则可以把古诗、历史事件和实验过程变成动态讲解。

各家模型在这些场景中已经表现出不同侧重。H3 强化了文字和品牌元素的准确呈现,字幕、标识和产品文案更容易直接进入广告、电商与品牌内容;Seedance 官方已经将机器人训练和自动驾驶长尾场景列为视频生成的产业应用方向;Wan 3.0 通过读取文档、表格和网页,缩短业务资料进入视频生成流程的路径,这也是 Wan 3.0“万物生视频”在企业场景中的具体落点。

当视频进入企业信息表达,电影感的重要性会有所下降,信息准确、流程完整、设备还原和版本可追溯变得更加关键。

这些场景对模型提出了不同于影视创作的要求。虽然在涉及安全、医疗和专业知识的内容方面仍需人工审核,但模型有机会显著降低复杂信息的视频化门槛。

视频模型的应用还在越过内容行业,为 Physical AI 提供训练数据。 现实世界中的极端天气、复杂交通事故和机器人异常操作等场景,往往危险、昂贵或难以反复采集。视频模型可以在可控条件下生成不同环境和行为数据,用于机器人和自动驾驶系统的训练与测试。

AI生成多样化驾驶环境训练数据示意图

图片来源:阿里云

因此,视频模型不只生产“给人看的内容”,也开始成为机器模拟和理解现实世界的一种基础设施。

应用越向外扩展,评价标准越难统一。

内容行业看重叙事与质感,企业视频强调准确和效率,Physical AI 则更关心物理规律、空间关系与数据可控性。

一个模型很难覆盖所有任务的最优解,像 WeToken 这样的聚合调度平台能够出现并快速起量,本身就说明,市场需要的是各有擅长的模型组合。第一梯队模型增加后,企业会获得更大的采购弹性、议价能力和更低的单一供应依赖。

这意味着赛道竞争不再只局限于展示能力上限的榜单跑分,价格成本、生成效率、API 服务稳定性、不同行业的场景适配能力,会成为客户选型时更加务实的标尺。




上一篇:Warp 如何用 Skill 实现 Self-Improving Agent 自动复盘?
下一篇:PCB散热设计:6种板级方法让芯片温升降低30℃
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-31 09:27 , Processed in 0.974618 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表