视频生成研究近来的两条路线:一条追求更长、更快、更清晰;另一条开始追问更难的问题——画面连续,不等于世界状态连续。此前,可编程世界模型把规则执行交给程序,长视频生成工作则把远距离信息压进线性记忆。快手可灵团队与新加坡国立大学、南京大学、牛津大学合作的这篇工作,从另一个方向切入:如果生成器不擅长现场推理,能不能先由视觉语言模型(VLM)把题目算明白,再把答案翻译成镜头能执行的指令?
这个思路听上去像“把提示词写长一点”,实际远没有那么简单。普通提示增强往往补的是画风、镜头、质感和运动描述;这里需要补的是规则、步骤、空间约束、终态答案以及不能被改动的画面元素。一个数字写错、一条路径走反、一个物体凭空变形,都意味着推理失败,即使视频依然看起来漂亮。
因此,论文真正讨论的不是“视频能不能更像电影”,而是“视频能不能成为一段可检查的推理过程”。 这会把评价重点从审美偏好,推向规则是否遵守、过程是否连贯、目标是否完成。
论文原题:From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models,地址为 arXiv:2609.11242。整项工作做了两件事:先用覆盖9类推理维度、38项细任务的视频世界通才评测框架(VWG-Bench)把问题测清,再用视频提示推理增强方法(Vid-PRE)把推理交给一个专门的视觉语言模型,生成器只负责照着可执行指令渲染。最醒目的结果是,Wan2.2在视频推理评测框架(V-ReasonBench)上的平均准确率从26.65提高到44.48,相对提升67%。
一、画面很顺,为什么仍然可能完全答错?
传统视频生成评测最容易观察的是清晰度、稳定性、运动自然度和文本一致性。这些指标当然重要,但它们有一个共同盲点:只要结果“看起来合理”,评分器就不会追问中间过程是否真的遵守了题目要求。
以数独为例。模型可以生成一支笔在格子里移动,数字不断出现,镜头稳定、动画流畅,乍看像是完成了解题。但如果填入的数字违反行列约束,这段视频从任务角度就是错的。迷宫也一样:方块最终出现在出口附近,并不代表它沿合法路径移动;它可能穿墙、跳格,甚至中途变成另一个物体。
物理任务同样如此。篮球落地后反弹很自然,属于普通物理一致性;题目若要求“重力反转”,模型就必须理解这个虚构规则,并让所有相关运动都服从它。视频越逼真,有时越容易掩盖逻辑错误,因为读者会先被材质、光影和动作吸引。
论文把失败拆成三个层次。第一层是视频本身是否流畅、稳定;第二层是任务规则是否始终被遵守;第三层是样本目标是否真正实现。这样一来,“拍得不好”和“想错了”不再被混成一个模糊分数。

图1上方九个区域对应符号逻辑、图形匹配、具身经验、界面交互、反事实、空间几何、多尺度时间、自然规律和社会常识;下方流程把样本送入视频模型,再分别检查画面质量、任务规则与样本目标。
二、VWG-Bench:38项任务不是为了堆数量
VWG-Bench覆盖9类推理维度和38项细任务。符号与逻辑部分包含算术、代码、井字棋和数独;图形匹配部分包含序列补全、盒子匹配、形状拼合和视觉类比;具身部分要求从场景和指令中推断动作目标,再生成正确的执行过程。
界面交互测试模型能否在图形界面里按要求点击,并保持后续状态合理。反事实部分故意改变物理或时间规则,看模型能否放下日常经验、服从题目设定。空间几何要求处理迷宫、旋转、三维变换和真实场景中的空间关系。
时间推理又分短时、长时和跨尺度演化。一个物体几秒内怎样运动,与河流、天气或生物在更长时间里怎样变化,考查的是不同层次的状态连续性。自然规律部分覆盖力学、流体、材料形变、光学、热学、生物运动和医学逻辑;社会常识部分则包括社会规则、文化习俗和情绪表达。
评测协议同样分层。视频层关注视觉流畅度与时间稳定性;任务层检查前景变化是否合理、背景是否无故崩坏,以及隐含规则有没有被违反;样本层检查必要中间状态是否出现,最后一帧是否达到明确目标。对于复杂过程,评委会查看关键帧,而不是只看开头和结尾。
论文用统一的视觉语言模型评委执行1到5分评分。为了判断自动评分是不是只偏爱漂亮画面,作者从九类任务中抽取100个提示,使用Veo3.1和Wan2.6-Flash生成200段视频,再让三位人工专家按同一标准打分。自动评分与人工评分的Spearman相关系数位于0.69到0.80,平均绝对误差均低于0.55。
这组一致性结果说明自动评委具备可用的排序能力,但它仍不是“绝对真相”。三位专家、200段视频和同一套评分标准,只能支持基准层面的相对比较;开放叙事、复杂审美和长视频中的细微错误,还需要更广的人类验证。
三、基线结果:最强商业模型也只有3.55分
论文测试了六个视频生成系统,包括开放权重的Wan2.2,以及Wan2.5、Wan2.6-Flash、可灵2.5专业版、Sora2和Veo3.1。该基准采用1到5分制,表现最好的Veo3.1总体分也只有3.55。
真正值得看的不是谁排第一,而是每个模型内部的能力落差。Wan2.2的视频质量得分为2.32,隐式规则遵循只有1.56。Sora2的视频质量为3.45,最后目标得分降到2.98。画面能力明显领先于规则维持和终点达成,这一趋势在多个模型上反复出现。
这说明当前生成器更像一个经验丰富的摄影师:它知道镜头怎样移动、物体大致怎样运动、画面怎样显得自然,却未必会先算出答案,再严格执行每一步。遇到常见动作时,训练数据中的模式足够支撑;遇到需要符号计算、反事实规则或长时目标管理的任务,表面统计就不够了。
从工程视角看,这个结论比单纯比较排行榜更有用。如果失败主要来自渲染器本身,团队需要改模型结构、训练数据或生成过程;如果失败主要来自指令没有展开,前置推理层就可能以更低成本改善结果。Vid-PRE正是沿着第二种假设设计。
四、Vid-PRE的核心:让推理与渲染分工
视频提示推理与增强器是放在视频生成器前面的模块。输入包括首帧图像和用户原始提示,输出不是视频,而是一段推理过程和一条更精确、可执行的视频提示。生成器不需要改结构,只接收改写后的指令继续生成。
它先回答三个问题:图里现在有什么;题目隐含了什么规则;成功终态是什么。随后把答案转成画面语言,明确哪些对象必须保持静止、哪个对象要怎样变化、变化应在什么顺序发生、相机是否固定,以及最后一帧必须呈现什么。
以视觉类比题为例。上排显示“小外星人变成同形状的大外星人”,下排给出一个灰色剪影。普通提示只说“补全右下角对象”,生成器可能创造花盆、鸟或其他看起来合理的物体。Vid-PRE先推出“保持形状、只放大尺度”的规则,再要求灰色剪影在固定位置平滑变成更大的同形对象。
数独题里,它先计算每个空格对应的数字,再把答案写成逐格输入动作,同时要求原始数字、网格和相机不变。算术题里,它先算出23加27等于50、21加49等于70,再指定两个答案分别淡入对应位置。逻辑解答和视觉执行被明确连接起来。
这套分工有一个重要好处:视觉语言模型擅长读图、理解规则、生成结构化文本;视频生成器擅长把明确描述渲染成连续画面。让一个模型同时承担两种能力,容易顾此失彼;把推理结果先压缩成执行指令,可以减少生成阶段的认知负担。
但它不是把所有难题都“外挂”解决。前置模型若算错答案,后面的生成器会更忠实地执行错误答案;前置模型写得过长或约束互相冲突,也可能降低生成质量。Vid-PRE的关键不只是增加文字,而是让推理正确、意图不漂移、空间关系一致,并保持输出格式稳定。

图2上半部分先构造首帧、原始提示、推理链和优化提示组成的训练对,经拒绝采样和难度补丁形成监督数据;下半部分让模型对高难任务生成多组候选,再按意图保持、图像空间一致、解法正确和格式合规四项文本奖励做强化优化。
五、第一阶段:用2万条样本先学会“把题讲明白”
该方法以80亿参数的Qwen3视觉语言模型为起点。第一阶段是监督微调,目标是让模型稳定输出符合图生视频格式的推理链与优化提示。训练数据大约包含2万条高质量样本,训练3个周期,批大小为128。
数据构造从首帧和用户提示出发,生成候选推理与提示,再由评估器进行拒绝采样。得分达到4分及以上的样本进入精选集合;低分样本结合标准答案进行难度补丁,重点补足模型容易漏掉的规则、空间位置和目标条件。随后,难样本与通用监督数据合并训练。
论文的消融实验也支持这一点。Wan2.2在多维视频一致性基准上从1.72提高到2.44,在视频推理基准上从26.65提高到40.26,仅靠监督微调就获得明显收益。这说明把规则展开成结构化提示,本身已经能缓解大量失败。
六、第二阶段:为什么强化学习只看文本,不生成视频?
第二阶段使用组相对策略优化算法(GRPO)。作者从错误率最高的10项任务中收集约1500条高难提示,训练约3000步。每个输入生成一组候选,奖励高于组内平均水平的候选获得正优势,低于平均水平的候选被压低。
最特别的设计是:奖励完全基于文本,不在每一步真的生成视频再打分。原因首先是稳定性。视频渲染存在较大随机性,一条逻辑正确的提示可能因为生成器偶然画崩而得到低分;反过来,一条逻辑不严谨的提示也可能偶然生成正确画面。把这种噪声直接塞进强化学习,会让优化方向摇摆。
第二个原因是成本。强化学习需要为同一个输入采样多条候选,如果每条候选都调用视频模型,训练开销会迅速膨胀。文本奖励只检查推理与提示,速度更快,也不会绑定某一个生成器。这使Vid-PRE可以作为即插即用前置层,连接不同视频模型。
奖励函数由四部分加权组成:意图保持、图像空间一致、解法正确和格式合规。总奖励等于四项分数分别乘以权重后相加。意图保持要求改写不能偷换用户任务;图像一致要求对象、位置与首帧对应;解法正确检查路径、答案或动作步骤;格式分保证输出能被下游稳定解析。
其中,解法正确是最主要的增益来源;意图保持和图像一致提供互补收益。这个结果符合直觉:视频推理任务首先要把题做对,但只给正确答案还不够。改写如果忽略首帧布局,或者为了完成目标擅自改变其他对象,生成视频仍会失败。
这里最值得借鉴的工程思想,是把昂贵、随机的视频结果奖励,替换成更靠近根因的文本约束奖励。 它牺牲了端到端真实性,却换来更低训练成本、更稳定的信用分配和跨生成器复用。
七、67%的提升,到底提升了什么?
论文在三个基准上评估该方法。多维视频一致性基准包含59组高质量图像与提示,从指令对齐、时间一致、视觉稳定、内容保真和焦点相关五方面评价。Wan2.2接入后,总分从1.72提高到2.58,相对提升50%。
V-ReasonBench包含12类、327组图像与提示,更强调物理和空间推理。Wan2.2平均准确率从26.65提高到44.48,相对提升67%;其中空间认知从1.32提高到36.25。Wan2.6-Flash也从32.10提高到52.57。
回到VWG-Bench,Wan2.2总体分从2.13提高到2.51,相对提升18%,最弱的隐式规则遵循从1.56提高到2.12。Wan2.6-Flash接入Vid-PRE后得到3.26,高于其原生提示扩展的3.04,并缩小了与Sora2的3.46和Veo3.1的3.55之间的差距。
消融实验显示,Wan2.2只做监督微调时,两项外部基准分别为2.44和40.26;加入强化学习后达到2.58和44.48。Wan2.6-Flash也从2.97和45.96继续提高到3.09和52.57。两阶段不是重复劳动:前者搭好结构,后者收紧规则。
推理开销方面,Vid-PRE每个样本改写约需3到5秒,而论文评估的视频流水线通常超过60秒,因此额外延迟低于端到端时延的8%。对离线创作和高价值生成任务,这个开销不算夸张;对实时交互、批量广告生产或成本敏感服务,则仍需要核算并发、显存和额外视觉语言模型调用。

图3红框为普通提示,绿框为Vid-PRE改写。视觉类比中,基线把灰色剪影变成无关对象,Vid-PRE保持形状并只放大;数独中,基线生成大量错误数字,Vid-PRE按行列约束填入结果;算术中,基线引入手和纸张,Vid-PRE固定画面并只补写50与70。
八、这张定性图,比排行榜更能说明问题
图3把三类失败摆在一起,很有代表性。视觉类比要求根据上排“小对象变大对象”的规律补全下排。基线即使收到“不要移动、不要缩放镜头、不要添加无关对象”等禁令,仍生成了不符合类比规则的鸟和花盆。Vid-PRE先识别尺度变换,再要求同一灰色剪影平滑放大。
数独案例更直接。基线在格子里堆出大量错误数字,画面看起来像“正在计算”,实际完全破坏了题目。Vid-PRE先求出第二行缺2、第三行首格缺1和第二格缺3、第四行首格缺4,再把这些答案写成顺序明确的输入动作。
算术案例则揭示了生成模型的常见惯性:当提示说“完成题目”,模型会自动联想到手、纸、笔和书写场景,生成一个更像视频的故事,却改变了原图。Vid-PRE要求固定相机、保留白底黑字,只让50和70分别淡入等号后面。任务目标因此从“拍一段做题视频”收缩为“精确更新两个区域”。
不过,定性图仍然只是代表性样本。它能展示典型机制和失败模式,不能替代整体统计,也不能保证每个任务都如此稳定。判断方法价值时,需要把案例、平均分、消融实验和评委一致性放在一起看。
九、与两类相近工作相比,它补上了哪一环?
第一类相近工作关注跨片段世界状态问题,比如追问视频续写时人物、物体和事件状态能否保持一致。它更像检查“故事记忆有没有断”;本文基准则把范围扩展到规则、目标、空间、物理和社会常识。
第二类工作关注特定物理条件。自运动物理一致性基准专门评估相机轨迹和场景状态能否保持一致,在单一困难维度上更深入;本文基准选择更广的任务谱系,强调诊断覆盖面。
此前的可编程世界模型把规则交给显式程序,优点是状态和逻辑更容易控制,代价是需要规则表示和程序接口。Vid-PRE没有建立完整程序世界,而是把推理结果压进自然语言提示。它更容易接入现有生成器,但可验证性也弱一些:自然语言不是严格执行代码,生成器仍可能不听。
此前的高效长视频生成工作关注内部效率:怎样同时保留局部细节和长距离记忆,并减少去噪步数。本文方法关注生成前的任务理解。两者解决的是不同瓶颈:一个让生成更快、更长,一个让指令更明确、更会推理。
这篇工作的独特位置,是把“评测发现的认知缺口”直接变成“可插拔的前置修复模块”。 它没有只做一张新榜单,也没有要求重新训练所有视频生成器,而是用同一套规则完成诊断和提示推理,形成闭环。
十、能落地到哪里?先看任务是否“可判定”
Vid-PRE最适合规则明确、首帧条件清楚、成功状态可描述的任务。教育视频里逐步写入算式答案,界面演示里按顺序完成操作,机器人或手部操作里沿指定轨迹执行动作,规则动画里严格保持对象身份,这些场景都容易从前置推理受益。
对产品团队而言,它还可以作为一个可观察的中间层。原始提示、推理链和最终可执行提示都能被记录,失败时更容易判断问题发生在任务理解、提示转换还是视频渲染。相比直接对黑盒生成器反复调词,这种分层诊断更利于建立测试集和回归流程。
但开放叙事、情绪表达和艺术创作未必适合如此严格的前置推理。它们的“正确答案”不唯一,过度展开约束可能压缩创造性。Vid-PRE的价值不是把所有提示都变成长规格说明书,而是在可判定任务中,把自由度留给画面,把规则收紧在真正不能错的地方。
部署成本也不能忽略。模型本身是8B视觉语言模型,训练使用8张H100;线上每次增加3到5秒推理,还要承担额外显存、并发和维护成本。对于一分钟以上的视频生成,这一开销比例不高;对于秒级交互,它可能直接改变用户体验。
十一、论文最需要警惕的四个问题
第一,数据生成与统一评估都重度依赖Gemini-3.0-Pro。 论文用人工评分验证了自动评委的一致性,但训练样本生成、奖励判断和最终评测若共享相近偏好,仍可能放大某些表达方式。未来需要更多异构评委、可执行规则和人工盲评交叉验证。
第二,文本奖励没有直接观察最终视频。 它能高效优化推理与提示,却无法保证生成器一定执行。提示正确而视频失败、提示略有瑕疵却生成成功,都会造成训练目标与最终目标之间的偏差。更理想的系统可能采用“文本奖励为主、少量视频验证校准”的混合方式。
第三,部分商业模型无法完全复现。 排行榜能够反映论文测试时的相对表现,却难以让外部研究者重新运行全部系统。模型版本、内置提示扩展和服务更新都可能改变结果,因此长期基准需要固定接口记录、版本快照和更多开放权重模型。
第四,基准以首帧条件和可判定任务为主。 这正是它能做精细评价的原因,也限制了外推范围。长篇叙事、多角色关系、开放世界互动和数分钟状态管理,仍比38项任务更复杂。一次提示改写也无法替代生成器内部缺失的长期记忆和因果表示。
这些问题不会抹掉论文价值,反而说明它更像一个清晰的中间步骤:先把可判定的视频推理做成基准,再证明前置推理可以显著改善结果;接下来才轮到更严格的可执行验证、更长时记忆和生成过程反馈。
十二、技术点评
这篇论文最值得肯定的,不是67%这个数字本身,而是它把“模型想错”和“模型画崩”拆开了。视频生成长期被单一审美分数牵着走,结果是画面越来越漂亮,规则执行和目标完成却缺少可解释诊断。VWG-Bench至少让团队知道问题出在哪一层。
Vid-PRE的路线也很务实。它没有等待下一代生成器自然长出强推理,而是让更擅长读图和解题的模型先处理认知部分。这种模块化分工符合工程现实:不同模型各做自己最擅长的事,往往比让一个大模型包办所有环节更容易迭代。
不过,团队如果准备采用这条路线,不能只看平均提升。应先建立自己的失败分类:是答案算错、对象身份漂移、空间关系错、动作顺序错,还是生成器根本无法执行?如果瓶颈在推理,Vid-PRE类前置层值得投入;如果瓶颈在长时视频质量或物理建模,再好的提示也只能有限缓解。
还要算清机会成本。增加一个8B视觉语言模型,意味着新的推理延迟、监控、版本管理和错误传播链。高价值教育、设计审核和规则动画可能愿意支付这笔成本;低价批量素材生成未必划算。真正的产品优势不在“接了一个推理器”,而在能否把错误率下降转成更少返工、更稳定交付和更低人工审核成本。
长期看,视频生成不会只沿着清晰度和时长前进。谁能把规则、记忆、状态和目标变成可验证的生成过程,谁才更接近真正可用的世界模拟系统。
十三、三点常见疑问
为什么不直接训练更强的视频生成器? 当然可以,但代价更高,问题也更难定位。前置推理层允许团队在不改生成器结构的情况下快速验证“指令展开是否有效”,适合做低成本迭代。最终系统仍可能需要生成器内部能力同步提升。
67%是不是意味着视频模型已经会推理? 不是。这个数字是Wan2.2在V-ReasonBench平均准确率从26.65到44.48的相对提升,最终准确率仍不到一半。提升来自“视觉语言模型先推理、视频模型再执行”的系统组合,不能全部归功于生成器自身。
普通用户能从中得到什么? 当任务有明确规则时,不要只给模型一句目标。先写清首帧对象、允许变化、禁止变化、步骤顺序和终态标准,效果往往比堆叠画风词更重要。Vid-PRE把这种经验系统化了:先把题讲明白,再让模型动手。
十四、总结:从“会生成”走向“按规则完成”
这篇论文给视频生成提出了一条更严格的进步标准。第一步,不再只看画面是否漂亮,而是把视频质量、规则遵循和目标实现分开评价;第二步,用9类、38项任务暴露不同认知缺口;第三步,通过Vid-PRE把首帧、规则和答案翻译成可执行提示。
结果表明,前置推理在多个生成器和基准上都能带来稳定提升,尤其适合答案可判定、规则明确的任务。与此同时,评委依赖、文本奖励与视频结果之间的距离、商业模型复现和开放长时任务,仍是下一阶段必须补的课。
视频模型是否“真正理解世界”还远没有定论。但至少,从这项工作开始,研究者可以用更具体的问题替代模糊争论:它有没有遵守规则?中间状态对不对?最后目标完成了吗?如果错了,是推理错,还是渲染错?能把这些问题持续测清,才有机会把漂亮演示变成可靠系统。
主要参考资料