论文基本信息
两个视频智能体站在同一个世界里,一个转身、一个建造,为什么各自看到的画面常常像发生在两条平行时间线?加州大学洛杉矶分校与Adobe Research团队提出世界编织器(WorldWeaver):不再要求模型每次都从最近几帧重新猜世界,而是在生成过程中维护一组可持续更新、跨智能体共享的“世界状态寄存器”。在约126小时双人Minecraft数据上,综合世界分从Solaris基线的81.0升至105.1,跨视角一致性从57.8升至76.6。真正值得关注的不是画面更漂亮,而是生成模型开始拥有一块可检查、可传递的共享状态。
想象两个玩家同时走进一座Minecraft建筑。玩家甲看到乙向左移动,玩家乙却在自己的画面里原地不动;甲刚放下的方块,换到乙的视角便消失;两人明明面对面,模型生成几秒后却变成背对背。
这些问题并不只是“视频偶尔闪一下”。多智能体世界模型的目标,是让多个观察者在同一环境中行动,并且相信自己身处同一个世界。如果每个视角只顾着生成一段看起来顺滑的视频,局部画面可以很美,联合起来却可能互相打架。
过去我们讨论过可编程世界模型:它用程序保存角色数量和战斗规则,再让视频模型负责渲染。这篇工作走的是另一条路线。它不把全部规则写成程序,而是在视频扩散模型内部放入一组持续更新的状态标记,让多个智能体共享位置、视角、场景文字和世界变化。
核心矛盾很清楚:视频模型擅长生成“眼前看见什么”,但共享世界要求它记住“即使当前看不见,也依然存在什么”。

图1展示WorldWeaver的核心结构。左侧是两个智能体各自的历史画面,中间的寄存器保存智能体状态、共享俯视图和场景文字,并在每轮生成后更新;右侧的新画面同时受到各自动作与共享状态约束。
一、只记最近几帧,为什么维持不了一个共同世界
主流流式视频模型通常把视频切成若干小段,一段一段往后生成。模型完成前四帧,再把这些帧放进上下文,继续生成后四帧。为了节省计算,它不会永远保留所有历史,而是维护一个有限窗口或注意力缓存。
对单一视角,这种做法已经很难。一个物体离开镜头后,模型可能忘记它的颜色、位置和状态;镜头绕一圈回来,桌上的杯子可能变成花瓶。多智能体场景更麻烦,因为每个人看到的是同一个三维世界的不同二维投影。
玩家甲向前一步,对甲来说是画面里的地面向后移动;对玩家乙来说,可能是甲在远处横向移动。两段像素变化长得完全不同,却应该对应同一个世界事件。只把两路画面拼在一起,模型仍要从像素中反复推理:谁在哪里、朝向哪里、刚才做了什么。
而且,世界并不会因为某个智能体没看见就暂停。乙在房间外放下一块石头,甲当时背对着它;甲稍后转身,石头仍应存在。局部视频历史只能告诉模型“最近看到了什么”,不能天然表达“世界现在是什么状态”。
这就是世界编织器要补的一层:把世界状态从像素历史里分离出来。画面负责呈现当前观察,寄存器负责携带跨时间、跨视角仍需保留的信息。它不是把全部地图写进数据库,而是在生成网络内部留出一块专门的状态空间。
二、世界状态寄存器:给生成模型一本不断改写的共享账本
论文中的世界状态寄存器,是一组可以参与注意力计算的可学习标记。它们与视频帧标记一起进入模型,却承担不同任务:视频标记要还原像素,寄存器标记要概括共享世界。
每生成一段新视频,模型会读取上一轮保留下来的寄存器,再结合两个智能体刚生成的新观察,写出下一轮寄存器。这个过程类似多人协作时维护一份共享文档:每个人只看到自己负责的窗口,但重要变化会被写进共同记录,下一位参与者不必重看全部录像。
寄存器必须同时满足两个条件。第一是持久:它不能每生成四帧就清空,否则仍然只是另一种短期缓存。第二是可更新:新动作改变了位置、朝向或场景,旧状态必须被修正,不能把过期世界永久背在身上。
这与普通注意力缓存的区别也在这里。缓存更像保存近期原始笔记,内容偏向最近画面;世界状态寄存器更像经过压缩的会议纪要,目标是留下后续生成真正需要的共同事实。前者擅长延续纹理与动作,后者被要求维护几何、身份和事件关系。
当然,给模型几个新标记,不代表它会自动学会记住正确内容。如果只靠视频扩散损失,寄存器可能存颜色、纹理,也可能成为无法解释的捷径。作者因此为它安排了三位“老师”,分别监督局部运动、全局空间和高层语义。
三、三类监督信号,分别教会模型记住什么
第一类是智能体状态。系统记录每个玩家的位置、速度、朝向和控制输入。它回答的是最基础的问题:甲往哪里走、乙转了多少度、两个人相距多远。若寄存器连这些可验证的运动量都无法恢复,所谓“共享状态”就很可能只是漂亮的隐藏特征。
第二类是鸟瞰图。第一人称视角会被墙壁、遮挡和镜头方向限制,俯视摄像机则能同时看见两个玩家以及周围布局。它迫使寄存器保存超出单个视角的整体几何关系,例如两人位于建筑两侧,或者正沿不同路径接近同一位置。
第三类是场景文字。团队把连续四帧视为一个时间块,结合两个第一人称视角、共享俯视图和真实控制输入,生成对当前动作与相对关系的文字描述。例如,甲保持静止并面向乙,乙向前移动并右转,两人距离缩短。
这三类信号分工不同。坐标和速度精确,但表达不了“正在合作建造”;鸟瞰图有全局几何,却不方便直接描述动作意图;场景文字善于总结关系,却可能损失细节。把三者放在一起,寄存器才既有数值锚点,又有空间结构和语义概括。
作者还做了一个重要设计:这些辅助解码头只用于训练,推理时可以丢掉。也就是说,正式生成不需要每一轮真的输出坐标、俯视图和文字,再把它们重新喂回模型;这些监督只是训练阶段用来塑形,让寄存器内部更愿意保存可检查的状态。
简单来说,老师在训练时会检查笔记,考试时学生只带自己的脑子。这样既保留显式监督的好处,又避免推理链变成笨重的多模块流水线。
四、三阶段训练:先学双人视频,再学状态,最后面对自己的错误
WorldWeaver不是一步训练完成。第一阶段先让单人视频扩散模型适应同步双人数据。两个玩家的画面沿“玩家维度”组织起来,模型学习在同一时间生成两路观察,并接收各自的动作序列。
第二阶段把训练改成因果流式模式,并加入世界状态寄存器。模型不能再偷看未来帧,只能依赖已完成的历史画面、上一轮寄存器和当前动作生成下一段内容。此时,三类辅助监督开始约束寄存器。
第三阶段采用自强制训练。传统训练常把真实历史帧提供给模型,正式生成时却只能看到自己生成的帧,二者之间存在明显落差。自强制让模型在训练中也沿着自己的输出继续滚动,于是错误、模糊和状态漂移会真实进入后续上下文。
这一步对寄存器尤其关键。若前一段画面已经产生小误差,寄存器可能把错误状态写进共享账本,后续两个视角再一起偏离。团队因此同时对已提交的画面和已提交的寄存器进行训练,让模型学会在自己的生成分布上继续更新状态。
论文使用四步去噪计划,并通过提前截断控制训练成本。真正重要的不是具体步数,而是训练目标发生了变化:模型不只要在干净答案旁边学会下一帧,还要在自己可能犯错的轨迹上,维持世界状态不持续漂移。
根据论文方法整理的伪代码
输入:两个智能体的首帧、动作序列、上一轮世界状态寄存器
重复每个视频时间块:
用历史画面、动作和寄存器生成两个智能体的新画面
从新画面与旧寄存器中更新共享世界状态
训练阶段用坐标、鸟瞰图和场景文字约束寄存器
把新画面与新寄存器提交给下一轮
输出:同步的双视角视频与持续演化的共享状态
伪代码里最关键的是“提交”二字。一旦新画面和新寄存器进入下一轮,模型不能回头假装自己从未出错。世界模型是否稳定,不只看单帧好不好看,更看状态经过多轮读写后是否仍能支撑一致的动作与视角。
视频帧和状态寄存器虽然在同一网络中交流,工作内容却差别很大。帧标记要恢复颜色、纹理、边缘和运动;状态标记要压缩位置、关系、全局布局与语义。若完全共享同一套参数,两种目标可能争抢模型容量。
论文采用混合Transformer设计:画面标记走视觉分支,寄存器标记走状态分支,但两者仍在共同注意力层中交互。可以把它理解为同一家公司设置两个专业团队:一个负责渲染,一个负责维护世界账本;开会时共享信息,干活时使用不同工具。
实验也说明,分支设计并非自动带来收益。在没有显式状态监督时,拆成两套权重并没有明显提高综合世界分。只有当场景文字等监督要求寄存器承载更丰富语义时,专门的状态分支才显示价值。
密集共享模型加入场景文字后,综合世界分只有91.3;混合Transformer达到103.2。这个对比很有启发:架构分工不是为了“模型更复杂”,而是为了避免像素生成与状态建模在同一组参数里互相拉扯。
它也提醒工程团队,不要把所有标记都当作同一种序列元素。不同标记的输入形式可以相似,但承担的优化目标、更新频率和长期责任不同。需要长期保存的状态,往往值得拥有专门路径。
六、实验数据:漂亮画面之外,更看重逻辑是否对得上
团队基于Solaris引擎(SolarisEngine)收集约126小时同步双人交互视频,分辨率为832×480,帧率为20帧每秒。每段记录同时包含两个第一人称画面、智能体状态、共享鸟瞰视角和按四帧切分的场景文字。
评测时,模型获得两个玩家的首帧和完整动作序列,然后生成后续视频。论文分别报告视觉语言模型准确率和生成分布距离。前者检查相对位置、记忆、建造和跨玩家一致性等关系是否正确,后者衡量画面与真实数据分布的接近程度。
作者又把五类任务的准确率与画面距离组合成辅助世界分。这个分数越高越好,但论文明确提醒,它没有上限,并且对画面距离的尺度敏感。因此,世界分适合快速比较整体趋势,不能代替逐项准确率与画质指标。
对照方法包括直接拼接两路画面,以及重新用相同训练数据训练的Solaris。这样可以减少“新方法只是看了更多数据”的干扰。比较覆盖移动、空间定位、记忆、建造和一致性五类任务。
结果中,WorldWeaver综合世界分达到105.1,Solaris为81.0,直接拼接画面为49.1。移动准确率从Solaris的79.7升至82.8,空间定位从81.3升至93.8,记忆从43.8升至46.9。
更明显的变化出现在建造和一致性。建造准确率从9.4升至28.1,仍然不算高,却接近三倍;跨视角一致性从57.8升至76.6。画面距离也在移动、定位、建造和一致性四类中下降,说明逻辑改善没有简单以牺牲视觉质量换取。

图3把生成画面与寄存器解码出的状态并排展示。每个时间块都能查看智能体坐标与轨迹、共享鸟瞰结构和场景文字,从而判断两个视角是否描述同一次移动、同一组相对位置与同一段建造进度。
这张图的价值不是证明模型已经理解开放世界,而是让隐藏状态有了可检查入口。普通视频模型错了,研究者往往只能看到最终画面不对;寄存器能够被解码后,可以进一步追问:是位置记错、俯视结构漂移,还是语义概括出现偏差。能够定位错误来源,才可能设计真正有效的修复,而不是盲目继续扩大模型。
七、消融实验:只加寄存器就有效,但“记什么”决定上限
最有信息量的一组实验,是逐步加入不同状态监督。Solaris基线的世界分为81.0。只加入寄存器、不告诉它具体应该保存什么,世界分已经升到93.8。这说明专门留出持久状态槽,本身就能减少每轮从局部窗口重新推理的负担。
但不同监督并不是每项指标都一起上涨。只用智能体坐标与运动状态时,移动和一致性提高,空间定位与建造却下降,综合分为88.1。状态太偏向局部运动,会让模型擅长追踪“人怎么走”,却未必理解更大的场景结构。
鸟瞰图监督把空间定位推到96.9,建造升至31.3,综合分达到102.4。场景文字监督让记忆达到62.5,一致性达到73.4,综合分为103.2。它们分别证明,全局几何与语义描述能给寄存器不同的能力侧重。
三类监督一起使用后,综合分达到105.1,平均准确率提高,平均画面距离下降。不过,组合设置并非每个单项都拿第一。例如,单独的鸟瞰监督在空间定位和建造准确率上更高;完整模型追求的是各类任务之间更均衡的世界状态。
这比“加模块、全指标上涨”的故事更真实。共享状态不是一个抽象能力按钮,监督什么,模型就更愿意保存什么。产品落地时也应先回答:系统最不能忘的是位置、身份、任务进度、库存,还是人与物的关系?答案不同,状态设计就不同。
论文还测试了半监督训练。少量带状态标注的数据负责固定寄存器含义,更多无标注视频继续改善生成。加入无标注数据后,世界分从63.2升至更高水平,说明这条路线不要求每段视频都配齐昂贵状态,但高质量标注仍承担“定义状态”的关键作用。
八、与相似路线相比:程序、三维状态与寄存器各有取舍
把WorldWeaver放进世界模型研究路线,可以看到三种保存世界的方法。第一种是程序化状态。可编程世界模型把角色、规则和事件写成可执行程序,状态准确、容易检查,适合规则清楚的环境;代价是程序结构需要预先设计,开放场景中的细节很难全部编码。
第二种是显式三维状态。持久三维状态模型(PERSIST)一类工作持续维护三维潜在场景,强调空间几何与跨视角记忆。它适合需要稳定地图、物体位置和长期视角切换的任务,但三维表示的更新、渲染和动态物体管理更重。
第三种就是WorldWeaver的寄存器。它把状态留在生成模型内部,不要求每一步构建完整三维地图,也不要求把所有规则写成程序。优点是与视频生成结合紧密、带宽低、更新方便;缺点是状态含义依赖训练监督,解释性与精确度不如完整程序或显式地图。
三条路线不是简单替代关系。程序状态擅长规则,三维状态擅长几何,寄存器擅长把压缩状态嵌入流式生成。真正的通用多智能体系统,很可能需要分层组合:底层保存几何与对象,中层维护任务进度与关系,上层再让生成模型负责丰富观察。
WorldWeaver补上的一环,是证明“共享状态”可以成为视频生成过程中的一等公民,而不是从漂亮画面里顺便推断出来的副产品。
九、能用在哪里:游戏只是测试场,关键是低带宽协作记忆
最直接的应用是多人互动游戏和可生成环境。多个角色不再各画各的,而是共享任务进度、物体状态和空间关系。即使角色暂时分开行动,重新会合时也能接上同一段世界历史。
第二类是机器人数字孪生。仓库中的多台机器人可能拥有不同相机和局部地图,却需要共享货架状态、任务占用和危险区域。传输全部视频既昂贵又冗余,压缩后的世界状态可以成为更低带宽的协作接口。
第三类是长时视频智能体。一个智能体离开房间后,另一个智能体改变了环境;前者回来时,需要知道哪些对象移动、哪些任务完成。持续寄存器可以保存“发生了什么”,而不是把几分钟视频全部塞回上下文。
但从Minecraft走到真实机器人,中间还有很长距离。真实传感器会有遮挡、延迟、标定误差与通信丢包;不同机器人的相机参数和行动能力也不同。游戏中的真实坐标和控制输入容易获得,现实世界往往只能估计。
工程上还要处理状态冲突。两个智能体同时报告不同位置,应该相信谁?寄存器写入错误后如何回滚?任务规模从两个智能体扩大到几十个时,固定数量的状态标记是否够用?这些问题决定它能否从研究原型变成可靠系统。
十、论文没有解决的几个关键问题
第一,实验集中在双智能体Minecraft。两个玩家、固定分辨率、固定动作空间,与开放世界中的多人协作仍有明显差距。智能体数量增加后,状态容量、注意力成本与冲突处理会一起增长。
第二,数据监督相当丰富。每段训练记录有真实位置、速度、朝向、共享俯视图和控制输入,场景文字也结合这些信息生成。很多真实场景无法获得同等质量的全局标注,半监督结果虽然提供方向,却没有消除这一依赖。
第三,综合世界分是辅助指标。它把准确率除以画面距离,再对五类任务求平均,便于排序,却会受画面距离尺度影响。判断方法是否真正进步,仍应回到各类准确率、画质指标和具体失败案例。
第四,建造准确率虽然从9.4升到28.1,绝对值仍然较低。模型更会维护建造进度,不等于已经可以稳定执行复杂长期工程。连续动作越长,早期的小错越容易通过画面和寄存器一起积累。
第五,寄存器能被辅助头解码,不代表内部每个标记都拥有清晰、稳定、可组合的语义。它仍是一种学习得到的压缩表示。若要用于安全关键系统,还需要不确定性估计、冲突检测、状态审计与外部纠错机制。
总结与思考:世界模型真正缺的,常常不是更多像素,而是一份可信状态
这篇工作的价值不在于把世界分推到105.1,而在于把“多智能体一致性”从模糊观感改造成可设计的系统问题。以前看到两个视角对不上,只能说视频模型还不够强;现在可以继续拆解:状态有没有保存、由谁更新、用什么监督、发生冲突怎么处理。
它最值得肯定的地方,是没有把共享状态做成文末外挂。寄存器直接参与每一段视频生成,并在自强制滚动中承受模型自己的误差。状态不是生成完成后的解释,而是下一轮生成的条件。
同时,这项工作仍处在“证明机制有效”的阶段。数据来自结构化游戏环境,监督信号丰富,智能体只有两个。离真实机器人、开放地图和长期多人协作还有容量、通信、冲突与安全四道硬关。
真正可落地的方向,不是让一个大模型默默记住一切,而是让状态拥有明确职责:哪些必须长期保留,哪些可以过期,哪些需要外部验证,哪些错误能够回滚。
这也影响团队怎样分配研发预算。若问题来自共享状态缺失,继续增加视频分辨率、模型参数或单帧画质训练,可能只会得到更精致的不一致。更合理的投入顺序,是先建立状态定义与评测,再决定需要多大的生成模型。能否在错误发生后找到是哪一项状态写错,往往比再提升一点平均画质更有产品价值。
对做智能体、机器人和生成式仿真的团队,这个判断比单一榜单更重要。模型越会生成,越需要一套独立于表面画面的状态纪律。否则,多智能体只是多了几台会说话的摄像机,而不是共同生活在一个世界里的协作者。
三个值得进一步思考的问题
第一,如果寄存器与画面冲突,系统应该相信谁? 目前模型把两者联合训练,但真实产品需要明确仲裁机制。传感器证据、时间戳、置信度和外部地图都可能参与决策。
第二,状态容量怎样随智能体数量和任务长度扩展? 固定标记适合双人短场景,几十台设备长期协作时,可能需要分层状态、按需检索、局部共享与过期淘汰。
第三,能否让世界状态成为跨模型协议? 若视频模型、规划器和机器人控制器都能读写一套受约束的状态表示,多智能体协作会更容易审计;但这要求状态语义比当前隐式寄存器更稳定、更可验证。
主要参考资料