云计算百科
云计算领域专业知识百科平台

代码世界模型:编码智能体作为世界大脑

26年8月来自西湖大学和新加坡南洋理工的论文“Code World Model: Coding Agent as World Brain”。

世界模型旨在模拟复杂环境在行动和事件作用下的演化过程,然而现有的基于视频世界模型主要通过视觉观察来学习动态,而这些观察揭示的是结果,而非支配世界演化的底层知识、规则和机制。这使得维持持久的后果和支持连贯的、开放式的演化变得困难。代码世界模型(Code World Model)框架,结合语言模型的推理和编码能力以及视频模型的生成先验,将世界演化与视觉实现分离。编码智能体作为世界大脑,负责推理事件及其后果,并生成可执行代码以维持持久的世界状态并执行符合规则的演化。为了将可执行状态与视觉生成连接起来,引入一种智能体表示,该表示编码逐帧的时空约束,并被编译成智能体视频,从而控制视频模型渲染高保真度的视觉观察结果。其进一步开发数据管道,用于从游戏视频和真实世界视频中构建对齐的智能体-观察对。在对配对游戏数据进行微调后,MiniMax-H3 能够遵循由编码智能体构建的简单交互式世界中基于智能体的时空规范,同时保留丰富的视觉细节和动态效果。这些结果展示将持久世界演化代码与视频模型相结合以实现灵活视觉效果的潜力,为构建开放式世界模型提供一条新途径。


代码世界模型(如图 1所示)是一个世界建模框架,它包含一个由编码智能体驱动的可执行世界演化机制、一个连接世界状态和视觉生成的可编程接口,以及一个生成最终视觉观测结果的视频模型。编码智能体的核心是世界大脑:它通过代码控制世界状态及其演化,而视频模型则将演化后的世界渲染成视觉观测结果。知识和规则驱动着世界状态的变化,而世界的视觉实现则依赖于学习到的先验知识,从而使交互式世界能够超越预定义的轨迹,持续且连贯地演化。
请添加图片描述

图 2 总结了编码智能体如何通过代码更新世界状态,以及由此产生的智体和提示如何影响视频模型以生成视觉观测结果。
请添加图片描述

编码智能体和代码在两种不同的计算机制中运行。编码智能体处理不频繁但复杂的决策,例如解释新事件、推断长期后果、选择机制以及修改世界的运行方式;它将这些决策转化为可执行、可重用和可修改的代码。代码随后执行高频、重复且确定性的操作——更新位置和数值属性、解决碰撞以及执行规则——而无需在每一步都调用编码智能体。这种智能体-代码组织结构将高层推理的频率与底层状态更新的频率解耦,使得世界状态能够持续演化,同时其运行机制保持可修改性。

有了这种可执行的世界状态,一个核心的技术挑战是如何将其转换为视频模型能够可靠解释的条件表示。一种直接的解决方案是将状态表示为结构化文本;然而,当前的视频模型尚无法可靠地将密集且不断变化的文本规范转换为具有精确帧位置、空间关系和摄像机轨迹的观测结果。另一种方法是让编码智能体构建一个完整的、显式的 3D 世界,并根据其渲染结果来约束视频模型 [75, 76]。虽然这提供了更强的空间控制,但构建生产级几何体、资源、动画、材质和渲染系统成本高昂,并且会过早地限制最终的视觉实现。为了在保留基于文本的规范的灵活性的同时,恢复显式 3D 表示的空间控制,引入代理(Proxy),一种粗略的世界状态表示,它编码了实体位置、姿态、轨迹、空间关系和摄像机运动。一个轻量级的确定性编译器将其渲染成代理视频(proxy video),该视频为视频模型提供直接的时空约束,同时保持外观和细粒度动态的未指定。代理(proxy)只需指定粗略的空间关系和整体轨迹,而视频模型则根据其学习到的先验信息合成局部运动和物理交互。在代理视频(proxy video)和结构化文本的共同条件下,视频模型利用其学习到的外观、运动和交互先验信息生成最终的观测结果。这样,代码决定了世界中发生了什么以及哪些后果会持续存在,而视频模型决定了这些结果如何在视觉上实现。因此,代理将编码智能体的控制从语言扩展到了视觉空间,使其能够将不断演变的世界状态表达为视频模型的可调整的逐帧约束。

为了实例化并评估从可执行世界状态到视觉观察的接口,开发一种适用于游戏玩法和真实世界视频的数据构建方案。目前的原型首先使用游戏玩法数据对预训练的视频模型进行自适应调整。在游戏玩法过程中,目标视频以及构建代理所需的摄像机、实体和场景状态均从同一执行过程中同步记录,从而生成时空对齐的代理-观察对。同样,真实世界视频也可以与基于 3D 重建和对象标注构建的对齐代理配对,无需动作标签,从而显著降低标注负担。在配对游戏玩法数据上进行微调后,MiniMax-H3 [77] 在基于编码智能体构建的简单交互式世界记录的代理时,能够定性地遵循角色位置、动作轨迹、场景布局和摄像机运动的代理规范(proxy spec),同时保持高保真度的外观和细粒度的动态特性。与仅通过文本或低维信号表达粗略意图来控制动作和相机的控制界面[31, 34, 37]相比,这个界面直接指定逐帧的实体运动和视角变化,从而实现更精细、更直接的时空控制。

总体而言,代码世界模型将知识驱动、规则一致的世界演化与视频模型学习的视觉、运动和交互先验知识相结合。目前的样机初步验证该框架两个关键组件的可行性:编码智能体可以通过编写和修改代码来改变世界的状态和运行机制,而经过微调的视频模型可以将表达的世界状态渲染成相应的视觉观测结果。


目标是构建开放世界,使其在保持高视觉保真度的同时,尽可能接近真实世界的因果复杂性。构建这样的世界需要一个编码智能体作为世界大脑,需要代码高效地执行连续、高频的状态更新,还需要视频模型生成具有逼真运动的高保真视觉观测结果。为了实现这一目标,引入代码世界模型,它将这些组件统一在一个框架内。如图 2 所示,编码智能体通过代码更新世界状态,由此产生的代理(proxy)和提示信息会触发视频模型生成视觉观测结果。

定义代码世界模型,并解释编码智能体如何通过持续维护、可执行和可修改的代码来控制世界演化。研究如何将世界状态传递给视频模型。它首先探讨结构化文本,并分析其实际局限性。为了应对这一挑战,引入一种粗略的视觉条件,称为代理(proxy),它由世界状态确定性地生成,并为视频模型提供直接的时空约束。基于这种代理设计(proxy design),提出一个数据管道,用于训练视频模型理解并遵循代理条件(proxy condition)。

1. 代码世界模型

为了具体说明此类复杂交互带来的挑战,回到奇幻世界示例。玩家刺杀城市统治者并离开后,该事件应持续影响继承、地方秩序、贸易、派系关系以及众多非玩家角色的信仰、目标和行为。这些后果可能在城市离开屏幕期间持续发展,与后续事件相互作用,并且只有在玩家很久之后返回时才会显现。因此,系统不仅要确定玩家返回时城市应呈现的面貌,还要确定玩家离开期间发生了什么、发生的原因、哪些后果仍然有效,以及当前状况将如何影响未来的发展。

从运行世界的角度来看,此类复杂交互带来了两种不同的挑战。第一种是稀疏但语义复杂的推理:解释新事件,将其与世界知识、角色关系和社会结构联系起来,确定哪些实体和机制受到影响,并规划长期的后果。第二点是密集且重复的执行:维护位置、属性、日程安排、冷却时间、碰撞和数值规则,并将高层决策转化为具体的状态更新。复杂的世界需要这两方面。后者必须以远高于前者的更新频率运行,而前者则需要更为复杂的推理。

视频模型为环境、角色和交互的视觉演变提供了宝贵的先验知识[5-7, 14]。理论上,足够强大的视频模型可以从视觉经验中获得应对这两种挑战所需的能力。然而,在实践中,视频数据只能通过其结果间接地揭示世界规则;屏幕外的角色状态没有连续的视觉记录;而且跨位置和长时间传播的后果是稀疏的[38, 39]。当前视频模型的训练上下文窗口通常短于一分钟,而许多需要推理的因果过程在现实世界中会持续数天甚至数年。这使得视频模型尤其难以获得应对第一个挑战所需的能力:构建和演化一个连贯的世界所需的语义复杂推理。此外,当前的视频世界模型主要基于游戏视频进行训练,而这些视频仅保留了运行固定游戏代码的视觉输出。因此,模型必须仅从这些输出中推断底层规则和状态转换,这使得学习过程效率极低,最终无法达到最优。

语言模型的世界知识、关系推理和长远规划能力使其成为治理世界演化的天然选择[67-70]。智能体可以将这些能力组织成一个持续循环:读取当前世界,决定下一步应该做什么,观察结果,并修改后续决策。然而,智能体不应成为整个世界的逐步执行者。随着世界的增长,可能需要频繁更新数千个世界状态变量,涵盖角色、物体以及天气、交通和预定事件等全局过程。每次更新都调用语言模型会产生高昂的推理成本,并且无法维持实时运行所需的更新频率和响应速度。更具可扩展性的组织方式是将高层决策转化为可重用的代码,并让该代码跨实体、跨时间和跨事件执行。

这种组织方式与当代编码智能体的核心优势自然契合:将高层意图转化为可执行、可重用且可持续修订的代码[73, 74]。假设统治者被刺杀后,编码智能体决定城市进入紧急状态。它可以改变派系目标、激活现有行为规则,或添加巡逻、继承和消息传播的新机制。编码智能体只需决定每个角色的高层行为,并在目标改变、发生异常或机制需要修订时进行干预。在其他情况下,代码会根据现有规则以高频率持续更新位置、方向和其他运行时状态。它的执行速度与编码智能体的推理频率和视频模型的生成帧率均不相关。在大型战斗中,代码可以持续处理众多实体的距离、碰撞、攻击范围、冷却时间、命中次数、伤害值和连锁触发等信息,而编码智能体则专注于稀疏的高级意图、异常情况以及需要添加或更改的机制。

最终形成一个持续的智能体-代码循环。交互或世界事件首先会改变当前状态。编码智能体读取已维护的世界状态,并选择调用现有代码或局部修改世界程序。代码随后执行可重用的机制,并更新多个状态变量。执行结果、测试以及新的世界反馈会返回给编码智能体,作为其下一步决策的依据。大多数重复性更新无需额外调用模型,世界状态的更新可以以事件驱动的方式进行,也可以以高于视觉生成频率的方式进行。当现有机制无法处理新情况时,编码智能体可以自适应地修改世界程序,不仅改变当前状态,还改变世界未来的运行方式。因此,代码既不是永久冻结的游戏逻辑,也不是独立于智能体的控制器;它是编码智能体持续维护、可执行且可修改的扩展。

基于此,本文提出代码世界模型:一个以编码智能体作为其大脑的世界模型。代码世界模型的核心在于使编码智能体成为主导世界演化的主要智能体。通过可执行且可修改的代码,它控制着世界状态、运行机制及其后续演化,同时代码代表它执行密集且可重用的底层更新。这种组织方式使代码世界模型区别于现有的视频世界模型,后者主要通过提供给视频模型发布的动作、摄像机或语义条件来控制生成[30, 31, 34, 37]。编码智能体并非仅仅提供高层指导,而是直接参与到世界的可执行演化过程中。

从世界状态到视觉观察。智能体-代码循环决定了世界的运行方式,但它并不决定该世界应该如何进行视觉实例化。由于该范式由世界的治理和演化方式定义,因此其视觉后端是可选择的。一个看似直接的解决方案是让编码智能体构建一个显式的3D环境[75, 76]。当所需的实体、外观、动作和交互事先已知时,这种方法是有效的,因为每一项都可以由预先准备好的资源、动画和模拟规则来支持。然而,开放世界会不断引入现有流程无法预料的新角色、物体、行为和情境。支持这些内容不仅需要新的可执行逻辑,还需要相应的视觉资源、动作和物理响应。更根本的是,这种方法的上限取决于其资源和模拟器的保真度和覆盖范围,难以达到真实世界的视觉丰富性和物理复杂性。这种依赖性使得显式 3D 难以扩展到开放式的视觉世界。

相比之下,视频模型可以将可执行世界提供的条件直接映射到视觉观察结果,而无需完整的资源-动画-模拟-渲染链。现代扩散- transformer视频模型通过学习大规模视觉数据,提供了关于外观、运动、交互和物理行为的丰富先验信息[78-80]。代码决定世界中发生了什么以及哪些结果会影响后续交互;视频模型则生成这些结果如何展开和呈现。与完全显式的 3D 实现相比,这种方法在视觉真实感和细粒度交互方面具有更高的上限,并且能够随着数据、模型和计算规模的扩大,吸收更广泛的真实世界运动和物理先验信息,而无需单独扩展每个资源、动画和仿真组件。这种可扩展性既支持高保真虚拟世界,也支持更接近真实分布的视觉环境,而真实分布正是虚拟世界模型 (VLM) 和具身智能体训练所必需的。因此,用视频模型作为代码世界模型的视觉后端。

这种选择的主要代价是,每一次新的视觉观察都需要生成式推理,这会导致比传统渲染更高的边际计算量和延迟。但考虑到最大化视觉保真度和开放式生成的目标,质量的提升值得付出这样的代价。预期视频模型推理的效率会越来越高,随着时间的推移,这种权衡会变得更加有利 [52, 54, 55]。

2. 视频模型的世界状态条件化

一旦选定视频模型作为视觉后端,便会面临一个直接的问题:如何将编码智能体的高级意图以及代码执行产生的不断变化的世界状态转换为视频模型能够有效利用的条件?

最直接的解决方案是将可执行状态组织成结构化文本,因为最新的交互式视频模型已经能够接受语言条件[15, 17, 29]。编码智能体可以为每个持久化身份编写外观、角色和目标的语义描述,并将其存储在由代码管理的身份记录中。随着世界运行,代码会持续更新实体的位置、方向、关系、行为和战斗状态。系统可以按身份、时间和事件自动组织这些持久化描述和运行时变量;将它们与编码智能体当前的高级意图和原始文本提示合并;并将结果提供给视频模型。这种方法没有引入新的条件模式,并且能够自然地容纳新的对象、属性和规则。因此,它是最简单、最优雅且显然最具可扩展性的选择。

然而,用近期大规模训练的视频世界模型[31]进行的实验表明,即使结合专门的摄像机训练路径,文本条件反射仍然无法精确控制摄像机轨迹和实体运动。这一观察结果并非意味着语言无法表达精确的世界状态。理论上,如果描述足够长,语言可以精确地指定每一帧的每个像素。然而,这样的描述效率极低,难以满足实时交互的延迟要求。当前的视频模型也难以可靠地执行如此复杂的指令。

代理(proxy)。这些实验表明,主要挑战在于如何使视频模型能够跟踪实体位置、空间关系和摄像机轨迹的精确、高频更新。这促使其探索一种不同的条件机制,以提供更直接、更精细的时空控制。

由于目标输出本身就是一个视频,因此自然而然地选择以相同的时空模态来表达这种控制。这种条件可以直接在图像坐标系中指定相机运动、实体位置、遮挡、相对关系和轨迹。视频模型随后读取时空组织已建立的控制信息。与仅使用文本相比,这为模型提供一种更清晰、更易于理解的表示基础。

此视觉条件中的信息应完全来自编码智能体和代码共同构建和执行的世界状态。它不应由其他信息源或生成模型(例如学习的 3D 生成器)补充,因为这会引入编码智能体无法直接检查或控制的映射。也不应要求编码智能体生成复杂的视觉世界:这样做会增加构建成本并过早地预设最终图像。最终条件中的每个控制信号都应可追溯到世界状态,从而对编码智能体保持状态到条件路径的白盒状态。

将影响当前观测的相机、实体位置、姿态、轨迹和空间关系组织成一个粗略的可编程世界表示,称之为代理(proxy)。确定性渲染过程将代理转换为时空视觉条件,称之为代理视频(proxy video)。结构化文本和代理源自同一世界状态,但使用不同的状态表示。文本将选定的状态序列化为语言;代理则在将其作为代理视频提供给视频模型之前,对其进行空间组织。通过这种方式,编码智能体通过两个互补的通道控制视频模型:文本传达语义意图,而代理视频(proxy video)则以可调整的逐帧约束形式表达不断演变的世界状态。

代理并非旨在尽可能完整地表示目标世界。它仅保留当前观察必须遵循的粗略结构和交互状态。它不试图表达视频模型应该生成的纹理、材质、精细光照或其他外观信息。其目标并非提供低质量的目标视频,而是以最简单实用的形式表达所需的状态和时空关系。

构建代理和渲染相应的代理视频也不需要完整的 3D 资产制作或高质量渲染流程。编码智能体以编程方式调用并组合一组给定的简单可重用原语。每个原语只需几行代码即可表示,因此对智能体的表示负担很小。可寻址参数指定实体的位置、缩放、姿态、布局、摄像机和状态标记(markers);然后,一个简单的确定性编译器执行轻量级光栅化。该过程不需要高质量的素材、复杂的材质、光照、精细的动画或昂贵的渲染。因此,代理(proxy)是可构建、可检查、可寻址且可局部编辑的,而不是来自学习型 3D 生成器的不透明视觉方案。尽管最终条件以图像或视频标记的形式进入视频模型,但其控制信息仍然源自世界状态。

代理与结构化文本结合使用。它表达了当前观察必须遵循的粗略时空状态,而文本则指定了角色和对象的外观、动作语义以及代理未指定的动态细节。添加代理需要编码智能体构建粗略的空间表示,但作为回报,它提供了更清晰的时空基础。单独使用文本不需要视觉表示,并为视频模型的实现留出了最大的空间,但使精确的空间控制更加困难。

条件带宽。代理设计的核心选择是其条件带宽。更丰富的代理(proxy)能够更好地绑定实体、布局和摄像机,但也要求编码智能体构建和维护更多基元和参数。例如,如果代理在关节层面编码角色的关节运动,编码智能体还必须在推理过程中控制该角色的关节轨迹。目前的编码代理在可靠地实现这种关节层面的运动控制方面仍然面临挑战,这可能会限制最终性能。信息过少的代理(proxy)虽然构建起来更轻量,但可能无法施加足够的时空约束。将代理设计视为可构建性和绑定强度之间的权衡:它应该提供当前观测必须遵循的最小充分状态,同时将最终外观和细粒度动态留给视频模型。

讨论。一个自然的担忧是,视觉条件可能会引入过多的tokens。在实现中,代理(proxy)在每个空间维度上都使用目标视频分辨率的四分之一,因此只向全向(omini-)transformer添加目标视频的 1/16 的视觉tokens,使其额外的推理负担可以忽略不计。

代理不应被解释为全局固定的条件。相反,它是一个视觉提示工具,编码智能体通过它来控制视频模型,作为文本提示的视觉对应物。在完整的编码世界模型中,编码智能体会根据当前世界和生成任务来决定是否启用、禁用或调整代理。当仅需文本信息时,它可以省略代理;当观察必须紧密跟随位置、轨迹、空间关系或交互拓扑时,它可以激活相关的代理。编码代理还可以进一步选择交互关键实体和区域,并调整所表示的状态类型、空间粒度、分辨率和条件帧速率。随着视频模型控制的改进,代理可能会变得更稀疏,甚至在某些情况下消失。本文实例化并评估了一种固定的代理设计;自主切换和带宽调整仍然是更广泛范式设计空间的一部分。

以上讨论将语言模型和视频模型视为独立的组件,但条件设计问题与该实现选择无关。即使将它们统一到一个全模态网络中,由代码维护的不断变化的外部世界状态仍然需要编码并提供给视觉生成过程。参数共享可以简化组件之间的通信,但并不能消除状态到条件的转换问题。

3. 数据

基于上述代理设计,需要成对的代理视频和目标视频。数据构建必须保持它们的时空对齐,以便视频模型能够学习在跟随代理视频的同时生成目标视频。由于动作后果和摄像机运动已经在代理视频中表示,因此该接口既不需要单独的动作标签,也不需要显式的摄像机姿态标注,这也使得真实视频数据的集成更加容易。

游戏数据。游戏是一个特别合适的数据源,因为可以从同一次执行中同步获得目标视频及其对应的运行时状态[7, 10, 14]。在游戏过程中,录制目标视频,并从运行时中提取构建代理所需的状态。不保留完整的3D模型、纹理或材质;记录相机状态、实体位置和方向、大致比例、场景布局以及交互关键状态。利用这些变量以编程方式构建一个代理(proxy),该代理沿着目标视频的摄像机轨迹渲染,从而为同一游戏过程形成一个条件-目标对。无需重新收集目标视频,即可将同一运行时录制的内容重新编译成具有不同覆盖范围和信息粒度的代理。

基本词汇表不必在所有数据中都固定为一种形状、粒度或视觉风格。现代视频模型可以学习各种粗略基本元素与目标视觉对象之间的对应关系。对于无法通过简单基本元素保持足够区分性的复杂对象,代理(proxy)可以仅使用边框来表示位置和大致范围,而结构化文本则指定其身份和属性。任何残留的歧义都可以通过随附文本中的身份、外观和动作语义进一步消除。

实验还表明,编码智能体可以自主构建简单但有区别的原语。对于人、树木、车辆、灌木丛和普通建筑物等常见类别,智能体(agent)对每个身份进行分类并组成相应的图元。对于结构复杂或不常见的对象,它首先决定简单的基元是否保持足够的可区分性;否则,系统将使用边框。框仅标记身份的位置和粗略的空间范围,而文本则提供类别、外观、属性和操作。这种回退避免了要求编码智能体重建复杂的几何形状,同时仍然通知视频模型该对象存在于特定位置。

记录的运行时间进一步提供精确的身份对应关系。对于渲染的代理视频的每一帧,获得一个逐像素的真值实例图,用于标识与每个像素相关的身份。此映射将结构化文本中每个身份的外观、属性和操作描述绑定到相应的代理区域(proxy region),从而产生更精确的条件。图 3a 显示这样一个自动构建的对。
请添加图片描述

真实世界的数据。真实视频是另一个重要来源。它们的价值不仅在于规模,还在于游戏资产、动画、模拟和渲染管道无法完全覆盖的高保真外观、运动和物理交互。这些先验可以使学习到的观察模型超越特定游戏流程所施加的视觉和动态上限。它们对于具身智能体尤其重要,具身智能体(embodied agent)的任务需要有关尺度、遮挡、接触、相机自我运动以及动作引起的运动和物理反应的线索。真实视频数据可以使生成的视觉环境更接近智能体的部署分布,使代码世界模型不仅支持虚拟世界的生成,还支持用于训练和评估智能体的可扩展的真实世界视觉环境。

对于依赖于单独动作或摄像机条件的方法 [26,34,37],将真实视频转换为训练数据通常需要动作标签或摄像机轨迹。无约束的现实世界视频中的动作可以在不同的语义粒度上定义,从而使得注释不明确,而连续的摄像机运动也难以估计和标记。本文界面只需要一个目标视频、一个相应的代理视频和一个结构化提示。动作和摄像机运动的视觉效果直接在代理视频中表示,而不是定义为独立的标签。

为了验证可以从现实世界的记录构建代理-观察对,在 KITTI-360 [93] 上构建几何辅助概念证明。校正后的RGB帧作为目标观测值,而校准后的相机位姿、累积的语义3D重建和3D对象注释仅在离线数据构建过程中用于编译相应的条件;它们都没有提供给视频模型。在每个时间戳,将静态场景几何体投影到校准的相机视图中,以获得度量深度和深度导出的表面法线。用与游戏数据相同的粗略原始词汇来表示需要明确空间基础的场景元素:行人的胶囊骨架、车辆的线框、植被的低多边形代理(low poly proxy)以及大型建筑物的粗略 3D 范围。投影几何体和代理基元通过共享深度缓冲区进行光栅化,从而在所有条件下保留相机运动、空间对齐和遮挡。使用相同的数据集帧索引在每个 RGB 目标及其编译条件之间建立一对一的对应关系。上面图 3b 显示一个代表性的对齐框架,说明代理条件可以从现有的现实世界 3D 重建中编译出来,而无需访问游戏引擎运行时状态。


实现细节

训练。对官方的 MiniMax-H3 Ref2VA 骨干网络 [77] 进行了微调,使其适用于代理条件视频生成。每个训练样本都使用代理序列(proxy sequence)和结构化文本作为条件,并以配对的 RGB 视频作为预测目标。157 个游戏片段包含约 5.6 小时的源视频。从这些片段中以两秒的间隔采样 9420 个五秒的训练片段。每个目标都是一个 124 帧、1344 × 768 分辨率、24 FPS 的视频。其时间对齐的代理条件是一个 124 帧、336 × 192 分辨率的序列,该序列结合固定对数深度和类别语义 ID 图。多模态编码器接收系统指令、片段特定的文本描述以及在偏移量 0、12、24,。。。,120 等处采样的 11 个代理帧。 在所有 50 个 Transformer 模块中应用 rank-128 LoRA [94],得到约 5.96 亿个可训练参数。从官方 Ref2VA 检查点开始,仅使用 AdamW 优化器在八块 NVIDIA H800 GPU 上优化视频目标函数,全局批大小为 8,权重衰减为 0.01,梯度范数裁剪为 1.0,混合精度为 BF16,使用 FlashAttention-3 [95] 和梯度检查点;音频损失函数被禁用。在现有计算资源下,训练运行三个 epoch,即 3534 个优化器步骤,其中包含 100 步的预热阶段,然后学习率从 2 × 10⁻⁵ 衰减至 1 × 10⁻⁶。

编码智能体推理。我用 GPT-5.6 Sol 作为编码智能体。在推理过程中,向其提供现有的游戏引擎代码,这些代码包含基本的玩家控制、碰撞处理和运行时更新循环,以及与训练数据构建中相同的代理原语(proxy primitive)。对于目前的编码智能体而言,从零开始构建 AAA 级场景和复杂的交互逻辑仍然十分困难。然而,我们发现编码智能体可以轻松地使用现有的 AAA 级游戏场景和游戏逻辑作为模板,通过组合、扩展和重写来构建每个目标世界。生成的世界是可执行的,并且玩家可以控制它,同时使用粗略的代理几何(proxy geometry)而非精细的 3D 资源来表示视觉相关的状态。在用户控制下运行这个世界,记录生成的代理视频,并将该序列作为逐帧条件提供给下游视频模型。鉴于编码智能体的快速发展,预期它们将能够越来越多地从零开始构建复杂的世界交互和场景布局。

视频模型推理。用第 3534 步的检查点,并使用显式欧拉方法对每个视频进行 20 步采样。对于定性示例,GPT Image 2 生成一个 1536 × 864 的第一帧外观锚点,该锚点基于第一个代理帧和编码智能体编写的文本提示。编码智能体编写的图像提示指示模型保留代理指定(proxy specified)的实体数量、近似位置、相对比例、物体方向、粗略布局、相机高度和取景,同时实现文本中描述的身份、材质、环境和整体视觉风格。生成的图像被调整大小为 1344 × 768,初始化目标潜槽 0,并提供给多模态编码器和 Ref2VA 外观参考分支。完整的代理序列提供了对相机运动、实体运动和场景布局的帧对齐控制,而文本指定了外观、动作语义以及代理未表示的细节。每次推理调用都会生成一个 124 帧、1344 × 768 分辨率、24 帧/秒的视频。推理过程仅处理视频,并使用 H800 GPU 上的 FlashAttention-3 算法。

对于长视频推理,用重叠的 124 帧窗口运行模型,窗口之间有 34 帧的重叠,因此每个新窗口都会将视频向前推进 90 帧。第一个窗口使用上文所述的 GPT Image 2 外观锚点进行初始化。对于每个后续窗口,前一个窗口的最后 34 帧 RGB 帧提供延续上下文,同时将相同的外观锚点再次提供给多模态编码器和 Ref2VA 外观参考分支。重叠的 RGB 上下文保持了局部时间连续性,而重用锚点则有助于保持窗口间的全局标识和外观。每次调用都会生成一个完整的 124 帧窗口;在拼接过程中,保留第一个窗口的所有帧,丢弃每个后续窗口重新生成的 34 帧重叠部分,并将剩余的 90 帧添加到拼接结果中。整个序列中都提供了帧对齐的代理条件。它们的 336 × 192 空间分辨率是 1344 × 768 输出分辨率在每个维度上的四分之一,对应的像素数量也只有输出分辨率的十六分之一。因此,即使是逐帧代理条件化,也只会引入极少的额外视觉tokens,并且相对于全分辨率视频生成而言,推理开销也微乎其微。

赞(0)
未经允许不得转载:网硕互联帮助中心 » 代码世界模型:编码智能体作为世界大脑
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!