Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.035 — 2026-08-08
PAPER HF 46 约 7 分钟

WorldClaw:一句话生成可漫游世界

WorldClaw把一句描述拆成规划、造地形和摆资产,让AI像制作团队一样搭建可漫游、可编辑的3D世界。

你对 AI 说:“做一座热带海盗岛,有港口、聚落和崎岖海岸。”生成一张漂亮图片不算太难。难的是让你离开拍摄位置,沿海岸走到港口,再绕到建筑背后时,整个空间仍然成立:道路不能凭空断掉,房子不能只有正面,物体还得能单独移动和修改。

WorldClaw瞄准的正是这道题。它不是一次“画”出整个世界,而是让多个 Agent——由模型驱动、承担不同任务的虚拟角色——先规划区域和地形,再逐片生成物体,最后通过渲染检查并修补问题。论文把它称为 fully agentic、coarse-to-fine,也就是由智能体协作、由粗到细地构建开放世界。

这里的“开放世界”首先是空间意义上的:用户可以在较大范围内移动,从不同方向观察连续的三维场景。它不自动等于一款完整游戏。论文没有证明这些世界具备游戏逻辑、物理交互或实时生成能力。本文涉及的效果也主要来自作者展示和定性比较,尚无量化指标或用户评测。

先编排,再动工

WorldClaw的核心判断很朴素:一个大世界不必在同一时刻、用同一种办法生成。更稳妥的做法,是先把全局共同遵守的规则定下来,再处理各地不同的细节。

系统分三步工作。第一步理解用户意图并制定计划;第二步搭建贯穿全场景的地形;第三步只在需要丰富内容的区域生成和摆放具体物体。它像一支虚拟制作团队:有人读需求,有人画总平面图,有人造山铺地,有人制作道具,还有人负责巡场验收。

规划阶段又刻意分成两层。意图分析 Agent只提取用户明确说过的内容,例如场景类型、风格、关键区域、物体和空间关系,不擅自补充。随后,场景规划 Agent才填写施工所需但用户没说清的信息,把一句话整理成结构化规格,其中包括区域、地形、物体、材质、密度和彼此的位置关系。

这份规格相当于各工序共用的施工单。它能减少一个常见问题:负责地形的模块把“峡谷聚落”理解成谷底村庄,负责摆建筑的模块却把房子放上陡峭山壁。先把语义和空间关系写成共同约束,各环节才不至于各说各话。

世界先要有一副连续的骨架

很多场景生成流程把地面当成一张平板,再往上摆东西。对室内或规则街区,这有时够用;但山脉、峡谷、沙丘和台地本身就是场景结构,不能只靠道具遮掩。

WorldClaw先生成一张语义布局图。不同颜色代表不同地形区域,用来确定各区域的大致位置、相邻关系和覆盖范围。随后,系统为每个区域设置基础高度、不同尺度的起伏噪声,以及山峰、沙丘、台地或侵蚀等地貌操作,再在边界处平滑混合。这样得到的是一整块连续的高度场——可以把它理解为一张记录每个地面位置高度的地图——而不是若干互不相干的小场景。

同一套区域划分还会指导材质和环境资产的分布。材质决定地表看起来像岩石、沙土还是积雪。WorldClaw既能生成包含颜色、凹凸和粗糙度信息的纹理,也能在 Blender 中用程序规则组合可重复铺设、可调参数的材质。岩石和植被簇等常见元素则先做成可复用的 3D 原型,再依据区域、坡度、高度和地表朝向散布。

“可复用”很重要。这些显式资产不是画面里看似立体的一团像素,而是可单独保存、摆放和编辑的带纹理网格。它们能被替换或再次使用,也更接近传统 3D 制作和游戏引擎需要的素材形式。

局部细节从二维借道,再回到三维

有了地形骨架,系统不会把整个世界重新生成一遍。区域规划 Agent会挑出仍需具体物体的地方,并规定这里要放什么、数量和密度如何、物体之间有什么关系。

接下来的一步颇有意思。WorldClaw先从选定视角渲染当地地形,得到一张保留坡度、材质和周边环境的二维图片;图像编辑模型再把建筑、车辆或设施填入其中。这张图不是最终成果,而是一份“带现场条件的摆放草图”。它让成熟的图像生成能力负责构图,同时用原有地形约束物体的位置和外观。

系统随后用 SAM3把图中的物体逐个分割出来,再通过 SAM3D和 Hunyuan3D重建为独立的 3D 网格。小物体会被裁切放大,以提高识别和重建效果;系统同时记录裁切前后的坐标关系,避免物体重建后找不回原来的位置。

把二维物体送回三维地形时,WorldClaw利用重建相机和地形相机中对应的视线,估计位置、尺度与方向。它还会沿视线微调深度和大小,检查物体底部与地面的接触比例,以减少悬空或陷入地下。这套过程的价值不只在“摆得像”,还在于每个物体仍是独立实例,后续可以单独编辑。

让 Agent 看成片,再返工

初次生成不会天然可靠。区域边界可能过于突兀,纹理比例可能不对,树木分布可能不自然;建筑也可能大小失衡、姿态奇怪或与地面接触不稳。

WorldClaw因此加入基于渲染的检查循环。Agent通过 Blender从预设视角重新渲染场景,检查地形、材质、散布效果和物体状态,再修改相应参数。对于质量不足的物体,它可以结合粗网格和原始物体图片,让 Hunyuan3D进一步改善几何与纹理,同时沿用已经求出的摆放位置。发现悬空或穿插时,系统还会局部移动物体,或压平、平滑其支撑区域的地形。修改被限制在接触附近,以免破坏全局地貌。

这也是“Agent式工作流”真正发挥作用的地方:Agent不只是把提示词转交给生成模型,还负责调用工具、观察渲染结果、诊断问题并安排下一轮修正。循环会在没有发现重大问题或达到预设迭代预算时停止。

为什么值得关注

WorldClaw最值得看的,不是“一句话”这个入口,而是它如何管理规模。系统把全局一致性放在地形、语义布局和共享规划里,把局部丰富度交给按需生成的区域流程。这样既不要求一个模型同时解决整个世界,也避免只拼出一组各自漂亮却无法连接的局部画面。

论文展示了热带海盗岛、带部落聚落的河流峡谷、沙漠战场,以及包含未来设施的雪山山谷。作者提供全局环绕视图、局部步行视图,以及实例、深度和法线渲染,用来呈现区域组织、地形起伏和独立物体表面。实验运行在配备4张 NVIDIA H20 GPU的服务器上,底层 Agent模型为 Claude Opus 4.8,场景构建、优化和渲染使用 Blender 5.1.1。

论文还定性比较了 SynCity、Marble、MajutsuCity、WorldGen和 GPT-5.6 Sol。作者认为,WorldClaw的语义布局图更有利于形成高低变化明显、语义不同但空间连续的地形。不过材料没有给出量化分数,比较也主要依赖展示图,因此更适合视为设计思路和案例证据,而不是已经证实的领先结论。

局限与未知

  • 论文没有披露世界的实际尺寸、完整生成耗时、成功率或资源成本,标题中的“at scale”缺少明确边界。
  • 实验以定性案例和视觉比较为主,没有量化基线、消融结果或用户评测;“全局连贯”“局部内容丰富”等判断主要是作者自述。
  • 当前材料证明的是可自由观察、可编辑资产组成的 3D 场景。它尚未证明完整游戏逻辑、可靠物理交互、实时生成,或普通用户可直接使用的一键式产品体验。

WorldClaw给出的更像一张路线图:开放世界生成未必依靠一个更大的模型硬做到底,也可以靠明确分工、共享规划和可检查的中间资产逐步搭建。它离“说一句话就得到可玩的世界”仍有距离,但已经把问题从生成漂亮画面,推进到了如何组织一套能够继续制作的三维环境。


供稿材料 SOURCES — 1

← 返回 2026-08-08 · 学术板块