NVIDIA 开源 Lyra2.0:从一张图到可探索的 3D 世界

UGC 国外 2026年04月20日 💬 0

NVIDIA Research 最近在 Hugging Face 上发布了一个新项目 Lyra2.0。这是一个开源框架,目标很直接:从一张图片出发,生成一个可以自由探索、还能实时渲染的 3D 场景。

简单理解,它不只是“生成视频”,而是试图把视频一步步变成一个真正能用的 3D 世界。


之前的问题:画面能动,但世界不稳定

如果你看过一些长视频生成模型,会发现两个很常见的问题:

  • 空间记不住:镜头一走远,前面生成的内容就“忘了”,再回去看会变样
  • 时间会漂:物体的位置、形状慢慢跑偏,越生成越不对

这两个问题叠加起来,基本就没法做稳定的 3D 重建。


Lyra2.0 做了什么改进

这次的思路不算花哨,但挺有效,核心是两点:

1. 加了一层“空间记忆”

系统会给每一帧维护一份 3D 几何信息,不过这份信息不是直接拿来渲染,而是用来“找参考”。

也就是说:
👉 用它去匹配历史帧、建立对应关系
👉 真正的画面生成还是交给模型本身

这样可以避免几何误差越积越多。


2. 训练时就让模型“踩坑”

Lyra2.0 在训练时,会故意让模型看到自己生成的“错误结果”,然后学着去修正。

效果就是:
模型不会一错再错,而是会慢慢把漂移拉回来。


整体流程:从图片到 3D 场景

实际用起来,大概是这么一步步走的:

  1. 输入一张图片(也可以加点文字描述)
  2. 在 3D 视图里手动设定镜头怎么移动
  3. 模型生成一段长视频(按你的镜头走)
  4. 把视频转成 3D 表示(点云 / Gaussian / 网格)
  5. 导出到引擎里继续用

最终可以直接丢进像 Unity、Unreal Engine 或 Isaac Sim 这样的环境里。


效果怎么样

官方实验里,它在长视频生成和 3D 重建上,整体超过了几种已有方法,比如:

  • GEN3C
  • CaM
  • Yume-1.5

比较明显的优势在两个地方:

  • 场景更大(可以做到几十米级)
  • 一致性更好(可以“走回去”不崩)

甚至还能在里面放机器人做实时交互。


开源信息

项目已经完全开放:

  • 模型:Hugging Face(nvidia/Lyra-2.0)
  • 代码:GitHub(nv-tlabs/lyra)
  • 协议:Apache 2.0(支持商用)

底层用的是类似 Wan-14B 的扩散模型,重建部分结合了 Depth Anything V3 这类工具。


能用在哪些地方

这套东西其实挺“工程向”的,几个比较直接的用途:

  • 机器人 / embodied AI:快速生成训练环境
  • 游戏开发:从概念图直接变成可探索场景
  • 3D 资产制作:省掉建模的大量重复工作

简单说结论

Lyra2.0 的意义不在于“画面更好看”,而是把一件以前很断裂的事情连起来了:

👉 图片 → 视频 → 3D 世界 → 可用资产

而且这条链路现在是可用的、还能开源。

如果后面稳定性再往上走一步,这类工具很可能会直接改变 3D 内容的生产方式。