World Labs发布Atlas:号称全球首个多模态世界模型,像素级相机控制生成1440p视频、稀疏图片重建3D,可为机器人生成模拟数据,未来数周开放早期访问
李飞飞创办的World Labs于9月1日发布多模态世界模型Atlas,官方称其为全球首个此类模型:可从一张或多张图片以像素级相机控制生成最长1分钟的1440p视频,从少量照片重建真实空间的3D结构,并为机器人生成RGB与深度模拟数据。公司自测在相机条件生成与3D重建基准上超过专用模型。目前仅向选定合作伙伴开放早期访问,未来几周扩大范围,未公布价格。
李飞飞创办的World Labs于9月1日通过官方X帖子发布多模态世界模型(world model)Atlas。所谓世界模型,是指学习一个场景的空间结构及其随时间的变化、进而生成新视角画面的模型。World Labs称Atlas是“全球首个”能以像素级相机控制生成图像和视频帧、并将其重建为3D的多模态世界模型。最直观的演示是:团队手工设计一条相机轨迹,仅凭7张参考图片就生成了一段1分钟、1440p分辨率的视频。
相机控制与3D重建
据官方博客,Atlas可处理文本、图像、视频和3D数据,架构为多模态自回归扩散Transformer(multimodal autoregressive diffusion transformer),输入在3D空间中定位,按序生成,把大语言模型(LLM)与视频模型的能力合到一处。模型用多样的多模态数据从零预训练;公司自测称,其在相机条件生成与3D重建基准上超过专用模型,且性能随训练算力扩展。
Atlas还能从一张到多张图片直接输出显式3D,官方称结果优于顶尖开源重建模型;输入图片越多,模型“想象”的部分越少。由于同时理解空间结构和时间演变,几台普通相机即可拼成“子弹时间”多视角拍摄棚,把动态瞬间定格下来。此外它还支持文生图与360度全景。
机器人模拟与早期访问
World Labs把机器人训练列为重点用途:Atlas能从几张照片重建空间,并生成机器人传感器在任意轨迹上会观察到的逼真RGB与深度数据,让机器人在更多场景中训练和测试。这与公司押注的“空间智能”(spatial intelligence)方向一致。
目前Atlas仅向选定合作伙伴开放早期访问,官网提供申请表,未来几周将扩大早期访问范围;价格未公布,也没有开放权重。World Labs称,Atlas还将为其创作工具Marble的后续版本提供动力。