李飞飞的 World Labs 放出了 Atlas,自称是全球第一个多模态世界模型。
拆开看,它同时干四件事:生成图像、生成视频帧、支持像素级的相机控制、把结果重建成 3D。前两件现在的视频模型都能做,后两件是分界线。
像素级相机控制的意思是,你不是给一句”镜头向左推”然后祈祷它照做,而是能精确指定视角。这在视频生成里一直是个软肋——现有模型对镜头运动的理解是统计意义上的,你说推轨它给你一个”像推轨的东西”,帧与帧之间的几何关系并不真的成立。重建成 3D 这一步等于反过来验证:如果生成的画面在几何上是自洽的,才可能重建出结构。
World Labs 从成立起就一直在讲空间智能这套叙事,Atlas 是这套叙事第一次给出可以上手的产品形态。
目前公开的还是官方演示和描述,没有第三方评测。世界模型这个方向历来是演示片段和实际可控性差距最大的领域之一,尤其”重建为 3D”的质量到底是能进生产管线,还是只够看个热闹,这个问题只能等外部试用之后才有答案。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






李飞飞的 World Labs 放出 Atlas:能生成、能控镜头、还能重建成 3D