如何在虚拟的AI空间,搭建一个真实可感的影像世界

单张图像就能生成可漫游的360度全景世界

研究员们提出的全新生成范式“Image as a World (IaaW)”首次实现了从单张2D图像生成高质量、可交互、可持续延展的360度全景视频世界。其核心在于全景几何感知模块与时空连贯生成机制:模型首先从单图中推理潜在空间结构并投影到球面坐标系,生成全景初始世界;随后利用训练好的全景动态生成能力,根据假设的摄像机运动或用户交互,生成可以任意旋转、平移的连续全景视频。关键技术在于保持跨视角几何一致性的同时,使生成视频能够向未来时间自然延展,呈现稳定的动态演化。这一突破突破了传统视频生成对输入视角与多帧序列的依赖,为沉浸式内容创作提供了更低门槛、更高自由度的技术路径,极大提升了生成模型在虚拟现实、元宇宙内容创作以及具身智能体环境模拟等领域的应用潜力。

如何在虚拟的AI空间,搭建一个真实可感的影像世界

物体中心表征让AI学会“理解”场景结构

传统生成模型缺乏对动态环境、三维结构和物理规律的建模能力。微软亚洲研究院提出的Dyn-O方法,采用物体中心表征来构建结构化世界模型,让AI不再只是生成像素,而是理解场景中每个物体的位置、运动轨迹和交互关系。这种表征方式使得模型能够像人类一样,将复杂场景分解为可操作的物体单元,从而在虚拟空间中实现更符合物理规律的角色调度、人物走位、摄影机运动以及景深关系。当AI掌握了“空间构建”和“角色调度”的维度,虚拟世界的影像就不再是二维画面的简单拼接,而是具有真实空间逻辑的立体舞台。

合成数据与物理AI:从虚拟环境反哺真实世界认知

真实可感的影像世界不仅需要视觉逼真,还需要符合物理世界的因果规律。NVIDIA Omniverse平台展示了如何通过合成数据训练物理AI模型:开发者利用针对通用场景描述(OpenUSD)的NVIDIA NIM微服务动态增强环境,实现场景创建、领域随机化、数据生成与数据增强。具体流程包括:首先创建全方位3D场景作为基础,纳入仓库、树木、道路等必要素材;接着利用USD Code NIM执行领域随机化,改变光线、背景、颜色、位置等参数;然后导出初始的注释影像(如2D边界框、语义分割、深度图、表面法线);最后借助NVIDIA Cosmos世界基础模型(WFM)将影像从3D增强至真实,通过简单用户提示为生成影像带来必要逼真感。这一流水线生成的合成数据,可大幅降低训练物理AI模型的成本,并解决真实数据稀缺与隐私问题,使虚拟世界成为训练机器人和自动驾驶汽车的“认知引擎”。

云端算力与虚拟化身:打通沉浸式体验的最后一公里

真实可感的影像世界最终需要用户以虚拟化身实时进入并交互。云计算为此提供了关键支撑:GPU云实例(如Amazon EC2 P4d)为Android应用提供原生ARM指令集支持的同时,提供远超手机芯片的X86计算性能,支持语音驱动口型动画、动作捕捉、表情迁移、模型自动生成等AI任务。元宇宙中的虚拟沉浸式影院、虚拟演唱会等场景,让观众以虚拟分身参与,摆脱座位限制和视角固定,获得沉浸式、多视角的丰富体验。开放的虚拟化身设计让用户摆脱现实外形限制,追求更强的自我认同,而AI(如Amazon Comprehend、Polly、Translate)则负责情绪分析、语音合成、实时翻译,增强社交趣味性与真实感。当虚拟空间具备了实时互动、个性化表达与云端算力保证,影像世界便从“观看”进化为“生存”。