2026-06-25 12:47 天天模拟器
根据媒体报道,英伟达在台北举办的GTC活动上正式推出了Cosmos 3,并宣称这是全球首款“完全开放的全能模型”。
这款模型主要面向机器人、自动驾驶汽车和视觉智能体,其核心优势在于基于视觉的推理能力,并且能够生成包括文本、图像、视频、环境声音以及动作在内的多种多模态内容。
英伟达表示,Cosmos 3采用了由推理Transformer与生成Transformer构成的双模块架构。其中,推理Transformer负责解读物体间的交互、运动轨迹以及时空关系,而生成Transformer则在此基础之上输出视频内容和动作路径。
这种设计使得模型能够先理解现实世界中的物理互动过程,随后再生成对应的画面和行为结果,从而大幅提升了对复杂环境的模拟能力。
英伟达强调,Cosmos 3的主要目标是解决机器人、自动驾驶车辆以及视觉智能体在真实环境理解方面长期存在的困难。
目前,相关的训练数据仍然较为匮乏,仿真系统也相对分散,这导致机器在学习物理世界规律时面临较高的门槛。Cosmos 3的愿景是以更高的物理准确性,原生地理解并生成包括文本、图像、视频、环境声音和动作信息在内的多种内容。
从应用定位来看,英伟达指出,Cosmos 3既可以作为视觉语言模型来使用,也可以扮演模拟物理环境、预测未来世界状态的世界模型角色,甚至能作为其他世界模型的基础平台。
在产品规划上,响应精度最高的Cosmos 3 Super以及轻量级版本Cosmos 3 Nano现已正式投入使用,而面向边缘设备实时推理的Cosmos 3 Edge版本将在后续阶段推出。
从技术层面分析,Transformer是一种擅长处理序列数据中上下文关系的深度学习神经网络,它能够通过并行计算来提升生成效率。英伟达此次将推理与生成能力整合在一起,旨在为机器人和自动驾驶系统提供更加贴近真实物理世界的基础模型能力。
来源:快科技
