CVPR 2026 于 6 月 3 日至 7 日举行。会议论文中,3D Gaussian Splatting(3DGS)不再仅被用于新视角合成和场景可视化,也被多项研究用于面向具身任务的在线三维场景理解、语义补全与导航推理。

其中,EmbodiedSplat提出在线前馈式语义 3DGS,目标是在流式图像输入下,同时完成三维重建与开放词汇三维语义理解。论文将二维 CLIP 表征绑定到三维高斯基元,并通过三维几何感知特征补充语言表征中的几何信息。作者在论文中将这一能力定位为面向具身任务的在线、近实时场景理解。
TGSFormer则聚焦具身语义场景补全。该方法以持续维护的高斯记忆保存随探索过程积累的场景表示,并通过时序特征融合与体素融合控制高斯基元密度。论文关注的问题是:在连续第一视角观测和更大场景尺度下,如何兼顾长期场景信息、计算开销与表示紧凑性。
另一篇工作Multi-Scale Gaussian-Language Map将自然语言描述与三维高斯表示结合,构建覆盖实例和区域层级语义的地图,并面向零样本具身导航和推理任务进行评测。结合这些研究可以看到,3DGS 在具身智能中的角色正被延伸为可增量构建、带有语义信息、可供任务模型查询的空间表示。不过,相关成果主要基于论文设定的数据集和评测协议,距离复杂真实环境中的稳定感知与操作仍需进一步验证。