多模态大模型的能力正从“被动感知”走向“主动执行”,但上下文长度与生成成本的同步攀升,使“效率”成为其规模化落地的关键瓶颈。将于 8 月 21 日至 22 日在深圳举办的 AICon 全球人工智能开发与应用大会,把这一议题放进了“大模型效率工程与 Agent 系统实践”专题。浙江大学百人计划研究员、博士生导师庄博涵已确认出席,并围绕“面向多模态推理的高效长上下文建模”作主题分享,从算法与系统协同设计的角度梳理破解路径。

庄博涵的主要研究方向是高效大模型的算法与系统协同优化,关注 Agent Loops、World Models 与具身智能等方向。从公开的演讲提纲看,多模态长上下文场景中的效率压力主要来自三处:注意力计算量随序列长度呈二次增长;KV cache 随 token 数量线性膨胀并大量占用显存;解码阶段的累积开销随生成长度上升,复杂推理尤其明显,因为模型需要生成大量中间步骤并反复回溯视觉证据。三者的共同结果是,能力更强的多模态模型在长上下文推理中反而更容易受制于成本与时延。
针对这三类瓶颈,演讲给出了一一对应的技术路径:
- 高效注意力:采用稀疏注意力与线性注意力,化解注意力随序列长度二次增长的瓶颈,支撑长上下文理解与长视频生成。
- 高效记忆:通过 KV-cache 压缩与缓存管理,突破长序列推理的显存瓶颈。
- 高效解码:借助并行解码策略提升推理吞吐、降低生成时延,以满足实时 Agent 交互的需求。
在“多模态大模型(Agent)的核心能力”部分,演讲进一步把理解与生成放进同一框架:理解侧关注在有限算力下高效理解长视频,并支撑空间推理与决策;生成侧关注以更低成本实现世界模型生成,覆盖 3D 世界生成重建与长视频生成;评测侧则强调用可诊断的基准牵引世界模型的演进。
世界模型推理提速是本次分享的一个代表性实践。面向游戏、具身等仿真场景,世界模型不仅要生成高质量视频,还要支持低延迟的实时交互。庄博涵团队在系统层面提出的 FPSAttention,针对视频 DiT 的三维注意力进行训练感知的 FP8 量化与稀疏协同设计;据其团队介绍,在 NVIDIA H20 上运行 Wan2.1-14B 生成 720p 视频时,注意力算子最高加速 7.09 倍,端到端视频生成加速 4.96 倍,同时生成质量基本无损。算法层面的 FlashBlock 则在 block diffusion 范式下探索新的缓存机制,在长文本与视频生成实验中实现最高 1.44 倍 token 吞吐提升、1.6 倍注意力耗时降低,对生成质量影响很小;近期的 Mirage 把视频模型的空间记忆保存在潜空间中,使三维缓存的显存占用最高降低 55 倍,并获得最高 10 倍的端到端加速,在 WorldScore 评测上取得最佳结果。这些面向 block diffusion 范式的系统与算法研究,正被整合到统一框架 Inferix 中,为世界模型提供推理引擎。
围绕多模态长上下文推理的效率问题,学术界与工业界近期也密集给出方案,路径与上述演讲主题高度呼应。在 KV cache 维度,NAACL 2025 收录的 MEDA 依据注意力熵为各层动态分配 KV cache 预算,最高实现 72% 的缓存显存降低与 2.82 倍解码加速;华中科技大学团队被 KDD 2026 录用的 MMSeq 提出多模态分隔符压缩框架,在预填充阶段实现 1.70 至 2.18 倍加速、解码阶段实现 1.52 至 2.03 倍加速,复杂推理任务的性能保留率约为 99%。在上下文表征维度,清华大学与智谱联合提出的 Glyph 将长文本渲染为图像,通过视觉-文本压缩实现 3 至 4 倍的 token 压缩;小米的 MiMo-V2.5 系列利用 Hybrid SWA 架构,使 KV cache 存储下降至接近全量存储的七分之一。NVIDIA 的 LongVILA 通过算法与系统协同设计,将视频帧数从 8 帧扩展到 2048 帧,支持 2M 上下文长度的长视频训练,同样体现了“算法—系统协同”这条主线。
这些工作共同指向一个趋势:多模态大模型的竞争正在从单点能力转向系统工程。高效注意力、KV-cache 管理与并行解码不再是彼此独立的优化技巧,而是需要在同一套系统里协同设计。庄博涵在分享的最后还会谈及面向视频生成对齐的高效扩散强化学习、交互式世界模型评测,以及对高效基础模型未来走向的思考,包括 agentic loop 等方向,为多模态长上下文推理从“跑得动”走向“跑得划算”提供更完整的图景。