豆包视频通话升级,火山引擎多模态传输系统提供支持

豆包视频通话接入 SeedRealtime 原生音视频全双工大模型,火山引擎多模态传输系统为实时交互提供底层支持。([infoq.cn](https://www.infoq.cn/article/kJK3qG9m7UEYtf7siCgU?utm_medium=article&utm_source=rss))

豆包视频通话功能完成升级,接入原生音视频全双工大模型 SeedRealtime。升级后,AI 可以同时接收和处理音频、视频、文本三路输入,在连续变化的真实场景中边看、边听、边说,并根据环境变化主动提醒用户。

此次升级由火山引擎多模态传输系统(MMT)提供技术支撑。该系统基于 QUIC 和 MoQ,将音视频、信令与模型状态统一纳入同一会话,报道提到建联耗时已从秒级压缩至数百毫秒,同时通过音画同步和按需传输策略,减少多模态信息错配对对话的影响。

InfoQ 援引官方评测称,与传统级联方案相比,升级后的对话节奏违和问题减少约 50%。这也显示,实时多模态交互的体验不仅取决于模型能力,底层传输和会话调度同样关键。