豆包视频通话功能完成升级,接入原生音视频全双工大模型 SeedRealtime。升级后,AI 可以同时接收和处理音频、视频、文本三路输入,在连续变化的真实场景中边看、边听、边说,并根据环境变化主动提醒用户。
此次升级由火山引擎多模态传输系统(MMT)提供技术支撑。该系统基于 QUIC 和 MoQ,将音视频、信令与模型状态统一纳入同一会话,报道提到建联耗时已从秒级压缩至数百毫秒,同时通过音画同步和按需传输策略,减少多模态信息错配对对话的影响。
InfoQ 援引官方评测称,与传统级联方案相比,升级后的对话节奏违和问题减少约 50%。这也显示,实时多模态交互的体验不仅取决于模型能力,底层传输和会话调度同样关键。