AICon深圳将于8月21日至22日举行。华为2012实验室大模型系统工程技术专家李柏潮确认将在“AI Infra、推理工程与异构计算”专题分享《盘古训练与推理通信优化实践:亲和昇腾平台的性能探索》,聚焦盘古模型训练和推理过程中的通信优化。

据InfoQ披露,在MoE模型场景中,AllToAll通信占端到端时间的比例可超过30%,是训练与推理优化的重要对象。针对这一问题,分享将介绍如何结合昇腾950的网络拓扑与CCU通信加速器,对盘古模型专家并行(EP)通信域的AllToAll进行优化;InfoQ称,该方案实现了10%以上的性能提升。
推理侧的另一项重点是超长上下文场景下的KV Cache卸载。InfoQ称,在100万上下文场景中,主机到设备的KV Cache传输延迟会影响首Token生成时间(TTFT)。相关实践将围绕Omni Cache的H2D与D2H通信展开,并称TTFT获得10%以上提升。
这场分享还将讨论硬件亲和优化的边界:针对特定硬件平台设计的通信策略并不一定能直接迁移至其他平台。议题计划进一步介绍通过融合算子、多流并行和流水编排减少未被计算掩盖的通信时间,以改善模型端到端训练和推理效率。
说明:上述性能数据和技术方案来自大会会前公布的议题介绍,属于相关团队披露的实践信息。