Qwen3.8首日可用,智源FlagOS推动存量算力持续使用

阿里巴巴开源超大规模MoE模型Qwen3.8-2.4T-A95B当天,众智FlagOS社区同步完成9家AI芯片的Day0适配,并通过统一INT8量化降低存量算力的运行门槛。

8月13日,阿里巴巴开源超大规模 MoE 模型 Qwen3.8-2.4T-A95B。模型发布当天,众智 FlagOS 社区同步完成 Day0 多芯片适配,Qwen3.8-2.4T-A95B 已在平头哥、英伟达、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、清微智能、燧原等 9 家 AI 芯片上完成基于 FlagOS 统一开源技术栈的多芯适配、精度对齐与部署验证,开发者可直接获取对应芯片的开箱即用方案。

Qwen3.8首日可用,智源FlagOS推动存量算力持续使用主题相关图片
图片来自:搜狐网

这是阿里巴巴开源模型系列中规模最大的一代,首次将 Qwen-Max 级别的模型开放。模型采用总参数 2.4T、激活参数 95B 的纯文本 MoE 架构,原生上下文长度为 262,144 tokens,可扩展至 1,010,000,并同时提供 BF16、FP8 权重。在 Coding Agent 相关基准上,Qwen3.8-Max 较 Qwen3.7-Max 明显提升:Terminal Bench 2.1 从 74.5 升至 86.6,SWE-bench Pro 从 60.6 升至 67.7,Paper Bench 从 64.8 升至 93.0。

相比 Qwen3.5/Qwen3.6,本次模型主体结构变化有限,主要挑战来自参数规模:与 Qwen3.5-397B 相比扩大约 6 倍。为了让已部署的主流 AI 芯片能够运行这一超大模型,FlagOS 技术栈新增了面向多款芯片的统一 INT8 量化支持,通过 FlagOS-Compressor 多芯片模型量化工具链,打通从 FP8/BF16 原生权重到 INT8 的两条量化压缩路径,并完成量化推理算子在多款芯片上的适配。评测显示,量化迁移后的权重在多种芯片上,与英伟达基于 CUDA 的 FP8 版本对照,误差平均分偏差位于对齐区间内。

从今年 2 月首次开展 MiniCPM4.5-o 模型的多芯片 Day0 适配至今,FlagOS 已累计完成来自 7 大头部模型团队、12 款主流开源模型、覆盖多达 10 款芯片的跨芯 Day0 适配。智源方面表示,这一能力回应了国产 AI 算力产业化落地的两项核心需求:一方面,让云服务与应用生态能够第一时间部署最新模型;另一方面,让既有算力基础设施持续承接模型演进,延长使用周期、释放存量算力价值。

对云厂商、智算中心和中小型 Token 算力服务商而言,不同芯片的适配链路相对独立,过去往往需要重复投入工程资源。FlagOS 将新模型从发布到多芯可用的周期压缩至 24 小时以内,使中小型服务商能够基于国产芯片快速上线推理 API 和 MaaS 服务。目前,腾讯云 HAI 社区、超算互联网等多个云平台已将 FlagOS 适配的模型纳入容器镜像中心,开发者可直接拉取镜像并部署到云端加速卡。

从单次 Day0 适配到规模化验证,FlagOS 正在把“前沿模型首日多芯可用”从技术演示推向云服务交付,为存量 AI 算力承接更大规模模型提供了统一、开放的基础软件支撑。