阿里千问团队于2026年8月14日开放Qwen3.8-27B模型权重。标题中的“Qwen3.8开源”具体指此次发布的27B版本:模型包含约270亿参数,采用原生多模态稠密架构,可处理文本和视觉输入。

根据发布信息,Qwen3.8-27B支持262K原生上下文,并可通过YaRN扩展至100万Token。模型还加入了reasoning_effort控制能力,开发者可以根据任务复杂度调整推理投入,在回答质量、延迟和资源消耗之间作出取舍。
千问团队称,新模型重点改善了编程和办公任务表现,官方评测中的综合能力超过Qwen3.7-Plus。需要注意的是,这属于模型发布方给出的评测结论;不同推理框架、提示词、量化方式和测试集均可能影响实际结果。
“家用显卡可运行”并不意味着原始精度模型能直接装入普通显卡。27B模型若以BF16保存,仅参数权重的理论体积就约为54GB,实际推理还需要为运行时状态、视觉模块和上下文缓存预留空间。消费级设备主要依靠4位或更低精度量化、CPU与GPU混合卸载,以及缩短上下文长度来降低内存需求。
模型发布后,Unsloth等社区项目已经提供GGUF量化版本,并给出约17GB内存或显存环境运行部分量化版本的方案。这让配备16GB至24GB显存、或拥有较大系统内存的个人电脑具备本地尝试的可能。24GB显存设备通常可以选择质量更高的量化文件或保留更多上下文;显存更小的设备则可能需要把部分层卸载到系统内存,并接受速度下降。
本地部署时还需区分“模型能够加载”和“能够使用完整上下文”。262K乃至100万Token会显著增加缓存及计算开销,普通家用设备即使能够运行量化权重,也不一定适合直接开启最大上下文。对于日常对话、代码辅助和文档处理,可先从较短上下文开始,再根据显存占用逐步调整。
此次发布的主要信息包括:
- 模型规模:约270亿参数,稠密架构。
- 输入类型:原生支持文本与视觉信息。
- 上下文:原生262K,可通过YaRN扩展至100万Token。
- 推理控制:支持按任务调整思考深度的
reasoning_effort功能。 - 开放方式:模型权重采用Apache 2.0许可证,可下载、部署和用于符合许可证要求的商业项目。
- 本地运行:社区已提供GGUF等量化格式,可通过llama.cpp及相关桌面工具部署。
对个人开发者而言,Qwen3.8-27B的意义不只是参数规模下降,而是把多模态、长上下文和可调推理能力放入一个仍有机会在消费级硬件上部署的模型中。不过,量化会带来一定能力损失,超长上下文也会迅速增加内存占用。“家用显卡可运行”更准确的理解是:在选择合适量化版本、限制上下文并配置内存卸载后,部分消费级设备可以完成本地推理,而不是所有家用显卡都能以完整精度和最高配置运行。