Qwen3.8-27B 可在消费级显卡运行,多项榜单超过 Claude

Qwen3.8-27B 开放权重上线。经过 4-bit 等方式量化后,这款 27B 稠密模型已经可以在 RTX 3090、RTX 4090 等配备 24GB 显存的消费级显卡上运行。官方模型卡显示,其在 SWE-bench Pro、QwenSWEBench、CoWorkBench 等部分编程与智能体评测中超过 Claude Opus 4.6 Max,但并非在所有基准上领先。

千问团队近日开放了 Qwen3.8-27B 的模型权重。与需要多张数据中心显卡部署的超大模型相比,这款模型采用约 27B 参数的稠密架构,经过 4-bit 等方式量化后,可以被压缩到消费级硬件能够承载的范围。社区已经报告在 RTX 3090、RTX 4090、RTX 5090 等单张显卡上运行该模型的案例。

Qwen3.8-27B 可在消费级显卡运行,多项榜单超过 Claude主题相关图片
图片来自:搜狗问问

需要说明的是,所谓“可在消费级显卡运行”主要指量化版本,而不是以 BF16 原始精度完整加载模型。以常见的 24GB 显存显卡为例,4-bit GGUF 或 NVFP4 版本通常可以装入显存,但实际可用上下文长度还会受到 KV Cache、推理框架、缓存精度和系统内存的影响。若希望使用模型原生支持的完整长上下文,所需显存会明显增加。

部分编程与智能体成绩超过 Claude

Qwen3.8-27B 模型卡列出的测试结果显示,它的优势主要集中在软件工程、指令遵循和长流程任务上。与表中的 Claude Opus 4.6 Max 相比,Qwen3.8-27B 在部分项目取得更高分:

  • SWE-bench Pro:Qwen3.8-27B 为 61.7,Claude Opus 4.6 Max 为 53.4;
  • QwenSWEBench:Qwen3.8-27B 为 79.0,Claude Opus 4.6 Max 为 63.8;
  • CoWorkBench:Qwen3.8-27B 为 70.7,Claude Opus 4.6 Max 为 68.2;
  • IFBench:Qwen3.8-27B 为 79.5,Claude Opus 4.6 Max 为 62.5;
  • LiveCodeBench v6:Qwen3.8-27B 为 90.3,Claude Opus 4.6 Max 为 88.8。

这些结果支持“多项榜单超过 Claude”的说法,但不能理解为全面超越。在 Terminal Bench 2.1 中,Qwen3.8-27B 得分为 73.0,低于 Claude Opus 4.6 Max 的 78.2;在 NL2Repo-Bench 上,前者为 42.3,后者为 47.6。Claude 在高难度知识推理和部分长程智能体测试中也保持优势。

此外,不同模型卡可能采用不同的推理预算、智能体框架、工具环境和采样参数。即使名称相同的基准,运行配置变化也可能显著影响结果。因此,这些数字更适合用于观察模型能力方向,不宜直接等同于真实项目中的稳定胜率。

面向本地编程智能体的 27B 模型

从公开信息看,Qwen3.8-27B 的定位并不只是通用对话模型。它重点覆盖代码生成、仓库理解、工具调用、软件工程和长流程智能体任务,同时具备多模态输入能力。模型原生上下文窗口为 262,144 tokens,并提供思考强度控制,以便开发者在回答质量、生成速度和计算消耗之间进行调整。

较小的模型规模意味着开发者可以在本地保存代码、文档和工具执行记录,减少将敏感数据发送到外部 API 的需求。对于代码审查、仓库检索、离线助手和实验性编程 Agent,这种部署方式具有实际吸引力。不过,长上下文并不等于任意长度下都能保持相同质量;上下文扩大还会增加显存占用、首字延迟和提示词处理时间。

消费级部署仍有条件

社区测试已经证明 Qwen3.8-27B 可以在单张 24GB 消费级显卡上运行,但“能运行”与“适合生产使用”仍是两个不同标准。部署时至少需要考虑以下因素:

  • 量化会降低显存需求,也可能带来不同程度的能力损失;
  • 上下文越长,KV Cache 占用越高,能够留给模型权重和并发请求的显存越少;
  • GGUF、vLLM、SGLang、MLX 等推理方案的速度和功能支持并不完全一致;
  • MTP 推测解码的实际收益依赖运行时实现,不能仅凭模型支持情况推断速度;
  • 单次基准成绩不能替代针对目标代码库、工具链和工作流的本地测试。

总体而言,Qwen3.8-27B 的意义不只是某几项分数超过 Claude,而是把较强的软件工程和智能体能力压缩到了本地工作站能够部署的规模。它尚不能在所有任务上替代前沿闭源模型,但已经为需要数据留存、离线运行和可定制推理链路的开发者提供了一个更具可操作性的选择。

Qwen3.8-27B 可在消费级显卡运行,多项榜单超过 Claude | 秒鲨指南