开放模型现状:2026年夏季观察

Hugging Face 发布《State of Open Models: Summer 2026 Observations》半年报:中国实验室在开放模型规模上占据主导,Qwen 以 15 万个衍生模型成为社区默认基座,小模型仍贡献绝大多数真实下载,AI 智能体则首次成为 Hub 上的主要流量来源。

2026 年 8 月 14 日,Hugging Face 发布了半年一度的生态报告《State of Open Models: Summer 2026 Observations》(开放模型现状:2026 年夏季观察)。报告由 Adina Yakefu、Apolinário Passos、Irene Solaiman 等成员撰写,基于 Hugging Face Hub 平台 2026 年 1 月至 8 月的数据,梳理了开放模型生态在规模、采用、许可与流量结构上的最新变化。作者在开篇即提醒:在 AI 领域,时间仿佛被压缩了——春季报告发布不过几个月,生态又呈现出许多新面貌。

开放模型现状:2026年夏季观察主题相关图片
来自网络

平台整体:数量快速增长,分布依旧极端

报告期内,Hub 上的公开模型仓库从 243 万个增长到 296 万个,数据集从 71.1 万增长到 100 万,Spaces 从 100 万增长到 144 万。但增长的背后是高度集中的分布:约 85.6% 的模型累计下载量不足 200 次,而 1.5% 的仓库拿走了全部下载量的 99.2%。报告指出,上述所有观察都发生在这种分布格局之中。

前沿规模:中国实验室主导,硬件厂商成为发布主力

报告最引人注目的结论之一是规模格局的变化。过去,实验室通常先发布小模型、再逐步向规模顶端推进,而 2026 年多家中国实验室完全跳过了这一路径。在几乎每一个月里,中国实验室发布的最大开源模型都超过了美国实验室同期发布的原创模型:中国实验室的月度规模上限在 7540 亿到 2.78 万亿参数之间,而美国实验室在七个月里有五个月低于 1300 亿参数,例外是 NVIDIA 的 Nemotron 3 Ultra(561B)和 Thinking Machines Lab 的 Inkling(952B)。

发布策略也随之分化。月之暗面(Moonshot)、MiniMax、小米和 Z.ai 几乎只发布 70B 以上的模型,走「前沿优先」路线;腾讯和阿里的 Qwen 则覆盖从 1B 以下到 2.4T 参数(Qwen 3.8 Max)的完整谱系。报告认为,参数量规模如今更像一种「意图声明」而非「能力证明」:只押注前沿模型的组合,把筹码放在基准排名和 API 需求上;全谱系组合则争取成为开发者标准化的模型家族。值得注意的是,小米和美团今年都跨过了万亿参数门槛,而一年前它们在开源权重领域还几乎名不见经传。

与此同时,美国并未缺席开源生态,但重心发生了转移。今年发布新模型仓库最多的两家机构是硬件厂商 AMD 和 NVIDIA,各自发布超过 200 个新仓库,远超其他机构,LiquidAI 以约 100 个排名第三。Google 和 Meta 在新模型发布数量上已明显落后于 NVIDIA——尽管它们在前几年定义了开源模型的发布节奏,Meta 转向闭源旗舰模型进一步凸显了这一变化。报告判断:开放模型的主导权已经从模型实验室转移到硬件和基础设施公司手中。

在前沿规模上,情况则截然不同:美国今年发布的超过 100B 参数的模型中,多数并非原创,而是基于中国模型构建的。该规模上重要的美国原创模型仅有 Thinking Machines 的 Inkling(952B)、NVIDIA 的 Nemotron 3 Ultra(561B)、Nemotron 3 Super(124B)和 Arcee AI 的 Trinity-Large(399B)。AMD 贡献了大量模型转换工作,让万亿参数级的中国模型能够在自家硬件上高效运行,但这一层属于分发与优化,而非模型创作。

关注度不等于采用度

报告比较了 2026 年累计下载量前 25 与点赞量前 25 的模型仓库,两个榜单恰好只有一个仓库重合。下载量记录的是「模型是否已被接入按计划运行的流水线」,点赞量记录的是「行业对什么感到兴奋」,二者衡量的是不同的行为。2026 年发布的模型没有一个进入当年下载榜前 25,而前 25 名中有 13 个来自 2022 年。句子嵌入模型 all-MiniLM-L6-v2 在七个月内被下载 15.5 亿次,点赞却只有 5156;Kimi-K3 平均每获得一个赞,对应约 60 次下载。

这种分化同样出现在发布方层面。中国前沿实验室是 Hub 上仅有的、下载量主要来自 70B 以上大模型的账号:MiniMax 2026 年的下载几乎全部来自大模型,月之暗面为 88%,DeepSeek 为 55%,Z.ai 为 39%。而 Google、Microsoft、IBM Granite 在 70B 以上的下载占比几乎为零,NVIDIA 和 Meta 分别只有 14% 和 9%。总量上差距更加悬殊:月之暗面靠前沿模型组合录得 3700 万次下载,而 Qwen 跨参数规模的广泛发布策略达到 20.45 亿次(若计入所有仓库则为 20.61 亿次),约为前者的 55 倍。

开放权重改变了价值积累的流向

如果前沿模型是一项授权许可业务,人们会预期最大的发布附带最严格的条款,但数据讲述了一个不同的故事。报告追踪的 178 个超过 200 亿参数的中国模型中,59% 采用 Apache 2.0 许可,22% 采用 MIT 许可,带有非商业限制的模型数量恰好为零。DeepSeek 和 Z.ai 甚至以纯 MIT 许可发布了 7000 亿到 1.65 万亿参数级别的模型。相比之下,美国实验室同一规模区间的模型只有 29% 采用 Apache 或 MIT,41% 采用自定义条款,30% 未声明许可。

报告认为,这些发布显然不是为了许可收入——权重以最宽松的条款免费提供,回报必然来自其他途径:API 与云业务、硬件和平台定位,或者生态系统地位本身。需要留意的是,许可标签不能替代完整条款审查:例如 Kimi 的许可中仍包含针对高营收企业的商业使用授权门槛。

Qwen 已成为社区的基础模型

一个模型家族的生态地位,不仅由其自身发布定义,更取决于社区在它之上构建的丰富程度。按此标准,Qwen 已成为开放模型生态系统中最大的基础之一:基于 Qwen 的衍生模型在 Hub 上达到 151,448 个,是 Meta 全部模型足迹的 2.6 倍、Llama 仓库数量的 4.7 倍;Google 以 82,506 个衍生模型位居第二,第三大衍生来源是发布量化与微调就绪版本的社区账号 Unsloth。2026 年前七个月,Qwen 衍生模型以每天约 180 到 210 个新仓库的速度增长。

报告将这一地位归因于三个相互强化的因素:稳定的发布节奏、覆盖多种尺寸和用例的完整谱系,以及 Apache 2.0 带来的低门槛开放性。「Qwen 已成为开发者在决定微调与部署哪些模型时的默认工作流程的一部分。」值得注意的是,这一生态主要由社区建成——在 Hub 上 28,531 个 Qwen 模型的 GGUF 转换版本中,Qwen 官方发布的只有 54 个。

小模型仍是实际应用层

在声明了参数数量的模型中,低于 1B 的模型占据了全部历史下载量的 83%,而高于 100B 的模型仅占 1%;即便只看 2026 年,70B 以上模型的下载占比也只有 3%。原因与此前相同:小模型是唯一能在大多数开发者实际拥有的硬件上运行的模型。

那么万亿参数模型是如何触达用户的?答案是 llama.cpp。今年 2 月,ggml 团队加入 Hugging Face,项目仍保持完全开源、社区治理与技术方向不变。7 月的快照已包含 DeepSeek-V4-Flash(约 284B)和 Kimi-K3(约 2.8 万亿参数)的 GGUF 构建——本地推理的含义从「在笔记本上跑一个 8B 模型」扩展为「将万亿参数的混合专家模型分布在几台消费级机器上运行」。这条路径同样由 Qwen 领跑:其 GGUF 月度下载量为 3960 万次,几乎是 Gemma(2080 万)的两倍、Llama(750 万)的五倍多——且差距并非供给问题,Llama 衍生的 GGUF 仓库数量其实略多于 Qwen。

报告期内,模型仓库增长了 21.5%,而周边工具层增长更快:声明使用 GGUF 库的仓库增长 464%,LeRobot 增长 194%,Apple 的 MLX 增长 148%;相比之下 transformers 和 peft 仅增长 16%,diffusers 增长 21%。决定模型「物理上能在何处运行」的层——本地推理格式、Apple 芯片、机器人控制栈——其增速是建模核心层的三到七倍。

智能体是新的用户

报告新增了智能体使用数据集(2026 年 7 月发布),首次记录编码智能体通过 huggingface_hubhf CLI 访问 Hub 时发送的 agent 标识。7 月,Claude Code 以 44.4% 的份额领跑,但单月数据掩盖了真正的发现:它在 4 月曾占 67.8%,5 月跌至 6.4%;Codex 则从 10.4% 稳步攀升至 20.8%。这是一个没有既得垄断者的市场——一次发布或一个默认设置的改变,就可能在单月内转移一半的流量。7 月近四分之一的智能体流量来自数据集中尚未命名的编排框架(5 月这一数字为 59.8%),新进入者的速度超过了注册表命名的速度。

Hugging Face 也在为「机器读者」重构服务:论文自 3 月起提供机器可读的 Markdown 格式;4 月智能体轨迹成为一级数据集类型,每个 Gradio Space 新增 agents.md 端点;7 月在 MCP 服务器上推出 hf_fs 工具,MCP 协议也进入了 Linux 基金会主导的 Agentic AI Foundation。然后,在 7 月,一个智能体从读者变成了入侵者:Hugging Face 遭遇了据称是首个有记录的、由自主智能体主动发起的持续入侵案例,目标是其自身基础设施。团队尝试用闭源前沿模型分析捕获的攻击代码时,安全护栏拒绝了这项任务,最终分析由运行在自家基础设施上的量化开源模型 GLM-5.2 完成。报告发布了一份披露声明和完整技术时间线。

数据口径与局限

报告发布次日,阿里巴巴宣布 Qwen 系列过去六个月全球下载量突破 30 亿次,超越 Meta 和 Google,并称已开源 460 多个模型、衍生模型超过 30 万个。需要厘清的是,3 亿——即 30 亿——这个数字涵盖 ModelScope 等所有分发渠道;而 Hugging Face 平台口径下,Qwen 2026 年的下载量为 20.45 亿次、衍生模型 151,448 个。口径差异不改变「谁是第一」,但说明引用的数字必须注明来源。

报告在方法论说明中也强调:下载量反映的是 Hub 生态内的活动,并不涵盖 API 调用、私有部署或通过其他渠道分发的模型;点赞反映社区关注度,衍生模型反映二次开发程度,它们都不应被直接解读为模型质量、商业采用率或整体市场份额的度量。报告同样提醒,开放权重在带来本地控制的同时,也把更多治理与遏制责任交给了运营方。

展望:生态竞争的多重时钟

与春季报告相比,地缘力量的再平衡在持续加速。美国开源生态仍在推进——Meta 和 NVIDIA 近几周都发布了新的开放模型,NVIDIA 明确表示要在开放权重上追赶中国;但报道也指出,北京正在评估限制海外访问中国最先进模型的可能性,这或将影响 Qwen 的全球普及路径。报告以马拉松作比:llama.cpp 这类工具抬高了本地部署的天花板,但一个广泛的模型家族及其生态采纳,才是连接开发者、发布方与未来用户的正向反馈循环的关键。

最终,智能体首次成为 Hub 上排名第一的用户群体。它们的默认选择可能塑造下一波采用浪潮,而人类开发者或许要过一段时间才会察觉。「因为在 AI 领域,短短几个月就可能重塑整个生态。」