如果你两年前说"开源模型能追上 GPT",大概率会被当成乐观过头。但到 2026 年,这个说法已经不需要辩论——数据摆在那里:开源与闭源的差距,正在以肉眼可见的速度消失。

一个被改写的事实:差距趋近于零

斯坦福 AI Index 2025 报告里有一个被反复引用的数字:2023 年底,最好的中美模型在 MMLU 上的差距还有 17.5 个百分点;到 2025—2026 年,这个差距已经基本归零。在数学基准(MATH-500、AIME)上,开源模型甚至开始反超。

更关键的是成本。DeepInfra 的测算显示,过去一年 API 价格下降了 60%–80%,对大多数应用场景来说,再为"闭源"支付高额溢价越来越难站得住脚。开源模型里,DeepSeek V4 Pro 在多项基准上逼近 GPT-5.5,而每百万 token 的输入/输出价格仅约 1.74/3.48 美元,接近前沿性能却只需零头成本;Meta 的 Llama 4 Maverick 通过第三方供应商,输入价甚至能压到每百万 token 0.20 美元以下。

中国军团的密集迭代

2025 至 2026 年,中国开源大模型进入密集迭代期。几个有代表性的节点:

  • DeepSeek-V4 预览版(2026 年 4 月):总参数达 1.6 万亿的 MoE 模型,采用混合专家架构,激活参数远小于总参数,兼顾性能与推理成本。其前身 R1 以 MIT 许可发布,在多数基准上追平 OpenAI o1,而据报道训练成本仅约 600 万美元——证明前沿推理能力不必依赖被出口限制的算力。
  • Kimi K3(2026 年 7 月,月之暗面):参数规模达 2.8 万亿,是全球规模最大的开源模型之一,采用自研 KDA 混合线性注意力机制,在复杂推理、代码生成、长上下文与智能体任务上均有提升。
  • Qwen 系列(阿里通义千问):Qwen3 成为全球下载量最大的开源模型家族,2026 年 1 月累计 Hugging Face 下载量突破 10 亿次;2026 年 2 月单月下载 1.536 亿次,超过其后八家供应商的总和。
  • GLM-5(智谱 AI,2026 年 2 月):开源面向复杂系统工程与长程智能体任务的旗舰基座,带来百万 token 上下文窗口。

数据说话:开源生态的中心在迁移

Hugging Face 发布的 2026 年春季全球开源 AI 生态报告指出,过去一年该平台上 41% 的大模型下载量来自中国研发的模型。在 OpenRouter 这类美国模型交易平台上,热度前十的模型也有多款出自中国厂商。2026 年上半年,人工智能开源大模型全球累计下载量突破 100 亿次。

这意味着什么?意味着"开源"不再只是西方实验室的主场。中国厂商在性价比、商用许可友好度(大量采用 Apache 2.0、MIT 等宽松许可)和国产算力适配上形成了自己的特点,把"可用、便宜、能商用"做到了极致。

对普通开发者的意义

对开发者来说,这场"反攻"最直接的红利是:很多过去必须调用昂贵 API 的场景,现在可以自己部署开源模型,或用极低成本接入。Llama 4 Maverick 拥有 1000 万 token 的上下文窗口,适合长文档分析和大型代码库;Qwen 在多语言(尤其中日韩)上原生友好;DeepSeek 在推理和数学上领先;Kimi 则擅长超长上下文与智能体编排。

当然也要清醒:开源不等于万能。在需要最高 10% 能力的极端场景、以及需要厂商承担合规与责任边界的企业级服务里,闭源旗舰仍有空间。但对"不需要顶尖那 10%"的绝大多数工作负载,开源模型已经能覆盖大部分用例。

一个趋势越来越清楚:未来选模型的核心问题,不再是"该不该用开源",而是"我的场景该用哪一个开源"。当免费模型追上付费旗舰,整个 AI 行业的成本结构,都被重写了一遍。