开源模型两个月内杀死比赛
分水岭:开源 Token 份额首超闭源
大模型市场跨过了一条历史性分水岭。在全球数百万开发者集聚的 AI 部署平台 Vercel AI Gateway 上:
- 4 月:开放权重模型 Token 份额仅约 11%
- 6 月下旬:升至 28.4%,仅占不到 4% 的 API 支出,却承担了近三分之一的调用
- 8 月 22 日:冲至 62%,首次反超闭源模型
其中 DeepSeek 单独拿下 22.6% 的 Token 份额,GLM-5.2 上线两周内日 Token 消耗量增长约 50 倍。
关键信号:这轮反超恰逢闭源模型密集推新。纵使 OpenAI、Anthropic 连发旗舰大招、频繁降价抵御开源冲击,Token 增量仍更多流向开源阵营。投资人 Gavin Baker 指出,7 月 OpenAI 和 Anthropic 的绝对 Token 调用量其实仍在加速增长——闭源在增长,但开源增长更快。
黄仁勋变阵:70 亿美元砸向开源
英伟达向 Poolside 支付 60 亿美元技术授权费 + 10 亿美元股权投资,收编其 100 多名工程师加入 Nemotron(开源大模型产品线)团队。
交易结构是典型的"变相人才收购"(Acquihire):
- 并非直接收购,而是技术授权 + 投资 + 人才吸收
- 按 120 亿美元投前估值投资 10 亿美元
- 目标:一年内推出超万亿参数、Frontier 水准的开源模型
黄仁勋的真正意图不是做最好的模型,而是把基础模型推理成本彻底打穿。当开源模型极度廉价且唾手可得时,全世界应用疯狂消耗 Token,利润最终沉淀回英伟达的硬件底座。
布局时间线:
- 3 月:牵头成立 Nemotron Coalition(Mistral、Perplexity、Cursor、Thinking Machines 等)
- 7 月:发表《Open Weights and American AI Leadership》
- 8 月:发布开源 Nemotron 3.5 Lightning 混合专家模型,与 CUDA/TensorRT-LLM 深度绑定
竞争节奏:从"半年一代"到"两周一轮"
过去半年的开源 vs 闭源交火线:
| 时间 | 开源阵营 | 闭源阵营 |
|---|---|---|
| 4 月 | DeepSeek V4、Qwen3.6、Kimi K2.6 推向 Coding/Agent | — |
| 5-6 月 | — | Anthropic Opus 4.8、Fable 5 守前沿;Sonnet 5 下放 Agent 能力 |
| 7 月 | — | OpenAI GPT-5.6 系列(Sol/Terra/Luna),"Performance per dollar"为核心卖点 |
| 8 月 | Qwen3.8-2.4T-A95B 旗舰权重;GLM-5.2、Kimi K3、DeepSeek V4 Pro | 谷歌 Gemini 3.7 Flash(距上代仅三周,价格对半砍);Anthropic Opus 5 价格腰斩 |
"性价比"这个曾专属开源阵营的底层武器,已成 OpenAI 们必须割肉流血回答的命题。
规模数据:
- Fireworks 单家开源推理平台日均 Token 处理量超 40 万亿,约为 OpenAI 3 月底 API 吞吐量的两倍
- 智谱 GLM-5.2 上线两周,日 Token 消耗暴涨约 50 倍
SemiAnalysis 判断:最近两个月是开源模型 Agentic 时代的"爆发期"。2025 年的 DeepSeek Moment 声势浩大,但 R1 主要承担边缘性测试任务;2026 年 GLM 5.3、Kimi K3 已能承担 Coding、Agent 等生产级任务——这恰是 Anthropic ARR 暴涨的核心腹地。
Fable 5 滞销:最强模型卖不动了
《金融时报》援引 Ramp 对约 7 万家企业的支付数据:
- Fable 5(能力最强、价格最高的旗舰):发布两个多月后仅占企业客户模型总支出的 11.4%,按 Token 计算更只有 6%
- Opus 5(7 月底上线、更便宜):企业支出很快反超 Fable
这打破了过去几年"新旗舰发布→企业默认迁移到最新最强模型"的惯例。
SemiAnalysis 三阶段框架:闭源窗口持续收窄
SemiAnalysis 将大模型发展划分为三个周期,发现一个稳定规律:每当闭源实验室率先开创新一代范式,开放模型追上它所需的时间大约缩短一半。
| 阶段 | 闭源领先者 | 开源追赶者 | 起始差距 | 追赶时间 |
|---|---|---|---|---|
| Early Scaling | GPT-3.5 | Llama 2 | 35.8 分 | — |
| Reasoning | o1 | DeepSeek R1-0528 | 12.1 分 | ~8.5 个月 |
| Agentic | Opus 4.5 / GPT-5.2 | Kimi K2.6 / GLM-5.2 | — | ~4.8 / ~6 个月 |
闭源仍然可以率先抵达下一站,但独占下一站的时间越来越短。 过去几十亿美元训练出领先模型可依靠一年甚至更长的技术窗口收费,现在可能只剩几个月。客户重新计算:为了领先 5% 的能力,值不值得支付数倍乃至十倍的价格?
重估智能溢价:边际效用递减
Anthropic 投资方 Accel 合伙人 Miles Clements 的判断:
"Most people don't need to operate at the frontier."
模型智能出现明显的边际效用递减:
- 70→90 分:让大量原本做不了的工作第一次变得可用——巨大价值
- 95→97 分:训练和推理成本急剧上涨,企业实际收益未必同步增长——难以支撑数倍成本差
Agent 的兴起进一步放大了这笔经济账:一次工作背后可能展开几十甚至上百轮模型调用,过去几分钱的 API 差价,在百万、千万乃至亿级 Token 调用面前,直接变成产品的成本结构和毛利率。
核心结论
过去半年,开源完成了一次比 Benchmark 登顶更重要的跨越:从"能用"走到了"值得被大规模使用"。
开源模型无需全面成为世界第一,只要与 Frontier 之间的差距缩小到"足够好",巨大的成本优势就足以让海量 Token 迁移过来。最强能力、最多 Token 和最高收入,第一次不再绑定在同一个模型身上。
过去几年统治大模型行业的商业模式——"只要持续制造最强智能,就能出售最高的智能溢价"——被开源模型彻底推翻。