Claude Code 80%的提示词说删就删,Anthropic用Fable 5打了个样:AI行业的"降本"才刚刚开始
"Fable 5 这个价格远高于中国程序员一天工资。写代码一天烧几百万 token 已经很节约了,然后一看账单几千 rmb。"
Anthropic 自家公司花在算力上的钱,已达到薪资支出的 2.3 倍。按一名高级工程师 22.4 万美元完全成本计算,每位工程师每年对应算力支出约 51.5 万美元——人还没模型贵。
1. Claude Code:烧 token 换"我很高产"的错觉
业界新词 Token Apocalypse(Token 末日)预示着范式转变:从 token maxing(炫耀用量)到 token apocalypse(成本恐慌)。使用 AI 不自动意味着省钱。
成本失控已成常态,大公司纷纷管控:
- 限制模型等级:部分公司禁止使用 Claude Opus,被迫降级
- 设定个人限额:Uber 每位工程师每月 1500 美元 token 上限
- 彻底停用权限:花旗银行完全限制高级 AI 工具访问;Uber CTO 坦言几个月用完全年预算;Walmart 停止部分工具
Claude Code 项目负责人 Boris 的出发点不是"如何帮开发者省 token",而是"如何展示模型的聪明"。能多烧 token 解决的问题,绝不找更省 token 的办法——所有 sub-agent、花哨 UI 动画、冗长 reasoning trace 都是为了让你觉得"这模型真聪明"。
这是一个精心设计的营销闭环:烧 token → 换"高产"感觉 → 觉得好用 → 继续用。Claude Code 的目标从来不是做好工具,而是成为 Anthropic 模型能力的"最佳展示窗口"。
而 OpenAI 走的是相反路线——拼命压 token。Deep SWE 对比图显示:GPT-5.5 medium 只用 2 万 token 拿到惊人分数,而 Opus 4.8 用了 5 万 token 得分反而更低。

行业在恐慌,Claude 在烧,OpenAI 在省。
2. Claude Code 的 Prompt 债:堆得越多,欠得越多
Anthropic 表示已删掉 Claude Code 80% 的系统提示词。技术团队成员 Tariq Shihipar 解释:新模型 Fable 5 比官方示例更有想象力,示例反而成了限制。
过去 AI Coding 圈的惯性思维:上下文越大越好、工具说明越多越好、system prompt 越完整越好。每次遇到模型问题就往 prompt 加规则,长期堆下来 system prompt 变成巨大的常驻上下文包袱。
核心问题:system prompt 不是免费的——每次调用都要被读入、计费、占上下文。
- Claude Code system prompt 一度膨胀到 65,000 个 token;关闭大部分功能后仍有 12,000 个
- 对比:Pi 启动时上下文不到 1,000 个 token
更麻烦的是 prompt 债比代码债更隐蔽。代码老了解决问题时暴露,prompt 老了只是让模型悄悄变差——用户觉得"Claude Code 最近不如以前聪明了",但真实原因可能是旧 prompt 没跟上新模型。
Cursor 曾花大量时间做 system prompt A/B testing,benchmark 提升达 10%-30%,差别核心就是那几段 prompt。但当 prompt 从竞争力变成负担,删掉 80% 反而能提升 token 效率。
3. Claude 的"废话税":多说一个字,多花一份钱
Caveman 插件("穴居人")今年迅速走红,专门解决 Claude Code 废话太多的问题——像原始人一样说话,不讲礼貌、不加多余语法、只保留核心意思。
"Caveman save you token, save you money. Star cost zero."
创建者 Julius Brussee 表示,重度使用 Claude Code 时发现大量 token 浪费在寒暄、模糊措辞、过渡语上。评测显示 Caveman 能减少 65%-75% 的输出 token,不影响代码、命令、路径等精确性部分。OpenAI 工程总监 Shayne Sweeney 也贡献了代码支持 Codex。
更有意思的是,OpenAI 早就把这种压缩语言应用到 reasoning trace 内部。泄露的推理痕迹不像普通英语,更像压缩过的工程速记:
"Use core new nodes. Need infer. Need add VAE encode for images. Try. Try period."
模型内部推理不需要像对用户说话那样保持礼貌和完整,只需保留动作、对象、判断和下一步。压缩 reasoning token 的收益更大,因为 agent 是多步执行的——前一步的思考变成后一步的输入,每少"想"一段,省下的是整条执行链上的重复开销。
Claude vs OpenAI 路线差异
- Claude:更好聊,reasoning trace 更长(可能用普通英语),输出更长,依赖 100 万 token 上下文窗口——不是为装更大代码库,而是生成的东西太长装不下。compaction 也很差,10-20 分钟后清掉 reasoning trace
- OpenAI:上下文窗口约 20 万 token,但通过简短语言从一开始就做到压缩
一个值得品味的细节:如果 Anthropic 修复了"废话太多"的问题,它们的收入会明显下降——开发者用更少 token 完成同样的工作,就是 Anthropic 赚不到的钱。