DeepSeek + Pi 王炸组合跑赢 Claude Code?Pi创始人:这套组合我早押中了
缓存命中的惊人数据
8 月 11 日,Pi Harness 创始人 Mario Zechner 转发了一组数据:开发者 0xEvan 用 Pi 调用 DeepSeek V4 Flash,处理了近 10 亿输入 Token,缓存命中率达到 99.93%,最终只花了 2.65 美元。如果没有缓存,同等用量预计需要 132 美元。

另一名开发者 Shantanu Goel 表示,DeepSeek V4 Flash 在其他 Harness 中的缓存命中率通常为 94% 至 97%,到了 Pi 中却能持续达到 99% 以上。Mario 评价道:"使用本地模型时,这一点尤其好用。"
这也让人想起 Mario 今年 5 月的评价:"pi + ds4 == sovereign AI enterprise ready clearly."——Pi + DeepSeek 4,企业级 AI 这不就成了吗。
Composio 横向测试:Pi 跑赢 Claude Code
Composio 选用同一个模型 DeepSeek V4 Flash,让它分别运行在 8 种不同的智能体 Harness 中,完成 30 项高难度智能体任务。
测试结果排名:
- Pi Agent:通过 20 项,成功率 66.7%
- Oh My Pi:通过 17 项
- Claude Code / Codex / Deep Agents:均通过 16 项
- Prime Agent / Hermes Agent:通过 15 项
- OpenCode:通过 14 项,排名最后
同一个模型,仅仅更换外面的 Harness,成功率便从 46.7% 升至 66.7%,相差整整 20 个百分点。
成本差距更加明显:
- Pi 平均完成一项成功任务:$0.028
- Claude Code:$0.195(接近前者的 7 倍)
Pi 完成任务的中位时间为 132.2 秒,略慢于 Claude Code 的 122.7 秒,但综合成功率、速度与成本,交出了最突出的成绩。
Harness 乘数效应
这项测试体现了所谓的"Harness 乘数效应":围绕 AI 搭建的工具会放大或削弱模型的实际表现。选对 Harness,同一个模型可以同时变得更可靠、更高效;选错 Harness,即使底层模型智能水平完全相同,任务成功率和运行效率也可能明显下降。
Composio 强调:如果一份 Agent 排行榜只写模型名称,却没有交代使用了哪套 Harness,那么这个分数就是不完整的。
极简的 Pi,为什么反而赢了
Pi 几乎没有添加额外配置,采用全新、未经修改的默认安装,只接入了测试所需的 MCP 服务器插件。正是这样一套接近开箱即用的方案,最终通过了最多的任务。
反观 Prime Agent:产生了最庞大的会话,部分会话消耗多达 350 万 Token,进行了 33 次工具调用。评分器仅处理它们就发生了超时,两次运行无法评分,另外四次没有留下记录。即使只看有效运行,Prime 通过的任务数量也只与 Hermes 相当,耗时却接近 Pi 的两倍。
核心洞察: 功能和会话最庞杂的 Prime,被自身运行负担拖慢;更轻量的 Pi 以较低开销通过了最多任务。每增加一层,智能体就多了一个可能迷路的地方;每增加一个工具,就多了一项需要做出的选择;每增加一份庞大的指令文件,行动前就要阅读更多噪声。
干净的 Harness 给模型提供了一条从接收任务到完成任务的短路径,臃肿的 Harness 则让它四处绕路。
99.9% 的缓存命中率是怎么做到的?
DeepSeek 前缀缓存机制
DeepSeek API 会缓存请求中提示词的前缀。如果下一次请求开头的 Token 序列与上一次完全相同,服务端就直接从缓存中读取,以远低于普通输入 Token 的价格计费。
关键约束: 这是一种前缀缓存,匹配需要从第一个 Token 开始。如果上下文前部发生变化,其后的大量 Token 就可能无法继续命中原有缓存。前缀越早发生变化,后面被"连坐"的 Token 就越多。
Reasonix 的设计原则
开源 Reasonix 围绕 DeepSeek 前缀缓存设计,核心原则:保持上下文前端稳定,采用追加而非修改的方式,并将变更成本降至最低。
具体实现:
- 启动时注入稳定的环境摘要——不在每轮对话中重新生成
- 过时工具输出截断清理——二十轮前一次 cat 命令的大量结果不会一直留在前缀中
- 工具 Schema 契约文档化 + 变更回归审查——工具定义被悄悄调整会导致缓存失效且表面看不出异常
- 双模型独立会话——执行模型和规划模型分别运行在各自缓存稳定的会话中,不交错放进同一上下文(最巧妙的设计)
pi-deepseek-cache 扩展
Pi 生态中的 pi-deepseek-cache 扩展与 Reasonix 思路高度一致:
| 层级 | 功能 | 对应 Reasonix 原则 |
|---|---|---|
| P0 | 启动时冻结日期和工作目录,杜绝动态内容 | 稳定环境摘要 |
| P3 | 缓存友好压缩:temperature=0 确定性摘要 + 哈希缓存 | 过时输出剪枝 |
| P2 | SHA-256 哈希诊断前缀变化 | Schema 契约审查 |
降本效果:
- deepseek-v4-flash 输入 Token:$0.14 → $0.003/百万 Token(降幅 98%)
- deepseek-v4-pro 输入 Token:$3.00 → $0.025/百万 Token(降幅 99%)
写在最后
DeepSeek 官方至今还没有推出自己的 Harness。8 月 11 日,"DeepSeek Harness 团队"微信公众号已完成注册,被解读为产品即将正式发布的信号。
官方 Harness 的核心优势在于"原生适配":第三方只能通过公开 API 做逆向优化,而官方团队可以和模型训练团队背靠背协同,让模型针对 Harness 的调用模式做针对性优化,Harness 也能利用模型内部的非公开信息——这种深度整合是任何第三方都做不到的。
参考链接
- https://x.com/badlogicgames/status/2086877202239353285
- https://www.reddit.com/r/DeepSeek/comments/1vhhxvy/deeppi_reasonixlevel_cache_performance_in_pi/
- https://dev.to/arshtechpro/reasonix-deepseek-a-terminal-coding-agent-built-around-the-thing-everyone-else-ignores-3l21
- https://pi.dev/packages/@rohaquinlop/pi-deepseek-cache
- https://www.youtube.com/watch?v=j3c35v386T0