DeepSeekPiAgentHarnessAI-Coding

DeepSeek + Pi 王炸组合跑赢 Claude Code?Pi创始人:这套组合我早押中了

Tina··原文链接
收录于 2026/8/13 15:50:16

缓存命中的惊人数据

8 月 11 日,Pi Harness 创始人 Mario Zechner 转发了一组数据:开发者 0xEvan 用 Pi 调用 DeepSeek V4 Flash,处理了近 10 亿输入 Token,缓存命中率达到 99.93%,最终只花了 2.65 美元。如果没有缓存,同等用量预计需要 132 美元。

数据对比

另一名开发者 Shantanu Goel 表示,DeepSeek V4 Flash 在其他 Harness 中的缓存命中率通常为 94% 至 97%,到了 Pi 中却能持续达到 99% 以上。Mario 评价道:"使用本地模型时,这一点尤其好用。"

这也让人想起 Mario 今年 5 月的评价:"pi + ds4 == sovereign AI enterprise ready clearly."——Pi + DeepSeek 4,企业级 AI 这不就成了吗。

Composio 横向测试:Pi 跑赢 Claude Code

Composio 选用同一个模型 DeepSeek V4 Flash,让它分别运行在 8 种不同的智能体 Harness 中,完成 30 项高难度智能体任务。

测试结果排名:

  • Pi Agent:通过 20 项,成功率 66.7%
  • Oh My Pi:通过 17 项
  • Claude Code / Codex / Deep Agents:均通过 16 项
  • Prime Agent / Hermes Agent:通过 15 项
  • OpenCode:通过 14 项,排名最后

同一个模型,仅仅更换外面的 Harness,成功率便从 46.7% 升至 66.7%,相差整整 20 个百分点。

成本差距更加明显:

  • Pi 平均完成一项成功任务:$0.028
  • Claude Code:$0.195(接近前者的 7 倍)

Pi 完成任务的中位时间为 132.2 秒,略慢于 Claude Code 的 122.7 秒,但综合成功率、速度与成本,交出了最突出的成绩。

Harness 乘数效应

这项测试体现了所谓的"Harness 乘数效应":围绕 AI 搭建的工具会放大或削弱模型的实际表现。选对 Harness,同一个模型可以同时变得更可靠、更高效;选错 Harness,即使底层模型智能水平完全相同,任务成功率和运行效率也可能明显下降。

Composio 强调:如果一份 Agent 排行榜只写模型名称,却没有交代使用了哪套 Harness,那么这个分数就是不完整的。

极简的 Pi,为什么反而赢了

Pi 几乎没有添加额外配置,采用全新、未经修改的默认安装,只接入了测试所需的 MCP 服务器插件。正是这样一套接近开箱即用的方案,最终通过了最多的任务。

反观 Prime Agent:产生了最庞大的会话,部分会话消耗多达 350 万 Token,进行了 33 次工具调用。评分器仅处理它们就发生了超时,两次运行无法评分,另外四次没有留下记录。即使只看有效运行,Prime 通过的任务数量也只与 Hermes 相当,耗时却接近 Pi 的两倍。

核心洞察: 功能和会话最庞杂的 Prime,被自身运行负担拖慢;更轻量的 Pi 以较低开销通过了最多任务。每增加一层,智能体就多了一个可能迷路的地方;每增加一个工具,就多了一项需要做出的选择;每增加一份庞大的指令文件,行动前就要阅读更多噪声。

干净的 Harness 给模型提供了一条从接收任务到完成任务的短路径,臃肿的 Harness 则让它四处绕路。

99.9% 的缓存命中率是怎么做到的?

DeepSeek 前缀缓存机制

DeepSeek API 会缓存请求中提示词的前缀。如果下一次请求开头的 Token 序列与上一次完全相同,服务端就直接从缓存中读取,以远低于普通输入 Token 的价格计费。

关键约束: 这是一种前缀缓存,匹配需要从第一个 Token 开始。如果上下文前部发生变化,其后的大量 Token 就可能无法继续命中原有缓存。前缀越早发生变化,后面被"连坐"的 Token 就越多。

Reasonix 的设计原则

开源 Reasonix 围绕 DeepSeek 前缀缓存设计,核心原则:保持上下文前端稳定,采用追加而非修改的方式,并将变更成本降至最低。

具体实现:

  1. 启动时注入稳定的环境摘要——不在每轮对话中重新生成
  2. 过时工具输出截断清理——二十轮前一次 cat 命令的大量结果不会一直留在前缀中
  3. 工具 Schema 契约文档化 + 变更回归审查——工具定义被悄悄调整会导致缓存失效且表面看不出异常
  4. 双模型独立会话——执行模型和规划模型分别运行在各自缓存稳定的会话中,不交错放进同一上下文(最巧妙的设计)

pi-deepseek-cache 扩展

Pi 生态中的 pi-deepseek-cache 扩展与 Reasonix 思路高度一致:

层级功能对应 Reasonix 原则
P0启动时冻结日期和工作目录,杜绝动态内容稳定环境摘要
P3缓存友好压缩:temperature=0 确定性摘要 + 哈希缓存过时输出剪枝
P2SHA-256 哈希诊断前缀变化Schema 契约审查

降本效果:

  • deepseek-v4-flash 输入 Token:$0.14 → $0.003/百万 Token(降幅 98%)
  • deepseek-v4-pro 输入 Token:$3.00 → $0.025/百万 Token(降幅 99%)

写在最后

DeepSeek 官方至今还没有推出自己的 Harness。8 月 11 日,"DeepSeek Harness 团队"微信公众号已完成注册,被解读为产品即将正式发布的信号。

官方 Harness 的核心优势在于"原生适配":第三方只能通过公开 API 做逆向优化,而官方团队可以和模型训练团队背靠背协同,让模型针对 Harness 的调用模式做针对性优化,Harness 也能利用模型内部的非公开信息——这种深度整合是任何第三方都做不到的。

参考链接

评分:
暂无0 人评分)