Writing

DeepSeek V4 的 agent harness 对比:codex、claude code、pi、hermes、opencode

模型本身的 agentic 能力决定上限,harness 决定你用不用得动这个上限。DeepSeek V4 Flash 0731 发布之后,agentic 指标大幅提升(Terminal Bench 2.1 从 61.8 涨到 82.7),「能不能接进一个好 harness」就成了实际的使用问题。这篇是我自己的选型过程:各家怎么接、社区实测怎么说、最后我选了哪条路。

背景:0731 之后的 DeepSeek

DeepSeek V4 Flash 0731 是 Flash 系列的正式版,取代 preview。它最值得注意的不是跑分本身,而是 agentic 能力的跳升:Terminal Bench 2.1 从 preview 的 61.8 到 82.7,DeepSWE 从 7.3 到 54.4——一个「便宜模型」突然有了能干活的基础。官方在模型卡里透露,这些 agentic 指标是用自家的 DeepSeek Harness 跑的,而这个 harness 至今没有公开发布。

所以现实是:模型有了,harness 得自己从现有生态里挑。

各家的接入方式

Codex。官方模型列表默认只有 OpenAI 的。接 DeepSeek 需要在配置里加自定义 model provider,指向 DeepSeek 的 OpenAI 兼容端点,用 API key——ChatGPT 的登录态不能用于自定义端点。能用,但绕,而且 Codex 的交互习惯是为自家模型调过的。

Claude Code。官方不支持 DeepSeek,社区方案 DeepClaude 把 Claude Code 的请求代理到 DeepSeek,宣称 17 倍成本优势。能用,但多一层代理,出问题时要多排查一跳。

opencode。社区对 DeepSeek 的默认推荐,模型生态直接,深水区资料多。也是第三方模型兼容性做得比较顺的一家。

hermes(NousResearch)。内置 deepseek provider,设一个 DEEPSEEK_API_KEY 就能用;还有个 tool_use_enforcement 选项,专门兜「模型描述了动作但没真调工具」这类问题——非 GPT 系模型在 agent 场景常见的毛病。

pi / omp。我现在用的。原生支持,配置简单,模型角色可以分开指定——主干活用 deepseek,视觉和搜索这类子任务可以指向别的模型。

社区实测:harness 是效率决策,不是质量决策

选型前我看到一个社区实测(同一模型、同一批 bug 修复任务、三家 harness 对比):

harness 固定开销/轮 输出 tokens 耗时 质量/3
pi 1,340 14,775 2.1 分钟 2.34
opencode 7,197 17,463 3.1 分钟 2.07
claude code 23,132 58,370 8.0 分钟 2.42

结论很直接:质量差异在统计上不显著,差距全在开销和耗时上——Claude Code 每任务 70 次工具调用(pi 是 40),探索得多,分数没高。对 DeepSeek 这种便宜模型来说,harness 越轻,单任务的 token 成本越低,效率差距就是成本差距。

另一份实测:Composio 的 30 任务评测

写这篇的时候,Composio 放出了一份更新鲜的评测:DeepSeek V4 Flash 在四个 harness(Hermes Agent、Pi Agent、Prime Agent、Deep Agents)上跑 30 个 agentic 任务,同时记录通过率、单任务成本和耗时:

屏幕截图 2026-08-11 100506.png

harness 通过率 单任务成本 单任务耗时
Pi Agent 66.7% $0.012 132s
Prime Agent 62.5% $0.045 242s
Deep Agents 53.3% $0.018 187s
Hermes Agent 50.0% $0.017 176s

这份评测的结论和上一份一致,而且更干脆:Pi Agent 通过率最高、单任务成本最低、耗时最短——三项指标全胜。注意 Hermes 也在里面:通过率垫底,成本和耗时中游。模型是同一个,拉开差距的全是 harness 的调度开销——又一次印证「harness 是效率决策」。

同一系列还有一份 8 个 harness 的全量对比,按 30 个任务的通过数排序:

HPXY5n5XcAAXfPc (1).png

  • Pi Agent:20 通过
  • Oh My Pi:17 通过(第二名,压过 Claude Code 和 Codex)
  • Claude Code / Codex / Deep Agents:各 16
  • Prime Agent:15(另有 6 次验证器无法评分)
  • Hermes Agent:15
  • OpenCode:14

(数据来源:Composio agentic eval)

Oh My Pi 就是我用的 omp——在第三方独立评测里排在 pi 系第二,高于 Claude Code 和 Codex。两个数据源互相印证,选型结论可以放心。

Pi 家族:一个原版和它的分支

评测里 pi 系占了三个名额(Pi Agent、Oh My Pi、Prime Agent),它们其实是一家人,但分化得很明显:

成员 维护者 定位 评测成绩
pi(pi-mono) Mario Zechner 生态源头,最稳的上游 20/30(Pi Agent)
oh-my-pi(omp) can1357 功能最全的日常选择 17/30
Prime Agent Prime Intellect 自主长跑路线 15/30(另有 6 次无法评分)

pi 是原版终端编码 agent,这个生态的起点。oh-my-pi 是社区最活跃的 fork:从上游持续同步,同时做架构级改造——Bun 运行时替代 Node、agent.db 凭据库替代 auth.json、Rust 原生层、capability 发现系统,还带 MCP、SSH、LSP 集成。Prime Agent 走的是完全不同的方向:IPython 持久内核、递归子 agent、守护进程后台会话、goals/schedules 自主模式、/refine 自我改进——它在评测里那 6 次无法评分,很可能就是自主长任务的输出形态让评分器覆盖不全(推断,原图只标注了无法评分)。

其余还有 tau/rho 这类 pi-style 的极简 Rust 移植(小众),以及 pi-image-tools 这种第三方编辑器扩展,属于外围生态。

三家血缘相同,路线不同:pi 是稳,omp 是全,Prime Agent 是自主。对日常写代码来说,omp 是那个「评测第二 + 功能最全」的选择。

我的选择:轻 harness + 强模型

最后我留在 pi/omp 上:deepseek-v4-flash 干主活,gpt-5.6-luna 当视觉和搜索的辅助角色。理由就是上面的实测——harness 不贡献质量,贡献的是效率和成本;既然这样,选最轻的,把省下来的预算花在更聪明的模型调用上。

一个值得注意的前提:这个结论建立在 0731 的 agentic 能力之上。preview 时代 DeepSWE 只有 7.3,那时候换什么 harness 都没用——先确认模型能干活,再谈 harness 效率。顺序别反。

总结

  • 模型 agentic 能力是前提,0731 之后 DeepSeek 才算「值得接 harness」
  • 各家都能接:codex 要自定义 provider、claude code 走代理、hermes 内置、opencode 生态最顺、pi 系最轻
  • 实测证明 harness 是效率决策:质量无差异,开销差 10 倍
  • 我的路线:轻 harness(pi/omp)+ deepseek 主干活 + luna 辅助视觉/搜索

官方 DeepSeek Harness 发布后值得再看一眼,在那之前,先用得动的那套。

More