DeepSeek V4 的 agent harness 对比:codex、claude code、pi、hermes、opencode
模型本身的 agentic 能力决定上限,harness 决定你用不用得动这个上限。DeepSeek V4 Flash 0731 发布之后,agentic 指标大幅提升(Terminal Bench 2.1 从 61.8 涨到 82.7),「能不能接进一个好 harness」就成了实际的使用问题。这篇是我自己的选型过程:各家怎么接、社区实测怎么说、最后我选了哪条路。
背景:0731 之后的 DeepSeek
DeepSeek V4 Flash 0731 是 Flash 系列的正式版,取代 preview。它最值得注意的不是跑分本身,而是 agentic 能力的跳升:Terminal Bench 2.1 从 preview 的 61.8 到 82.7,DeepSWE 从 7.3 到 54.4——一个「便宜模型」突然有了能干活的基础。官方在模型卡里透露,这些 agentic 指标是用自家的 DeepSeek Harness 跑的,而这个 harness 至今没有公开发布。
所以现实是:模型有了,harness 得自己从现有生态里挑。
各家的接入方式
Codex。官方模型列表默认只有 OpenAI 的。接 DeepSeek 需要在配置里加自定义 model provider,指向 DeepSeek 的 OpenAI 兼容端点,用 API key——ChatGPT 的登录态不能用于自定义端点。能用,但绕,而且 Codex 的交互习惯是为自家模型调过的。
Claude Code。官方不支持 DeepSeek,社区方案 DeepClaude 把 Claude Code 的请求代理到 DeepSeek,宣称 17 倍成本优势。能用,但多一层代理,出问题时要多排查一跳。
opencode。社区对 DeepSeek 的默认推荐,模型生态直接,深水区资料多。也是第三方模型兼容性做得比较顺的一家。
hermes(NousResearch)。内置 deepseek provider,设一个 DEEPSEEK_API_KEY 就能用;还有个 tool_use_enforcement 选项,专门兜「模型描述了动作但没真调工具」这类问题——非 GPT 系模型在 agent 场景常见的毛病。
pi / omp。我现在用的。原生支持,配置简单,模型角色可以分开指定——主干活用 deepseek,视觉和搜索这类子任务可以指向别的模型。
社区实测:harness 是效率决策,不是质量决策
选型前我看到一个社区实测(同一模型、同一批 bug 修复任务、三家 harness 对比):
| harness | 固定开销/轮 | 输出 tokens | 耗时 | 质量/3 |
|---|---|---|---|---|
| pi | 1,340 | 14,775 | 2.1 分钟 | 2.34 |
| opencode | 7,197 | 17,463 | 3.1 分钟 | 2.07 |
| claude code | 23,132 | 58,370 | 8.0 分钟 | 2.42 |
结论很直接:质量差异在统计上不显著,差距全在开销和耗时上——Claude Code 每任务 70 次工具调用(pi 是 40),探索得多,分数没高。对 DeepSeek 这种便宜模型来说,harness 越轻,单任务的 token 成本越低,效率差距就是成本差距。
另一份实测:Composio 的 30 任务评测
写这篇的时候,Composio 放出了一份更新鲜的评测:DeepSeek V4 Flash 在四个 harness(Hermes Agent、Pi Agent、Prime Agent、Deep Agents)上跑 30 个 agentic 任务,同时记录通过率、单任务成本和耗时:

| harness | 通过率 | 单任务成本 | 单任务耗时 |
|---|---|---|---|
| Pi Agent | 66.7% | $0.012 | 132s |
| Prime Agent | 62.5% | $0.045 | 242s |
| Deep Agents | 53.3% | $0.018 | 187s |
| Hermes Agent | 50.0% | $0.017 | 176s |
这份评测的结论和上一份一致,而且更干脆:Pi Agent 通过率最高、单任务成本最低、耗时最短——三项指标全胜。注意 Hermes 也在里面:通过率垫底,成本和耗时中游。模型是同一个,拉开差距的全是 harness 的调度开销——又一次印证「harness 是效率决策」。
同一系列还有一份 8 个 harness 的全量对比,按 30 个任务的通过数排序:

- Pi Agent:20 通过
- Oh My Pi:17 通过(第二名,压过 Claude Code 和 Codex)
- Claude Code / Codex / Deep Agents:各 16
- Prime Agent:15(另有 6 次验证器无法评分)
- Hermes Agent:15
- OpenCode:14
(数据来源:Composio agentic eval)
Oh My Pi 就是我用的 omp——在第三方独立评测里排在 pi 系第二,高于 Claude Code 和 Codex。两个数据源互相印证,选型结论可以放心。
Pi 家族:一个原版和它的分支
评测里 pi 系占了三个名额(Pi Agent、Oh My Pi、Prime Agent),它们其实是一家人,但分化得很明显:
| 成员 | 维护者 | 定位 | 评测成绩 |
|---|---|---|---|
| pi(pi-mono) | Mario Zechner | 生态源头,最稳的上游 | 20/30(Pi Agent) |
| oh-my-pi(omp) | can1357 | 功能最全的日常选择 | 17/30 |
| Prime Agent | Prime Intellect | 自主长跑路线 | 15/30(另有 6 次无法评分) |
pi 是原版终端编码 agent,这个生态的起点。oh-my-pi 是社区最活跃的 fork:从上游持续同步,同时做架构级改造——Bun 运行时替代 Node、agent.db 凭据库替代 auth.json、Rust 原生层、capability 发现系统,还带 MCP、SSH、LSP 集成。Prime Agent 走的是完全不同的方向:IPython 持久内核、递归子 agent、守护进程后台会话、goals/schedules 自主模式、/refine 自我改进——它在评测里那 6 次无法评分,很可能就是自主长任务的输出形态让评分器覆盖不全(推断,原图只标注了无法评分)。
其余还有 tau/rho 这类 pi-style 的极简 Rust 移植(小众),以及 pi-image-tools 这种第三方编辑器扩展,属于外围生态。
三家血缘相同,路线不同:pi 是稳,omp 是全,Prime Agent 是自主。对日常写代码来说,omp 是那个「评测第二 + 功能最全」的选择。
我的选择:轻 harness + 强模型
最后我留在 pi/omp 上:deepseek-v4-flash 干主活,gpt-5.6-luna 当视觉和搜索的辅助角色。理由就是上面的实测——harness 不贡献质量,贡献的是效率和成本;既然这样,选最轻的,把省下来的预算花在更聪明的模型调用上。
一个值得注意的前提:这个结论建立在 0731 的 agentic 能力之上。preview 时代 DeepSWE 只有 7.3,那时候换什么 harness 都没用——先确认模型能干活,再谈 harness 效率。顺序别反。
总结
- 模型 agentic 能力是前提,0731 之后 DeepSeek 才算「值得接 harness」
- 各家都能接:codex 要自定义 provider、claude code 走代理、hermes 内置、opencode 生态最顺、pi 系最轻
- 实测证明 harness 是效率决策:质量无差异,开销差 10 倍
- 我的路线:轻 harness(pi/omp)+ deepseek 主干活 + luna 辅助视觉/搜索
官方 DeepSeek Harness 发布后值得再看一眼,在那之前,先用得动的那套。