评测来源官方评测
Terminal-Bench 4 · 系统参考
Harbor / Terminal-Bench / 编程 · 保留模型搭配不同 Agent 在终端任务中的原始成绩,供交叉核对。
在 MyHOT 中仅供参考
证据预算不计分
上游数据时间09/03 10:43
最近成功同步09/29 14:05
它测什么,怎么测
固定 Terminal-Bench 4.0,分别保留模型、Agent 版本、推理档位和运行次数;不把不同工具系统解释为统一模型条件。
如何使用这份证据
原始成绩参考:锁定官方提交清单与数据版本后自动采集,逐条保留不同系统配置,不选模型代表分。只供交叉核对,不进入综合或编程排名。
评测成绩
下列为模型搭配不同 Agent 的系统成绩,运行条件不同,仅供参考。每项最多展示 30 条配置,匿名测试型号不展示。
| 原榜名次 | 原榜型号 | 原始成绩 | 运行配置 |
|---|---|---|---|
| 1 | claude-fable-5-1Anthropic | 57.9% | Claude Code 2.1.257 · max 推理 |
| 2 | claude-opus-5Anthropic | 51.8% | Claude Code 2.1.231 · max 推理 |
| 3 | claude-fable-5Anthropic | 44.5% | Claude Code 2.1.231 · max 推理 |
| 4 | glm-5.3Z.ai | 41.8% | Claude Code 2.1.207 · max 推理 |
| 5 | gpt-5.6-solOpenAI | 37.3% | Codex 0.149.1 · max 推理 |
| 6 | claude-opus-4-8Anthropic | 23.6% | Claude Code 2.1.231 · max 推理 |
| 7 | gpt-5.6-terraOpenAI | 21.5% | Codex 0.149.1 · max 推理 |
| 8 | grok-4.6xAI | 20.3% | Grok Build 1.0.5 · 来源未报告推理档位 |
| 9 | gemini-3.8-flashGoogle | 19.1% | mini-SWE-agent 2.4.6 · high 推理 |
| 10 | gpt-5.6-lunaOpenAI | 17.3% | Codex 0.149.1 · max 推理 |
| 11 | grok-4.5xAI | 12.4% | Grok Build 1.0.5 · 来源未报告推理档位 |
| 11 | claude-sonnet-5Anthropic | 12.4% | Claude Code 2.1.231 · max 推理 |
| 13 | gemini-3.7-flashGoogle | 11.2% | mini-SWE-agent 2.4.6 · high 推理 |
评测局限与数据署名
不同模型使用 Claude Code、Codex、GrokBuild 或 mini-SWE 等不同工具;AA v4.3 已含 Terminal-Bench v4,不得再次计入综合票权。
数据许可:Apache 2.0 · 官方 harbor-framework/terminal-bench 仓库内的成绩提交;保留署名、协议与修改说明。
成绩由 Harbor / Terminal-Bench 发布,原始分数与 MyHOT 共识分使用不同尺度,不能直接相加。