跳到正文
评测来源

Terminal-Bench 4 · 系统参考

Harbor / Terminal-Bench / 编程 · 保留模型搭配不同 Agent 在终端任务中的原始成绩,供交叉核对。

官方评测
在 MyHOT 中仅供参考
证据预算不计分
上游数据时间09/03 10:43
最近成功同步09/29 14:05

它测什么,怎么测

固定 Terminal-Bench 4.0,分别保留模型、Agent 版本、推理档位和运行次数;不把不同工具系统解释为统一模型条件。

如何使用这份证据

原始成绩参考:锁定官方提交清单与数据版本后自动采集,逐条保留不同系统配置,不选模型代表分。只供交叉核对,不进入综合或编程排名。

评测成绩

下列为模型搭配不同 Agent 的系统成绩,运行条件不同,仅供参考。每项最多展示 30 条配置,匿名测试型号不展示。

原榜名次原榜型号原始成绩运行配置
1claude-fable-5-1Anthropic57.9%Claude Code 2.1.257 · max 推理
2claude-opus-5Anthropic51.8%Claude Code 2.1.231 · max 推理
3claude-fable-5Anthropic44.5%Claude Code 2.1.231 · max 推理
4glm-5.3Z.ai41.8%Claude Code 2.1.207 · max 推理
5gpt-5.6-solOpenAI37.3%Codex 0.149.1 · max 推理
6claude-opus-4-8Anthropic23.6%Claude Code 2.1.231 · max 推理
7gpt-5.6-terraOpenAI21.5%Codex 0.149.1 · max 推理
8grok-4.6xAI20.3%Grok Build 1.0.5 · 来源未报告推理档位
9gemini-3.8-flashGoogle19.1%mini-SWE-agent 2.4.6 · high 推理
10gpt-5.6-lunaOpenAI17.3%Codex 0.149.1 · max 推理
11grok-4.5xAI12.4%Grok Build 1.0.5 · 来源未报告推理档位
11claude-sonnet-5Anthropic12.4%Claude Code 2.1.231 · max 推理
13gemini-3.7-flashGoogle11.2%mini-SWE-agent 2.4.6 · high 推理
评测局限与数据署名

不同模型使用 Claude Code、Codex、GrokBuild 或 mini-SWE 等不同工具;AA v4.3 已含 Terminal-Bench v4,不得再次计入综合票权。

数据许可:Apache 2.0 · 官方 harbor-framework/terminal-bench 仓库内的成绩提交;保留署名、协议与修改说明。

成绩由 Harbor / Terminal-Bench 发布,原始分数与 MyHOT 共识分使用不同尺度,不能直接相加。