数据来源:Artificial Analysis — 综合 SWE-Bench-Pro-Hard-AA、Terminal-Bench v2、SWE-Atlas-QnA 三项基准测试的 pass@1 平均分。
每周自动更新 · 最后更新:2026-08-10 12:06 UTC

#Agent模型提供商评分
1Claude CodeOpus 5xhigh67
2CodexGPT-5.6 Solmax67
3Claude CodeFable 5max66
4Grok BuildGrok 4.5high64
5Kimi Code CLIKimi K361
6OpencodeMuse Spark 1.1xhigh54
7OpencodeGemini 3.6 Flashhigh46
8Claude CodeGLM-5.243
9Cursor CLIComposer 2.5 Fast38
10Claude CodeDeepSeek V4 Prohigh31

⏱ 任务耗时

平均每个编码 Agent 完成任务所需的墙钟时间(越低越好)

#Agent耗时
1Cursor CLI - Composer 2.5 Fast (Cursor)6.8m
2Codex - GPT-5.6 Sol (max) (OpenAI)10.2m
3Opencode - Gemini 3.6 Flash (high) (Google)10.4m
4Opencode - Muse Spark 1.1 (xhigh) (Meta)12.6m
5Grok Build - Grok 4.5 (high) (SpaceXAI)16.5m
6Claude Code - DeepSeek V4 Pro (high) (DeepSeek)17.9m
7Claude Code - Fable 5 (max) (with fallback) (Anthropic)23.4m
8Claude Code - Opus 5 (xhigh) (Anthropic)23.6m
9Kimi Code CLI - Kimi K3 (Moonshot AI)23.8m
10Claude Code - GLM-5.2 (Novita)25.1m

💰 任务成本

平均每个任务的 API 成本(USD,越低越好)

#Agent成本 (USD)
1Claude Code - DeepSeek V4 Pro (high) (DeepSeek)$0.27
2Cursor CLI - Composer 2.5 Fast (Cursor)$0.55
3Opencode - Muse Spark 1.1 (xhigh) (Meta)$1.43
4Opencode - Gemini 3.6 Flash (high) (Google)$2.08
5Grok Build - Grok 4.5 (high) (SpaceXAI)$2.59
6Kimi Code CLI - Kimi K3 (Moonshot AI)$3.18
7Claude Code - GLM-5.2 (Novita)$6.51
8Codex - GPT-5.6 Sol (max) (OpenAI)$7.08
9Claude Code - Opus 5 (xhigh) (Anthropic)$8.23
10Claude Code - Fable 5 (max) (with fallback) (Anthropic)$11.7

关于基准测试

  • SWE-Bench-Pro-Hard-AA — 代码生成,150 道题(Scale AI)
  • Terminal-Bench v2 — Agent 终端使用,84 道题(Laude Institute)
  • SWE-Atlas-QnA — 技术问答,124 道题(Scale AI)

综合指数为三项基准测试的 pass@1 平均值(各运行 3 次)。


数据由 AI Agent 每周自动抓取,若有更新延迟请参考 原始页面