数据来源:Artificial Analysis — 综合 SWE-Bench-Pro-Hard-AA、Terminal-Bench v2、SWE-Atlas-QnA 三项基准测试的 pass@1 平均分。
每周自动更新 · 最后更新:2026-08-10 12:06 UTC
| # | Agent | 模型 | 提供商 | 评分 |
|---|---|---|---|---|
| 1 | Claude Code | Opus 5 | xhigh | 67 |
| 2 | Codex | GPT-5.6 Sol | max | 67 |
| 3 | Claude Code | Fable 5 | max | 66 |
| 4 | Grok Build | Grok 4.5 | high | 64 |
| 5 | Kimi Code CLI | Kimi K3 | 61 | |
| 6 | Opencode | Muse Spark 1.1 | xhigh | 54 |
| 7 | Opencode | Gemini 3.6 Flash | high | 46 |
| 8 | Claude Code | GLM-5.2 | 43 | |
| 9 | Cursor CLI | Composer 2.5 Fast | 38 | |
| 10 | Claude Code | DeepSeek V4 Pro | high | 31 |
⏱ 任务耗时
平均每个编码 Agent 完成任务所需的墙钟时间(越低越好)
| # | Agent | 耗时 |
|---|---|---|
| 1 | Cursor CLI - Composer 2.5 Fast (Cursor) | 6.8m |
| 2 | Codex - GPT-5.6 Sol (max) (OpenAI) | 10.2m |
| 3 | Opencode - Gemini 3.6 Flash (high) (Google) | 10.4m |
| 4 | Opencode - Muse Spark 1.1 (xhigh) (Meta) | 12.6m |
| 5 | Grok Build - Grok 4.5 (high) (SpaceXAI) | 16.5m |
| 6 | Claude Code - DeepSeek V4 Pro (high) (DeepSeek) | 17.9m |
| 7 | Claude Code - Fable 5 (max) (with fallback) (Anthropic) | 23.4m |
| 8 | Claude Code - Opus 5 (xhigh) (Anthropic) | 23.6m |
| 9 | Kimi Code CLI - Kimi K3 (Moonshot AI) | 23.8m |
| 10 | Claude Code - GLM-5.2 (Novita) | 25.1m |
💰 任务成本
平均每个任务的 API 成本(USD,越低越好)
| # | Agent | 成本 (USD) |
|---|---|---|
| 1 | Claude Code - DeepSeek V4 Pro (high) (DeepSeek) | $0.27 |
| 2 | Cursor CLI - Composer 2.5 Fast (Cursor) | $0.55 |
| 3 | Opencode - Muse Spark 1.1 (xhigh) (Meta) | $1.43 |
| 4 | Opencode - Gemini 3.6 Flash (high) (Google) | $2.08 |
| 5 | Grok Build - Grok 4.5 (high) (SpaceXAI) | $2.59 |
| 6 | Kimi Code CLI - Kimi K3 (Moonshot AI) | $3.18 |
| 7 | Claude Code - GLM-5.2 (Novita) | $6.51 |
| 8 | Codex - GPT-5.6 Sol (max) (OpenAI) | $7.08 |
| 9 | Claude Code - Opus 5 (xhigh) (Anthropic) | $8.23 |
| 10 | Claude Code - Fable 5 (max) (with fallback) (Anthropic) | $11.7 |
关于基准测试
- SWE-Bench-Pro-Hard-AA — 代码生成,150 道题(Scale AI)
- Terminal-Bench v2 — Agent 终端使用,84 道题(Laude Institute)
- SWE-Atlas-QnA — 技术问答,124 道题(Scale AI)
综合指数为三项基准测试的 pass@1 平均值(各运行 3 次)。
数据由 AI Agent 每周自动抓取,若有更新延迟请参考 原始页面。