RANKING / 第三方榜单
模型榜单
数据来源:OpenCompass(上海人工智能实验室) · 通道 json_api · 批次时间 · 共 15 个模型 · 其中 0 条同时有分值与价格(可进斩杀线图)
BY DIMENSION / 按维度
智能体与工具 榜
工具调用与智能体任务(tau / apex / analyst) · 价格为美元 / 百万 tokens(第三方原始口径)
| # | 模型 | 智能体与工具 (工具调用与智能体任务(tau / apex / analyst)) | 综合分 | 较上批 | 输入价 | 输出价 | 吞吐 | |
|---|---|---|---|---|---|---|---|---|
| 11 | Claude Opus 4.8 (high) Anthropic · 未匹配本地档案 本批新增 推理档位 | — | 75.10 | — | — | — | — | — |
| 1 | Claude Opus 5 (high) Anthropic · 未匹配本地档案 本批新增 推理档位 | — | 83.30 | — | — | — | — | — |
| 13 | DeepSeek-V4-Flash DeepSeek · 未匹配本地档案 本批新增 | — | 73.70 | — | — | — | — | — |
| 9 | DeepSeek-V4-Pro DeepSeek · 未匹配本地档案 本批新增 | — | 77.50 | — | — | — | — | — |
| 5 | Doubao-Seed-2.1-Pro-260628 (high) ByteDance · 未匹配本地档案 本批新增 推理档位 | — | 80.50 | — | — | — | — | — |
| 6 | Gemini-3.7-Flash Google · 未匹配本地档案 本批新增 | — | 80.50 | — | — | — | — | — |
| 12 | GLM-5.3 Zhipu AI · 未匹配本地档案 本批新增 | — | 74.40 | — | — | — | — | — |
| 3 | GPT-5.5 (high) OpenAI · 未匹配本地档案 本批新增 推理档位 | — | 80.60 | — | — | — | — | — |
| 2 | GPT-5.6-Sol (high) OpenAI · 未匹配本地档案 本批新增 推理档位 | — | 80.80 | — | — | — | — | — |
| 8 | Grok-4.6 (high) xAI · 未匹配本地档案 本批新增 推理档位 | — | 78.00 | — | — | — | — | — |
| 14 | Hy3-preview (high) Tencent · 未匹配本地档案 本批新增 推理档位 | — | 73.60 | — | — | — | — | — |
| 10 | Kimi-K2.6 (high) Moonshot · 未匹配本地档案 本批新增 推理档位 | — | 75.70 | — | — | — | — | — |
| 7 | Kimi-K3 (high) Moonshot · 未匹配本地档案 本批新增 推理档位 | — | 79.10 | — | — | — | — | — |
| 15 | MiniMax-M3 MiniMax · 未匹配本地档案 本批新增 | — | 69.00 | — | — | — | — | — |
| 4 | Qwen3.8-Max Alibaba · 未匹配本地档案 本批新增 | — | 80.60 | — | — | — | — | — |
币种口径:价格已折算为人民币(1 USD = 6.710202 CNY,来源 open.er-api.com · 2026-09-22);原始口径为第三方币种。
同一模型的多个推理档位(max / xhigh / high…)在榜单里是多行;模型档案把它们折叠成一个条目
(取分最高的档位),点进去可以看到该模型的汇总读数。
想比较性价比请看 斩杀线坐标图 ·
本页只展示已验证有效的批次(校验规则见方法学)。
维度口径:智能体与工具 —— 工具调用与智能体任务(tau / apex / analyst);
复合维度(编程/智能体/知识)由该组内的评测项**取均值**得到(缺项不参与,不按 0 计),
原始维度值可在模型档案页查看。所有维度都来自同一批快照,切换维度不会重新抓取。