COMPARE / 2–4 个模型
模型并排对比
横轴是价格、纵轴是能力 —— 越靠左上,性价比越高。 红色虚线是当前榜单里的性价比前沿线(沿着"更贵但更强"的边界走), 落在它下方的模型意味着"花同样的钱能买到更强的"。
PRICE / CAPABILITY FRONTIER
模型斩杀线坐标
215 个模型有完整价格与分值;横轴为对数刻度,标出的点是你选中的模型
图上的点可以直接点:点一下会把它设为「聚焦查看」——在图下标出它的名字与读数, 不占用上方 4 个对比名额(键盘 Tab 也能选中)。再点一次相同的点即可取消聚焦。
币种口径:价格已折算为 CNY(1 USD = 6.724641 CNY,来源 open.er-api.com · 观察于 2026-09-26);口径为每日快照(不追实时),原始口径不受影响。
口径:横轴 = 标准输入价(每百万 tokens,已折人民币),纵轴 = AA 能力指数。 只画同时有价格与分值的行 —— 缺一个就没法定位,硬塞进图里等于编数据。
- 厂商
- 未知
- 榜单排名
- 137
- 综合智能指数
- 25.30
- 输入价
- ¥0.94
- 输出价
- ¥3.9
- 吞吐
- 89.6699
- 上下文
- 256K
PROFILE / 能力画像
六轴对照
同一固定区间归一化,跨模型可比;缺数据的轴标"无数据"
Step 5 Preview
step-5
- 输入价
- 6.724641
- 输出价
- 18.1565307
- 缓存命中价
- 0.33623205
- 缓存写入价
- 无数据
- 每任务成本
- 4.811635302243
Grok 4.3
grok-4-3
- 输入价
- 8.40580125
- 输出价
- 16.8116025
- 缓存命中价
- 1.3449282
- 缓存写入价
- 8.40580125
- 每任务成本
- 1.1115831573000001
Inkling
inkling
- 输入价
- 6.724641
- 输出价
- 27.23479605
- 缓存命中价
- 1.1431889700000002
- 缓存写入价
- 无数据
- 每任务成本
- 4.082159695844999
Kimi K3
kimi-k3
- 输入价
- 20.173923000000002
- 输出价
- 100.869615
- 缓存命中价
- 2.0173923
- 缓存写入价
- 无数据
- 每任务成本
- 13.450169652611999
MATRIX / 完整对照
各项指标并排对比
30 / 32 项有数据 · 绿色高亮 = 该行最优;"—" 表示该模型这项没有数据(不参与最优比较)
| 指标 | Step 5 Preview | Grok 4.3 xAI | Inkling | Kimi K3 Moonshot AI |
|---|---|---|---|---|
| 综合智能指数 越高越好 | 43.73 最优 | 24.88 | 24.98 | 43.59 |
|
编程与工程
scicode / terminalBench 取均值 越高越好 |
46.1 | 30.2 | 34.4 | 51.2 最优 |
|
智能体与工具
tau / apex / analyst 取均值 越高越好 |
— | 34.0 | 26.4 | 42.0 最优 |
|
知识与推理
omniscience / gpqa / hle 取均值 越高越好 |
47.1 | 45.8 | 47.2 | 59.8 最优 |
| SciCode 越高越好 | 58.9% | 48.3% | 47.0% | 59.5% 最优 |
| Terminal-Bench 2.1 越高越好 | — | 39.7% | 55.1% | 85.0% 最优 |
| Terminal-Bench 4.0 越高越好 | 33.3% 最优 | 0.0% | 1.0% | 12.6% |
| τ²-Banking(工具调用) 越高越好 | — | 12.4% | 29.1% | 46.0% 最优 |
| GPQA(科学问答) 越高越好 | — | 90.1% | 87.2% | 93.5% 最优 |
| HLE(Humanity's Last Exam) 越高越好 | 46.5% | 37.2% | 31.9% | 46.9% 最优 |
| 知识准确性 越高越好 | 41.5% | 34.8% | 41.5% | 47.6% 最优 |
| 非幻觉率 越高越好 | 57.0% | 74.2% 最优 | 32.3% | 46.8% |
| IFBench(指令遵循) 越高越好 | — | 81.3% | — | — |
| MMMU-Pro(多模态) 越高越好 | 76.4% | 78.1% | 73.5% | 80.5% 最优 |
| ITBench-SRE(运维) 越高越好 | — | 32.7% | — | 47.7% 最优 |
| GDPval(经济价值任务) 越高越好 | 53.3% 最优 | 21.2% | 28.2% | 51.2% |
| Analyst Agent(分析师智能体) 越高越好 | — | 8.8% | 23.8% | 38.8% 最优 |
| Apex Agents 越高越好 | — | 17.0% | — | 41.3% 最优 |
| 指标 | Step 5 Preview | Grok 4.3 xAI | Inkling | Kimi K3 Moonshot AI |
|---|---|---|---|---|
| 输出吞吐 tokens/s 越高越好 | 76.8 | 126.4 | 169.6 最优 | 35.1 |
| 首 token 延迟 s 越低越好 | 3.00 | 24.85 | 1.87 最优 | 4.18 |
| 端到端响应 s 越低越好 | 35.55 | 28.80 | 16.61 最优 | 75.37 |
| 上下文窗口 tokens 越高越好 | 1,000,000 | 1,000,000 | 1,000,000 | 1,048,576 最优 |
| 指标 | Step 5 Preview | Grok 4.3 xAI | Inkling | Kimi K3 Moonshot AI |
|---|---|---|---|---|
| 输入价 ¥/百万 越低越好 | 6.7246 最优 | 8.4058 | 6.7246 | 20.1739 |
| 输出价 ¥/百万 越低越好 | 18.1565 | 16.8116 最优 | 27.2348 | 100.8696 |
| 每任务成本 ¥ 越低越好 | 4.8116 | 1.1116 最优 | 4.0822 | 13.4502 |
| 性价比(指数 ÷ 输入价) 分/元 越高越好 | 6.5 最优 | 3.0 | 3.7 | 2.2 |
| 指标 | Step 5 Preview | Grok 4.3 xAI | Inkling | Kimi K3 Moonshot AI |
|---|---|---|---|---|
| 厂商 | 未知 | xAI | 未知 | Moonshot AI |
| 榜单排名 越低越好 | 33 最优 | 146 | 143 | 34 |
| 推理档位 | 是 | 是 | 是 | 是 |
| 开放权重 | — | — | — | — |
| 模态 | ||||
| 发布时间 | — | — | — | — |
数据来源:能力与评测 / 性能与延迟 / 价格来自第三方榜单当前有效批次 (Artificial Analysis,随批次更新);档案来自本站模型目录。 复合分(编程/智能体/知识)由该组内评测项**取均值**得出(缺项不参与,不按 0 计)—— 口径见方法学。