参数局PARAM BUREAU

COMPARE / 2–4 个模型

模型并排对比

横轴是价格、纵轴是能力 —— 越靠左上,性价比越高。 红色虚线是当前榜单里的性价比前沿线(沿着"更贵但更强"的边界走), 落在它下方的模型意味着"花同样的钱能买到更强的"。

模型 1 Hy3 更换 移除
模型 2 Kimi K3 更换 移除
模型 3 Step 3.7 Flash 更换 移除
模型 4 + 选择模型

PRICE / CAPABILITY FRONTIER

模型斩杀线坐标

87 个模型有完整价格与分值;横轴为对数刻度,标出的点是你选中的模型

32.138.544.951.257.6¥0.67¥1.34¥3.36¥6.72¥13.44¥33.6¥67.19性价比前沿线Claude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback) · 能力 57.62 · ¥26.88(点击查看)Claude Opus 5.5 (Adaptive Reasoning, Xhigh Effort, Default Fallback) · 能力 55.99 · ¥26.88(点击查看)Claude Opus 5.5 (Adaptive Reasoning, High Effort, Default Fallback) · 能力 53.58 · ¥26.88(点击查看)Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) · 能力 53.35 · ¥67.19(点击查看)Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) · 能力 53.2 · ¥67.19(点击查看)GPT-6 Astra (max) · 能力 52.67 · ¥67.19(点击查看)GPT-6 Astra (xhigh) · 能力 52.39 · ¥67.19(点击查看)Claude Opus 5.5 (Adaptive Reasoning, Medium Effort, Default Fallback) · 能力 51.24 · ¥26.88(点击查看)Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) · 能力 51.15 · ¥67.19(点击查看)GPT-6 Astra (high) · 能力 50.92 · ¥67.19(点击查看)Claude Opus 5 (Adaptive Reasoning, Max Effort) · 能力 50.78 · ¥33.6(点击查看)Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) · 能力 49.68 · ¥33.6(点击查看)Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) · 能力 49.63 · ¥67.19(点击查看)GPT-6 Astra (medium) · 能力 49.57 · ¥67.19(点击查看)Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) · 能力 48.92 · ¥67.19(点击查看)Claude Opus 5 (Adaptive Reasoning, High Effort) · 能力 48.12 · ¥33.6(点击查看)Muse Spark 1.3 (max) · 能力 48.09 · ¥8.4(点击查看)GPT-6 Sol (max) · 能力 47.53 · ¥13.44(点击查看)GPT-5.6 Sol (max) · 能力 46.97 · ¥26.88(点击查看)Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) · 能力 46.82 · ¥67.19(点击查看)Grok 4.7 (xhigh) · 能力 46.45 · ¥13.44(点击查看)Grok 4.7 (high) · 能力 46.33 · ¥13.44(点击查看)MiMo-V2.6-Pro · 能力 46.32 · ¥2.92(点击查看)GPT-6 Astra (low) · 能力 45.78 · ¥67.19(点击查看)Qwen3.8 Max (0902) · 能力 45.42 · ¥13.44(点击查看)Muse Spark 1.3 (xhigh) · 能力 45.07 · ¥8.4(点击查看)Claude Opus 5 (Adaptive Reasoning, Medium Effort) · 能力 44.83 · ¥33.6(点击查看)GLM-5.3 (max) · 能力 44.78 · ¥9.41(点击查看)Grok 4.6 (high) · 能力 44.31 · ¥13.44(点击查看)Grok 4.6 (xhigh) · 能力 44.2 · ¥13.44(点击查看)GPT-6 Sol (xhigh) · 能力 44.1 · ¥13.44(点击查看)GPT-5.6 Sol (xhigh) · 能力 44.01 · ¥26.88(点击查看)Step 5 Preview · 能力 43.73 · ¥6.72(点击查看)Kimi K3 (max) · 能力 43.59 · ¥20.16(点击查看)Grok 4.6 (medium) · 能力 42.84 · ¥13.44(点击查看)GPT-6 Sol (high) · 能力 42.82 · ¥13.44(点击查看)GPT-5.6 Sol (high) · 能力 42.35 · ¥26.88(点击查看)Claude Opus 5.5 (Adaptive Reasoning, Low Effort, Default Fallback) · 能力 42.31 · ¥26.88(点击查看)GPT-5.6 Terra (max) · 能力 42.08 · ¥13.44(点击查看)GLM 5.3 Flash · 能力 41.81 · ¥1.01(点击查看)Claude Opus 4.8 (Adaptive Reasoning, Max Effort) · 能力 41.79 · ¥33.6(点击查看)Gemini 3.8 Flash (high) · 能力 40.93 · ¥5.04(点击查看)Claude Opus 4.7 (Adaptive Reasoning, Max Effort) · 能力 40.69 · ¥33.6(点击查看)Qwen3.8 Max · 能力 40.15 · ¥13.44(点击查看)Qwen3.8 2.4T A95B · 能力 39.89 · ¥13.44(点击查看)Qwen3.8-Flash-Next · 能力 39.82 · ¥1.01(点击查看)GPT-6 Sol (medium) · 能力 39.78 · ¥13.44(点击查看)Gemini 3.8 Flash (medium) · 能力 39.77 · ¥5.04(点击查看)Gemini 3.7 Flash (medium) · 能力 39.62 · ¥5.04(点击查看)Muse Spark 1.2 (xhigh) · 能力 39.58 · ¥8.4(点击查看)DeepSeek V4.1 Flash (Reasoning, Max Effort) · 能力 39.46 · ¥2.02(点击查看)Claude Opus 5 (Adaptive Reasoning, Low Effort) · 能力 39.35 · ¥33.6(点击查看)GPT-5.6 Sol (medium) · 能力 39.24 · ¥26.88(点击查看)Gemini 3.7 Flash (high) · 能力 39.06 · ¥5.04(点击查看)GPT-5.4 (xhigh) · 能力 38.98 · ¥16.8(点击查看)Grok 4.5 (high) · 能力 38.81 · ¥13.44(点击查看)GPT-5.5 (xhigh) · 能力 38.36 · ¥33.6(点击查看)Claude Sonnet 5 (Adaptive Reasoning, Max Effort) · 能力 38.16 · ¥13.44(点击查看)GPT-5.6 Terra (xhigh) · 能力 37.95 · ¥13.44(点击查看)MiMo-V2.6-Flash · 能力 37.88 · ¥0.94(点击查看)GPT-5.6 Luna (max) · 能力 37.32 · ¥1.34(点击查看)GPT-6 Luna (max) · 能力 37.26 · ¥0.67(点击查看)GPT-5.5 (high) · 能力 36.98 · ¥33.6(点击查看)Gemini 3.7 Flash (low) · 能力 36.95 · ¥5.04(点击查看)DeepSeek V4 Pro 0813 (Reasoning, Max Effort) · 能力 36 · ¥8.87(点击查看)Grok 4.6 (low) · 能力 35.12 · ¥13.44(点击查看)DeepSeek V4 Flash Vision (Reasoning, Max Effort) · 能力 34.84 · ¥2.96(点击查看)GPT-5.6 Luna (xhigh) · 能力 34.56 · ¥1.34(点击查看)Kimi K3 (low) · 能力 34.46 · ¥20.16(点击查看)Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) · 能力 34.38 · ¥13.44(点击查看)DeepSeek V4 Flash 0731 (Reasoning, Max Effort) · 能力 34.33 · ¥2.96(点击查看)GLM-5.3 (low) · 能力 34.3 · ¥9.41(点击查看)GPT-5.6 Terra (high) · 能力 34.24 · ¥13.44(点击查看)Gemini 3.6 Flash (high) · 能力 33.98 · ¥5.04(点击查看)GPT-6 Sol (low) · 能力 33.9 · ¥13.44(点击查看)GPT-6 Luna (xhigh) · 能力 33.88 · ¥0.67(点击查看)GPT-5.5 (medium) · 能力 33.8 · ¥33.6(点击查看)Muse Spark 1.1 (xhigh) · 能力 33.73 · ¥8.4(点击查看)GLM-5.2 (max) · 能力 33.71 · ¥9.41(点击查看)GLM-5.2 (max)Qwen3.8 27B (xhigh) · 能力 33.7 · ¥3.36(点击查看)Gemini 3.5 Flash (medium) · 能力 33.63 · ¥10.08(点击查看)GPT-5.6 Sol (low) · 能力 33.47 · ¥26.88(点击查看)Gemini 3.8 Flash (low) · 能力 33.45 · ¥5.04(点击查看)Gemini 3.5 Flash (high) · 能力 32.6 · ¥10.08(点击查看)GPT-5.3 Codex (xhigh) · 能力 32.5 · ¥11.76(点击查看)GPT-6 Luna (high) · 能力 32.15 · ¥0.67(点击查看)GPT-5.6 Luna (high) · 能力 32.12 · ¥1.34(点击查看)输入价格(对数轴,人民币)能力指数

图上的点可以直接点:点一下会把它设为「聚焦查看」——在图下标出它的名字与读数, 不占用上方 4 个对比名额(键盘 Tab 也能选中)。再点一次相同的点即可取消聚焦。

币种口径:价格已折算为 CNY(1 USD = 6.719488 CNY,来源 open.er-api.com · 观察于 2026-09-28);口径为每日快照(不追实时),原始口径不受影响。

口径:横轴 = 标准输入价(每百万 tokens,已折人民币),纵轴 = AA 能力指数。 只画同时有价格与分值的行 —— 缺一个就没法定位,硬塞进图里等于编数据。

FOCUS / 聚焦查看(不占对比名额)

GLM-5.2

加入对比 → 取消聚焦

厂商
Zhipu AI
榜单排名
29
综合智能指数
1470.19
输入价
—
输出价
—
吞吐
—
上下文
—

PROFILE / 能力画像

六轴对照

同一固定区间归一化,跨模型可比;缺数据的轴标"无数据"

画像口径: 综合画像 智能程度 速度与延迟 成本

Hy3

hy3

这个口径下没有数据(该榜源没有这类指标)

能力指数
1441.5739
性价比
无数据
吞吐
无数据
上下文
无数据
输入成本
无数据
输出成本
无数据

Kimi K3

kimi-k3

这个口径下没有数据(该榜源没有这类指标)

能力指数
79.1
性价比
无数据
吞吐
无数据
上下文
无数据
输入成本
无数据
输出成本
无数据

Step 3.7 Flash

step-3-7-flash

这个口径下没有数据(该榜源没有这类指标)

能力指数
19.0634
性价比
无数据
吞吐
无数据
上下文
无数据
输入成本
无数据
输出成本
无数据

MATRIX / 完整对照

各项指标并排对比

6 / 32 项有数据 · 绿色高亮 = 该行最优;"—" 表示该模型这项没有数据(不参与最优比较)

能力与评测 来自第三方榜单(Artificial Analysis)当前有效批次
指标 Hy3 Kimi K3 Moonshot AI Step 3.7 Flash
综合智能指数 越高越好 1,441.57 最优 79.10 19.06
编程与工程
scicode / terminalBench 取均值 越高越好
— — —
智能体与工具
tau / apex / analyst 取均值 越高越好
— — —
知识与推理
omniscience / gpqa / hle 取均值 越高越好
— — —
SciCode 越高越好 — — —
Terminal-Bench 2.1 越高越好 — — —
Terminal-Bench 4.0 越高越好 — — —
τ²-Banking(工具调用) 越高越好 — — —
GPQA(科学问答) 越高越好 — — —
HLE(Humanity's Last Exam) 越高越好 — — —
知识准确性 越高越好 — — —
非幻觉率 越高越好 — — —
IFBench(指令遵循) 越高越好 — — —
MMMU-Pro(多模态) 越高越好 — — —
ITBench-SRE(运维) 越高越好 — — —
GDPval(经济价值任务) 越高越好 — — —
Analyst Agent(分析师智能体) 越高越好 — — —
Apex Agents 越高越好 — — —
性能与延迟 同批快照的实测中位数;延迟类越低越好
指标 Hy3 Kimi K3 Moonshot AI Step 3.7 Flash
输出吞吐 tokens/s 越高越好 — — —
首 token 延迟 s 越低越好 — — —
端到端响应 s 越低越好 — — —
上下文窗口 tokens 越高越好 256,000 1,048,576 最优 262,144
价格与成本 第三方原始口径(美元 / 百万 tokens);每任务成本越低越好
指标 Hy3 Kimi K3 Moonshot AI Step 3.7 Flash
输入价 ¥/百万 越低越好 — — —
输出价 ¥/百万 越低越好 — — —
每任务成本 ¥ 越低越好 — — —
性价比(指数 ÷ 输入价) 分/元 越高越好 — — —
档案 模型目录里的本地档案字段(第三方可能不提供)
指标 Hy3 Kimi K3 Moonshot AI Step 3.7 Flash
厂商 未知 Moonshot AI 未知
榜单排名 越低越好 70 7 最优 130
推理档位 — 是 —
开放权重 — — —
模态
发布时间 — — —

数据来源:能力与评测 / 性能与延迟 / 价格来自第三方榜单当前有效批次 (Artificial Analysis,随批次更新);档案来自本站模型目录。 复合分(编程/智能体/知识)由该组内评测项**取均值**得出(缺项不参与,不按 0 计)—— 口径见方法学。