COMPARE / 2–4 个模型
模型并排对比
横轴是价格、纵轴是能力 —— 越靠左上,性价比越高。 红色虚线是当前榜单里的性价比前沿线(沿着"更贵但更强"的边界走), 落在它下方的模型意味着"花同样的钱能买到更强的"。
为「模型 1」选择 · Google
← 返回厂商列表- Gemini 1.0 Pro加入对比 →
- Gemini 1.0 Ultra加入对比 →
- Gemini 1.5 Flash加入对比 →
- Gemini 1.5 Flash-8B加入对比 →
- Gemini 1.5 Pro加入对比 →
- Gemini 2.0 Flash Thinking Experimental加入对比 →
- Gemini 2.0 Flash-Lite加入对比 →
- Gemini 2.0 Pro Experimental加入对比 →
- Gemini 2.5 Flash加入对比 →
- Gemini 2.5 Flash Preview加入对比 →
- Gemini 2.5 Flash-Lite Preview加入对比 →
- Gemini 2.5 Pro加入对比 →
- Gemini 2.5 Pro Preview加入对比 →
- Gemini 3 Deep Think加入对比 →
- Gemini 3 Flash Preview加入对比 →
- Gemini 3 Pro Preview加入对比 →
- Gemini 3.1 Flash-Lite加入对比 →
- Gemini 3.1 Pro Preview加入对比 →
- Gemini 3.5 Flash加入对比 →
- Gemini 3.5 Flash-Lite加入对比 →
- Gemini 3.6 Flash加入对比 →
- Gemini 3.7 Flash加入对比 →
- Gemini 3.8 Flash加入对比 →
- gemini-1.5-flash-001加入对比 →
- gemini-1.5-flash-002加入对比 →
- gemini-1.5-flash-8b-001加入对比 →
- gemini-1.5-pro-001加入对比 →
- gemini-1.5-pro-002加入对比 →
- gemini-2.0-flash-001加入对比 →
- gemini-2.0-flash-lite-preview-02-05加入对比 →
- gemini-2.5-flash-lite-preview-06-17加入对比 →
- gemini-2.5-flash-lite-preview-09-2025-no加入对比 →
- gemini-2.5-flash-preview-09-2025加入对比 →
- gemini-advanced-0514加入对比 →
- gemini-pro-dev-api加入对比 →
- Gemma 3 12B Instruct加入对比 →
- Gemma 3 1B Instruct加入对比 →
- Gemma 3 270M加入对比 →
- Gemma 3 27B Instruct加入对比 →
- Gemma 3 4B Instruct加入对比 →
- Gemma 3n E2B Instruct加入对比 →
- Gemma 3n E4B Instruct Preview加入对比 →
- Gemma 4 12B加入对比 →
- Gemma 4 26B A4B加入对比 →
- Gemma 4 31B加入对比 →
- Gemma 4 E2B加入对比 →
- Gemma 4 E4B加入对比 →
- gemma-2-2b-it加入对比 →
- gemma-2-9b-it加入对比 →
- gemma-2-9b-it-simpo加入对比 →
- gemma-3n-e4b-it加入对比 →
- google/gemini-2.5-flash-image加入对比 →
- google/gemini-3-pro-image-20260528加入对比 →
- google/gemini-3.1-flash-image-20260528加入对比 →
- google/gemini-3.1-flash-lite-image-20260630加入对比 →
- google/gemini-3.1-flash-tts-preview加入对比 →
- google/gemini-3.1-pro-preview-customtools-20260219加入对比 →
- google/gemini-3.8-live加入对比 →
- google/gemini-embedding-001加入对比 →
- google/gemini-embedding-2加入对比 →
- google/gemma-2-27b-it加入对比 →
- google/gemma-3-12b-it加入对比 →
- google/gemma-3-27b-it加入对比 →
- google/gemma-3-4b-it加入对比 →
- google/gemma-4-26b-a4b-it-20260403加入对比 →
- google/gemma-4-31b-it-20260402加入对比 →
- google/lyria-3-clip-preview-20260330加入对比 →
- google/lyria-3-pro-preview-20260330加入对比 →
PRICE / CAPABILITY FRONTIER
模型斩杀线坐标
215 个模型有完整价格与分值;横轴为对数刻度,标出的点是你选中的模型
图上的点可以直接点:点一下会把它设为「聚焦查看」——在图下标出它的名字与读数, 不占用上方 4 个对比名额(键盘 Tab 也能选中)。再点一次相同的点即可取消聚焦。
币种口径:价格已折算为 CNY(1 USD = 6.719488 CNY,来源 open.er-api.com · 观察于 2026-09-28);口径为每日快照(不追实时),原始口径不受影响。
口径:横轴 = 标准输入价(每百万 tokens,已折人民币),纵轴 = AA 能力指数。 只画同时有价格与分值的行 —— 缺一个就没法定位,硬塞进图里等于编数据。
PROFILE / 能力画像
六轴对照
同一固定区间归一化,跨模型可比;缺数据的轴标"无数据"
Hy3
hy3
- 能力指数
- 25.2973
- 性价比
- 26.89
- 吞吐
- 87.0519
- 上下文
- 256000
- 输入成本
- 0.9407283200000001
- 输出成本
- 3.8973030399999997
Claude Opus 4.6
claude-opus-4-6-adaptive
- 能力指数
- 31.9457
- 性价比
- 0.95
- 吞吐
- 38.5327
- 上下文
- 1000000
- 输入成本
- 33.59744
- 输出成本
- 167.9872
MATRIX / 完整对照
各项指标并排对比
28 / 32 项有数据 · 绿色高亮 = 该行最优;"—" 表示该模型这项没有数据(不参与最优比较)
| 指标 | Hy3 | Claude Opus 4.6 Anthropic |
|---|---|---|
| 综合智能指数 越高越好 | 25.30 | 31.95 最优 |
|
编程与工程
scicode / terminalBench 取均值 越高越好 |
37.9 | — |
|
智能体与工具
tau / apex / analyst 取均值 越高越好 |
22.9 | 62.6 最优 |
|
知识与推理
omniscience / gpqa / hle 取均值 越高越好 |
45.6 | 58.8 最优 |
| SciCode 越高越好 | 48.6% | — |
| Terminal-Bench 2.1 越高越好 | 64.4% | — |
| Terminal-Bench 4.0 越高越好 | 0.5% | — |
| τ²-Banking(工具调用) 越高越好 | 22.9% | — |
| GPQA(科学问答) 越高越好 | 89.7% 最优 | 89.6% |
| HLE(Humanity's Last Exam) 越高越好 | 33.5% | 39.9% 最优 |
| 知识准确性 越高越好 | 32.0% | 47.0% 最优 |
| 非幻觉率 越高越好 | 25.9% | 37.2% 最优 |
| IFBench(指令遵循) 越高越好 | — | 53.1% |
| MMMU-Pro(多模态) 越高越好 | — | 75.4% |
| ITBench-SRE(运维) 越高越好 | — | — |
| GDPval(经济价值任务) 越高越好 | 27.3% | — |
| Analyst Agent(分析师智能体) 越高越好 | — | — |
| Apex Agents 越高越好 | — | 33.0% |
| 指标 | Hy3 | Claude Opus 4.6 Anthropic |
|---|---|---|
| 输出吞吐 tokens/s 越高越好 | 87.1 最优 | 38.5 |
| 首 token 延迟 s 越低越好 | 3.03 最优 | 13.17 |
| 端到端响应 s 越低越好 | 31.75 | 26.15 最优 |
| 上下文窗口 tokens 越高越好 | 256,000 | 1,000,000 最优 |
| 指标 | Hy3 | Claude Opus 4.6 Anthropic |
|---|---|---|
| 输入价 ¥/百万 越低越好 | 0.9407 最优 | 33.5974 |
| 输出价 ¥/百万 越低越好 | 3.8973 最优 | 167.9872 |
| 每任务成本 ¥ 越低越好 | 0.4993 | — |
| 性价比(指数 ÷ 输入价) 分/元 越高越好 | 26.9 最优 | 1.0 |
| 指标 | Hy3 | Claude Opus 4.6 Anthropic |
|---|---|---|
| 厂商 | 未知 | Anthropic |
| 榜单排名 越低越好 | 138 | 90 最优 |
| 推理档位 | 是 | 是 |
| 开放权重 | — | — |
| 模态 | ||
| 发布时间 | — | — |
数据来源:能力与评测 / 性能与延迟 / 价格来自第三方榜单当前有效批次 (Artificial Analysis,随批次更新);档案来自本站模型目录。 复合分(编程/智能体/知识)由该组内评测项**取均值**得出(缺项不参与,不按 0 计)—— 口径见方法学。