参数局PARAMBUREAU

COMPARE / 2–4 MODELS

模型对比

MODEL SELECTOR

选择对比模型

4 / 4

Phi-4 Mini Instruct×Command A+×GLM-4.5V (Reasoning)×Quasar 438B (max, based on GLM-5.2)×
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)AnthropicGPT-6 Astra (max)OpenAIClaude Opus 5 (Adaptive Reasoning, Max Effort)AnthropicClaude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)AnthropicMuse Spark 1.3 (max)MetaGPT-5.6 Sol (max)OpenAIQwen3.8 Max (0902)阿里巴巴(通义千问)GLM-5.3 (max)智谱 AI(Z.ai)Grok 4.6 (high)SpaceXAIStep 5 Preview阶跃星辰(StepFun)Kimi K3 (max)月之暗面(Kimi)GPT-5.6 Terra (max)OpenAIGLM 5.3 Flash智谱 AI(Z.ai)Claude Opus 4.8 (Adaptive Reasoning, Max Effort)AnthropicGemini 3.8 Flash (high)GoogleClaude Opus 4.7 (Adaptive Reasoning, Max Effort)AnthropicQwen3.8 Max阿里巴巴(通义千问)Qwen3.8 2.4T A95B阿里巴巴(通义千问)Qwen3.8-Flash-Next阿里巴巴(通义千问)Gemini 3.7 Flash (high)GoogleMuse Spark 1.2 (xhigh)MetaDeepSeek V4.1 Flash (Reasoning, Max Effort)深度求索(DeepSeek)GPT-5.4 (xhigh)OpenAIGrok 4.5 (high)SpaceXAIGPT-5.5 (xhigh)OpenAIClaude Sonnet 5 (Adaptive Reasoning, Max Effort)AnthropicGPT-5.6 Luna (max)OpenAIDeepSeek V4 Pro 0813 (Reasoning, Max Effort)深度求索(DeepSeek)Agnes 3.0 FlashSapiens AIAgnes 2.5 Pro BetaSapiens AIDeepSeek V4 Flash Vision (Reasoning, Max Effort)深度求索(DeepSeek)DeepSeek V4 Flash 0731 (Reasoning, Max Effort)深度求索(DeepSeek)Gemini 3.6 Flash (high)GoogleMuse Spark 1.1 (xhigh)MetaGLM-5.2 (max)智谱 AI(Z.ai)Qwen3.8 27B (xhigh)阿里巴巴(通义千问)Gemini 3.5 Flash (high)GoogleMotif 3Motif TechnologiesGPT-5.3 Codex (xhigh)OpenAIMotif 3 (Beta)Motif TechnologiesClaude Opus 4.6 (Adaptive Reasoning, Max Effort)AnthropicMuse SparkMetaK2 Horizon 375B A23BInstitute of Foundation ModelsDeepSeek V4 Pro 0424 (Reasoning, Max Effort)深度求索(DeepSeek)GPT-5.2 (xhigh)OpenAIApodex 1.1ApodexClaude Sonnet 4.6 (Adaptive Reasoning, Max Effort)AnthropicGemini 3.1 Pro PreviewGoogleQwen3.7 Max阿里巴巴(通义千问)MiniMax-M3稀宇科技(MiniMax)Claude Opus 4.5 (Reasoning)AnthropicMiMo-V2-Pro小米GPT-5.2 Codex (xhigh)OpenAIQwen3.6 Max Preview阿里巴巴(通义千问)Nex-N2-Pro (based on Qwen3.5-397B-A17B)Nex AGISolar Pro 4UpstageGemini 3 Pro Preview (high)GoogleGLM-5 (Reasoning)智谱 AI(Z.ai)Inkling SmallThinking MachinesJT-4.1 Flash 236B A21B中国移动Grok Build 0.1 0616SpaceXAIQwen3.6 Plus阿里巴巴(通义千问)Kimi K2.6月之暗面(Kimi)Agnes 2.5 Pro AlphaSapiens AIQuasar 438B (max, based on GLM-5.2)Multiverse ComputingGLM-5-Turbo智谱 AI(Z.ai)Gemini 3 Flash Preview (Reasoning)GoogleGLM-5.1 (Reasoning)智谱 AI(Z.ai)GPT-5.5 Instant (June 2026)OpenAIDeepSeek V4 Flash 0420 (Reasoning, High Effort)深度求索(DeepSeek)MiMo-V2.5-Pro小米Kimi K2.7 Code月之暗面(Kimi)Grok 4.20 0309 v2 (Reasoning)SpaceXAIK2 Horizon MoVA 36B A4BInstitute of Foundation ModelsHy3腾讯Grok 4.20 0309 (Reasoning)SpaceXAIMiMo-V2.5小米Qwen3.7 Plus阿里巴巴(通义千问)MiMo-V2-Omni-0327小米Inkling (xhigh)Thinking MachinesLing 3.0 Flash蚂蚁集团(百灵)GPT-5 Codex (high)OpenAIGrok 4.3 (high)SpaceXAISolar Open2 250BUpstageGPT-5.1 (high)OpenAILing-3.0-flash-VL蚂蚁集团(百灵)GPT-5.4 mini (xhigh)OpenAIMiMo-V2-Omni小米GPT-5.1 Codex (high)OpenAIGLM 5V Turbo (Reasoning)智谱 AI(Z.ai)Kimi K2.5 (Reasoning)月之暗面(Kimi)GPT-5 (high)OpenAINemotron 3 Ultra 550B A55B (Reasoning)NVIDIAQwen3.5 27B (Reasoning)阿里巴巴(通义千问)Claude 4.1 Opus (Reasoning)AnthropicMiniMax-M2.5稀宇科技(MiniMax)MiniMax-M2.7稀宇科技(MiniMax)Hy3-preview (Reasoning)腾讯A.X-K2SK TelecomGPT-5.5 Instant (May 2026)OpenAILing-3.0-flash-Fin蚂蚁集团(百灵)Grok 4SpaceXAIMiMo-V2-Flash (Feb 2026)小米GLM-4.7 (Reasoning)智谱 AI(Z.ai)Gemini 3.5 Flash-LiteGoogleKimi K2 Thinking月之暗面(Kimi)o3-proOpenAIG9v3-39A5BAI9StarsKAT Coder Pro V2快手(KAT)DeepSeek V3.2 (Reasoning)深度求索(DeepSeek)Qwen3.5 397B A17B (Reasoning)阿里巴巴(通义千问)Qwen3.6 27B (Reasoning)阿里巴巴(通义千问)Qwen3 Max Thinking阿里巴巴(通义千问)MiniMax-M2.1稀宇科技(MiniMax)MiMo-V2-Flash (Reasoning)小米GPT-5.4 nano (xhigh)OpenAIClaude 4.5 Sonnet (Reasoning)AnthropicClaude 4 Opus (Reasoning)AnthropicGPT-5 mini (high)OpenAIK2 Horizon 7BInstitute of Foundation ModelsQwen3.5 Omni Plus阿里巴巴(通义千问)GPT-5.1 Codex mini (high)OpenAIGrok 4.1 Fast (Reasoning)SpaceXAIo3OpenAIK-EXAONE 2.0 0803LG AI ResearchStep 3.7 Flash阶跃星辰(StepFun)Qwen3.5 35B A3B (Reasoning)阿里巴巴(通义千问)LongCat 2.0美团(LongCat)Gemma 4 31B (Reasoning)GoogleClaude 4 Sonnet (Reasoning)AnthropicJT-35B-Flash中国移动MiniMax-M2稀宇科技(MiniMax)KAT-Coder-Pro V1快手(KAT)GLM-4.6 (Reasoning)智谱 AI(Z.ai)Qwen3.6 35B A3B (Reasoning)阿里巴巴(通义千问)Grok 4 Fast (Reasoning)SpaceXAIQwen3.5 122B A10B (Reasoning)阿里巴巴(通义千问)Claude 3.7 Sonnet (Reasoning)AnthropicMuse Glimmer (high)MetaLing-2.6-1T蚂蚁集团(百灵)Step 3.5 Flash 2603阶跃星辰(StepFun)Doubao Seed Code字节跳动(豆包)Claude 4.5 Haiku (Reasoning)AnthropicGemma 4 26B A4B (Reasoning)Googleo4-mini (high)OpenAIRing-2.6-1T蚂蚁集团(百灵)Step 3.5 Flash阶跃星辰(StepFun)DeepSeek V3.2 Exp (Reasoning)深度求索(DeepSeek)Qwen3 Max Thinking (Preview)阿里巴巴(通义千问)Gemini 2.5 ProGoogleK2 Horizon 3.7BInstitute of Foundation ModelsQwen3 Max阿里巴巴(通义千问)Gemini 3.1 Flash-LiteGoogleGemini 2.5 Flash Preview (Sep '25) (Reasoning)GoogleKimi K2 0905月之暗面(Kimi)Ling 3.0 Tiny蚂蚁集团(百灵)o1OpenAIGemini 2.5 Pro Preview (Mar' 25)GoogleGLM-4.7-Flash (Reasoning)智谱 AI(Z.ai)Granite 4.2 30BIBMDeepSeek V3.1 Terminus (Reasoning)深度求索(DeepSeek)Grok 3 mini Reasoning (high)SpaceXAIGemini 2.5 Pro Preview (May' 25)GoogleDeepSeek V3.2 Speciale深度求索(DeepSeek)K-EXAONE (Reasoning)LG AI ResearchERNIE 5.0 Thinking Preview百度Mistral Medium 3.5MistralGemma 4 12B (Reasoning)GoogleNova 2.0 Pro Preview (medium)AmazonGrok Code Fast 1SpaceXAIApriel-v1.5-15B-ThinkerServiceNowMercury 2InceptionDeepSeek V3.1 (Reasoning)深度求索(DeepSeek)Qwen3.5 9B (Reasoning)阿里巴巴(通义千问)Nova 2.0 Omni (medium)AmazonQwen3 VL 235B A22B (Reasoning)阿里巴巴(通义千问)Apriel-v1.6-15B-ThinkerServiceNowNova 2.0 Lite (high)AmazonEXAONE 4.5 33BLG AI ResearchCommand A+CohereQwen3.5 4B (Reasoning)阿里巴巴(通义千问)DeepSeek R1 0528 (May '25)深度求索(DeepSeek)Gemini 2.5 Flash (Reasoning)GoogleGPT-5 nano (high)OpenAINemotron 3.5 LightningNVIDIANemotron 3 Super 120B A12B (Reasoning)NVIDIAGLM-4.5 (Reasoning)智谱 AI(Z.ai)Kimi K2月之暗面(Kimi)Qwen3 235B A22B 2507 (Reasoning)阿里巴巴(通义千问)GPT-4.1OpenAIQwen3 Max (Preview)阿里巴巴(通义千问)Qwen3.5 Omni Flash阿里巴巴(通义千问)o3-mini (high)OpenAIMiniCPM5-2B面壁智能(OpenBMB)o1-proOpenAIJT-MINI中国移动Grok 3SpaceXAISeed-OSS-36B-Instruct字节跳动(豆包)Qwen3 235B A22B 2507 Instruct阿里巴巴(通义千问)Qwen3 Coder 480B A35B Instruct阿里巴巴(通义千问)Qwen3 VL 32B (Reasoning)阿里巴巴(通义千问)Magistral Medium 1.2MistralSonar Reasoning ProPerplexityHyperNova 60B 2605 (high, based on gpt-oss-120b)Multiverse ComputingMiniMax M1 80k稀宇科技(MiniMax)Nemotron Cascade 2 30B A3BNVIDIAGemini 2.5 Flash Preview (Reasoning)Googlegpt-oss-120b (high)OpenAIK2 Think V2Institute of Foundation ModelsLongCat Flash Lite美团(LongCat)DeepSeek R1 (Jan '25)深度求索(DeepSeek)o1-previewOpenAIHyperCLOVA X SEED Think (32B)NaverMistral Small 4 (Reasoning)MistralGLM-4.6V (Reasoning)智谱 AI(Z.ai)Qwen3 Next 80B A3B (Reasoning)阿里巴巴(通义千问)GLM-4.5-Air智谱 AI(Z.ai)Granite 4.2 8BIBMMi:dm K 2.5 ProKorea TelecomRing-1T蚂蚁集团(百灵)G9v3-3BAI9StarsTrinity Large ThinkingArcee AIINTELLECT-3Prime IntellectGPT-5 (ChatGPT)OpenAISolar Open 100B (Reasoning)UpstageGrok 3 Reasoning BetaSpaceXAIGemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning)GoogleNemotron 3 Nano Omni 30B A3B ReasoningNVIDIAGPT-4.1 miniOpenAILlama 4 MaverickMetaMiniMax M1 40k稀宇科技(MiniMax)gpt-oss-20b (high)OpenAIQwen3 VL 235B A22B Instruct阿里巴巴(通义千问)North Mini CodeCohereK2-V2 (high)Institute of Foundation ModelsQwen3 30B A3B 2507 (Reasoning)阿里巴巴(通义千问)o1-miniOpenAIDeepSeek V3 0324深度求索(DeepSeek)Ling 2.6 Flash蚂蚁集团(百灵)Qwen3 Next 80B A3B Instruct阿里巴巴(通义千问)Tri-21B-think PreviewTrillion LabsQwen3 Coder 30B A3B Instruct阿里巴巴(通义千问)GPT-4.5 (Preview)OpenAIDiffusionGemma 26B A4BGoogleQwen3 235B A22B (Reasoning)阿里巴巴(通义千问)QwQ 32B阿里巴巴(通义千问)Qwen3 VL 30B A3B (Reasoning)阿里巴巴(通义千问)Gemini 2.0 Flash Thinking Experimental (Jan '25)GoogleMistral Large 3MistralQwen3 Coder Next阿里巴巴(通义千问)Motif-2-12.7B-ReasoningMotif TechnologiesMistral Medium 3.1MistralLing-1T蚂蚁集团(百灵)Nova PremierAmazonSolar Pro 2 (Preview) (Reasoning)UpstageGranite 4.2 3BIBMMagistral Medium 1MistralMistral Medium 3MistralLlama Nemotron Super 49B v1.5 (Reasoning)NVIDIADevstral MediumMistralTri-21B-ThinkTrillion LabsGPT-4o (March 2025, chatgpt-4o-latest)OpenAIGemini 2.0 Flash (Feb '25)GoogleClaude 3.5 HaikuAnthropicLlama 3.3 Nemotron Super 49B v1 (Reasoning)NVIDIAGemma 4 E4B (Reasoning)GoogleNVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIAQwen3 4B 2507 (Reasoning)阿里巴巴(通义千问)MiniCPM5-1B (Reasoning)面壁智能(OpenBMB)Sarvam 105B (high)SarvamGemini 2.0 Pro Experimental (Feb '25)GoogleDevstral Small (May '25)MistralClaude 3 OpusAnthropicSonar ReasoningPerplexityDevstral 2MistralMagistral Small 1.2MistralQwen3 32B (Reasoning)阿里巴巴(通义千问)Gemini 2.5 Flash-Lite (Reasoning)GoogleDeepSeek V3 (Dec '24)深度求索(DeepSeek)GPT-4o (Nov '24)OpenAINanbeige4.1-3BNanbeigeLFM2.5-2.6BLiquid AIQwen3 VL 32B Instruct阿里巴巴(通义千问)DeepSeek R1 Distill Qwen 32B深度求索(DeepSeek)Mistral Small 3.2MistralMagistral Small 1MistralGemini 2.0 Flash (experimental)GoogleEXAONE 4.0 32B (Reasoning)LG AI ResearchQwen3 VL 8B (Reasoning)阿里巴巴(通义千问)Qwen3 14B (Reasoning)阿里巴巴(通义千问)DeepSeek R1 0528 Qwen3 8B深度求索(DeepSeek)Llama 4 ScoutMetaQwen2.5 Max阿里巴巴(通义千问)Qwen3 VL 30B A3B Instruct阿里巴巴(通义千问)Hermes 4 - Llama-3.1 70B (Reasoning)Nous ResearchGemini 1.5 Pro (Sep '24)GoogleDeepSeek R1 Distill Llama 70B深度求索(DeepSeek)Claude 3.5 Sonnet (Oct '24)AnthropicDeepSeek R1 Distill Qwen 14B深度求索(DeepSeek)Falcon-H1R-7BTII UAEGPT-4.1 nanoOpenAISolar Pro 3UpstageLing-flash-2.0蚂蚁集团(百灵)Gemma 4 E2B (Reasoning)GoogleQwen3 Omni 30B A3B (Reasoning)阿里巴巴(通义千问)GPT-4o (Aug '24)OpenAIQwen2.5 Instruct 72B阿里巴巴(通义千问)SonarPerplexityStep3 VL 10B阶跃星辰(StepFun)Llama 3.3 Instruct 70BMetaQwen3 30B A3B (Reasoning)阿里巴巴(通义千问)Sonar ProPerplexityDevstral Small (Jul '25)MistralQwQ 32B-Preview阿里巴巴(通义千问)GLM-4.5V (Reasoning)智谱 AI(Z.ai)Mistral Large 2 (Nov '24)MistralDevstral Small 2MistralLlama 3.1 Nemotron Ultra 253B v1 (Reasoning)NVIDIAQwen3 30B A3B 2507 Instruct阿里巴巴(通义千问)ERNIE 4.5 300B A47B百度Hermes 4 - Llama-3.1 405B (Reasoning)Nous ResearchSolar Pro 2 (Reasoning)UpstageNVIDIA Nemotron Nano 12B v2 VL (Reasoning)NVIDIAGranite 4.1 30BIBMNVIDIA Nemotron Nano 9B V2 (Reasoning)NVIDIAGemini 2.0 Flash-Lite (Feb '25)GoogleNVIDIA Nemotron 3 Nano 4BNVIDIAGPT-4o (May '24)OpenAIGemini 2.0 Flash-Lite (Preview)GoogleLlama 3.1 Nemotron Nano 4B v1.1 (Reasoning)NVIDIAKimi Linear 48B A3B Instruct月之暗面(Kimi)Llama 3.1 Instruct 405BMetaQwen3 8B (Reasoning)阿里巴巴(通义千问)Qwen3 VL 8B Instruct阿里巴巴(通义千问)Qwen3 4B (Reasoning)阿里巴巴(通义千问)LFM2.5-8B-A1BLiquid AIClaude 3.5 Sonnet (June '24)AnthropicLlama 3.1 Tulu3 405BAllen Institute for AIGPT-4o (ChatGPT)OpenAIRing-flash-2.0蚂蚁集团(百灵)Pixtral LargeMistralOlmo 3.1 32B ThinkAllen Institute for AIMistral Small 3.1MistralGrok 2 (Dec '24)SpaceXAIGemini 1.5 Flash (Sep '24)GoogleQwen3 VL 4B (Reasoning)阿里巴巴(通义千问)GPT-4 TurboOpenAINova ProAmazonCommand ACohereQwen3.5 2B (Reasoning)阿里巴巴(通义千问)Llama 3.1 Nemotron Instruct 70BNVIDIALlama 3.1 Instruct 8BMetaGrok BetaSpaceXAIQwen2.5 Instruct 32B阿里巴巴(通义千问)Mistral Large 2 (Jul '24)MistralQwen3 4B 2507 Instruct阿里巴巴(通义千问)Qwen2.5 Coder Instruct 32B阿里巴巴(通义千问)GPT-4OpenAIMistral Small 3MistralNova LiteAmazonGPT-4o miniOpenAIDeepSeek-V2.5 (Dec '24)深度求索(DeepSeek)Llama 3.1 Instruct 70BMetaGranite 4.1 8BIBMSarvam 30B (high)SarvamGemini 2.0 Flash Thinking Experimental (Dec '24)GoogleDeepSeek-V2.5深度求索(DeepSeek)Olmo 3.1 32B InstructAllen Institute for AIMistral SabaMistralDeepSeek R1 Distill Llama 8B深度求索(DeepSeek)Olmo 3 32B ThinkAllen Institute for AIGemini 1.5 Pro (May '24)GoogleR1 1776PerplexityQwen2.5 Turbo阿里巴巴(通义千问)Reka Flash (Sep '24)Reka AILlama 3.2 Instruct 90B (Vision)MetaSolar MiniUpstageCeleris-1CelerisGrok-1SpaceXAIQwen2 Instruct 72B阿里巴巴(通义千问)Phi-4 Mini InstructMicrosoftGemini 1.5 Flash-8BGoogleQwen3.5 0.8B (Reasoning)阿里巴巴(通义千问)DeepHermes 3 - Mistral 24B Preview (Non-reasoning)Nous ResearchJamba 1.7 LargeAI21 LabsGranite 4.0 H SmallIBMMinistral 3 14BMistralJamba 1.5 LargeAI21 LabsQwen3 Omni 30B A3B Instruct阿里巴巴(通义千问)Hermes 3 - Llama-3.1 70BNous ResearchDeepSeek-Coder-V2深度求索(DeepSeek)OLMo 2 32BAllen Institute for AIJamba 1.6 LargeAI21 LabsLFM2 24B A2BLiquid AIGemini 1.5 Flash (May '24)GooglePhi-4MicrosoftClaude 3 SonnetAnthropicNova MicroAmazonGranite 4.1 3BIBMMistral Small (Sep '24)MistralGemini 1.0 UltraGooglePhi-3 Mini Instruct 3.8BMicrosoftGemma 3n E4B Instruct Preview (May '25)GooglePhi-4 Multimodal InstructMicrosoftQwen2.5 Coder Instruct 7B阿里巴巴(通义千问)Mistral Large (Feb '24)MistralMixtral 8x22B InstructMistralLlama 2 Chat 7BMetaLlama 3.2 Instruct 3BMetaMiniCPM-V 4.6 1.3B面壁智能(OpenBMB)Jamba Reasoning 3BAI21 LabsQwen3 VL 4B Instruct阿里巴巴(通义千问)Qwen1.5 Chat 110B阿里巴巴(通义千问)Reka Flash 3Reka AIOlmo 3 7B ThinkAllen Institute for AIClaude 2.1AnthropicClaude 3 HaikuAnthropicOLMo 2 7BAllen Institute for AIMolmo 7B-DAllen Institute for AILing-mini-2.0蚂蚁集团(百灵)DeepSeek R1 Distill Qwen 1.5B深度求索(DeepSeek)Claude 2.0AnthropicDeepSeek-V2-Chat深度求索(DeepSeek)Mistral Small (Feb '24)MistralMistral MediumMistralGPT-3.5 TurboOpenAIMinistral 3 8BMistralLlama 3 Instruct 70BMetaArctic InstructSnowflakeQwen Chat 72B阿里巴巴(通义千问)LFM 40BLiquid AILlama 3.2 Instruct 11B (Vision)MetaPALM-2GoogleGemini 1.0 ProGoogleDeepSeek Coder V2 Lite Instruct深度求索(DeepSeek)Sarvam M (Reasoning)SarvamDeepSeek LLM 67B Chat (V1)深度求索(DeepSeek)Llama 2 Chat 70BMetaLlama 2 Chat 13BMetaCommand-R+ (Apr '24)CohereOpenChat 3.5 (1210)OpenChatDBRX InstructDatabricksExaone 4.0 1.2B (Reasoning)LG AI ResearchOlmo 3 7B InstructAllen Institute for AILFM2.5-1.2B-ThinkingLiquid AIJamba 1.7 MiniAI21 LabsLFM2 2.6BLiquid AILFM2.5-1.2B-InstructLiquid AIJamba 1.5 MiniAI21 LabsGranite 4.0 H 1BIBMQwen3 1.7B (Reasoning)阿里巴巴(通义千问)Jamba 1.6 MiniAI21 LabsMixtral 8x7B InstructMistralGemma 3 270MGoogleApertus 70B InstructSwiss AI InitiativeGranite 4.0 MicroIBMDeepHermes 3 - Llama-3.1 8B Preview (Non-reasoning)Nous ResearchClaude InstantAnthropicCommand-R (Mar '24)CohereLlama 65BMetaMistral 7B InstructMistralQwen Chat 14B阿里巴巴(通义千问)Granite 4.0 1BIBMMolmo2-8BAllen Institute for AILFM2 8B A1BLiquid AIGranite 3.3 8B (Non-reasoning)IBMGemma 3 27B InstructGoogleMinistral 3 3BMistralApertus 8B InstructSwiss AI InitiativeGemma 3 1B InstructGoogleGemma 3 4B InstructGoogleGemma 3n E2B InstructGoogleGemma 3n E4B InstructGoogleGranite 4.0 350MIBMGranite 4.0 H 350MIBMLFM2 1.2BLiquid AILFM2.5-VL-1.6BLiquid AILlama 3 Instruct 8BMetaLlama 3.2 Instruct 1BMetaQwen3 0.6B (Reasoning)阿里巴巴(通义千问)Tiny Aya GlobalCohereGemma 3 12B InstructGoogleK2 Horizon 0.9BInstitute of Foundation ModelsCogito v2.1 (Reasoning)Deep CogitoGemini 3 Deep ThinkGoogleGPT-3.5 Turbo (0613)OpenAIGPT-4o mini Realtime (Dec '24)OpenAIGPT-4o Realtime (Dec '24)OpenAIGPT-5.4 Pro (xhigh)OpenAIGPT-5.5 Pro (xhigh)OpenAIMi:dm K 2.5 Pro PreviewKorea Telecom

Phi-4 Mini Instruct / Command A+ / GLM-4.5V (Reasoning) / Quasar 438B (max, based on GLM-5.2)

PRICE / CAPABILITY FRONTIER

模型斩杀线坐标

4 个所选模型

左上区域代表更低价格和更高能力。红色前沿线由当前主流模型计算;对比状态只显示所选模型点,隐藏其他背景点。价格采用标准输入档位,横轴为对数刻度。

020406080100

AA 智能指数越高越好

Phi-4 Mini InstructMicrosoft
6.329差 76.3%
Command A+Cohere
13.134差 50.9%
GLM-4.5V (Reasoning)Z AI
7.556差 71.7%
Quasar 438B (max, based on GLM-5.2)Multiverse Computing
26.737最优

GPQA 科学推理越高越好

Phi-4 Mini InstructMicrosoft
0.331差 56.4%
Command A+Cohere
0.761最优
GLM-4.5V (Reasoning)Z AI
0.684差 10.1%
Quasar 438B (max, based on GLM-5.2)Multiverse Computing
0.732差 3.7%

τ² 智能体工具任务越高越好

Phi-4 Mini InstructMicrosoft
0.082差 89.9%
Command A+Cohere
0.807最优
GLM-4.5V (Reasoning)Z AI
0.225差 72.1%
Quasar 438B (max, based on GLM-5.2)Multiverse Computing

SciCode 科研编程越高越好

Phi-4 Mini InstructMicrosoft
Command A+Cohere
0.385差 20.0%
GLM-4.5V (Reasoning)Z AI
Quasar 438B (max, based on GLM-5.2)Multiverse Computing
0.481最优

输出速度中位数越高越好

Phi-4 Mini InstructMicrosoft
44.979差 81.3%
Command A+Cohere
240.861最优
GLM-4.5V (Reasoning)Z AI
41.199差 82.9%
Quasar 438B (max, based on GLM-5.2)Multiverse Computing
175.394差 27.2%

条长为同一维度内的 0至100 归一化分数;右侧数字为来源原始值。指数使用原始百分制,速度和延迟按本次所选模型相对归一化。

评测数据来自 Artificial Analysis,本站仅作非官方中文呈现;归一化仅用于当前所选模型的视觉比较,不改变原始值。查看指标口径

FULL SPECIFICATION

完整指标对照

35 项

指标Phi-4 Mini InstructCommand A+GLM-4.5V (Reasoning)Quasar 438B (max, based on GLM-5.2)
AA 智能指数 · 越高越好6.329距最优 76.3%13.134距最优 50.9%7.556距最优 71.7%26.737最优
智能指数评测成本USD · 越低越好无数据0最优无数据2.025不可计算
CritPT 批判性推理 · 越高越好0距最优 100.0%0.003距最优 97.0%0距最优 100.0%0.094最优
GDPval 专业任务 · 越高越好0距最优 100.0%0距最优 100.0%无数据0.331最优
GPQA 科学推理 · 越高越好0.331距最优 56.4%0.761最优0.684距最优 10.1%0.732距最优 3.7%
Humanity’s Last Exam · 越高越好0.045距最优 76.2%0.12距最优 36.0%0.063距最优 66.3%0.187最优
IFBench 指令遵循 · 越高越好0.211距最优 71.5%0.74最优0.342距最优 53.7%无数据
LCR 长上下文推理 · 越高越好0.153距最优 79.9%0.527距最优 31.0%0距最优 100.0%0.763最优
MMMU-Pro 多模态理解 · 越高越好无数据0.632最优0.505距最优 20.2%无数据
Omniscience 综合知识 · 越高越好-61.083距最优 2249.4%-4.017距最优 54.5%-46.283距最优 1680.1%-2.6最优
Omniscience 准确率 · 越高越好0.095距最优 54.4%0.089距最优 57.4%0.208最优0.155距最优 25.5%
Omniscience 非幻觉率 · 越高越好0.22距最优 74.4%0.858最优0.152距最优 82.3%0.786距最优 8.5%
SciCode 科研编程 · 越高越好无数据0.385距最优 20.0%无数据0.482最优
τ² 智能体工具任务 · 越高越好0.082距最优 89.9%0.807最优0.225距最优 72.1%无数据
τ-Bench 银行业任务 · 越高越好无数据0.06距最优 79.1%无数据0.287最优
Terminal-Bench Hard · 越高越好0距最优 100.0%0.25最优0.053距最优 78.8%无数据
输出速度中位数tokens/s · 越高越好44.979距最优 81.3%240.861最优41.199距最优 82.9%175.394距最优 27.2%
输出速度 P05tokens/s · 越高越好42.148距最优 72.7%154.637最优25.268距最优 83.7%115.173距最优 25.5%
输出速度 P25tokens/s · 越高越好43.665距最优 79.6%214.228最优31.991距最优 85.1%146.323距最优 31.7%
输出速度 P75tokens/s · 越高越好45.688距最优 82.2%256.147最优50.982距最优 80.1%216.813距最优 15.4%
输出速度 P95tokens/s · 越高越好47.12距最优 84.3%299.929最优60.695距最优 79.8%292.323距最优 2.5%
推理耗时中位数秒 · 越低越好无数据8.304最优48.545距最优 484.6%11.403距最优 37.3%
首 token 延迟中位数秒 · 越低越好0.855距最优 101.9%0.424最优2.78距最优 556.0%1.107距最优 161.3%
首 token 延迟 P05秒 · 越低越好0.81距最优 136.7%0.342最优1.915距最优 459.7%0.851距最优 148.6%
首 token 延迟 P25秒 · 越低越好0.827距最优 122.6%0.371最优2.652距最优 613.9%0.921距最优 147.9%
首 token 延迟 P75秒 · 越低越好0.905距最优 88.2%0.481最优3.053距最优 534.6%1.271距最优 164.1%
首 token 延迟 P95秒 · 越低越好0.972距最优 14.6%0.849最优4.37距最优 414.9%1.691距最优 99.2%
首答案 token 延迟中位数秒 · 越低越好0.855最优8.727距最优 920.2%51.325距最优 5900.0%12.51距最优 1362.5%
端到端响应中位数秒 · 越低越好11.972距最优 10.8%10.803最优63.461距最优 487.4%15.361距最优 42.2%
上下文窗口tokens · 越高越好128,000距最优 87.2%192,000距最优 80.8%64,000距最优 93.6%1,000,000最优
Standard 输入价格百万 tokens · 越低越好¥0.0000最优¥0.0000最优¥4.0186不可计算¥4.0186不可计算
Standard 输出价格百万 tokens · 越低越好¥0.0000最优¥0.0000最优¥12.0558不可计算¥12.0558不可计算
Standard 缓存输入价格百万 tokens · 越低越好无数据无数据无数据无数据
terminal bench21 · 越高越好0.004距最优 99.5%0.229距最优 67.0%无数据0.693最优
terminal bench40 · 越高越好无数据0.005距最优 50.0%无数据0.01最优

人民币价格按服务端汇率 1 USD = 6.6976 CNY 折算,参考日期 2026/9/18。