Leaderboards

Benchmarks

Every score carries its origin — leaderboard is independent,vendor is self-reported. History is kept, never overwritten.

Reasoning280Coding266Math174Agentic110Chat515Speech654
Arena Code (WebDev)74Arena Coding143HumanEval0LiveBench Coding35LiveCodeBench14

LiveBench Coding

% average over LiveBench code generation and completion taskshigher is better
Provenanceindependent leaderboard35 modelsscores Jun 25, 2026
1Claude Fable 5Anthropic85.99via Max effort2Jun 25, 2026leaderboard2GPT-5.6 SolOpenAI83.94via Max6Jun 25, 2026leaderboard3GPT-5.2-CodexOpenAI83.626Jun 25, 2026leaderboard4GPT-5.6 LunaOpenAI82.92via Max63Jun 25, 2026leaderboard5GPT-5.5OpenAI82.15via xHigh8Jun 25, 2026leaderboard6Claude Opus 4.7Anthropic82.09via xHigh effort3Jun 25, 2026leaderboard7Claude Opus 4.8Anthropic81.83via Max effort3Jun 25, 2026leaderboard8Kimi K3Moonshot AI2.8T81.456~0.046Jun 25, 2026leaderboard9Claude Opus 5Anthropic81.45via Max effort3Jun 25, 2026leaderboard10Claude Sonnet 5Anthropic80.68via xHigh effort8Jun 25, 2026leaderboard11Claude Opus 4.5Anthropic79.65via Thinking 64k High effort3Jun 25, 2026leaderboard12GLM 5.2Z.AI753B79.6553~0.17Jun 25, 2026leaderboard13Claude Sonnet 4.6Anthropic79.27via Thinking Auto Medium effort5Jun 25, 2026leaderboard14Kimi K2.6Moonshot AI1.1T78.57via Thinking32~0.12Jun 25, 2026leaderboard15GPT-5.6 TerraOpenAI78.25via Max26Jun 25, 2026leaderboard16Gemini 3.5 FlashGoogle78.18via High17Jun 25, 2026leaderboard17Claude Opus 4.6Anthropic78.18via Thinking Auto High effort3Jun 25, 2026leaderboard18Qwen3.6 PlusQwen78.1840Jun 25, 2026leaderboard19Gemini 3.6 FlashGoogle77.86via High21Jun 25, 2026leaderboard20GPT-5.4OpenAI77.54via xHigh10Jun 25, 2026leaderboard21Muse Spark 1.1Meta77.16via xHigh18Jun 25, 2026leaderboard22Gemini 3.5 Flash LiteGoogle76.07via High61Jun 25, 2026leaderboard23GPT-5.2 ChatOpenAI76.07via High11Jun 25, 2026leaderboard24Qwen3.7 MaxQwen74.2220Jun 25, 2026leaderboard25Kimi K2.7 CodeMoonshot AI1.1T73.9621~0.11Jun 25, 2026leaderboard26Qwen3.6 27BQwen27.8B71.7938~4.1Jun 25, 2026leaderboard27GPT-5.4 MiniOpenAI71.62via xHigh32Jun 25, 2026leaderboard28InklingThinking Machines952B71.02via xHigh18~0.12Jun 25, 2026leaderboard29GPT-5.4 NanoOpenAI70.84via xHigh113Jun 25, 2026leaderboard30DeepSeek V4 ProDeepSeek1.6T69.9980~0.069Jun 25, 2026leaderboard31Grok 4.3xAI69.9328Jun 25, 2026leaderboard32DeepSeek V4 FlashDeepSeek291B69.23392~0.38Jun 25, 2026leaderboard33Grok 4.5xAI68.5911Jun 25, 2026leaderboard34MiniMax M3MiniMax427B68.271~0.25Jun 25, 2026leaderboard35Grok Build 0.1xAI65.3933Jun 25, 2026leaderboard

A tilde in Score / GB VRAM means the memory figure behind it is calculated from the parameter count rather than read from a published file. Those ratios are shown to two significant figures, and rows within a few percent of each other are not distinguishable.