Leaderboards

Benchmarks

Every score carries its origin — leaderboard is independent,vendor is self-reported. History is kept, never overwritten.

Reasoning280Coding266Math174Agentic110Chat515Speech654
Arena Creative Writing143Arena Instruction Following143Arena Text (overall)143IFEval16LiveBench Instruction Following35LiveBench Language35

LiveBench Language

% average over LiveBench language comprehension taskshigher is better
Provenanceindependent leaderboard35 modelsscores Jun 25, 2026
1Claude Fable 5Anthropic90.68via Max effort2Jun 25, 2026leaderboard2Claude Opus 5Anthropic88.69via Max effort4Jun 25, 2026leaderboard3GPT-5.6 SolOpenAI87.68via Max6Jun 25, 2026leaderboard4GPT-5.5OpenAI87.36via xHigh9Jun 25, 2026leaderboard5Kimi K3Moonshot AI2.8T85.536~0.049Jun 25, 2026leaderboard6Gemini 3.5 FlashGoogle84.58via High19Jun 25, 2026leaderboard7Gemini 3.6 FlashGoogle83.9via High22Jun 25, 2026leaderboard8Claude Opus 4.6Anthropic83.27via Thinking Auto High effort3Jun 25, 2026leaderboard9GPT-5.6 TerraOpenAI82.89via Max28Jun 25, 2026leaderboard10Grok 4.5xAI82.814Jun 25, 2026leaderboard11GPT-5.4OpenAI82.63via xHigh11Jun 25, 2026leaderboard12Claude Opus 4.5Anthropic81.26via Thinking 64k High effort3Jun 25, 2026leaderboard13GPT-5.2 ChatOpenAI79.81via High11Jun 25, 2026leaderboard14Qwen3.7 MaxQwen79.7421Jun 25, 2026leaderboard15Claude Opus 4.8Anthropic79.66via Max effort3Jun 25, 2026leaderboard16DeepSeek V4 ProDeepSeek1.6T78.1390~0.078Jun 25, 2026leaderboard17Claude Opus 4.7Anthropic77.91via xHigh effort3Jun 25, 2026leaderboard18Kimi K2.7 CodeMoonshot AI1.1T77.9122~0.12Jun 25, 2026leaderboard19MiniMax M3MiniMax427B76.8480~0.29Jun 25, 2026leaderboard20GLM 5.2Z.AI753B76.2451~0.16Jun 25, 2026leaderboard21Claude Sonnet 4.6Anthropic76.1via Thinking Auto Medium effort5Jun 25, 2026leaderboard22Kimi K2.6Moonshot AI1.1T75.14via Thinking30~0.11Jun 25, 2026leaderboard23Qwen3.6 PlusQwen74.9938Jun 25, 2026leaderboard24Claude Sonnet 5Anthropic74.97via xHigh effort7Jun 25, 2026leaderboard25Muse Spark 1.1Meta74.34via xHigh17Jun 25, 2026leaderboard26GPT-5.2-CodexOpenAI73.685Jun 25, 2026leaderboard27Grok 4.3xAI73.5829Jun 25, 2026leaderboard28InklingThinking Machines952B73.46via xHigh18~0.12Jun 25, 2026leaderboard29GPT-5.6 LunaOpenAI72.57via Max55Jun 25, 2026leaderboard30Grok Build 0.1xAI72.4636Jun 25, 2026leaderboard31Gemini 3.5 Flash LiteGoogle71.82via High57Jun 25, 2026leaderboard32GPT-5.4 MiniOpenAI70.95via xHigh32Jun 25, 2026leaderboard33DeepSeek V4 FlashDeepSeek291B70.12398~0.38Jun 25, 2026leaderboard34Qwen3.6 27BQwen27.8B63.333~3.6Jun 25, 2026leaderboard35GPT-5.4 NanoOpenAI62.51via xHigh100Jun 25, 2026leaderboard

A tilde in Score / GB VRAM means the memory figure behind it is calculated from the parameter count rather than read from a published file. Those ratios are shown to two significant figures, and rows within a few percent of each other are not distinguishable.