Leaderboards
Benchmarks
Every score carries its origin — leaderboard is independent,vendor is self-reported. History is kept, never overwritten.
Arena Creative Writing143Arena Instruction Following143Arena Text (overall)143IFEval16LiveBench Instruction Following35LiveBench Language35
LiveBench Language
% average over LiveBench language comprehension taskshigher is betterProvenanceindependent leaderboard35 modelsscores Jun 25, 2026
1Claude Fable 5Anthropic90.68via Max effort2—Jun 25, 2026leaderboard2Claude Opus 5Anthropic88.69via Max effort4—Jun 25, 2026leaderboard3GPT-5.6 SolOpenAI87.68via Max6—Jun 25, 2026leaderboard4GPT-5.5OpenAI87.36via xHigh9—Jun 25, 2026leaderboard5Kimi K3Moonshot AI2.8T85.536~0.049Jun 25, 2026leaderboard6Gemini 3.5 FlashGoogle84.58via High19—Jun 25, 2026leaderboard7Gemini 3.6 FlashGoogle83.9via High22—Jun 25, 2026leaderboard8Claude Opus 4.6Anthropic83.27via Thinking Auto High effort3—Jun 25, 2026leaderboard9GPT-5.6 TerraOpenAI82.89via Max28—Jun 25, 2026leaderboard10Grok 4.5xAI82.814—Jun 25, 2026leaderboard11GPT-5.4OpenAI82.63via xHigh11—Jun 25, 2026leaderboard12Claude Opus 4.5Anthropic81.26via Thinking 64k High effort3—Jun 25, 2026leaderboard13GPT-5.2 ChatOpenAI79.81via High11—Jun 25, 2026leaderboard14Qwen3.7 MaxQwen79.7421—Jun 25, 2026leaderboard15Claude Opus 4.8Anthropic79.66via Max effort3—Jun 25, 2026leaderboard16DeepSeek V4 ProDeepSeek1.6T78.1390~0.078Jun 25, 2026leaderboard17Claude Opus 4.7Anthropic77.91via xHigh effort3—Jun 25, 2026leaderboard18Kimi K2.7 CodeMoonshot AI1.1T77.9122~0.12Jun 25, 2026leaderboard19MiniMax M3MiniMax427B76.8480~0.29Jun 25, 2026leaderboard20GLM 5.2Z.AI753B76.2451~0.16Jun 25, 2026leaderboard21Claude Sonnet 4.6Anthropic76.1via Thinking Auto Medium effort5—Jun 25, 2026leaderboard22Kimi K2.6Moonshot AI1.1T75.14via Thinking30~0.11Jun 25, 2026leaderboard23Qwen3.6 PlusQwen74.9938—Jun 25, 2026leaderboard24Claude Sonnet 5Anthropic74.97via xHigh effort7—Jun 25, 2026leaderboard25Muse Spark 1.1Meta74.34via xHigh17—Jun 25, 2026leaderboard26GPT-5.2-CodexOpenAI73.685—Jun 25, 2026leaderboard27Grok 4.3xAI73.5829—Jun 25, 2026leaderboard28InklingThinking Machines952B73.46via xHigh18~0.12Jun 25, 2026leaderboard29GPT-5.6 LunaOpenAI72.57via Max55—Jun 25, 2026leaderboard30Grok Build 0.1xAI72.4636—Jun 25, 2026leaderboard31Gemini 3.5 Flash LiteGoogle71.82via High57—Jun 25, 2026leaderboard32GPT-5.4 MiniOpenAI70.95via xHigh32—Jun 25, 2026leaderboard33DeepSeek V4 FlashDeepSeek291B70.12398~0.38Jun 25, 2026leaderboard34Qwen3.6 27BQwen27.8B63.333~3.6Jun 25, 2026leaderboard35GPT-5.4 NanoOpenAI62.51via xHigh100—Jun 25, 2026leaderboard
A tilde in Score / GB VRAM means the memory figure behind it is calculated from the parameter count rather than read from a published file. Those ratios are shown to two significant figures, and rows within a few percent of each other are not distinguishable.