Leaderboards

Benchmarks

Every score carries its origin — leaderboard is independent,vendor is self-reported. History is kept, never overwritten.

Reasoning280Coding266Math174Agentic110Chat515Speech654
Arena Creative Writing143Arena Instruction Following143Arena Text (overall)143IFEval16LiveBench Instruction Following35LiveBench Language35

LiveBench Instruction Following

% average over LiveBench constrained-rewriting taskshigher is better
Provenanceindependent leaderboard35 modelsscores Jun 25, 2026
1Claude Fable 5Anthropic75.77via Max effort2Jun 25, 2026leaderboard2Gemini 3.5 FlashGoogle75.6via High17Jun 25, 2026leaderboard3Gemini 3.6 FlashGoogle75.37via High20Jun 25, 2026leaderboard4Qwen3.7 MaxQwen74.0420Jun 25, 2026leaderboard5Claude Opus 4.8Anthropic72.03via Max effort3Jun 25, 2026leaderboard6GPT-5.6 SolOpenAI71.85via Max5Jun 25, 2026leaderboard7Grok 4.5xAI71.5312Jun 25, 2026leaderboard8Kimi K3Moonshot AI2.8T71.365~0.041Jun 25, 2026leaderboard9GPT-5.5OpenAI70.73via xHigh7Jun 25, 2026leaderboard10GPT-5.4OpenAI70.22via xHigh9Jun 25, 2026leaderboard11InklingThinking Machines952B70.1via xHigh17~0.12Jun 25, 2026leaderboard12Muse Spark 1.1Meta69.64via xHigh16Jun 25, 2026leaderboard13Gemini 3.5 Flash LiteGoogle67.24via High54Jun 25, 2026leaderboard14GPT-5.4 NanoOpenAI67.2via xHigh108Jun 25, 2026leaderboard15Claude Opus 4.7Anthropic66.74via xHigh effort3Jun 25, 2026leaderboard16GPT-5.2-CodexOpenAI66.455Jun 25, 2026leaderboard17Grok Build 0.1xAI65.2233Jun 25, 2026leaderboard18GPT-5.6 TerraOpenAI64.62via Max22Jun 25, 2026leaderboard19Kimi K2.6Moonshot AI1.1T64.36via Thinking26~0.096Jun 25, 2026leaderboard20Claude Sonnet 5Anthropic63.86via xHigh effort6Jun 25, 2026leaderboard21Claude Opus 5Anthropic63.77via Max effort3Jun 25, 2026leaderboard22Claude Opus 4.6Anthropic63.31via Thinking Auto High effort3Jun 25, 2026leaderboard23Claude Sonnet 4.6Anthropic63.22via Thinking Auto Medium effort4Jun 25, 2026leaderboard24DeepSeek V4 FlashDeepSeek291B63.14358~0.34Jun 25, 2026leaderboard25Grok 4.3xAI62.7525Jun 25, 2026leaderboard26Claude Opus 4.5Anthropic62.55via Thinking 64k High effort3Jun 25, 2026leaderboard27DeepSeek V4 ProDeepSeek1.6T62.3572~0.062Jun 25, 2026leaderboard28GLM 5.2Z.AI753B62.2942~0.13Jun 25, 2026leaderboard29GPT-5.2 ChatOpenAI61.77via High9Jun 25, 2026leaderboard30GPT-5.6 LunaOpenAI60.12via Max46Jun 25, 2026leaderboard31GPT-5.4 MiniOpenAI59.8via xHigh27Jun 25, 2026leaderboard32Qwen3.6 PlusQwen58.3430Jun 25, 2026leaderboard33MiniMax M3MiniMax427B57.5160~0.21Jun 25, 2026leaderboard34Kimi K2.7 CodeMoonshot AI1.1T56.2916~0.084Jun 25, 2026leaderboard35Qwen3.6 27BQwen27.8B53.2328~3Jun 25, 2026leaderboard

A tilde in Score / GB VRAM means the memory figure behind it is calculated from the parameter count rather than read from a published file. Those ratios are shown to two significant figures, and rows within a few percent of each other are not distinguishable.