Leaderboards

Benchmarks

Every score carries its origin — leaderboard is independent,vendor is self-reported. History is kept, never overwritten.

Reasoning280Coding266Math174Agentic110Chat515Speech654
Arena Hard Prompts143GPQA Diamond16LiveBench35LiveBench Data Analysis35LiveBench Reasoning35MMLU0MMLU-Pro16

LiveBench

Average % across monthly-refreshed reasoning/coding/math taskshigher is better
Provenanceindependent leaderboard35 modelsscores Jun 25, 2026
1Claude Fable 5Anthropic82.97via Max effort2Jun 25, 2026leaderboard2GPT-5.6 SolOpenAI81.05via Max5Jun 25, 2026leaderboard3GPT-5.5OpenAI80.19via xHigh8Jun 25, 2026leaderboard4Claude Opus 5Anthropic80.08via Max effort3Jun 25, 2026leaderboard5Kimi K3Moonshot AI2.8T79.196~0.045Jun 25, 2026leaderboard6GPT-5.4OpenAI77.97via xHigh10Jun 25, 2026leaderboard7GPT-5.6 TerraOpenAI77.94via Max26Jun 25, 2026leaderboard8Claude Opus 4.7Anthropic76.53via xHigh effort3Jun 25, 2026leaderboard9Claude Opus 4.8Anthropic76.22via Max effort3Jun 25, 2026leaderboard10Claude Sonnet 5Anthropic76.04via xHigh effort8Jun 25, 2026leaderboard11Grok 4.5xAI75.7713Jun 25, 2026leaderboard12Muse Spark 1.1Meta75.3via xHigh18Jun 25, 2026leaderboard13Gemini 3.5 FlashGoogle74.64via High17Jun 25, 2026leaderboard14GPT-5.2 ChatOpenAI74.63via High11Jun 25, 2026leaderboard15Claude Opus 4.6Anthropic74.52via Thinking Auto High effort3Jun 25, 2026leaderboard16GPT-5.2-CodexOpenAI73.985Jun 25, 2026leaderboard17Gemini 3.6 FlashGoogle73.59via High20Jun 25, 2026leaderboard18GPT-5.6 LunaOpenAI73.56via Max56Jun 25, 2026leaderboard19GLM 5.2Z.AI753B73.1649~0.15Jun 25, 2026leaderboard20Qwen3.7 MaxQwen73.1420Jun 25, 2026leaderboard21Claude Sonnet 4.6Anthropic72.99via Thinking Auto Medium effort5Jun 25, 2026leaderboard22Claude Opus 4.5Anthropic72.58via Thinking 64k High effort3Jun 25, 2026leaderboard23InklingThinking Machines952B71.92via xHigh18~0.12Jun 25, 2026leaderboard24DeepSeek V4 ProDeepSeek1.6T71.5782~0.071Jun 25, 2026leaderboard25Kimi K2.6Moonshot AI1.1T70.54via Thinking28~0.11Jun 25, 2026leaderboard26GPT-5.4 NanoOpenAI69.58via xHigh111Jun 25, 2026leaderboard27Qwen3.6 PlusQwen68.9135Jun 25, 2026leaderboard28Kimi K2.7 CodeMoonshot AI1.1T68.4120~0.1Jun 25, 2026leaderboard29Grok Build 0.1xAI67.7834Jun 25, 2026leaderboard30MiniMax M3MiniMax427B67.2670~0.25Jun 25, 2026leaderboard31GPT-5.4 MiniOpenAI66.37via xHigh29Jun 25, 2026leaderboard32DeepSeek V4 FlashDeepSeek291B65.48371~0.36Jun 25, 2026leaderboard33Qwen3.6 27BQwen27.8B64.0334~3.7Jun 25, 2026leaderboard34Gemini 3.5 Flash LiteGoogle63.94via High51Jun 25, 2026leaderboard35Grok 4.3xAI62.2525Jun 25, 2026leaderboard

A tilde in Score / GB VRAM means the memory figure behind it is calculated from the parameter count rather than read from a published file. Those ratios are shown to two significant figures, and rows within a few percent of each other are not distinguishable.