Leaderboards

Benchmarks

Every score carries its origin — leaderboard is independent,vendor is self-reported. History is kept, never overwritten.

Reasoning280Coding266Math174Agentic110Chat515Speech654
Arena Agent (IPS)36LiveBench Agentic Coding35SWE-bench Verified39

LiveBench Agentic Coding

% average over LiveBench agentic coding tasks, run inside an agent harnesshigher is better
Provenanceindependent leaderboard35 modelsscores Jun 25, 2026
1Claude Opus 5Anthropic65.2via Max effort3Jun 25, 2026leaderboard2Kimi K3Moonshot AI2.8T62.174~0.035Jun 25, 2026leaderboard3Claude Fable 5Anthropic62.17via Max effort1Jun 25, 2026leaderboard4Claude Sonnet 5Anthropic59.39via xHigh effort6Jun 25, 2026leaderboard5Muse Spark 1.1Meta58.54via xHigh14Jun 25, 2026leaderboard6Grok 4.5xAI56.469Jun 25, 2026leaderboard7GPT-5.6 SolOpenAI56.21via Max4Jun 25, 2026leaderboard8GPT-5.6 TerraOpenAI54.95via Max18Jun 25, 2026leaderboard9GPT-5.5OpenAI53.99via xHigh5Jun 25, 2026leaderboard10GPT-5.4OpenAI53.84via xHigh7Jun 25, 2026leaderboard11GLM 5.2Z.AI753B51.7735~0.11Jun 25, 2026leaderboard12Claude Opus 4.7Anthropic50.66via xHigh effort2Jun 25, 2026leaderboard13Claude Opus 4.8Anthropic50.51via Max effort2Jun 25, 2026leaderboard14GPT-5.2 ChatOpenAI50.25via High7Jun 25, 2026leaderboard15InklingThinking Machines952B49.39via xHigh12~0.082Jun 25, 2026leaderboard16GPT-5.2-CodexOpenAI49.394Jun 25, 2026leaderboard17Claude Opus 4.6Anthropic48.99via Thinking Auto High effort2Jun 25, 2026leaderboard18Gemini 3.5 FlashGoogle48.99via High11Jun 25, 2026leaderboard19GPT-5.6 LunaOpenAI48.43via Max37Jun 25, 2026leaderboard20Kimi K2.6Moonshot AI1.1T46.92via Thinking19~0.07Jun 25, 2026leaderboard21GPT-5.4 NanoOpenAI46.77via xHigh75Jun 25, 2026leaderboard22Grok Build 0.1xAI45.8123Jun 25, 2026leaderboard23Kimi K2.7 CodeMoonshot AI1.1T45.6613~0.068Jun 25, 2026leaderboard24Gemini 3.5 Flash LiteGoogle45.25via High36Jun 25, 2026leaderboard25Qwen3.7 MaxQwen43.5912Jun 25, 2026leaderboard26Gemini 3.6 FlashGoogle43.43via High12Jun 25, 2026leaderboard27Claude Sonnet 4.6Anthropic42.63via Thinking Auto Medium effort3Jun 25, 2026leaderboard28DeepSeek V4 ProDeepSeek1.6T42.6349~0.042Jun 25, 2026leaderboard29GPT-5.4 MiniOpenAI41.67via xHigh19Jun 25, 2026leaderboard30Qwen3.6 PlusQwen41.3621Jun 25, 2026leaderboard31MiniMax M3MiniMax427B40.6642~0.15Jun 25, 2026leaderboard32Claude Opus 4.5Anthropic39.7via Thinking 64k High effort2Jun 25, 2026leaderboard33Qwen3.6 27BQwen27.8B39.2921~2.2Jun 25, 2026leaderboard34DeepSeek V4 FlashDeepSeek291B37.63213~0.21Jun 25, 2026leaderboard35Grok 4.3xAI18.547Jun 25, 2026leaderboard

A tilde in Score / GB VRAM means the memory figure behind it is calculated from the parameter count rather than read from a published file. Those ratios are shown to two significant figures, and rows within a few percent of each other are not distinguishable.