Leaderboards
Benchmarks
Every score carries its origin — leaderboard is independent,vendor is self-reported. History is kept, never overwritten.
LiveBench Agentic Coding
% average over LiveBench agentic coding tasks, run inside an agent harnesshigher is betterProvenanceindependent leaderboard35 modelsscores Jun 25, 2026
1Claude Opus 5Anthropic65.2via Max effort3—Jun 25, 2026leaderboard2Kimi K3Moonshot AI2.8T62.174~0.035Jun 25, 2026leaderboard3Claude Fable 5Anthropic62.17via Max effort1—Jun 25, 2026leaderboard4Claude Sonnet 5Anthropic59.39via xHigh effort6—Jun 25, 2026leaderboard5Muse Spark 1.1Meta58.54via xHigh14—Jun 25, 2026leaderboard6Grok 4.5xAI56.469—Jun 25, 2026leaderboard7GPT-5.6 SolOpenAI56.21via Max4—Jun 25, 2026leaderboard8GPT-5.6 TerraOpenAI54.95via Max18—Jun 25, 2026leaderboard9GPT-5.5OpenAI53.99via xHigh5—Jun 25, 2026leaderboard10GPT-5.4OpenAI53.84via xHigh7—Jun 25, 2026leaderboard11GLM 5.2Z.AI753B51.7735~0.11Jun 25, 2026leaderboard12Claude Opus 4.7Anthropic50.66via xHigh effort2—Jun 25, 2026leaderboard13Claude Opus 4.8Anthropic50.51via Max effort2—Jun 25, 2026leaderboard14GPT-5.2 ChatOpenAI50.25via High7—Jun 25, 2026leaderboard15InklingThinking Machines952B49.39via xHigh12~0.082Jun 25, 2026leaderboard16GPT-5.2-CodexOpenAI49.394—Jun 25, 2026leaderboard17Claude Opus 4.6Anthropic48.99via Thinking Auto High effort2—Jun 25, 2026leaderboard18Gemini 3.5 FlashGoogle48.99via High11—Jun 25, 2026leaderboard19GPT-5.6 LunaOpenAI48.43via Max37—Jun 25, 2026leaderboard20Kimi K2.6Moonshot AI1.1T46.92via Thinking19~0.07Jun 25, 2026leaderboard21GPT-5.4 NanoOpenAI46.77via xHigh75—Jun 25, 2026leaderboard22Grok Build 0.1xAI45.8123—Jun 25, 2026leaderboard23Kimi K2.7 CodeMoonshot AI1.1T45.6613~0.068Jun 25, 2026leaderboard24Gemini 3.5 Flash LiteGoogle45.25via High36—Jun 25, 2026leaderboard25Qwen3.7 MaxQwen43.5912—Jun 25, 2026leaderboard26Gemini 3.6 FlashGoogle43.43via High12—Jun 25, 2026leaderboard27Claude Sonnet 4.6Anthropic42.63via Thinking Auto Medium effort3—Jun 25, 2026leaderboard28DeepSeek V4 ProDeepSeek1.6T42.6349~0.042Jun 25, 2026leaderboard29GPT-5.4 MiniOpenAI41.67via xHigh19—Jun 25, 2026leaderboard30Qwen3.6 PlusQwen41.3621—Jun 25, 2026leaderboard31MiniMax M3MiniMax427B40.6642~0.15Jun 25, 2026leaderboard32Claude Opus 4.5Anthropic39.7via Thinking 64k High effort2—Jun 25, 2026leaderboard33Qwen3.6 27BQwen27.8B39.2921~2.2Jun 25, 2026leaderboard34DeepSeek V4 FlashDeepSeek291B37.63213~0.21Jun 25, 2026leaderboard35Grok 4.3xAI18.547—Jun 25, 2026leaderboard
A tilde in Score / GB VRAM means the memory figure behind it is calculated from the parameter count rather than read from a published file. Those ratios are shown to two significant figures, and rows within a few percent of each other are not distinguishable.