The Aigentic logo
Subscribe

ModelsLiveBench

LiveBench

LiveBench is an objective, contamination-resistant benchmark: questions are refreshed so models cannot memorize the test set. Pick a category below: Overall plus Reasoning, Coding, Agentic Coding, Math, Data Analysis, Language, and Instruction Following (IF). Overall is the mean of category averages. This page mirrors the LiveBench-2026-06-25 public release.

Newer flagships (including Grok 4.7) may be absent until the next LiveBench refresh — a missing row is not a score of zero. For human preference across multiple Arena boards, see LMArena boards. For the Artificial Analysis Index cut used elsewhere on the site, see Models. Also: Price vs value · Pricing history.

Snapshot as of Jun 25, 2026 (LiveBench-2026-06-25). Not investment advice. Figures lag the labs. Prefer livebench.ai for the latest release.

Overall

Mean of category averages. Higher is better.

Bars scaled to this board's score range (not from zero), so small gaps show up.

Frontier closedOpen weight
  • Claude Fable 5.183.4
  • Claude Fable 583
  • GPT-6 Astra82.2
  • Muse Spark 1.381.6
  • DeepSeek V4.1 Flash81.1
  • GPT-5.6 Sol81
  • GPT-5.580.2
  • Claude Opus 580.1
  • Kimi K379.2
  • Gemini 3.7 Flash78.8
  • Qwen3.8 Max78.5
  • Grok 4.678
  • Muse Spark 1.278
  • GPT-5.6 Terra77.9
  • Gemini 3.1 Pro Preview77
  • GPT-5.4 Mini66.4
  • Qwen3.6 27B64
  • Grok 4.362.3

Full table

Sortable detail across all categories. Models missing a category score show an em dash in that column.

  • #1 Claude Fable 5.1

    Anthropic · Max Effort

    Overall
    83.4
    Cost / task
    $1.212
    Reasoning
    91.7
    Coding
    86.4
    Agentic Coding
    66.1
    Math
    97
    Data Analysis
    80.3
    Language
    89.5
    IF
    73
  • #2 Claude Fable 5

    Anthropic · Max Effort

    Overall
    83
    Cost / task
    $1.439
    Reasoning
    89.7
    Coding
    86
    Agentic Coding
    62.2
    Math
    96
    Data Analysis
    80.5
    Language
    90.7
    IF
    75.8
  • #3 GPT-6 Astra

    OpenAI · Max Effort

    Overall
    82.2
    Cost / task
    $0.736
    Reasoning
    92.7
    Coding
    80.4
    Agentic Coding
    57.3
    Math
    96.8
    Data Analysis
    83
    Language
    89.4
    IF
    75.6
  • #4 Muse Spark 1.3

    Meta · xHigh

    Overall
    81.6
    Cost / task
    $0.219
    Reasoning
    89.7
    Coding
    81.1
    Agentic Coding
    64.1
    Math
    95.9
    Data Analysis
    79.6
    Language
    82.8
    IF
    78
  • #5 DeepSeek V4.1 Flash

    DeepSeek · Max · Open

    Overall
    81.1
    Cost / task
    $0.029
    Reasoning
    86.7
    Coding
    80
    Agentic Coding
    77.3
    Math
    93.3
    Data Analysis
    79.3
    Language
    81.2
    IF
    70
  • #6 GPT-5.6 Sol

    OpenAI · Max Effort

    Overall
    81
    Cost / task
    $0.515
    Reasoning
    91.7
    Coding
    83.9
    Agentic Coding
    56.2
    Math
    96.2
    Data Analysis
    79.8
    Language
    87.7
    IF
    71.8
  • #7 GPT-5.5

    OpenAI · xHigh Thinking

    Overall
    80.2
    Cost / task
    $0.435
    Reasoning
    89.7
    Coding
    82.1
    Agentic Coding
    54
    Math
    95.9
    Data Analysis
    81.6
    Language
    87.4
    IF
    70.7
  • #8 Claude Opus 5

    Anthropic · Max Effort Thinking

    Overall
    80.1
    Cost / task
    $0.699
    Reasoning
    91.2
    Coding
    81.4
    Agentic Coding
    65.2
    Math
    95.7
    Data Analysis
    74.6
    Language
    88.7
    IF
    63.8
  • #9 Kimi K3

    Moonshot · Open

    Overall
    79.2
    Cost / task
    $0.348
    Reasoning
    90.7
    Coding
    81.4
    Agentic Coding
    62.2
    Math
    84.4
    Data Analysis
    78.7
    Language
    85.5
    IF
    71.4
  • #10 Gemini 3.7 Flash

    Google · High

    Overall
    78.8
    Cost / task
    $0.157
    Reasoning
    87.8
    Coding
    78.9
    Agentic Coding
    58.3
    Math
    93.5
    Data Analysis
    68
    Language
    85.5
    IF
    79.9
  • #11 Qwen3.8 Max

    Alibaba · Open

    Overall
    78.5
    Cost / task
    $0.275
    Reasoning
    88.2
    Coding
    72.9
    Agentic Coding
    64.6
    Math
    91.3
    Data Analysis
    78.4
    Language
    79.7
    IF
    74.1
  • #12 Grok 4.6

    xAI

    Overall
    78
    Cost / task
    $0.207
    Reasoning
    90.5
    Coding
    76.8
    Agentic Coding
    57
    Math
    92.6
    Data Analysis
    73.9
    Language
    83.7
    IF
    71.9
  • #14 Muse Spark 1.2

    Meta · xHigh

    Overall
    78
    Cost / task
    Reasoning
    Coding
    Agentic Coding
    Math
    Data Analysis
    Language
    IF
  • #13 GPT-5.6 Terra

    OpenAI · Max Effort

    Overall
    77.9
    Cost / task
    $0.352
    Reasoning
    90.6
    Coding
    78.2
    Agentic Coding
    54.9
    Math
    94.9
    Data Analysis
    79.3
    Language
    82.9
    IF
    64.6
  • #15 Gemini 3.1 Pro Preview

    Google · High

    Overall
    77
    Cost / task
    $0.286
    Reasoning
    84
    Coding
    76.5
    Agentic Coding
    44.1
    Math
    91
    Data Analysis
    78.5
    Language
    85.4
    IF
    79.1
  • #16 GPT-5.4 Mini

    OpenAI · xHigh

    Overall
    66.4
    Cost / task
    $0.334
    Reasoning
    71.3
    Coding
    71.6
    Agentic Coding
    41.7
    Math
    78.5
    Data Analysis
    70.8
    Language
    71
    IF
    59.8
  • #17 Qwen3.6 27B

    Alibaba · Open

    Overall
    64
    Cost / task
    $0.202
    Reasoning
    70.3
    Coding
    71.8
    Agentic Coding
    39.3
    Math
    79.9
    Data Analysis
    70.4
    Language
    63.3
    IF
    53.2
  • #18 Grok 4.3

    xAI

    Overall
    62.3
    Cost / task
    Reasoning
    Coding
    Agentic Coding
    Math
    Data Analysis
    Language
    IF

the aigentic

Know what matters in AI.

The stories shaping AI, the tools worth trying, and what they mean for your work.

Morning Brief + Closing Time. Two emails every weekday.

Free. Unsubscribe anytime.