The Latent Score

AI model rankings: The Latent Score

As of 2026-10-10, Opus 5.5 leads The Latent Score on the point estimate at 144.2 points among 31 ranked models. Rankings describe published capability evidence, not a statistically proven winner or the best model for every workload.

One score summarizes demonstrated capability across published reasoning settings and seven equally weighted domains. Related benchmark variants share a family budget, and influence from one evaluator is capped.

Anchored at mean 100, SD 15 across a frozen 18-model cohort. This is a fixed reference scale, not human IQ or the average of today’s models.

144.2leading score · Opus 5.5
92benchmarks inside the fit
7capability domains
v1.0frozen methodology version

Headline

The Latent Score

  1. 1

    Opus 5.5United States

    Anthropic

    144.2
    Stability range
    133.3–155.2
    Contributing
    13
    Domains
  2. 2139.2
    Stability range
    128–150.2
    Contributing
    54
    Domains
  3. 3134.8
    Stability range
    123.4–146.9
    Contributing
    9
    Domains
  4. 4

    Fable 5.1United States

    Anthropic

    134.7
    Stability range
    125.6–143.8
    Contributing
    40
    Domains
  5. 5

    Sonnet 5.5United States

    Anthropic

    132.5
    Stability range
    118.6–147
    Contributing
    9
    Domains
  6. 6

    Opus 5United States

    Anthropic

    129.2
    Stability range
    123.6–134.8
    Contributing
    69
    Domains
  7. 7125.8
    Stability range
    112–138.3
    Contributing
    12
    Domains
  8. 8

    Fable 5United States

    Anthropic

    120.0
    Stability range
    112.9–126.8
    Contributing
    57
    Domains
  9. 9118.2
    Stability range
    100.3–136
    Contributing
    4
    Domains
  10. 10

    GPT-6 SolUnited States

    OpenAI

    117.5
    Stability range
    103.7–132.8
    Contributing
    9
    Domains
  11. 11114.2
    Stability range
    102.3–125.8
    Contributing
    13
    Domains
  12. 12113.0
    Stability range
    99.7–128.3
    Contributing
    10
    Domains
  13. 13111.9
    Stability range
    103.8–119.6
    Contributing
    88
    Domains
  14. 14111.3
    Stability range
    94.2–129.6
    Contributing
    6
    Domains
  15. 15105.7
    Stability range
    97.1–115.5
    Contributing
    27
    Domains
  16. 16

    Kimi K3China

    Moonshot AI

    104.0
    Stability range
    95.2–112.5
    Contributing
    67
    Domains
  17. 17103.8
    Stability range
    92.2–115.3
    Contributing
    42
    Domains
  18. 18102.8
    Stability range
    90.4–113.4
    Contributing
    40
    Domains
  19. 19101.4
    Stability range
    91.2–111.5
    Contributing
    41
    Domains
  20. 20100.5
    Stability range
    83.8–117.2
    Contributing
    6
    Domains
  21. 2197.3
    Stability range
    80.8–116.9
    Contributing
    7
    Domains
  22. 2295.1
    Stability range
    88.8–101.3
    Contributing
    54
    Domains
  23. 2394.4
    Stability range
    80.3–108.1
    Contributing
    7
    Domains
  24. 2493.1
    Stability range
    83.8–103.2
    Contributing
    46
    Domains
  25. 2592.2
    Stability range
    83.7–100.7
    Contributing
    36
    Domains
  26. 2686.2
    Stability range
    77.1–95.3
    Contributing
    38
    Domains
  27. 27

    Mistral Large 4France

    Mistral AI

    83.0
    Stability range
    65.7–100.7
    Contributing
    4
    Domains
  28. 2881.3
    Stability range
    73–90.1
    Contributing
    54
    Domains
  29. 29

    Sonnet 5United States

    Anthropic

    81.3
    Stability range
    74.3–88.5
    Contributing
    51
    Domains
  30. 3070.5
    Stability range
    61.5–79.3
    Contributing
    40
    Domains
  31. 3167.1
    Stability range
    59.5–73.3
    Contributing
    39
    Domains
Domain fingerprint, left to right
  1. Knowledge & reasoning
  2. Coding & software engineering
  3. Agentic tool & computer use
  4. Professional & real-world work
  5. Multimodal & vision
  6. Cybersecurity
  7. Preference & communication

What does the stability range mean?

The score stability range is a 95% bootstrap score interval conditional on frozen calibration and comparable evidence availability. It resamples benchmark families and evaluators and adds a frozen missing-evidence correction. It excludes selection across reasoning settings, selective publication, calibration changes and new domains. It is not a 95% guarantee about true capability or where a future score will land. Sparse or conflicting evidence can widen the range.

It does not measure how consistently a model answers repeated prompts. Ranks follow point estimates, not a confidence test. Methodology, evidence and uncertainty →

Domain profile

Seven capability domains

Domain scores are in calibration-cohort SD units within each domain.
Browse the benchmark database →

Knowledge & reasoning

17 benchmarks in this domain
  1. GPT-6 Astra+1.44
  2. Opus 5.5+1.37
  3. Fable 5.1+1.13
  4. Gemini 4 Argon+1.02
  5. Sonnet 5.5+0.94
  6. Opus 5+0.91
  7. GPT-6.1 Sol+0.81
  8. Fable 5+0.68
  9. GPT-6 Sol+0.64
  10. MiMo-V2.6-Pro+0.61
  11. Muse Spark 1.3+0.58
  12. GPT-5.6 Sol+0.54
  13. Gemini 3.8 Flash+0.33
  14. Grok 4.7+0.32
  15. Grok 4.6+0.17
  16. Gemini 3.7 Flash+0.12
  17. Claude Haiku 5.5+0.09
  18. DeepSeek V4.1-Flash-0.09
  19. Kimi K3-0.11
  20. GPT-5.6 Terra-0.12
  21. GLM-5.3-0.13
  22. Muse Spark 1.2-0.16
  23. GPT-6 Luna-0.18
  24. Qwen3.8-Max-0.22
  25. GLM 5.3 Flash-0.25
  26. Sonnet 5-0.40
  27. DeepSeek V4 Pro-0.48
  28. Mistral Large 4-0.71
  29. GPT-5.6 Luna-0.73
  30. DeepSeek V4 Flash-0.89
  31. Qwen3.8-27B-1.08

Coding & software engineering

20 benchmarks in this domain
  1. Opus 5.5+1.37
  2. GPT-6 Astra+1.22
  3. Gemini 4 Argon+1.21
  4. Fable 5.1+1.16
  5. Sonnet 5.5+1.03
  6. Opus 5+0.88
  7. MiMo-V2.6-Pro+0.87
  8. Fable 5+0.65
  9. DeepSeek V4.1-Flash+0.62
  10. GPT-6 Sol+0.55
  11. Grok 4.7+0.47
  12. Muse Spark 1.3+0.46
  13. GPT-6.1 Sol+0.36
  14. Grok 4.6+0.35
  15. GLM-5.3+0.21
  16. GPT-5.6 Sol+0.19
  17. Kimi K3+0.16
  18. Claude Haiku 5.5+0.08
  19. Gemini 3.8 Flash+0.04
  20. GPT-6 Luna+0.03
  21. DeepSeek V4 Pro-0.06
  22. Gemini 3.7 Flash-0.10
  23. GPT-5.6 Terra-0.12
  24. Qwen3.8-Max-0.24
  25. GLM 5.3 Flash-0.30
  26. Muse Spark 1.2-0.31
  27. Mistral Large 4-0.40
  28. GPT-5.6 Luna-0.40
  29. Sonnet 5-0.54
  30. DeepSeek V4 Flash-0.79
  31. Qwen3.8-27B-1.09

Agentic tool & computer use

17 benchmarks in this domain
  1. Opus 5.5+1.26
  2. GPT-6 Astra+1.14
  3. Sonnet 5.5+0.99
  4. Fable 5.1+0.92
  5. Gemini 4 Argon+0.80
  6. Opus 5+0.78
  7. MiMo-V2.6-Pro+0.53
  8. GPT-6 Sol+0.46
  9. DeepSeek V4.1-Flash+0.41
  10. Grok 4.6+0.39
  11. GPT-5.6 Sol+0.37
  12. Muse Spark 1.3+0.34
  13. Gemini 3.8 Flash+0.26
  14. Fable 5+0.20
  15. GPT-5.6 Terra+0.12
  16. GLM-5.3+0.10
  17. GLM 5.3 Flash+0.06
  18. Gemini 3.7 Flash-0.04
  19. GPT-6 Luna-0.05
  20. Kimi K3-0.06
  21. Claude Haiku 5.5-0.15
  22. Muse Spark 1.2-0.19
  23. Qwen3.8-Max-0.27
  24. GPT-5.6 Luna-0.41
  25. DeepSeek V4 Pro-0.58
  26. Qwen3.8-27B-0.65
  27. Sonnet 5-0.69
  28. DeepSeek V4 Flash-0.77

Professional & real-world work

21 benchmarks in this domain
  1. Opus 5.5+1.17
  2. Gemini 4 Argon+1.12
  3. Fable 5.1+0.91
  4. Sonnet 5.5+0.90
  5. Opus 5+0.83
  6. MiMo-V2.6-Pro+0.69
  7. Fable 5+0.68
  8. GPT-6 Astra+0.59
  9. Muse Spark 1.3+0.53
  10. GPT-5.6 Sol+0.18
  11. GLM-5.3+0.17
  12. Kimi K3+0.02
  13. Grok 4.6-0.01
  14. Gemini 3.7 Flash-0.09
  15. Muse Spark 1.2-0.16
  16. Gemini 3.8 Flash-0.20
  17. GPT-5.6 Terra-0.23
  18. Qwen3.8-Max-0.25
  19. Sonnet 5-0.38
  20. GPT-5.6 Luna-0.46
  21. DeepSeek V4 Pro-0.64
  22. Qwen3.8-27B-0.77
  23. DeepSeek V4 Flash-0.97

Multimodal & vision

10 benchmarks in this domain
  1. Opus 5.5+1.16
  2. GPT-6 Astra+1.08
  3. Opus 5+0.74
  4. Fable 5.1+0.67
  5. GPT-6.1 Sol+0.56
  6. Fable 5+0.55
  7. GPT-5.6 Sol+0.44
  8. GPT-6 Sol+0.42
  9. Gemini 3.7 Flash+0.25
  10. Kimi K3+0.19
  11. Muse Spark 1.3+0.12
  12. Grok 4.6+0.09
  13. Qwen3.8-Max+0.06
  14. Gemini 3.8 Flash-0.04
  15. GLM-5.3-0.05
  16. GPT-6 Luna-0.13
  17. GLM 5.3 Flash-0.19
  18. Muse Spark 1.2-0.21
  19. GPT-5.6 Terra-0.29
  20. Qwen3.8-27B-0.48
  21. Mistral Large 4-0.54
  22. GPT-5.6 Luna-0.54
  23. Sonnet 5-0.67
  24. DeepSeek V4 Flash-0.97

Cybersecurity

3 benchmarks in this domain
  1. GPT-6 Astra+0.98
  2. MiMo-V2.6-Pro+0.98
  3. Opus 5+0.61
  4. DeepSeek V4.1-Flash+0.59
  5. GPT-5.6 Sol+0.37
  6. GLM-5.3+0.12
  7. Grok 4.6+0.08
  8. Gemini 3.7 Flash+0.07
  9. Kimi K3+0.02
  10. DeepSeek V4 Pro-0.18
  11. Qwen3.8-Max-0.30
  12. DeepSeek V4 Flash-0.93

Preference & communication

4 benchmarks in this domain
  1. GPT-6 Astra+1.02
  2. Fable 5.1+0.99
  3. Opus 5+0.80
  4. Fable 5+0.57
  5. Kimi K3+0.51
  6. GLM-5.3+0.27
  7. GPT-5.6 Sol+0.15
  8. Grok 4.6-0.03
  9. Qwen3.8-Max-0.14
  10. GPT-5.6 Terra-0.21
  11. Muse Spark 1.2-0.30
  12. DeepSeek V4 Pro-0.41
  13. Sonnet 5-0.47
  14. GPT-5.6 Luna-0.62
  15. Qwen3.8-27B-0.91
  16. DeepSeek V4 Flash-1.01

Cite and download this release

Permanent release page and analysis · Release archive

Maintained by The Latent. Methodology: tli-2026-v1.0.

The Latent. “The Latent Score.” Release tli-2026-v1.0-2026-10-10-refresh-21, updated 2026-10-10. thelatent.co/score.

Download this release’s public scores (JSON). Includes model scores, stability ranges, ranks and domain coverage. Data usage terms.