DeepSeek V4.1-Flash: score and benchmark evidence

Current published release · · DeepSeek

113.0 points · Rank 6 among 20 ranked models · Stability range 99.7–128.3 points.

Rank follows the point estimate; it does not establish statistically significant superiority. The scale is anchored at mean 100, SD 15 in the frozen calibration cohort, not human IQ or a percentage.

One score summarizes demonstrated capability across published reasoning settings and seven equally weighted domains. Related benchmark variants share a family budget, and influence from one evaluator is capped.

Release tli-2026-v1.0-2026-09-10-deepseek-3. Methodology and limitations for this release.

Permanent link to these exact scores and sources

Capability domains

Domain scores use calibration-cohort standard-deviation units. Unmeasured domains are shown as unavailable, not zero.

DomainScore (SD units)Observed benchmarks
Knowledge & reasoning-0.092
Coding & software engineering0.625
Agentic tool & computer use0.412
Professional & real-world workUnavailable0
Multimodal & visionUnavailable0
Cybersecurity0.591
Preference & communicationUnavailable0

Published benchmark evidence

10 results contribute to this score, from 20 collected results and 7 contributing benchmark families. Counts are not independent sample sizes.

Results, source citations, review decisions and compatible reasoning modes are stored in a versioned relational database. Each publication uses a sealed, checksum-verified export; CSV files are optional exports, not editable scoring inputs. Previous revisions remain available for audit. Collected means a numeric result exists in the database. Used means its source, exact model checkpoint and benchmark protocol have been reviewed and its benchmark has a frozen calibration supported by multiple providers. For each benchmark we select the highest published aggregate across comparable reasoning modes, not necessarily maximum effort, and count it once. More tested settings provide more chances to record a high score; this selection advantage is not corrected by the conditional interval. Developer-reported and sole/unspecified settings remain eligible and disclosed. Unresolved does not mean false or useless: conflicting metrics, unverified citations and unmatched versions stay collected until reconciled.

The score stability range is a 95% bootstrap score interval conditional on frozen calibration and comparable evidence availability. It resamples benchmark families and evaluators and adds a frozen missing-evidence correction. It excludes selection across reasoning settings, selective publication, calibration changes and new domains. It is not a 95% guarantee about true capability or where a future score will land. Sparse or conflicting evidence can widen the range.

Reporting sensitivity: ±23.6 points. Sensitivity to selectively published results. This stress range is not a confidence interval or a probability statement.

  1. GPQA Diamond: 90.9%

    Contributes to the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim.

  2. Humanity's Last Exam (no tools): 36.8%

    Contributes to the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim. Full HLE 36.8; the separately reported 39.1 is text-only and is not substituted.

  3. HLE text-only — DeepSeek V4.1 release: 39.1%

    Not used in the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim. Retained as a separate protocol; does not contribute to the current frozen score.

  4. Codeforces Rating — DeepSeek V4.1 release: 3471 native-points

    Not used in the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: rating

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim. Retained as a separate protocol; does not contribute to the current frozen score.

  5. MathArena Apex: 65.6%

    Not used in the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim. Retained as a separate protocol; does not contribute to the current frozen score.

  6. Terminal-Bench 2.1: 90.6%

    Contributes to the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim.

  7. Terminal-Bench v3.0: 30%

    Contributes to the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim.

  8. Terminal-Bench 4.0: 31.2%

    Contributes to the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim.

  9. DeepSWE v1.1: 74.2%

    Contributes to the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim.

  10. ProgramBench — DeepSeek V4.1 release: 20.3%

    Not used in the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim. Retained as a separate protocol; does not contribute to the current frozen score.

  11. NL2Repo: 65.4%

    Contributes to the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim.

  12. CyberGym: 88.1%

    Contributes to the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim.

  13. SEC-Bench Pro — DeepSeek V4.1 release: 62.8%

    Not used in the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim. Retained as a separate protocol; does not contribute to the current frozen score.

  14. ExploitGym: 15.3%

    Not used in the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim.

  15. Humanity's Last Exam w/ tools: 63.9%

    Contributes to the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim.

  16. Automation-Bench — DeepSeek V4.1 release: 54.8%

    Not used in the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim. Retained as a separate protocol; does not contribute to the current frozen score.

  17. Agents' Last Exam: 31.8%

    Contributes to the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim.

  18. Chartography (w/tools): 78.9%

    Not used in the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim. Retained as a separate protocol; does not contribute to the current frozen score.

  19. BabyVision (w/tools): 89.6%

    Not used in the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim. Retained as a separate protocol; does not contribute to the current frozen score.

  20. ZeroBench-main (w/tools): 49%

    Not used in the score. Developer-reported. Review status: reviewed-developer.

    Configuration: DeepSeek V4.1-Flash, September 10 release; sole published setting (effort undisclosed)

    Metric: published benchmark score (%)

    Original source · Retrieved 2026-09-10

    Developer-reported release-table aggregate, corroborated against the supplied screenshot. Effort, harness, retry budget and fallback accounting are undisclosed; no maximum-effort claim. Retained as a separate protocol; does not contribute to the current frozen score.

Cite this model record

The Latent. “DeepSeek V4.1-Flash: score and benchmark evidence.” 2026-09-10. Release tli-2026-v1.0-2026-09-10-deepseek-3.

Download release data and definitions (JSON) · Data usage terms

Related reporting

These dated stories provide reporting context; they may describe an earlier release.