The Aggregate Digest logo

The Aggregate Digest

Archives
Log in
Subscribe
July 17, 2026

AI Benchmark Digest — 2026-07-17

AI Benchmark Digest — 2026-07-17

View on AI Benchmark Hub

Daily

New Benchmarks (9)

  • Benchmarks.bio - BioSecBench-Surveillance (Pass Rate (%)): Grok 4.5 leads with 53.3 across 15 models. BioSecBench-Surveillance (benchmarks.bio) — biosurveillance analysis over pathogen genomic samples (isolates, wastewater, clinical, air): variant detection, taxonomic classification, antimicrobial-resistance and toxin characterization, and source tracking, scored as pass rate.
  • Benchmarks.bio - VariantBench (Pass Rate (%)): GPT-5.6 Sol leads with 42.1 across 11 models. VariantBench (benchmarks.bio) — agentic genetic-variant discovery and interpretation over real sequencing data (short- and long-read WGS and exome across Illumina, PacBio and ONT): small-variant, structural-variant and repeat calling with QC, statistical and population genomics, and clinical/personal genome interpretation, scored as pass rate with deterministic grading.
  • LLM Stats (PostTrainBench) (Score (%)): MiniMax-M3 leads with 37.1 across 5 models.
  • LLM Stats (Program Bench) (Score (%)): Kimi K3 leads with 77.8 across 5 models.
  • LLM Stats (WorldVQA) (Score (%)): Qwen 3.7 Plus leads with 61.1 across 5 models.
  • Long-Horizon Terminal-Bench (Mean Score (%)): Grok 4.5 leads with 50.5 across 21 models. Long-Horizon Terminal-Bench (LHTB) — coding and research agent tasks in a real terminal that unfold over hundreds of steps, graded by dense per-step reward rather than single pass/fail; headline is the mean reward across tasks (0-100).
  • Visual Acuity Test (4K) (Mean Accuracy (%)): GPT-5.4 leads with 100.0 across 30 models. Visual Acuity Test for LLMs — reading text rendered at progressively smaller sizes inside a 4K image; measures how small a model can still read as mean character accuracy, taking each model's best detail/resolution setting.
  • RadLE 2.0 (Radiology) (RadLE Score): Claude Fable 5 leads with 758.0 across 16 models. RadLE 2.0 (crashlab.in) — radiology visual-reasoning cases pitting vision-language models against board-certified radiologists and trainees; models earn an Elo-style RadLE score (human experts sit near 989).
  • HumainE Leaderboard (HumainE Score): Gemini 3.1 Pro (Preview) leads with 35.38 across 54 models.

New Models (1)

  • Kimi K3 — ELO 2974, #7/1477, above Claude Fable 5, below GPT-5.4 Pro
    • Chatbot Arena (Code): 1679.0 (#1/98)
    • Tau3 Banking: 33.4 (#1/157)
    • LLM Stats (APEX-Agents): 37.6 (#1/7)
    • LLM Stats (AutomationBench): 30.8 (#1/6)
    • LLM Stats (BabyVision): 85.7 (#1/8)
    • LLM Stats (BrowseComp): 91.2 (#1/57)
    • LLM Stats (DeepSearchQA): 95.0 (#1/8)
    • LLM Stats (MathVision): 97.8 (#1/32)
    • LLM Stats (MCP Atlas): 84.2 (#1/29)
    • LLM Stats (Toolathlon): 73.2 (#1/29)

New Scores From Top-10 Models (58)

  • GPT-5.6 Sol on Blueprint-Bench 2: 0.336 Connectivity Similarity Score (#4/18)
  • GPT-5.6 Sol on CADGenBench: 0.4108 Aggregate CAD Score (#6/17)
  • GPT-5.6 Sol on HieroglyphBench: 27.6 Sign accuracy (%) (#4/16)
  • GPT-5.6 Sol on React Native Evals: 86.34 Overall Score (%) (#4/26)
  • Inkling on Chatbot Arena (Code): 1434.0 Elo (#38/98)
  • Inkling on Chatbot Arena (Text): 1441.0 Elo (#67/376)
  • Inkling on Vals AI (Vals Index): 49.28 Accuracy (%) (#26/38)
  • Inkling on Vals AI Terminal-Bench 2.1: 47.57 Accuracy (%) (#34/43)
  • Kimi K3 on AA CritPt: 23.43 Accuracy (%) (#9/447)
  • Kimi K3 on AA GDPval: 1668.08 ELO (#4/157)
  • Kimi K3 on AA GPQA Diamond: 93.54 Accuracy (%) (#4/541)
  • Kimi K3 on AA Humanity's Last Exam: 44.35 Accuracy (%) (#7/537)
  • Kimi K3 on AA Long Context Reasoning: 74.67 Accuracy (%) (#4/469)
  • Kimi K3 on AA MMMU-Pro: 80.52 Accuracy (%) (#13/226)
  • Kimi K3 on AA Omniscience: 18.42 Score (#13/446)
  • Kimi K3 on AA Omniscience - Business: 38.8 Accuracy (%) (#27/446)
  • Kimi K3 on AA Omniscience - Health: 37.5 Accuracy (%) (#44/446)
  • Kimi K3 on AA Omniscience - Humanities & Social Sciences: 43.8 Accuracy (%) (#26/446)
  • Kimi K3 on AA Omniscience - Law: 37.7 Accuracy (%) (#33/446)
  • Kimi K3 on AA Omniscience - Science, Engineering & Mathematics: 47.8 Accuracy (%) (#19/446)
  • Kimi K3 on AA Omniscience - Software Engineering (SWE): 70.1 Accuracy (%) (#25/446)
  • Kimi K3 on AA Omniscience - Software Engineering (SWE) - C: 87.0 Accuracy (%) (#11/446)
  • Kimi K3 on AA Omniscience - Software Engineering (SWE) - Dart: 62.0 Accuracy (%) (#23/446)
  • Kimi K3 on AA Omniscience - Software Engineering (SWE) - Go: 56.0 Accuracy (%) (#48/446)
  • Kimi K3 on AA Omniscience - Software Engineering (SWE) - HTML: 76.0 Accuracy (%) (#22/446)
  • Kimi K3 on AA Omniscience - Software Engineering (SWE) - Java: 53.0 Accuracy (%) (#30/446)
  • Kimi K3 on AA Omniscience - Software Engineering (SWE) - JavaScript: 77.27 Accuracy (%) (#21/446)
  • Kimi K3 on AA Omniscience - Software Engineering (SWE) - Julia: 48.0 Accuracy (%) (#47/446)
  • Kimi K3 on AA Omniscience - Software Engineering (SWE) - Kotlin: 66.0 Accuracy (%) (#28/446)
  • Kimi K3 on AA Omniscience - Software Engineering (SWE) - PHP: 78.0 Accuracy (%) (#21/446)
  • Kimi K3 on AA Omniscience - Software Engineering (SWE) - Python: 70.0 Accuracy (%) (#33/446)
  • Kimi K3 on AA Omniscience - Software Engineering (SWE) - R: 62.0 Accuracy (%) (#20/446)
  • Kimi K3 on AA Omniscience - Software Engineering (SWE) - Rust: 74.0 Accuracy (%) (#43/446)
  • Kimi K3 on AA Omniscience - Software Engineering (SWE) - Swift: 80.0 Accuracy (%) (#22/446)
  • Kimi K3 on AA Omniscience - Software Engineering (SWE) - TypeScript: 74.44 Accuracy (%) (#26/446)
  • Kimi K3 on AA SciCode: 58.68 Accuracy (%) (#3/535)
  • Kimi K3 on AA-Omniscience Accuracy: 45.95 Accuracy (%) (#25/446)
  • Kimi K3 on AI Chess Leaderboard (Continuation): 1800.0 Elo (#3/240)
  • Kimi K3 on AI Chess Leaderboard (Reasoning): 1522.0 Elo (#18/296)
  • Kimi K3 on Artificial Analysis Intelligence Index: 57.11 Intelligence Index (#4/540)
  • Kimi K3 on Bullshit Benchmark: 58.2 BS Detection Rate (%) (#23/162)
  • Kimi K3 on Chatbot Arena (Text): 1486.0 Elo (#9/376)
  • Kimi K3 on GDPval-AA: 1668.0 Elo (#4/162)
  • Kimi K3 on LLM Stats (CharXiv-R): 91.3 Score (%) (#2/44)
  • Kimi K3 on LLM Stats (DeepSWE): 67.5 Score (%) (#3/9)
  • Kimi K3 on LLM Stats (FrontierSWE): 81.2 Score (%) (#2/14)
  • Kimi K3 on LLM Stats (GDPval-AA): 1668.0 ELO (#3/39)
  • Kimi K3 on LLM Stats (OfficeQA Pro): 63.3 Score (%) (#4/7)
  • Kimi K3 on LLM Stats (Terminal-Bench 2.1): 88.3 Score (%) (#2/12)
  • Kimi K3 on LLM Stats (ZEROBench): 41.0 Score (%) (#3/9)
  • Kimi K3 on PM-LLM-Benchmark: 39.2 Score (#3/159)
  • Kimi K3 on PinchBench: 30.25 Success Rate (%) (#58/60)
  • Kimi K3 on SvelteBench: 95.6 Average pass@1 (%) (#25/150)
  • Kimi K3 on Vals AI (Vals Index): 74.7 Accuracy (%) (#2/38)
  • Kimi K3 on Vals AI CorpFin v2: 71.56 Accuracy (%) (#2/123)
  • Kimi K3 on Vals AI MedCode: 48.88 Accuracy (%) (#16/73)
  • Kimi K3 on Vals AI Terminal-Bench 2.1: 80.9 Accuracy (%) (#2/43)
  • Kimi K3 on ZeroEval GPQA Diamond: 93.5 GPQA Diamond Score (#7/232)

New #1 Leaders (14)

  • Chatbot Arena (Code) (Elo): Kimi K3 (1679.0) beat GPT-5.6 Sol (xHigh) (1631.0) by 48.0.
  • ClockBench (Accuracy (%)): GPT-5.6 Sol (Max) (66.7) beat GPT-5.4 (High) (50.6) by 16.1.
  • LLM Stats (Toolathlon) (Score (%)): Kimi K3 (73.2) beat Claude Opus 4.8 (59.9) by 13.3.
  • LLM Stats (AutomationBench) (Score (%)): Kimi K3 (30.8) beat GPT-5.6 Sol (18.1) by 12.7.
  • LLM Stats (BabyVision) (Score (%)): Kimi K3 (85.7) beat Seed 2.1 Pro (73.7) by 12.0.
  • TrackingAI IQ Test (Offline) (Offline IQ Score (%)): GPT-Sol-Ultra (87.5) beat GPT-5 Pro (81.25) by 6.25.
  • AgenticVBench (Average Success (%)): GPT-5.6 Sol (38.4) beat Claude Fable 5 (32.4) by 6.0.
  • LLM Stats (APEX-Agents) (Score (%)): Kimi K3 (37.6) beat Seed 2.1 Pro (33.8) by 3.8.
  • LLM Stats (MathVision) (Score (%)): Kimi K3 (97.8) beat Seed 2.1 Pro (94.5) by 3.3.
  • LLM Stats (DeepSearchQA) (Score (%)): Kimi K3 (95.0) beat Claude Opus 4.8 (93.1) by 1.9.
  • LLM Stats (BrowseComp) (Score (%)): Kimi K3 (91.2) beat GPT-5.6 Sol (90.4) by 0.8.
  • Tau3 Banking (Success Rate (%)): Kimi K3 (33.4) beat GPT-5.6 Sol (Max) (32.99) by 0.41.
  • LLM Stats (MCP Atlas) (Score (%)): Kimi K3 (84.2) beat Seed 2.1 Pro (83.8) by 0.4.
  • CADGenBench (Aggregate CAD Score): Archie in Forge (0.5073) beat GPT-5.5 (xHigh) (0.46) by 0.05.
Don't miss what's next. Subscribe to The Aggregate Digest:
← Newer AI Benchmark Digest — 2026-07-18 Older → AI Benchmark Digest — 2026-07-16
aibenchmarks.dev
Twitter
Telegram
Powered by Buttondown, the easiest way to start and grow your newsletter.