Kronos TeknolojiResearch index · v1.3.0

Kronos AI Index

Open Frontier Delta measures the LiveBench percentage-point difference between a model and the highest model LiveBench designates open-weight in each of seven categories. It does not claim to measure universal intelligence.

Last updated: Sep 25, 2026, 2:12 PM UTC

Last LiveBench check: Sep 27, 2026, 12:01 PM UTC

Benchmark release: LiveBench 2026-06-25

Data status: Stale

Data source: LiveBench

Read the methodology

Primary metric · methodology v1.3.0

Open Frontier Delta

Values are LiveBench percentage points above or below the LiveBench-designated open frontier.

Model Open Frontier Delta, coverage, evidence confidence, ownership, cost, measured output speed, and last updated date.
Claude Fable 5.1 Max EffortAnthropic-0.6 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Claude 5.5 Opus Thinking xHigh Effort · claude-opus-5-5-max-effortAnthropic-0.8 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Claude Fable 5 Max EffortAnthropic-1.0 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
GPT-6 Astra Max EffortOpenAI-1.8 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Claude 5.5 Opus Thinking xHigh EffortAnthropic-1.9 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Muse Spark 1.3 xHigh EffortMeta-2.4 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
DeepSeek V4.1 Flash Max Effort · 2026-09-10DeepSeek-2.9 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
GPT-5.6 Sol Max EffortOpenAI-3.0 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
GPT-5.5 · xhighOpenAI-3.8 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Claude 5 Opus Thinking xHigh Effort · claude-opus-5-max-effortAnthropic-3.9 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Smaug AgenticAbacus.AI-4.5 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
GPT-6 Sol Max EffortOpenAI-4.8 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Kimi K3Moonshot AI-4.8 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
Gemini 3.7 Flash HighGoogle-5.2 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Qwen 3.8 MaxAlibaba-5.5 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
Grok 4.6xAI-6.0 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
GPT-5.4 · xhighOpenAI-6.0 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Muse Spark 1.2 xHigh EffortMeta-6.1 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
GPT-5.6 Terra Max EffortOpenAI-6.1 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
DeepSeek V4 Pro 0813DeepSeek-6.6 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
Smaug FlashAbacus.AI-6.6 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
Grok 4.7 xHighxAI-6.6 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Gemini 3.1 Pro Preview HighGoogle-7.1 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Smaug MiniAbacus.AI-7.1 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
DeepSeek V4 Flash Vision ExpDeepSeek-7.2 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
Claude 4.7 Opus Thinking High Effort · claude-opus-4-7-xhigh-effortAnthropic-7.5 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Claude 4.8 Opus Thinking Max Effort · 2026-04-16Anthropic-7.8 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Qwen 3.8 Flash NextAlibaba-7.8 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
GLM-5.3Z.AI-7.9 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
Union AlphaStealth-7.9 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Claude Sonnet 5 xHigh EffortAnthropic-8.0 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Gemini 3.8 Flash HighGoogle-8.2 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Grok 4.5xAI-8.2 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Muse Spark 1.1 xHigh EffortMeta-8.7 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Qwen3.8 27BAlibaba-8.7 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
Gemini 3.5 Flash · highGoogle-9.4 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
GPT-5.2 · highOpenAI-9.4 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Claude 4.6 Opus Thinking High Effort · 2026-02-05Anthropic-9.5 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
DeepSeek V4 Flash 0731DeepSeek-9.8 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
GPT-5.2 Codex · 2026-01-14OpenAI-10.0 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Gemini 3.6 Flash HighGoogle-10.4 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
GPT-5.6 Luna Max EffortOpenAI-10.4 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
GLM-5.2Z.AI-10.8 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
Qwen 3.7 MaxAlibaba-10.9 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Claude 4.6 Sonnet Thinking High Effort · claude-sonnet-4-6-thinking-auto-medium-effortAnthropic-11.0 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Claude 4.5 Opus Thinking · high-effortAnthropic-11.4 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
GPT-6 Luna Max EffortOpenAI-12.0 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Inkling xHigh EffortThinking Machines-12.1 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
GLM-5.3 FlashZ.AI-12.4 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
deepseek-v4-proUnknown organization-12.4 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Kimi K2.6 ThinkingMoonshot AI-13.5 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
GPT-5.4 Nano · xhighOpenAI-14.4 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
ox-alpha-maxStealth-14.8 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Qwen 3.6 Plus · 2026-04-02Alibaba-15.1 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Kimi K2.7 CodeMoonshot AI-15.6 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
Grok Build 0.1xAI-16.2 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Nemotron 3 Ultra 550B A55BNVIDIA-16.6 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
Minimax M3Minimax-16.7 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
GPT-5.4 Mini · xhighOpenAI-17.6 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
deepseek-v4-flashUnknown organization-18.5 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Qwen 3.6 27BAlibaba-20.0 pp100%100LiveBench-designated open weightNot providedUSD per 1M tokensNot providedSep 25, 2026
Gemini 3.5 Flash-Lite HighGoogle-20.1 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026
Grok 4.3xAI-21.8 pp100%100Not designated as open-weight by LiveBenchNot providedUSD per 1M tokensNot providedSep 25, 2026

What the open frontier means

For each category, the ingestion reads LiveBench's openweight flag from the release-pinned model metadata and automatically selects the highest-scoring flagged model. A different model can lead each category. This source classification is not a separate Kronos verification of the model's license. The headline is the equal mean of all seven category deltas and is withheld if any category lacks a flagged baseline or comparable score.

AGI Capability Beta

Not scored

There is not enough structured evidence for an honest composite score. A future beta may study breadth, depth, reliability, autonomy, adaptation, and robustness; each currently remains Insufficient evidence.

  • BreadthInsufficient evidence
  • DepthInsufficient evidence
  • ReliabilityInsufficient evidence
  • AutonomyInsufficient evidence
  • AdaptationInsufficient evidence
  • RobustnessInsufficient evidence

Snapshot history is versioned. New evidence appears only after an explicit calculation; it does not rewrite previously published scores.

Based on public LiveBench release data. Kronos applies the source's open-weight flag to calculate category deltas; this index is not affiliated with or endorsed by LiveBench.

Kronos AI Index | Open Frontier Delta