Gemini 3.6 Flash
Gemini 3.6 Flash achieves 94/100 multimodal benchmark score — top-tier performance.

Track model launches, capability updates, pricing changes, and benchmark milestones across the AI industry.
Gemini 3.6 Flash achieves 94/100 multimodal benchmark score — top-tier performance.
Moonshot AI
Kimi K3 achieves 94/100 reasoning benchmark score — top-tier performance.
Anthropic
Claude Sonnet 4.5 achieves 95/100 coding benchmark score — top-tier performance.
OpenAI
GPT-5 achieves 96/100 reasoning benchmark score — top-tier performance.
DeepSeek
DeepSeek V4 achieves 92/100 coding benchmark score — top-tier performance.
Anthropic
Claude Opus 4.1 achieves 97/100 reasoning benchmark score — top-tier performance.
Gemini 3 Pro achieves 96/100 multimodal benchmark score — top-tier performance.
Anthropic
Claude 4 Sonnet achieves 96/100 coding benchmark score — top-tier performance.
Anthropic
Claude 4 Opus achieves 97/100 coding benchmark score — top-tier performance.
Gemini 2.5 Flash achieves 94/100 multimodal benchmark score — top-tier performance.
OpenAI
OpenAI o4 Mini achieves 93/100 reasoning benchmark score — top-tier performance.
OpenAI
OpenAI o3 achieves 97/100 reasoning benchmark score — top-tier performance.
OpenAI
GPT-4.1 achieves 94/100 coding benchmark score — top-tier performance.
Gemini 2.5 Pro achieves 97/100 multimodal benchmark score — top-tier performance.
DeepSeek
DeepSeek V3 0324 achieves 92/100 coding benchmark score — top-tier performance.
Anthropic
Claude 3.7 Sonnet achieves 95/100 coding benchmark score — top-tier performance.
xAI
Grok 3 achieves 92/100 reasoning benchmark score — top-tier performance.
DeepSeek
DeepSeek R1 achieves 95/100 reasoning benchmark score — top-tier performance.
Mistral
Codestral achieves 94/100 coding benchmark score — top-tier performance.
Gemini 2.0 Flash achieves 92/100 multimodal benchmark score — top-tier performance.
OpenAI
OpenAI o1 achieves 96/100 reasoning benchmark score — top-tier performance.
Mistral
Pixtral Large achieves 93/100 multimodal benchmark score — top-tier performance.
Anthropic
Claude 3.5 Sonnet achieves 94/100 writing benchmark score — top-tier performance.
DeepSeek
DeepSeek Coder V2 achieves 93/100 coding benchmark score — top-tier performance.
OpenAI
GPT-4o achieves 95/100 multimodal benchmark score — top-tier performance.
Anthropic
Claude 3 Opus achieves 93/100 writing benchmark score — top-tier performance.