Claude 4 Sonnet
Anthropic
Claude 4 Sonnet achieves 96/100 coding benchmark score — top-tier performance.

Track model launches, capability updates, pricing changes, and benchmark milestones across the AI industry.
Anthropic
Claude 4 Sonnet achieves 96/100 coding benchmark score — top-tier performance.
Anthropic
Claude 4 Opus achieves 97/100 coding benchmark score — top-tier performance.
Gemini 2.5 Flash achieves 94/100 multimodal benchmark score — top-tier performance.
OpenAI
OpenAI o4 Mini achieves 93/100 reasoning benchmark score — top-tier performance.
OpenAI
OpenAI o3 achieves 97/100 reasoning benchmark score — top-tier performance.
OpenAI
GPT-4.1 achieves 94/100 coding benchmark score — top-tier performance.
Gemini 2.5 Pro achieves 97/100 multimodal benchmark score — top-tier performance.
DeepSeek
DeepSeek V3 0324 achieves 92/100 coding benchmark score — top-tier performance.
Anthropic
Claude 3.7 Sonnet achieves 95/100 coding benchmark score — top-tier performance.
xAI
Grok 3 achieves 92/100 reasoning benchmark score — top-tier performance.
DeepSeek
DeepSeek R1 achieves 95/100 reasoning benchmark score — top-tier performance.
Mistral
Codestral achieves 94/100 coding benchmark score — top-tier performance.