基准测试

Evolvent Frontier Index

按照每项评测原始论文采用的指标,对比前沿模型在 Evolvent 各项基准测试中的表现。

Anthropic

Claude Sonnet 4.6

Anthropic · avg@3

75.8%

80
60
40
20
0

已发布评测

基准测试库

🥇
AnthropicClaude Sonnet 4.675.8
🥈
AnthropicClaude Opus 4.674.6
🥉
OpenAIGPT-5.4 High72.0
🥇
GoogleGemini 3.1 Pro Preview75.4
🥈
OpenAIGPT-563.3
🥉
AnthropicClaude Opus 4.661.3
🥇
AnthropicClaude Opus 532.5
🥈
AnthropicClaude Sonnet 526.3
🥉
GoogleGemini 3.1 Pro26.2
🥇
Moonshot AIKimi K3 + Kimi Code27.317%
🥈
OpenAICodex gpt-5.6-sol27.277%
🥉
AnthropicClaude Code Sonnet-523.441%

持续获取最新基准测试

关注 Evolvent 新发布的评测、数据集与可复现智能体研究。

基准测试 - Evolvent AI