MModelosIA

Ranking

Benchmarks

SWE-bench es la señal principal para coding agéntico. Los huecos significan que el proveedor o el índice aún no publican ese número.

#ModeloSWE-benchLiveCodeBenchHumanEval
1Claude Opus 5
Anthropic
79.4%——
2Claude Opus 4.8
Anthropic
79.4%——
3GLM-5
Zhipu AI
77.8%——
4GPT-5.5
OpenAI
75.2%—96.2
5Gemini 3.1 Pro
Google
71.8%—94.6
6Kimi K2.6
Moonshot AI
71.6%——
7Gemini 3.7 Flash
Google
—81.2—