Ranking
Benchmarks
SWE-bench es la señal principal para coding agéntico. Los huecos significan que el proveedor o el índice aún no publican ese número.
| # | Modelo | SWE-bench | LiveCodeBench | HumanEval |
|---|---|---|---|---|
| 1 | Claude Opus 5 Anthropic | 79.4% | — | — |
| 2 | Claude Opus 4.8 Anthropic | 79.4% | — | — |
| 3 | GLM-5 Zhipu AI | 77.8% | — | — |
| 4 | GPT-5.5 OpenAI | 75.2% | — | 96.2 |
| 5 | Gemini 3.1 Pro Google | 71.8% | — | 94.6 |
| 6 | Kimi K2.6 Moonshot AI | 71.6% | — | — |
| 7 | Gemini 3.7 Flash Google | — | 81.2 | — |