обо всех бенчмарки невозможно рассказать в одном посте. поэтому тут собраны и усреднены результаты бенчмарков, которые по моему мнению стоят вашего внимания. и да, тут нет недавно вышедших моделей, а именно minimax-m3, qwen-3.7, kimi-k2.7, glm-5.2. зато есть fable, который очевидно занял первое место в этом лидерборде.
в комментах картинка в хорошем качестве
источники:
- DeepSWE — deepswe.datacurve.ai/blog
- SWE-Marathon — swe-marathon.org/#analysis
- FrontierSWE — frontierswe.com
- AA-Coding — artificialanalysis.ai/agents/coding-agents
- FrontierCode — cognition.ai/blog/frontier-code
- Fable 5 на FrontierCode — anthropic.com/news/claude-fable-5-mythos-5

