Детали: По данным Cognition, SWE-2 получила 50,0% на FrontierCode 1.1 Main — против 50,9% у Fable 5.1 — при заявленной экономии 64% относительно Fable 5.1. Модель post-trained на базе Kimi K3 с 2,8 трлн параметров.
Ключевая идея — RL-алгоритм, который обучает несколько уровней reasoning effort в одном запуске. На FrontierCode средний effort SWE-2, по данным Cognition, делает на 58% меньше ходов и стоит на 81% дешевле SWE-1.7. Это vendor-reported benchmarks, а не независимый аудит.
SWE-2 доступна в Devin Desktop и CLI, а также разворачивается в Devin Web и Fusion; веса закрыты.
Где деньги: автономная разработка, исправление багов и поддержка больших кодовых баз. Экономия на ходах важна для агентных команд: дешевле не только один запрос, но и весь цикл «исследование → код → тесты → исправление».
Вердикт: SWE-2 показывает, что cost-performance frontier для coding agents становится отдельным полем конкуренции. Сравнивать проценты нужно вместе с harness, стоимостью, latency и доступными инструментами.
Источник: Cognition
Карта для оплаты AI: открыть бота
🎁 Подарок: неделя Claude Pro — забрать
AI От веб-кодинга к вайб-кодингу 🔥
11 сен 2026 09:38
Комментариев пока нет.