Свежий аудит 254 публичных заявок на SWE-bench показывает: топовые…
✨ Свежий аудит 254 публичных заявок на SWE-bench показывает: топовые агенты фактически сошлись в одну точку. Лидирующие две системы решают одинаковые 396 из 500 задач Verified, а топ-10 делят между собой 285 общих успехов и 51 общий провал — на различие остаётся всего 164 задачи из 500. Из Медианное пересечение решений на фронтире — 0.935, против ожидаемых 0.774, если бы системы решали задачи независимо друг от друга.
Строгий парный тест (McNemar) не смог статистически разделить ни одну соседнюю пару в топ-30 на Verified — то есть разница в позициях на лидерборде часто не более чем шум. И ключевая деталь: разброс результатов одной и той же модели с разными харнессами достигает 29.8 процентных пунктов — больше, чем весь разброс топ-30 систем (8.8 пунктов). Это прямое продолжение темы, которую мы разбирали через Nvidia — оценка отражает пару модель+харнесс, а не саму модель.
👍 Авторы предлагают закупщикам и командам не гнаться за местом в топе, а смотреть на статистические тиры, эффективный размер сравнения и то, какая именно связка модель-харнесс стоит за цифрой.
Похожие записи
Оцените материал:
Похожие записи
«Билайн» внедрил платформу с ИИ-аватаром дистанционного мониторинга пациентов для МОНИКИ…
25.09.2026
Для любителей пива создали ТАМАГОЧИ, который пьянеет вместе с хозяином…
25.09.2026
Сооснователь Panda Express назвал work-life balance дорогой в бедность 78-летний…
25.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
