Composio прогнала Kimi K3 через шесть агентных оболочек на одних и…
Composio прогнала Kimi K3 через шесть агентных оболочек на одних и тех же 26 задачах. Модель была одинаковой, менялась только обвязка, и результаты заметно разошлись.
По числу решённых задач лидирует Kimi Code с 21 из 26, затем Hermes Agent с 20, Pi Agent и Claude Code по 19, OpenCode с 18 и Codex с 17. Codex особенно проседал на длинных сценариях: дважды упёрся в лимит 900 секунд на аудите расходов, который Pi Agent прошёл за 446.
По затратам разброс ещё сильнее. Средняя задача обходилась в 0,39 $ в Hermes Agent и 0,40 $ в Pi Agent против 1,47 $ в Claude Code. По медианному времени самым быстрым оказался Pi Agent — 161,7 секунды, самым медленным Claude Code — 347,6.
Одна и та же модель, те же задачи, а стоимость отличается в 3,8 раза, а результативность — от 17 до 21 задачи из 26.
Вывод простой: важно подбирать не только модель под задачу, но и подходящий харнес. Здесь явно есть большой потенциал.
Похожие записи
Оцените материал:
Похожие записи
Нейросеть поможет выучить ЧТО УГОДНО — нашли топовый сервис Flashback,…
27.01.2026
Зафиксировано крупнейшее слияние чёрных дыр в истории наблюдений. Две сверхтяжёлые…
16.07.2025
Нейросети: их поведение на ставках игровых автоматов вошло в классику
27.10.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
