Composio прогнала Kimi K3 через шесть агентных оболочек на одних и…
Composio прогнала Kimi K3 через шесть агентных оболочек на одних и тех же 26 задачах. Модель была одинаковой, менялась только обвязка, и результаты заметно разошлись.
По числу решённых задач лидирует Kimi Code с 21 из 26, затем Hermes Agent с 20, Pi Agent и Claude Code по 19, OpenCode с 18 и Codex с 17. Codex особенно проседал на длинных сценариях: дважды упёрся в лимит 900 секунд на аудите расходов, который Pi Agent прошёл за 446.
По затратам разброс ещё сильнее. Средняя задача обходилась в 0,39 $ в Hermes Agent и 0,40 $ в Pi Agent против 1,47 $ в Claude Code. По медианному времени самым быстрым оказался Pi Agent — 161,7 секунды, самым медленным Claude Code — 347,6.
Одна и та же модель, те же задачи, а стоимость отличается в 3,8 раза, а результативность — от 17 до 21 задачи из 26.
Вывод простой: важно подбирать не только модель под задачу, но и подходящий харнес. Здесь явно есть большой потенциал.
Похожие записи
Оцените материал:
Похожие записи
🪐 Компания Anthropic выпустила новую версию своей флагманской модели —…
04.06.2026
Ваши наушники теперь переводчик на 70+ языков. Любые наушники —…
04.04.2026
👔Новый DualSense Sony запатентовала дизайн нового геймпада для PlayStation 6….
16.02.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
