Composio прогнала Kimi K3 через шесть агентных оболочек на одних и…
Composio прогнала Kimi K3 через шесть агентных оболочек на одних и тех же 26 задачах. Модель была одинаковой, менялась только обвязка, и результаты заметно разошлись.
По числу решённых задач лидирует Kimi Code с 21 из 26, затем Hermes Agent с 20, Pi Agent и Claude Code по 19, OpenCode с 18 и Codex с 17. Codex особенно проседал на длинных сценариях: дважды упёрся в лимит 900 секунд на аудите расходов, который Pi Agent прошёл за 446.
По затратам разброс ещё сильнее. Средняя задача обходилась в 0,39 $ в Hermes Agent и 0,40 $ в Pi Agent против 1,47 $ в Claude Code. По медианному времени самым быстрым оказался Pi Agent — 161,7 секунды, самым медленным Claude Code — 347,6.
Одна и та же модель, те же задачи, а стоимость отличается в 3,8 раза, а результативность — от 17 до 21 задачи из 26.
Вывод простой: важно подбирать не только модель под задачу, но и подходящий харнес. Здесь явно есть большой потенциал.
Похожие записи
Оцените материал:
Похожие записи
Так выглядит китайская ферма для развода парней в интернете —…
27.07.2026
В Кабардино-Балкарии готовят ИИ-видеонаблюдение RedVideo Учёные Кабардино-Балкарского госуниверситета им. Х.М….
26.06.2026
Китайцы (Moonshot AI) выпустили Агентного убийцу Claude🤯 Компания Moonshot AI…
28.01.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
