Один кастомный skill поднял результат Claude на ARC-AGI-3 с 30%…
Один кастомный skill поднял результат Claude на ARC-AGI-3 с 30% до 100%
На бенчмарке ARC-AGI-3 модель Claude Opus 5 показала около 30% решённых задач в обычном режиме. После подключения кастомного skill — набора инструкций, который описывает логику работы с инструментами и жёстко задаёт формат ответов — результат поднялся до 100%. Дополнительно вдвое сократилось количество шагов, которые модель тратила на решение.
Это хорошая иллюстрация того, где сейчас находится узкое место. Модель уже обладает нужными способностями, но тратит их на блуждание: выбирает не тот инструмент, переспрашивает саму себя, уходит в ветвления. Явно прописанный сценарий работы убирает эти потери, не меняя саму модель.
Практический вывод для тех, кто строит агентов: прежде чем менять модель на более дорогую или запускать дообучение, стоит вложиться в структуру задачи — описание инструментов, порядок шагов и формат вывода. Обратная сторона в том, что и бенчмарки от таких обвязок теряют часть смысла: сравнивать по итогу приходится не столько модели, сколько качество лесов вокруг них.
Похожие записи
Оцените материал:
Похожие записи
ИИ начал ускорять создание следующего ИИ — именно этого все…
14.09.2026
Grok 4.7 слишком рано сдаётся — релиз задерживается. Маск признал,…
14.09.2026
Unity пустила ИИ-агентов прямо внутрь разработки игр Unity выпустила официальный…
14.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
