Один кастомный skill поднял результат Claude на ARC-AGI-3 с 30%…
Один кастомный skill поднял результат Claude на ARC-AGI-3 с 30% до 100%
На бенчмарке ARC-AGI-3 модель Claude Opus 5 показала около 30% решённых задач в обычном режиме. После подключения кастомного skill — набора инструкций, который описывает логику работы с инструментами и жёстко задаёт формат ответов — результат поднялся до 100%. Дополнительно вдвое сократилось количество шагов, которые модель тратила на решение.
Это хорошая иллюстрация того, где сейчас находится узкое место. Модель уже обладает нужными способностями, но тратит их на блуждание: выбирает не тот инструмент, переспрашивает саму себя, уходит в ветвления. Явно прописанный сценарий работы убирает эти потери, не меняя саму модель.
Практический вывод для тех, кто строит агентов: прежде чем менять модель на более дорогую или запускать дообучение, стоит вложиться в структуру задачи — описание инструментов, порядок шагов и формат вывода. Обратная сторона в том, что и бенчмарки от таких обвязок теряют часть смысла: сравнивать по итогу приходится не столько модели, сколько качество лесов вокруг них.
Похожие записи
Оцените материал:
Похожие записи
Из OpenAI ушёл человек, который писал отчёты о безопасности к…
07.10.2026
В текст ChatGPT встроят невидимые вотермарки — OpenAI прогнулись под…
07.10.2026
Познакомьтесь с Гриффином, первой моделью искусственного интеллекта, которая может перебивать…
07.10.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
