Один кастомный skill поднял результат Claude на ARC-AGI-3 с 30%…
Один кастомный skill поднял результат Claude на ARC-AGI-3 с 30% до 100%
На бенчмарке ARC-AGI-3 модель Claude Opus 5 показала около 30% решённых задач в обычном режиме. После подключения кастомного skill — набора инструкций, который описывает логику работы с инструментами и жёстко задаёт формат ответов — результат поднялся до 100%. Дополнительно вдвое сократилось количество шагов, которые модель тратила на решение.
Это хорошая иллюстрация того, где сейчас находится узкое место. Модель уже обладает нужными способностями, но тратит их на блуждание: выбирает не тот инструмент, переспрашивает саму себя, уходит в ветвления. Явно прописанный сценарий работы убирает эти потери, не меняя саму модель.
Практический вывод для тех, кто строит агентов: прежде чем менять модель на более дорогую или запускать дообучение, стоит вложиться в структуру задачи — описание инструментов, порядок шагов и формат вывода. Обратная сторона в том, что и бенчмарки от таких обвязок теряют часть смысла: сравнивать по итогу приходится не столько модели, сколько качество лесов вокруг них.
Похожие записи
Оцените материал:
Похожие записи
🧠 Загляни внутрь ChatGPT: интерактивный сайт показывает, как модель думает…
04.03.2026Opus 4.8 превращают в Fable 5 одним промптом — вайбкодеры…
04.07.2026
Человек ошибается постоянно, человечество — никогда Сэр Фрэнсис Гальтон был…
10.10.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
