Один кастомный skill поднял результат Claude на ARC-AGI-3 с 30%…
Один кастомный skill поднял результат Claude на ARC-AGI-3 с 30% до 100%
На бенчмарке ARC-AGI-3 модель Claude Opus 5 показала около 30% решённых задач в обычном режиме. После подключения кастомного skill — набора инструкций, который описывает логику работы с инструментами и жёстко задаёт формат ответов — результат поднялся до 100%. Дополнительно вдвое сократилось количество шагов, которые модель тратила на решение.
Это хорошая иллюстрация того, где сейчас находится узкое место. Модель уже обладает нужными способностями, но тратит их на блуждание: выбирает не тот инструмент, переспрашивает саму себя, уходит в ветвления. Явно прописанный сценарий работы убирает эти потери, не меняя саму модель.
Практический вывод для тех, кто строит агентов: прежде чем менять модель на более дорогую или запускать дообучение, стоит вложиться в структуру задачи — описание инструментов, порядок шагов и формат вывода. Обратная сторона в том, что и бенчмарки от таких обвязок теряют часть смысла: сравнивать по итогу приходится не столько модели, сколько качество лесов вокруг них.
Похожие записи
Оцените материал:
Похожие записи
🍔 OpenAI выпустили GPT 5.2 — свою новую флагманскую модель….
26.12.2025
⭐️Intel анонсировала новые процессоры — Intel Core Ultra 7 270K…
20.03.2026
Импланты Neuralink теперь позволяют не только играть в видеоигры силой…
29.06.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
