Компания Anthropic запускает Claude Opus 5, более дешевую модель искусственного интеллекта для программирования, агентов и корпоративных рабочих процессов.
Майкл Нуньес
В пятницу компания Anthropic выпустила Claude Opus 5 — модель, которая, по словам компании, обладает почти всеми интеллектуальными возможностями топовой модели Claude Fable 5, но стоит вдвое дешевле. Этот запуск свидетельствует о том, что в гонке за искусственный интеллект акцент смещается с анализа базовых возможностей на экономику повседневного использования.
Новая модель, доступная сразу на всех платформах Anthropic, оценивается в 5 долларов за миллион входных токенов и 25 долларов за миллион выходных токенов, оставаясь неизменной по сравнению со своей предшественницей, Opus 4.8. Она становится новой моделью по умолчанию на Claude Max, премиальном потребительском уровне Anthropic, и самой мощной моделью, доступной на Claude Pro.
Такой подход является преднамеренным. Anthropic не утверждает, что Opus 5 — это самая умная модель компании — это звание по-прежнему принадлежит Fable 5, и конкурирующие системы сохраняют преимущество в определенных областях. Вместо этого компания выдвигает более тонкий аргумент, который может иметь большее значение для корпоративных покупателей: наиболее экономически важная работа в области ИИ выполняется в среднем диапазоне сложности, где интеллект, близкий к передовому уровню и предоставляемый эффективно и дешево, превосходит передовой интеллект, предоставляемый дорого.
«Opus 5 — это ваш основной инструмент, модель, которой вы доверяете сложные задачи и проверяете их выполнение», — сказал представитель Anthropic в интервью VentureBeat, описывая нынешнюю структуру линейки продуктов компании. «Fable 5 — для самых амбициозных проектов, многодневных автономных работ, за которые раньше никто не мог взяться… Sonnet 5 — для масштабных задач, где скорость и стоимость звонка определяют, что будет выпущено. Haiku 4.5 — для субагентов и мгновенных ответов».
Как результаты бенчмарка Claude Opus 5 соотносятся с результатами Fable 5 и конкурирующих моделей ИИ.
На бумаге результаты впечатляют. Компания Anthropic утверждает, что Opus 5 устанавливает новые рекорды в тестах на программирование и интеллектуальную работу, включая Frontier-Bench и GDPval-AA. В Frontier-Bench v0.1, тесте на программирование для агентных терминалов, Opus 5 набирает 43,3% — более чем вдвое больше, чем 18,7% у Opus 4.8, и значительно опережает 33,7% у Fable 5 — при более низкой стоимости выполнения задачи, по данным компании. В ARC-AGI 3, тесте на решение новых задач, Anthropic сообщает, что Opus 5 показал в три раза лучшие результаты, чем следующая по этому показателю модель. В OSWorld 2.0, тесте на использование компьютера, компания утверждает, что модель превосходит лучший результат Fable 5, при этом стоимость выполнения задачи составляет чуть более трети от его результата.
Приведенные цифры сопровождаются честными оговорками, которые сами по себе заслуживают внимания в отрасли, склонной к преувеличениям. Компания Anthropic признает, что Opus 5 по-прежнему отстает от Mythos 5, конкурирующей модели, в задачах кибербезопасности и биологических исследованиях, а модель семейства OpenAI все еще лидирует в одном из бенчмарков по программированию агентов.
Наиболее показательное замечание прозвучало от самой компании Anthropic, когда её спросили, в чём Opus 5 всё ещё уступает Fable 5. Ответ представителя компании фактически представлял собой откровенное признание того, что бенчмарки отражают, а что нет.
«В тестах, где Opus 5 показывает лучшие результаты, решаются ограниченные задачи с конкретным результатом, и именно в этом его сильные стороны. Однако в этих тестах не учитывается продолжительность выполнения», — заявил представитель компании VentureBeat. «Проще говоря: Opus 5 — лучший инструмент для задач, которые можно оценить с помощью бенчмарков, а Fable 5 — это то, к чему обращаются, когда задача превосходит бенчмарк».
В отличие от этого, Fable 5 «предназначена для самых длительных и автономных задач, где модель должна оставаться согласованной на протяжении множества связанных этапов в течение нескольких часов или дней при работе с большим объемом исходного материала», — сказал представитель компании, посоветовав клиентам «запускать обе модели на репрезентативной рабочей нагрузке, одной ограниченной задаче и одной задаче с длительным горизонтом планирования». Такая трактовка — ограниченные задачи против автономности с длительным горизонтом планирования — может стать определяющим фактором дифференциации моделей в 2026 году, поскольку количество бенчмарков достигнет максимума, а самые сложные оставшиеся проблемы будут связаны с продолжительной, многодневной работой агентов, а не с отдельными головоломками.
Почему эффективность токенов становится настоящим полем битвы за корпоративные расходы на ИИ
В основе запуска лежит тема, которую Anthropic явно хочет донести до покупателей: Opus 5 не просто хорошо показывает себя, он хорошо показывает себя за потраченные деньги. Модель поставляется с регулируемым параметром «усилий», который позволяет клиентам обменивать интеллект на скорость и экономию токенов, а графики Anthropic акцентируют внимание на производительности при заданной стоимости, а не только на пиковой производительности.
Первые клиенты подтвердили это с необычайной конкретностью. Компания Harvey, занимающаяся разработкой юридического ИИ, заявила, что Opus 5 показал результаты, аналогичные режиму максимального рассуждения Opus 4.8, «при этом генерируя в среднем на 26% меньше токенов», — сообщил Нико Групен, руководитель отдела прикладных исследований компании. Ричард Фам из Fundamental Research Lab сказал, что в сложных задачах финансового моделирования модель в среднем показала на девять процентных пунктов более высокую точность, «при этом используя примерно на треть меньше операций и вызовов инструментов и на 60% меньше времени».
Уэйд Фостер, генеральный директор Zapier, заявил, что Opus 5 возглавил рейтинг AutomationBench его компании, «не потратив больше токенов, чем предыдущие модели Claude», выполнив полный рабочий процесс предотвращения оттока клиентов от начала до конца. «Предыдущие модели не прошли проверку; Opus 5 достиг 100%», — сказал он. Скотт Ву, генеральный директор Cognition, компании, разработавшей агент для программирования Devin, заявил, что на FrontierCode 1.1 «Claude Opus 5 приближается к уровню производительности Fable при вдвое меньших затратах», демонстрируя особенно сильные стороны в отладке и анализе первопричин.
Акцент на эффективности отражает коммерческую реальность. Корпоративные расходы на ИИ перестали быть экспериментальными, а затраты на вывод результатов — стоимость фактического запуска этих моделей в масштабе — стали статьей расходов на уровне совета директоров.
Бизнес Anthropic в значительной степени ориентирован на API и корпоративное использование; согласно анализу Contrary Research, проведенному в феврале 2026 года, к концу 2025 года Claude занимал примерно 40 процентов рынка крупных корпоративных языковых моделей по объему использования, а годовой доход одной только компании Claude Code достиг около 1 миллиарда долларов. Для компании, клиенты которой платят токенами, модель, позволяющая достигать большего с меньшим количеством токенов, — это не просто желательная функция, а сам продукт.
Самопроверяющиеся агенты искусственного интеллекта и их значение для скрытых издержек автоматизации.
Помимо цифр, Anthropic продает историю, основанную на поведенческих принципах: Opus 5 проверяет свою работу и совершенствуется до тех пор, пока не добьется успеха. Компания привела несколько примеров из тестирования, которые выглядят как небольшие притчи о машинном упрямстве.
В одном из заданий Frontier-Bench модели было предложено реконструировать деталь машины в виде 3D CAD-модели из чертежа, который ей намеренно не предоставили для просмотра. Вместо того чтобы потерпеть неудачу, как утверждает Anthropic, Opus 5 разработал собственный конвейер компьютерного зрения для извлечения геометрии из необработанных пикселей — и делал это неоднократно, в то время как ни одна конкурирующая модель не решила задачу за пять попыток. В другом случае, получив реальную ошибку в популярном менеджере пакетов с открытым исходным кодом, модель нашла первопричину и исправила крайний случай, который пропустил собственный патч сообщества; конкурирующая модель исправила только симптом и объявила о победе. Инженер торговой фирмы, как утверждает компания, использовал Opus 5 для создания потока рыночных данных для новой биржи за одну сессию и, не найдя реального потока для проверки, наблюдал, как модель создает собственную тестовую среду для проверки своего кода парсинга.
Клиенты описывали аналогичное поведение в реальных условиях. Кристиан Ривера, штатный инженер-программист в Stripe, рассказал, что на выходные он «назначил модели роль руководителя над своими средами разработки»: «она создала собственный монитор, управляла каждым устройством и привлекала меня только для принятия решений».
Именно эта возможность действительно важна для предприятий, и стоит задуматься, почему. Разрыв между моделью, выдающей правдоподобные результаты, и моделью, которая проверяет эти результаты, — это разрыв между демонстрационной версией и развертываемой системой. Большая часть скрытых затрат на корпоративный ИИ сегодня — это проверка человеком: инженеры проверяют работу машины. Модель, которая надежно проверяет свою собственную работу, снижает эти затраты, и именно поэтому клиенты постоянно отмечают меньшее количество итераций, меньшее количество проходов и меньшее время, а не более высокие показатели.
Стратегия безопасности Anthropic изнутри: пробелы в возможностях, классификаторы и резервные модели.
Запуск также демонстрирует все более сложный подход Anthropic к безопасности — подход, который теперь включает в себя преднамеренное необучение моделей определенным навыкам. Компания заявляет, что ее автоматизированный поведенческий аудит показал, что Opus 5 является наиболее соответствующей ее модели на сегодняшний день, получив оценку 2,3 по общему показателю несоответствия поведения, что ниже, чем у Opus 4,8, Sonnet 5 или Fable 5, с наименьшим количеством обманного поведения и наименьшей восприимчивостью к обману и злоупотреблению.
Что касается возможностей, Anthropic заявляет, что намеренно избегала обучения Opus 5 задачам кибербезопасности, как это было с Opus 4.8. Тем не менее, модель улучшила эти показатели — побочный эффект общего повышения возможностей — и теперь почти сравнялась с Mythos 5 по обнаружению уязвимостей программного обеспечения. Но она по-прежнему значительно отстает по их эксплуатации: в ходе оценки Anthropic с помощью OSS-Fuzz Opus 5 выявил уязвимости с вероятностью 79,4%, что близко к 80% у Mythos 5, но успешно разработал эксплойты только в 4 задачах против 13 у Mythos 5. Эта асимметрия — сильные позиции при обнаружении уязвимостей, имеющих отношение к обороне, и слабые позиции при их эксплуатации, имеющих отношение к нападению, — по-видимому, является преднамеренной, и меры защиты следуют той же логике. Anthropic ожидает, что классификаторы кибербезопасности Opus 5 будут вмешиваться примерно на 85% реже, чем Fable 5.
Когда срабатывает классификатор, запросы в Claude.ai, Claude Code и Claude Cowork по умолчанию переключаются на Opus 4.8, что вызывает очевидный вопрос: если запрос слишком рискован для одной модели, почему он приемлем для другой? «Модель, к которой происходит переключение, имеет более низкий уровень возможностей, что также снижает риск вредоносного использования», — сказал представитель, добавив, что «при этом появляется сообщение, которое отображается в чате и информирует пользователя об этом».
Логика здесь оправдана, но она показывает, как на самом деле работает безопасность ИИ в 2026 году: риск — это не свойство самого вопроса, а свойство вопроса, умноженное на возможности системы, которая на него отвечает. В биологии же расчеты идут в обратную сторону. Opus 5 теперь является самой совершенной общедоступной моделью Anthropic для научных исследований — она набрала на 10,2 процентных пункта больше, чем Opus 4.8, по внутреннему бенчмарку компании в области химии, — хотя представитель признал, что «Mythos 5 остается более сильной моделью для долгосрочных, открытых проектов, таких как автономные кампании по разработке лекарств».
Основные коммерческие интересы, стоящие за запуском: оценка компании в 380 миллиардов долларов и масштабные инвестиции в вычислительные мощности.
Запуск происходит в момент необычайного коммерческого успеха — и одновременно необычайных обязательств — для Anthropic. В феврале агентство Reuters сообщило, что в последнем раунде финансирования компания была оценена примерно в 380 миллиардов долларов, после периода, в течение которого, согласно анализу Contrary Research, ее годовая выручка выросла с примерно 1 миллиарда долларов в конце 2024 года до прогнозируемых 9 миллиардов долларов к концу 2025 года, а внутренние целевые показатели, как сообщается, достигнут 20–26 миллиардов долларов к 2026 году. Эти цели обеспечиваются огромными инвестициями в инфраструктуру, включая, по сообщениям, сделку по предоставлению вычислительных ресурсов Azure на сумму 30 миллиардов долларов, а также соглашения с Google Cloud и Nvidia — расходы, которые окупятся только в том случае, если предприятия продолжат расширять использование сервиса.
Именно в этом контексте ценовая стратегия Opus 5 имеет смысл. Сохранение цены на уровне Opus 4.8 при одновременном примерно двукратном увеличении производительности по ключевым показателям эффективности агентов фактически представляет собой резкое снижение цены за единицу возможностей, призванное расширить круг задач, которые экономически выгодно автоматизировать. Каждая задача, которая была незначительной при стоимости успешного выполнения в Opus 4.8, становится жизнеспособной в Opus 5 — и каждая жизнеспособная задача приносит регулярный доход в виде токенов.
Нормативно-правовая база также стала более сложной. Как сообщило агентство Reuters, на этой неделе американский судья окончательно утвердил соглашение Anthropic с авторами книг о выплате компенсации в размере 1,5 миллиарда долларов, завершив тем самым судебную тяжбу по поводу ранних обучающих данных компании. А в июне Reuters, ссылаясь на Axios, сообщило, что правительство США приняло меры по блокированию доступа иностранных компаний к самым передовым моделям Anthropic — это напоминание о том, что передовые разработки в области ИИ теперь тесно связаны с экспортной политикой, определяя, какие товары и услуги могут приобрести покупатели.
Также в пятницу поступят в продажу: быстрый режим, работающий примерно в 2,5 раза быстрее стандартного, но вдвое дороже базовой версии; автоматическая маршрутизация по резервному каналу через API; и изменения инструментов в середине разговора, которые больше не аннулируют кэш подсказок — небольшая функция, которую разработчики агентов, возможно, оценят больше, чем любые сравнительные тесты. Как и в предыдущих моделях Opus, Opus 5 не предъявляет требований к хранению данных для общего доступа, на что представитель компании без запроса обратил внимание клиентов с «жесткими требованиями к нулевому хранению данных». Разработчики могут получить доступ к модели как claude-opus-5 через API Claude начиная с сегодняшнего дня.
Два вопроса определят, оправдается ли ставка: выдержат ли заявления об эффективности Opus 5 проверку в условиях масштабируемых производственных нагрузок, и примут ли предприятия мир, где классификаторы безопасности, а не пользователи, иногда определяют, какая модель даст правильный ответ. Но более глубокий смысл пятничного запуска заключается в том, что центр тяжести индустрии ИИ сместился. В течение трех лет лаборатории соревновались в том, что может сделать их лучшая модель в свой лучший день. С Opus 5 компания Anthropic соревнуется в чем-то менее привлекательном, но гораздо более прибыльном: что может сделать очень хорошая модель каждый день за половину цены. На рынке, где границы постоянно меняются, Anthropic делает ставку на то, что настоящее богатство находится прямо за ней.
Источник: venturebeat.com
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
