Компании тратят миллионы на перестройку способов использования ИИ. Практически ни одна из них не может доказать его эффективность.
Шубхам Шарма
В декабре 2025 года Uber предоставил своим инженерам код Клода и создал внутренние таблицы лидеров, отслеживающие потребление токенов и ранжирующие команды по частоте их использования. К апрелю весь бюджет на разработку ИИ на 2026 год был исчерпан.
Этот бюджетный кризис широко освещался в СМИ, но настоящим сюрпризом стало заявление президента и главного операционного директора Uber Эндрю Макдональда о том, что пока нет связи между чрезмерным использованием сервиса и предоставлением действительно более качественных услуг пассажирам и водителям.
Весь этот эпизод дал название более широкой проблеме: «токенмаксинг», или стремительный рост потребления токенов без достаточной окупаемости инвестиций.
По прогнозам Gartner, расходы на программное обеспечение для ИИ-агентов в этом году приблизятся к 207 миллиардам долларов, что более чем на 139% больше, чем 86,4 миллиарда долларов в 2025 году. Однако ценообразование на основе токенов не работает так, как модели затрат на программное обеспечение, которые финансовые директора десятилетиями изучали. Один и тот же инженер, используя один и тот же инструмент, в один и тот же день, может выставлять совершенно разные счета в зависимости от того, потратил ли он утро на автоматическое заполнение подсказок или на запуск параллельных агентов для масштабной миграции базы данных.
Теперь Uber ограничивает расходы на один инструмент для разработки программного обеспечения Agentic до 1500 долларов в месяц на одного сотрудника. И это не единственная компания, которая пересматривает свое решение.
Microsoft поставила под сомнение стоимость лицензий Claude Code, прежде чем отменить их во всем подразделении Experiences and Devices. Duolingo отменила план по учету использования ИИ в оценке производительности после того, как сотрудники выступили против указаний использовать инструменты в личных целях.
Сегодня внедрение и потребление токенов — это лишь составляющие более широкого вопроса о ценности ИИ для предприятий. Компания может внедрить ИИ практически во всех своих инженерах и при этом не суметь доказать, что затраты привели к увеличению количества выпущенных функций, исправлению ошибок или решению проблем клиентов.
Этот разрыв теперь представляет собой проблему для предприятий. И люди, пытающиеся его устранить, не всегда сходятся во мнении о том, как его решить.
Проблема с людьми или с сантехникой?
Ноэ Рамос, вице-президент по операциям в области ИИ в компании Agiloft, платформе для управления жизненным циклом корпоративных контрактов, считает, что термин «токенмаксинг» указывает не на того виновника.
«Команды тратят деньги впустую не потому, что любят расточительство. Они тратят их потому, что стандартная инфраструктура подталкивает их к этому», — сказал Рамос в интервью VentureBeat. «Большинство предприятий по-прежнему передают выбор модели тому, кто ее предлагает, а это значит, что передовая модель выполняет задачи, которые дешевая, легковесная модель могла бы выполнить так же хорошо. Это не проблема людей. Это проблема инфраструктуры».
Дмитрий Паланичук, руководитель инженерного отдела компании Promova, занимающейся изучением языков, винит в этом настройки по умолчанию, установленные в большинстве инструментов искусственного интеллекта.
«Оказалось, что в командных и корпоративных тарифных планах премиальные модели предустановлены; по умолчанию они работают с высокой вычислительной нагрузкой, а в нашем плане сессии Opus переходят на контекстное окно с 1 миллионом токенов. Конечно, никто не меняет эти настройки в своих собственных параметрах», — сказал он.
Спустя несколько месяцев он увидел, как премиальная модель справляется с такими тривиальными задачами, как проверка электронной почты.
По словам Паланичука, для устранения этих пробелов Промова работает над соотношением 40/50/10 между Opus, Sonnet и Haiku. Однако он называет это скорее направлением, чем конечной целью, поскольку соотношение на самом деле не является определяющим фактором.
«Нам мешает в основном поведенческая проблема. Даже если вы принудительно установите Sonnet в качестве модели по умолчанию, но не разовьете понимание того, что использовать в каждом конкретном случае, люди все равно будут следовать привычке», — сказал Паланичук. «Самое важное — это чтобы люди использовали модели осознанно, понимая, какую модель выбрать для какой задачи, и выработали привычку проверять ее перед началом нового разговора с представителем LLM».
Оптимизация использования — это не то же самое, что использование меньшего количества ИИ.
Несмотря на стремительный рост стоимости токенов, оптимизация использования ИИ не обязательно означает сокращение его применения.
«Первая реакция не должна заключаться в том, чтобы „использовать меньше ИИ“. Высокое использование токенов может означать многое. Если кто-то использует токены на сумму 16 000 долларов, чтобы сэкономить нам 100 000 долларов, конечно, мы хотим это поощрять», — сказал Рик Спенсер, генеральный менеджер по технологиям и продуктам в SUSE, в интервью VentureBeat. «Все начинается с диагностики, а не с принуждения».
SUSE разделяет использование ИИ на три категории, которым руководствуются менеджеры: повседневная работа, автономные агенты и внедрение новых технологий для разовых стратегических задач.
«Например, наилучшая модель для автономного агента не обязательно является самой современной моделью», — отметил он. «Важно то, что мы не пытаемся подавить использование; мы пытаемся убедиться, что использование соответствует результатам».
Примечательно, что в SUSE отсутствует какой-либо автоматизированный уровень маршрутизации, и Спенсер говорит: «У нас нет никакого прокси-сервера, поэтому решения принимаются отдельными разработчиками». Он добавил, что прокси-сервер находится в планах разработки.
Компания Everlaw, предоставляющая решения на основе ИИ для судебных разбирательств и расследований, действительно устанавливает ограничения на количество токенов на человека (подобно Uber), но технический директор Макс Кристофф называет это противоположностью нормирования. Достижение лимита приводит к отправке однострочного электронного письма команде разработчиков инструментов, и инженер, как правило, получает вдвое больше лимита в тот же день.
Компания Everlaw также оказалась единственной, кто смог предоставить точные данные о возврате инвестиций в ИИ. Один из проектов по модернизации основной инфраструктуры Java обошелся в 3500 токенов и сократил время внедрения с 9,5 инженерных месяцев до 2,5.
«Это реальные цифры; окупаемость инвестиций в размере 3500 долларов за счет экономии семи месяцев работы инженеров просто очевидна», — сказал Кристофф. Более крупный, еще не запущенный продукт уже обошелся в 27 000 токенов и, вероятно, достигнет 40 000 долларов, в то время как время, затрачиваемое инженерами, сократилось с примерно 90-100 инженерных месяцев до 19.
Не всё работает всегда. Компания Everlaw потратила тысячи долларов на то, чтобы агенты переносили код интерфейса из Dojo в React, и в итоге выбросила результат, потому что эти фреймворки основаны на разных предположениях о взаимосвязи состояния и представления. Теперь команда просит агента сначала задокументировать поведение старой системы, а затем строить на основе этой документации.
Компания Agiloft, со своей стороны, полностью отказалась от своих ограничений: «74% пользователей все равно никогда не достигали старых ограничений. Ограничения представляли собой ложный потолок, который создавал препятствия для активных пользователей, не решая при этом реальные факторы, влияющие на стоимость», — сказал Рамос.
Вместо этого компания сделала более дешевые модели моделями по умолчанию, переходя к моделям более высокого уровня только тогда, когда этого требует задача, используя маршрутизацию на уровне инфраструктуры, а не на уровне командной строки, и кэширование.
«Самый быстрый способ для большинства корпоративных команд — это внедрение общекорпоративного шлюза LLM, который обрабатывает более дешевые настройки по умолчанию и интеллектуальную маршрутизацию», — сказал Рамос. «Не следует ограничивать использование инструмента. Нужно исправить архитектуру, лежащую в его основе. Управление дефицитом — это временное решение. Интеллектуальная маршрутизация — это решение проблемы».
Внутри маршрутизаторов
Интересно, что сегодня многие поставщики, включая Merge, Databricks, AWS Bedrock и Azure AI Foundry, решают эту проблему с помощью автоматических маршрутизаторов, которые определяют сложность задачи и направляют ее к наиболее подходящей для нее модели, оставаясь при этом доступными по цене.
В июне на саммите Data + AI компания Databricks представила функцию интеллектуальной маршрутизации в Unity AI Gateway, а также жесткие ограничения на расходы и распределение затрат между размещенными моделями, агентами кодирования и пользовательскими агентами. Функция находится в стадии бета-тестирования и доступна в режимах только рекомендаций и автоматической маршрутизации.
Дэвид Наси, директор по управлению продуктами в Databricks, заявил, что маршрутизатор оценивает каждый запрос, используя детерминированные сигналы и классификацию на основе моделей, анализируя такие факторы, как намерение и длина запроса, используемые файлы, трассировка стека, масштаб изменений, глубина рассуждений и сложность выполнения.
Маршрутизатор выбирает не только модель. «Мы обнаружили, что одна и та же модель работает по-разному при использовании с различными кабельными жгутами, поэтому мы разработали функцию Smart Routing, чтобы обеспечить такую гибкость», — рассказал Наси изданию VentureBeat.
«Решение принимается полностью прозрачно во время выполнения; мы намеренно избегаем превращения маршрутизатора в черный ящик», — сказал он. Когда маршрутизация достигает потолка бюджета, администраторы выбирают между жестким ограничением, которое блокирует дальнейшие запросы, и резервным вариантом, который сначала пробует более дешевую, соответствующую требованиям модель.
С агентными задачами работать еще сложнее, поскольку одна задача может разветвляться на десятки вызовов модели, и ни один человек не утверждает каждый из них. В этом случае маршрутизатор Databricks выполняет оценку на границах выполнения, а не для каждого вызова отдельно.
Проблема рентабельности инвестиций
Тем не менее, будь то осознанная индивидуальная маршрутизация или автоматическая маршрутизация, практически никто не может точно оценить экономию в денежном эквиваленте.
Паланичук, который стремится к соотношению 40/50/10 между моделями, при котором люди сознательно выбирают то, что им нужно для решения задачи, не привел данных о результатах до и после внедрения изменений в Promova, поскольку эти изменения были внесены одновременно с другими работами. Однако, согласно его данным, Opus в рамках окна с 1 миллионом токенов обеспечил около трети ежемесячных расходов.
Компания SUSE, которая занимается сортировкой использования ИИ по категориям с помощью разрабатываемого прокси-сервера, также не располагает никакими метриками, только отдельными случаями. В одном проекте количество уязвимостей CVE в зависимостях сократилось с сотен до нуля, а его агенты с мая классифицировали около 10 000 уязвимостей CVE в базе данных VEX.
Тем временем компания Databricks дала представление о том, в каком направлении движутся команды.
«Первые данные об использовании показывают явный сдвиг: команды, которые ранее обрабатывали весь трафик с помощью передовых моделей, начинают переводить рутинные задачи (такие как генерация шаблонного кода, простые исправления ошибок или незначительные правки) на более экономичные модели без заметного снижения показателей решения проблем», — сказал Наси.
Чтобы обеспечить командам ясность в вопросах оптимизации затрат и выявить отклонения в качестве после изменения маршрутизации, Databricks поставляет Unity AI Gateway с унифицированной трассировкой и системами оценки, в которых LLM выступает в роли эксперта, а также наборами данных для оценки, аналитикой трассировки и автоматизированными циклами обратной связи.
Однако проверка точности для конкретной бизнес-области лежит на плечах клиента, что, по словам Паланичука, представляет собой проблему, поскольку «вы накладываете детерминированные проверки на недетерминированные выходные данные, а модели выпускаются примерно раз в квартал — оценка, настроенная на одну модель, не может быть корректно перенесена на следующую».
Кристофф говорит, что Everlaw пытается решить эту проблему, предоставляя инженерам широкий выбор моделей и бюджет, позволяя им выбирать (при условии прохождения проверки безопасности). Идея заключается в том, что человек, проверяющий код, быстрее всего определяет, какая модель дает результаты, которые стоит сохранить.
Модели могут пройти все тесты, но при этом оставить код, который никто не сможет поддерживать. «Агент по программированию предложит двадцать поверхностных исправлений вместо того, чтобы устранить скрытую закономерность», — сказал Кристофф.
Что будет дальше?
И Паланичук, и Кристофф отметили, что конкретные тактики, которые они используют сейчас для оптимизации применения ИИ, устареют, но лежащая в их основе дисциплина сохранится.
«Я не думаю, что эта конкретная цель будет иметь большое значение, но дисциплина будет», — сказал Паланичук о модельном ряде Promova. «Более дешевые модели не отменяют необходимости подбирать инструмент под конкретную задачу — наоборот, большее количество вариантов делает этот выбор еще более важным».
Кристофф считает, что команды будут активнее использовать потребление токенов в процессе планирования.
«Я прогнозирую, что в течение следующих одного-двух лет мы начнем рассматривать расходы на токены скорее как ежегодные затраты на персонал или производство, а не как расходы на ИТ или общее программное обеспечение», — сказал он, добавив, что руководители отделов вскоре будут приступать к ежегодному планированию, имея позицию по численности персонала и по токенам, а также обоснование целесообразности обоих вариантов.
По сути, одна команда может запланировать миллионы токенов и практически не нанимать новых сотрудников. Другая же может полностью изменить подход.
Хотя руководители расходились во мнениях относительно того, с чего начать, их выводы, рассматриваемые в совокупности, показывают, что необходимо предпринять специалисту по мере роста стоимости и использования токенов.
Рамос восстановит мощный уровень маршрутизации, Спенсер начнет с обучения и подготовки менеджеров, а Кристофф начнет с более детального изучения того, что именно компания оптимизирует, прежде чем кто-либо начнет что-либо делать. Паланичук будет наблюдать за тем, что делает его собственная команда с инструментами, и определять, где именно необходима оптимизация.
«Предоставьте своей команде инструмент и видимый бюджет для экспериментов — разные модели, разных поставщиков — и фиксируйте их реальное использование в течение короткого периода времени с помощью телеметрии и обратной связи», — сказал он. «Не стройте теорий о правильном сочетании; пусть данные от вашей собственной команды сами его определят. Часто сюрпризом становится то, кто окажется наиболее компетентным в определенной области: как ни странно, это не всегда самые технически подкованные специалисты».

Источник: venturebeat.com
Похожие записи
- Моя первая статья на VentureBeat называлась «Вудсток искусственного интеллекта». Последняя — о покупке компанией Nvidia компании Hugging Face за 12,9 миллиарда долларов.
- HydraFusion от GitHub снижает затраты на разработку кода для ИИ во всех тестах производительности. Однако качество сопоставимо только в одном тесте.
- Как мы научили ИИ читать корпоративные регламенты: от наивного RAG до измеримого pipeline
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
