Decision-модели: какую выбрать и сколько стоит миллион решений
За 16 дней после выхода Jev у неё появилось пять конкурентов: от Cloudflare, Perplexity, AWS, Fastino и индийской Convai Innovations. Все шесть моделей работают одинаково. Им передают описание ситуации и список допустимых вариантов, а в ответ приходит выбранный вариант и вероятность для каждого. Для бизнеса это способ снять с дорогих LLM рутинные решения: куда направить обращение, пропускать ли контент, можно ли агенту выполнить действие. Цены на один и тот же объём решений различаются в шесть раз, а каждый разработчик побеждает Jev в собственной таблице.
Как устроена Jev, я подробно писал в отдельной статье. Здесь разбор для тех, кто выбирает модель под свою задачу.
Где decision-модель окупается
Модель подходит там, где все возможные ответы известны заранее, решений много, а человек оценил бы каждое за пару секунд. Типичные задачи:
- маршрутизация обращений в поддержку по отделам и срочности;
- модерация: пропустить, отклонить или отправить на ручную проверку;
- проверка действий ИИ-агента перед запуском: только чтение, обратимое изменение или удаление данных;
- выбор LLM под запрос: простой вопрос уходит дешёвой модели, сложный дорогой;
- контроль качества ответов ИИ-агентов.
Последний сценарий проверила LangChain. Jev оценивала ответы агента наравне с тремя LLM и совпала с оценкой человека в 100% случаев при цене $0,00035 за вызов. Claude Sonnet 4.6 совпала в 80% и стоила $0,028 за вызов. При 10 000 проверок в день месяц обходится в $104 против $8 434.
Тест узкий: один агент и пять запросов, повторённых по 100 раз. Но разница в цене в 80 раз заметна и на таком объёме.
Если задачу уже правильно решает обычный код, модель не нужна: условие в программе быстрее и дешевле любого вызова.
Сколько стоит миллион решений
Nadir посчитал цену миллиона решений по прайсам на начало октября, исходя из 300 входных токенов на одно решение. Дешевле всех pplx-decider и Jev: $12 и $12,6. Clef-flash обходится в $27, Clef в $72. Обычные LLM в роли классификатора стоят $35 у GPT-6 Luna, $350 у Claude Haiku 4.5 и $700 у Claude Sonnet 5.
Clef и pplx-decider построены на одной и той же Qwen3.8-27B, но по прайсу различаются в шесть раз. Clef при этом дороже, чем GPT-6 Luna в роли классификатора, так что decision-модель не всегда дешевле обычной LLM.
GLiDE в расчёт не попала: она считает токены своего рассуждения как входные, и цена зависит от сложности задачи. В тесте Anthus миллион решений GLiDE стоил от $159 до $278.
Если к одному тексту нужно задать несколько вопросов, их можно отправить одним запросом: текст оплачивается один раз. Clef принимает до 64 вопросов за запрос.
Сравнение моделей
Jev от TypeSafe доступна только через API и стоит $0,042 за миллион входных токенов. Принимает до 32K токенов текста, картинки не понимает. Подойдёт тем, кому нужна самая проверенная модель: её уже тестировали независимые команды, например LangChain и Anthus.
pplx-decider-v1-27b от Perplexity есть и в API, и в виде открытых весов. В API она стоит $0,04 за миллион токенов, дешевле остальных. Контекст 262K токенов, понимает картинки. Подойдёт для длинных документов и задач, где главное цена.
Clef и Clef-flash от Cloudflare тоже доступны и в API Workers AI, и в открытых весах. Clef стоит $0,24 за миллион токенов, Clef-flash $0,09. Обе принимают до 64K токенов, картинки и видео. Есть оговорка: через API Workers AI длинный текст сейчас обрезается примерно до первых 2 000 токенов, а весь объём доступен только на своём сервере. Модели подойдут компаниям, которые уже работают на Cloudflare; Clef-flash выбирают, когда важны скорость и цена.
Strands Decider 2B от AWS распространяется только в виде открытых весов, бесплатно. Нужно своё железо, но модель запускается даже на CPU. В тестах авторов окно было 4K токенов. Подойдёт, если данные не должны покидать компанию.
Laya от Convai Innovations тоже бесплатна и запускается только у себя. Она обрабатывает короткие тексты, от 512 до 1 024 токенов, и работает больше чем со 100 языками. Подойдёт для простых решений с несколькими вариантами.
GLiDE от Fastino доступна только через API за $0,30 за миллион входных токенов, и в эту сумму входят токены её рассуждения. Контекст 40K. Подойдёт для сложных многошаговых решений, где ответ можно ждать секунды.
Открытые веса Clef, pplx-decider, Strands Decider и Laya выпущены под лицензией Apache 2.0, которая разрешает коммерческое использование. Jev, Clef и pplx-decider не берут денег за выходные токены: платить нужно только за отправленные данные.
Как выбрать: пять вопросов
- Можно ли отправлять данные внешнему сервису? Если нет, выбор сужается до моделей с открытыми весами: Strands Decider, Laya, Clef и pplx-decider на своём сервере. Jev и GLiDE работают только через API.
- Сколько решений в день? Свой сервер окупается только при большой и ровной нагрузке. По расчёту Nadir, чтобы аренда H100 за $2,5 в час обошлась дешевле API Perplexity, видеокарта должна круглосуточно обрабатывать больше 17 000 токенов в секунду. Для Clef порог ниже, около 2 900. При меньшей нагрузке дешевле облако.
- Что на входе? Короткий текст обработает любая модель. Документы на сотни страниц помещаются только в pplx-decider с контекстом 262K токенов. Картинки понимают pplx-decider и Clef, Jev и GLiDE принимают только текст.
- Сколько вариантов и насколько сложен выбор? Маленькие модели хорошо работают с короткими списками и теряют точность на длинных. На 77 категориях банковских обращений Laya даёт точность 0,425, Jev 0,870. Для многошаговых решений Fastino предлагает GLiDE с рассуждением, но в независимом тесте она оказалась медленнее и дороже Jev.
- Сколько можно ждать ответа? Если решение стоит внутри запроса пользователя, считать нужно задержку вместе с сетью. Cloudflare заявляет для Clef-flash 38,8 мс, а замер со стороны клиента показал 191–205 мс. Модель на своём сервере рядом с приложением экономит этот путь по сети.
Чему не верить в анонсах
Каждый разработчик сравнивает себя с Jev на своём наборе тестов и побеждает. Подробности показывают другую картину.
- В таблице самой Perplexity её модель выигрывает в среднем на 1,2 пункта, но уступает Jev в 6 тестах из 11.
- Clef обходит Jev на 14,5 пункта в классификации банковских обращений и проигрывает 8,6 пункта в тесте When2Call, где нужно решить, вызывать ли агенту инструмент прямо сейчас.
- Fastino заявляет, что GLiDE лучше Jev в 31 тесте из 38. В независимом тесте Anthus на 3 600 логических задачах GLiDE оказалась менее точной, отвечала в среднем за секунду против 0,18 секунды у Jev, а 243 ответа заняли больше 10 секунд. Миллион решений обошёлся в $213 против $23. Anthus сама работает в основном с Jev, это стоит учитывать.
- Задержку в анонсах меряют внутри дата-центра. Ваш код ждёт дольше, как в примере с Clef-flash выше.
Для выбора важнее среднего балла другой показатель: доля решений, которые модель принимает уверенно и правильно на ваших данных. От неё зависит, сколько запросов уйдёт на дорогую проверку человеком или большой LLM.
Nadir приводит наглядный пример. Модель за $12 за миллион решений уверенно закрывает 70% случаев, остальные уходят на LLM, и в сумме миллион решений стоит $117. Модель за $72 закрывает 90% и обходится в $107. Цифры условные, но так дорогая модель может оказаться дешевле.
Как запустить пилот без риска
- Выберите одну частую и малорисковую развилку, например распределение обращений по отделам.
- Соберите несколько сотен примеров с правильными ответами из истории: обращения, которые сотрудники перенаправили вручную, решения модераторов.
- Добавьте в список вариант «другое» или «передать человеку». Модель всегда выбирает из списка и непредусмотренный случай уверенно отнесёт к неподходящему варианту.
- Запустите модель в теневом режиме: она отвечает на реальные запросы, а решения пока принимают люди. Сравните ответы.
- Задайте порог уверенности по результатам сравнения. Выше порога решение исполняется автоматически, ниже уходит человеку или большой LLM.
- Подключайте модель через общий интерфейс. Clef и GLiDE совместимы с API Jev, поэтому поставщика можно сменить без переписывания кода.
- Сравнивайте модели по цене одного правильного решения на ваших данных и повторяйте сравнение, когда меняются цены. Perplexity уже обещала снизить свою.
Итог
- Нужны минимальная цена и длинные документы: pplx-decider.
- Данные нельзя отдавать наружу: Strands Decider или Laya на своём сервере, для сложных задач pplx-decider или Clef на своей видеокарте.
- Инфраструктура уже на Cloudflare и важна скорость: Clef-flash.
- Нужна модель с независимыми тестами: Jev.
- GLiDE пробовать там, где ответа можно ждать секунды.
Рынку три недели, цены и лидеры будут меняться. Выиграет команда, которая может за день проверить новую модель на своих данных и переключиться на неё.
Источники
- Six Deciders, Sixteen Days
- It’s Not a System 1 Model If It Takes Ten Seconds
- Jev-as-a-Judge for Agent Evals
- Jev: Inside TypeSafe AI’s First System One Decision Model
- Clef на OpenRouter
- Clef в документации Cloudflare Workers AI
- pplx-decider-v1-27b на OpenRouter
- Introducing Strands Decider 2B
- Laya на GitHub
- Introducing GLiDE
- Denis Yarats о pplx-decider-v1-27b
- Jev и новый тренд в ИИ
Источник: vc.ru
Похожие записи
Оцените материал:
Похожие записи
Как я читерил с помощью ИИ в реверс‑инжиниринге промышленного ПО
07.10.2026
Дешево, но не точно: разбираем контроллер доверия к памяти LLM-агентов
07.10.2026
Китайцы взломали мозг собственному роботу и сломали ему суставы. Зачем? Чтобы доказать абсолютную неуязвимость!
07.10.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
