Архив рубрики ~Лента новостей~

Decision-модели: какую выбрать и сколько стоит миллион решений

Decision-модели: какую выбрать и сколько стоит миллион решений
Decision-модели: какую выбрать и сколько стоит миллион решений

За 16 дней после выхода Jev у неё появилось пять конкурентов: от Cloudflare, Perplexity, AWS, Fastino и индийской Convai Innovations. Все шесть моделей работают одинаково. Им передают описание ситуации и список допустимых вариантов, а в ответ приходит выбранный вариант и вероятность для каждого. Для бизнеса это способ снять с дорогих LLM рутинные решения: куда направить обращение, пропускать ли контент, можно ли агенту выполнить действие. Цены на один и тот же объём решений различаются в шесть раз, а каждый разработчик побеждает Jev в собственной таблице.

Как устроена Jev, я подробно писал в отдельной статье. Здесь разбор для тех, кто выбирает модель под свою задачу.

Где decision-модель окупается

Модель подходит там, где все возможные ответы известны заранее, решений много, а человек оценил бы каждое за пару секунд. Типичные задачи:

  • маршрутизация обращений в поддержку по отделам и срочности;
  • модерация: пропустить, отклонить или отправить на ручную проверку;
  • проверка действий ИИ-агента перед запуском: только чтение, обратимое изменение или удаление данных;
  • выбор LLM под запрос: простой вопрос уходит дешёвой модели, сложный дорогой;
  • контроль качества ответов ИИ-агентов.

Последний сценарий проверила LangChain. Jev оценивала ответы агента наравне с тремя LLM и совпала с оценкой человека в 100% случаев при цене $0,00035 за вызов. Claude Sonnet 4.6 совпала в 80% и стоила $0,028 за вызов. При 10 000 проверок в день месяц обходится в $104 против $8 434.

Тест узкий: один агент и пять запросов, повторённых по 100 раз. Но разница в цене в 80 раз заметна и на таком объёме.

Если задачу уже правильно решает обычный код, модель не нужна: условие в программе быстрее и дешевле любого вызова.

Сколько стоит миллион решений

Nadir посчитал цену миллиона решений по прайсам на начало октября, исходя из 300 входных токенов на одно решение. Дешевле всех pplx-decider и Jev: $12 и $12,6. Clef-flash обходится в $27, Clef в $72. Обычные LLM в роли классификатора стоят $35 у GPT-6 Luna, $350 у Claude Haiku 4.5 и $700 у Claude Sonnet 5.

Clef и pplx-decider построены на одной и той же Qwen3.8-27B, но по прайсу различаются в шесть раз. Clef при этом дороже, чем GPT-6 Luna в роли классификатора, так что decision-модель не всегда дешевле обычной LLM.

GLiDE в расчёт не попала: она считает токены своего рассуждения как входные, и цена зависит от сложности задачи. В тесте Anthus миллион решений GLiDE стоил от $159 до $278.

Если к одному тексту нужно задать несколько вопросов, их можно отправить одним запросом: текст оплачивается один раз. Clef принимает до 64 вопросов за запрос.

Сравнение моделей

Jev от TypeSafe доступна только через API и стоит $0,042 за миллион входных токенов. Принимает до 32K токенов текста, картинки не понимает. Подойдёт тем, кому нужна самая проверенная модель: её уже тестировали независимые команды, например LangChain и Anthus.

pplx-decider-v1-27b от Perplexity есть и в API, и в виде открытых весов. В API она стоит $0,04 за миллион токенов, дешевле остальных. Контекст 262K токенов, понимает картинки. Подойдёт для длинных документов и задач, где главное цена.

Clef и Clef-flash от Cloudflare тоже доступны и в API Workers AI, и в открытых весах. Clef стоит $0,24 за миллион токенов, Clef-flash $0,09. Обе принимают до 64K токенов, картинки и видео. Есть оговорка: через API Workers AI длинный текст сейчас обрезается примерно до первых 2 000 токенов, а весь объём доступен только на своём сервере. Модели подойдут компаниям, которые уже работают на Cloudflare; Clef-flash выбирают, когда важны скорость и цена.

Strands Decider 2B от AWS распространяется только в виде открытых весов, бесплатно. Нужно своё железо, но модель запускается даже на CPU. В тестах авторов окно было 4K токенов. Подойдёт, если данные не должны покидать компанию.

Laya от Convai Innovations тоже бесплатна и запускается только у себя. Она обрабатывает короткие тексты, от 512 до 1 024 токенов, и работает больше чем со 100 языками. Подойдёт для простых решений с несколькими вариантами.

GLiDE от Fastino доступна только через API за $0,30 за миллион входных токенов, и в эту сумму входят токены её рассуждения. Контекст 40K. Подойдёт для сложных многошаговых решений, где ответ можно ждать секунды.

Открытые веса Clef, pplx-decider, Strands Decider и Laya выпущены под лицензией Apache 2.0, которая разрешает коммерческое использование. Jev, Clef и pplx-decider не берут денег за выходные токены: платить нужно только за отправленные данные.

Как выбрать: пять вопросов

  1. Можно ли отправлять данные внешнему сервису? Если нет, выбор сужается до моделей с открытыми весами: Strands Decider, Laya, Clef и pplx-decider на своём сервере. Jev и GLiDE работают только через API.
  2. Сколько решений в день? Свой сервер окупается только при большой и ровной нагрузке. По расчёту Nadir, чтобы аренда H100 за $2,5 в час обошлась дешевле API Perplexity, видеокарта должна круглосуточно обрабатывать больше 17 000 токенов в секунду. Для Clef порог ниже, около 2 900. При меньшей нагрузке дешевле облако.
  3. Что на входе? Короткий текст обработает любая модель. Документы на сотни страниц помещаются только в pplx-decider с контекстом 262K токенов. Картинки понимают pplx-decider и Clef, Jev и GLiDE принимают только текст.
  4. Сколько вариантов и насколько сложен выбор? Маленькие модели хорошо работают с короткими списками и теряют точность на длинных. На 77 категориях банковских обращений Laya даёт точность 0,425, Jev 0,870. Для многошаговых решений Fastino предлагает GLiDE с рассуждением, но в независимом тесте она оказалась медленнее и дороже Jev.
  5. Сколько можно ждать ответа? Если решение стоит внутри запроса пользователя, считать нужно задержку вместе с сетью. Cloudflare заявляет для Clef-flash 38,8 мс, а замер со стороны клиента показал 191–205 мс. Модель на своём сервере рядом с приложением экономит этот путь по сети.

Чему не верить в анонсах

Каждый разработчик сравнивает себя с Jev на своём наборе тестов и побеждает. Подробности показывают другую картину.

  • В таблице самой Perplexity её модель выигрывает в среднем на 1,2 пункта, но уступает Jev в 6 тестах из 11.
  • Clef обходит Jev на 14,5 пункта в классификации банковских обращений и проигрывает 8,6 пункта в тесте When2Call, где нужно решить, вызывать ли агенту инструмент прямо сейчас.
  • Fastino заявляет, что GLiDE лучше Jev в 31 тесте из 38. В независимом тесте Anthus на 3 600 логических задачах GLiDE оказалась менее точной, отвечала в среднем за секунду против 0,18 секунды у Jev, а 243 ответа заняли больше 10 секунд. Миллион решений обошёлся в $213 против $23. Anthus сама работает в основном с Jev, это стоит учитывать.
  • Задержку в анонсах меряют внутри дата-центра. Ваш код ждёт дольше, как в примере с Clef-flash выше.

Для выбора важнее среднего балла другой показатель: доля решений, которые модель принимает уверенно и правильно на ваших данных. От неё зависит, сколько запросов уйдёт на дорогую проверку человеком или большой LLM.

Nadir приводит наглядный пример. Модель за $12 за миллион решений уверенно закрывает 70% случаев, остальные уходят на LLM, и в сумме миллион решений стоит $117. Модель за $72 закрывает 90% и обходится в $107. Цифры условные, но так дорогая модель может оказаться дешевле.

Как запустить пилот без риска

  1. Выберите одну частую и малорисковую развилку, например распределение обращений по отделам.
  2. Соберите несколько сотен примеров с правильными ответами из истории: обращения, которые сотрудники перенаправили вручную, решения модераторов.
  3. Добавьте в список вариант «другое» или «передать человеку». Модель всегда выбирает из списка и непредусмотренный случай уверенно отнесёт к неподходящему варианту.
  4. Запустите модель в теневом режиме: она отвечает на реальные запросы, а решения пока принимают люди. Сравните ответы.
  5. Задайте порог уверенности по результатам сравнения. Выше порога решение исполняется автоматически, ниже уходит человеку или большой LLM.
  6. Подключайте модель через общий интерфейс. Clef и GLiDE совместимы с API Jev, поэтому поставщика можно сменить без переписывания кода.
  7. Сравнивайте модели по цене одного правильного решения на ваших данных и повторяйте сравнение, когда меняются цены. Perplexity уже обещала снизить свою.

Итог

  • Нужны минимальная цена и длинные документы: pplx-decider.
  • Данные нельзя отдавать наружу: Strands Decider или Laya на своём сервере, для сложных задач pplx-decider или Clef на своей видеокарте.
  • Инфраструктура уже на Cloudflare и важна скорость: Clef-flash.
  • Нужна модель с независимыми тестами: Jev.
  • GLiDE пробовать там, где ответа можно ждать секунды.

Рынку три недели, цены и лидеры будут меняться. Выиграет команда, которая может за день проверить новую модель на своих данных и переключиться на неё.

Источники

  • Six Deciders, Sixteen Days
  • It’s Not a System 1 Model If It Takes Ten Seconds
  • Jev-as-a-Judge for Agent Evals
  • Jev: Inside TypeSafe AI’s First System One Decision Model
  • Clef на OpenRouter
  • Clef в документации Cloudflare Workers AI
  • pplx-decider-v1-27b на OpenRouter
  • Introducing Strands Decider 2B
  • Laya на GitHub
  • Introducing GLiDE
  • Denis Yarats о pplx-decider-v1-27b
  • Jev и новый тренд в ИИ

Источник: vc.ru

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ AGI оказался типичным сеньором: GPT-6 Astra не смогла написать бота… Архив рубрики ~Коротко из Telegram~ Рекомендации успевают за сменой интересов пользователей — Яндекс выложил в… Архив рубрики ~Полезное~ Выкатили Nano Banana 2.1 — мощный апдейт для генерации и… Архив рубрики ~Полезное~ Приложения Яндекса с Алисой AI вошли в топ-15 мобильных ИИ-приложений… Архив рубрики ~Полезное~ Сбер выкатил Kandinsky 6.0 Video — новая линейка нейронок теперь… Архив рубрики ~Полезное~ Генерим видосы на видеокарте с 8 ГБ памяти — разрабы… Архив рубрики ~Полезное~ Нанимаем бесплатных ИИ-коллег: вышел OpenDots — открытый аналог Dots от… Архив рубрики ~Коротко из Telegram~ Wikimedia Foundation обнаружила следы несанкционированной активности агентов OpenAI Фонд сообщил,… Архив рубрики ~Полезное~ DeepSeek выкатили десктопный Harness для macOS и Windows — опенсорсный… Архив рубрики ~Коротко из Telegram~ Длинное тире больше не работает как маркер ИИ-текста: исследователи нашли… Архив рубрики ~Полезное~ Google отправили четыре TPU в космос Прототип Project Suncatcher вышел… Архив рубрики ~Полезное~ Учим нейронки писать понятнее — Андрей Карпаты поделился лайфхаками, как… Архив рубрики ~Коротко из Telegram~ Apple закрыла уязвимость связанную с функционалом Airlift в iOS 27.2… Архив рубрики ~Коротко из Telegram~ Apple выпускает третьи бета-версии следующих систем для разработчиков: • iOS… Архив рубрики ~Коротко из Telegram~ AGI оказался типичным сеньором: GPT-6 Astra не смогла написать бота… Архив рубрики ~Коротко из Telegram~ Рекомендации успевают за сменой интересов пользователей — Яндекс выложил в… Архив рубрики ~Полезное~ Выкатили Nano Banana 2.1 — мощный апдейт для генерации и… Архив рубрики ~Полезное~ Приложения Яндекса с Алисой AI вошли в топ-15 мобильных ИИ-приложений… Архив рубрики ~Полезное~ Сбер выкатил Kandinsky 6.0 Video — новая линейка нейронок теперь… Архив рубрики ~Полезное~ Генерим видосы на видеокарте с 8 ГБ памяти — разрабы… Архив рубрики ~Полезное~ Нанимаем бесплатных ИИ-коллег: вышел OpenDots — открытый аналог Dots от… Архив рубрики ~Коротко из Telegram~ Wikimedia Foundation обнаружила следы несанкционированной активности агентов OpenAI Фонд сообщил,… Архив рубрики ~Полезное~ DeepSeek выкатили десктопный Harness для macOS и Windows — опенсорсный… Архив рубрики ~Коротко из Telegram~ Длинное тире больше не работает как маркер ИИ-текста: исследователи нашли… Архив рубрики ~Полезное~ Google отправили четыре TPU в космос Прототип Project Suncatcher вышел… Архив рубрики ~Полезное~ Учим нейронки писать понятнее — Андрей Карпаты поделился лайфхаками, как… Архив рубрики ~Коротко из Telegram~ Apple закрыла уязвимость связанную с функционалом Airlift в iOS 27.2… Архив рубрики ~Коротко из Telegram~ Apple выпускает третьи бета-версии следующих систем для разработчиков: • iOS…

Оставить комментарий