Архив рубрики ~Лента новостей~

Модели перестают писать текст. Разбираем Jev и новый тренд в ИИ

Модели перестают писать текст. Разбираем Jev и новый тренд в ИИ
Модели перестают писать текст. Разбираем Jev и новый тренд в ИИ

Как работают привычные модели

ChatGPT, Claude и другие языковые модели пишут ответ по одному кусочку слова за раз. Каждый следующий кусочек зависит от предыдущего. Поэтому длинный ответ генерируется несколько секунд, а платите вы за каждый выданный токен.

Для разговора это удобно. Для программ часто избыточно.

Возьмём сервис поддержки, которому нужно понять, куда отправить обращение: в оплату, доставку или возвраты. Нужен один ответ из трёх вариантов. А модель сначала пишет текст, потом программа вытаскивает из него ответ, и иногда формат ломается. Если таких решений миллион в день, это медленно, дорого и ненадёжно.

Что делает Jev

Jev вообще не пишет текст. Разработчик заранее задаёт вопрос и варианты ответа, модель выбирает. Форм ответа три:

  • выбор одного варианта из списка;
  • оценка на шкале, например риск ухода клиента от 0 до 1;
  • вероятность «да» или «нет».

К каждому ответу прилагается уверенность: «доставка, 94%».

Проще всего представить так. Языковой модели вы пишете письмо и получаете письмо в ответ. Jev вы даёте анкету с галочками, и она заполняет её за доли секунды.

В чём инновация

Скорость и цена. Все возможные ответы известны заранее, поэтому модель считает их вероятности одновременно, за один проход. Генерировать ничего не надо. По данным TypeSafe, одно решение занимает 70–500 мс, а миллион входных токенов стоит $0,042. Выход бесплатный: считать там почти нечего. Компания заявляет, что на тех же задачах Jev в 20–200 раз быстрее языковых моделей и в 40–400 раз дешевле.

Ответ всегда в нужном формате. Jev не может выдать вариант, которого нет в списке, сломать структуру или ответить «извините, не могу помочь». Программа получает ответ и сразу с ним работает.

Уверенность не фейковая. Языковые модели учили нравиться людям, поэтому они часто звучат уверенно, даже когда ошибаются. Jev учили по-другому: если модель говорит «70%», она должна оказываться права примерно в 70% таких случаев. Компания называет этот метод RLCD, обучение на калиброванных решениях.

Когда уверенности можно верить, разработчик ставит пороги: выше 90% система действует сама, между 60 и 90% просит подтверждение, ниже отдаёт человеку. Такую схему рекомендует сама TypeSafe. Автоматизацией становится можно управлять.

Где Jev уже применяют

Модели две недели, но первые проекты уже есть. Все цифры ниже получили их авторы на своих данных.

Разбор документов. Разработчик Kyotofin собрал на Jev классификатор налоговых документов. Система определяет, к какой из 261 налоговой формы США относится каждая страница PDF. По словам автора, на их наборе документов классификатор не ошибся ни разу, страница стоит около $0,001. Это в 34 раза дешевле и в 6 раз быстрее конвейера на языковой модели, которым они пользовались до этого.

Оценка работы ИИ-агентов. Когда агент выполнил задачу, кто-то должен проверить, справился ли он. Обычно это поручают другой языковой модели. LangChain сравнила Jev в этой роли с GPT-5.6 и Claude Sonnet 4.6. При повторных прогонах оценки Jev разбросаны в 92–913 раз меньше. Проверка заняла в среднем 0,44 с и $0,00035. Весь тест обошёлся в $0,34, а тот же тест на Claude в $28,17. После теста Jev добавили как судью в LangSmith.

Выбор инструментов для агента. У агента бывают сотни навыков, и описания всех приходится держать в запросе. В проекте Skill Router Jev перед каждым ходом решает, какие навыки нужны, и подгружает только их. На каталоге из 236 навыков запрос сократился со 113 до 26 тыс. токенов. Агент ответил правильно в 90% случаев, с полным каталогом было 88%.

Проверка дешёвой модели. Отвечает недорогая языковая модель, Jev проверяет ответ, и только сомнительные случаи уходят модели посильнее. Такой рецепт опубликован в документации OpenRouter.

Во всех четырёх примерах решение простое, однотипное и повторяется тысячи раз. На такие задачи Jev и рассчитан.

Откуда название

Само имя отсылает к парадоксу Джевонса. Когда паровые машины стали экономичнее, угля стали сжигать больше: дешёвая энергия открыла новые применения. Ставка TypeSafe та же. Если решение ИИ стоит доли цента и занимает доли секунды, его можно встроить туда, где раньше языковые модели были невыгодны.

Чего Jev не умеет

Он не пишет текст и код, с ним нельзя поговорить. По отзывам первых пользователей, контекст ограничен 32 тыс. токенов. Изображения модель пока не принимает.

«Не галлюцинирует» тоже стоит понимать узко. Формат ответа гарантирован, правильность нет: модель может уверенно выбрать не тот вариант. Глава TypeSafe сам признал это в обсуждении запуска. Цифры скорости и цены компания получила на собственных тестах, независимых бенчмарков пока нет.

Jev не заменяет ChatGPT. Языковая модель думает и пишет, Jev быстро принимает однотипные решения внутри программы.

Мне как руководителю разработки интересна сама идея. Последние годы ИИ встраивали в продукты через чат: всё, что нужно программе, упаковывали в текстовый запрос и надеялись, что ответ придёт в правильном формате. Jev первым сделал модель, которая говорит на языке программы.

Если уже пробовали Jev или похожие модели на своих задачах, напишите в комментариях, на какой задаче и что получилось.

Источники

  • Анонс Jev в блоге TypeSafe AI
  • The Rundown AI: как TypeSafe предлагает использовать Jev
  • Интервью Диогу Алмейды в подкасте Latent Space
  • Разбор запуска и критики с Hacker News (explainx.ai)
  • LangChain: Jev как судья для оценки агентов
  • Skill Router для LangChain
  • Классификатор налоговых документов Kyotofin

Источник: vc.ru

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ Logitech представили свою первую клавиатуру для ВАЙБКОДЕРОВ MX Keypad —… Архив рубрики ~Коротко из Telegram~ «Объясни это скептику» — и вдруг появляются аргументы, которых не… Архив рубрики ~Коротко из Telegram~ ⚡️ Разработчик из Anthropic показал команду, которая экономит 30% токенов… Архив рубрики ~Коротко из Telegram~ «Оцени, насколько это сложная задача» — простой способ понять, стоит… Архив рубрики ~Коротко из Telegram~ Приём, который экономит время Кажется логичным сразу попросить ИИ сделать… Архив рубрики ~Полезное~ Для GPT-6 Sol и Opus 5.5 выложили официальные гайды для… Архив рубрики ~Коротко из Telegram~ По данным Марка Гурмана Apple может выпустить свои первые умные… Архив рубрики ~Коротко из Telegram~ С 1 декабря в России планируют ввести технологический сбор на… Архив рубрики ~Коротко из Telegram~ Samsung глядя на Apple продолжает жмотную деградацию – в комплекте… Архив рубрики ~Коротко из Telegram~ ChatGPT поможет разобрать ваш сон — модель попробует объяснить, какие… Архив рубрики ~Полезное~ Виртуальный музей истории ИИ Юзер с помощью Claude Opus 5.5… Архив рубрики ~Коротко из Telegram~ Mimo-v2.6 крокодил от Xiaomi Слежу пристально за новыми моделями из… Новости робототехники Peak XV повысила потолок начальных инвестиций Surge до 5 миллионов долларов и представила группу из 18 стартапов. Архив рубрики ~Полезное~ 🕸️ Нашёл удобное решение для всех, кто потерял доступ к… Архив рубрики ~Коротко из Telegram~ Logitech представили свою первую клавиатуру для ВАЙБКОДЕРОВ MX Keypad —… Архив рубрики ~Коротко из Telegram~ «Объясни это скептику» — и вдруг появляются аргументы, которых не… Архив рубрики ~Коротко из Telegram~ ⚡️ Разработчик из Anthropic показал команду, которая экономит 30% токенов… Архив рубрики ~Коротко из Telegram~ «Оцени, насколько это сложная задача» — простой способ понять, стоит… Архив рубрики ~Коротко из Telegram~ Приём, который экономит время Кажется логичным сразу попросить ИИ сделать… Архив рубрики ~Полезное~ Для GPT-6 Sol и Opus 5.5 выложили официальные гайды для… Архив рубрики ~Коротко из Telegram~ По данным Марка Гурмана Apple может выпустить свои первые умные… Архив рубрики ~Коротко из Telegram~ С 1 декабря в России планируют ввести технологический сбор на… Архив рубрики ~Коротко из Telegram~ Samsung глядя на Apple продолжает жмотную деградацию – в комплекте… Архив рубрики ~Коротко из Telegram~ ChatGPT поможет разобрать ваш сон — модель попробует объяснить, какие… Архив рубрики ~Полезное~ Виртуальный музей истории ИИ Юзер с помощью Claude Opus 5.5… Архив рубрики ~Коротко из Telegram~ Mimo-v2.6 крокодил от Xiaomi Слежу пристально за новыми моделями из… Новости робототехники Peak XV повысила потолок начальных инвестиций Surge до 5 миллионов долларов и представила группу из 18 стартапов. Архив рубрики ~Полезное~ 🕸️ Нашёл удобное решение для всех, кто потерял доступ к…

Оставить комментарий