Архив рубрики ~Лента новостей~

Мы перестали ждать жалоб от пользователей и наняли ИИ-дежурного за $10 в месяц. Он дважды нам соврал — и всё равно окупился

Мы перестали ждать жалоб от пользователей и наняли ИИ-дежурного за $10 в месяц. Он дважды нам соврал — и всё равно окупился
Мы перестали ждать жалоб от пользователей и наняли ИИ-дежурного за $10 в месяц. Он дважды нам соврал — и всё равно окупился

Пользователи почти никогда не сообщают о поломках: напишет в поддержку хорошо если 1 из 20, остальные молча закроют вкладку и уйдут к конкурентам. Мы устали узнавать о проблемах последними — и посадили на логи нашего сервиса ИИ-агента, который дежурит круглосуточно. Обходится он в $10 в месяц, о проблеме сообщает в Telegram через минуты, а его лучший сигнал превратился в исправленную ошибку за часы. По дороге он дважды нам наврал — расскажу и про это 😉

Почему жалобы от пользователей — плохая система оповещения

У нас платформа Creatorry — генерация музыки, фото и видео нейросетями. Делает её наша студия NuroKod: мы собираем ИИ-агентов и автоматизацию для бизнеса, а Creatorry — собственный продукт, на котором обкатываем всё в первую очередь. Под капотом 18 сервисов, которые пишут около 300 тысяч строк технических логов в сутки. Команда маленькая, выделенного дежурного инженера нет.

Как обычно бизнес узнаёт, что что-то сломалось? Три пути:

  1. Пользователь пожаловался. Спойлер: не пожалуется. Он попробует один раз, увидит вечную загрузку и уйдёт. Жалоба — это подарок, который дарят единицы.
  2. Автоматические алерты по порогам. Настроили «пищать, если больше N ошибок» — и через неделю все замьютили этот канал, потому что он пищит на каждый чих.
  3. Инженер читает логи по утрам. Значит, ночная поломка живёт до утра. И это дорогие часы дорогого специалиста на скучнейшую работу.

Мы выбрали четвёртый путь: логи каждые полчаса читает языковая модель — та же технология, что в ChatGPT, только настроенная на одну узкую задачу. Она умеет то, что не умеют пороги: отличить настоящую проблему от штатного шума. А стоит как одна чашка кофе в неделю.

Как это работает — на пальцах

Раз в 30 минут агент просыпается и делает четыре вещи:

  1. Читает свежие ошибки из всех 18 сервисов (за это отвечает скрипт в 20 строк — никакой магии).
  2. Сравнивает с прошлым: столько же ошибок было час назад? Вчера? Если это старая известная болячка, которая не растёт, — молчит.
  3. Решает по жёстким правилам, стоит ли беспокоить людей. Правил всего два: либо ошибка бьёт по пользователям и деньгам, либо частота резко выросла. Всё остальное — в утреннюю сводку.
  4. Пишет в Telegram — с цифрами и объяснением, почему решил разбудить.

Главная цифра, которой мы гордимся: в 9 случаях из 10 агент молчит. Это осознанный дизайн. Система оповещения, которая говорит слишком часто, умирает — её просто перестают читать. Наш канал алертов живёт четвёртый месяц, и его читают.

ИИ агентИИ агент

Как он нам врал: история первая

Апрель. Агент находит в логах две настоящие ошибки — молодец. Осталось отправить сообщение. И тут выясняется, что инструмент отправки ему недоступен. Что делает человек? Останавливается. Что сделала модель? Придумала недостающее: собрала запрос к Telegram сама и подставила ключ доступа. Выдуманный. Правильного формата, но с цифрами из своей ИИ головы.

Сообщение не ушло. Две настоящие ошибки остались непрочитанными, а узнали мы об этом только на следующий день.

Урок, который стоит запомнить каждому, кто внедряет ИИ в процессы: упёршись в препятствие, модель скорее дорисует реальность, чем остановится. Теперь всё, что можно достать из конфигурации детерминированно, достаётся скриптом — модели просто негде «вспоминать».

История вторая: 84 ошибки в час из 2,5 реальных

4 мая агент прислал тревогу: «84 ошибки в час!» Проверяем руками: реальная частота — 2,5 в час. В указанном окне — вообще ноль.

Разобрались, как он дошёл до такого. Модель посчитала ошибки за 5 минут (неправильно), умножила на 12 (нельзя), и заодно записала в ошибки события, которые ошибками не являются (клиент сам закрыл соединение). А главное — проверял свою находку тот же, кто её нашёл. Сам нашёл, сам себя проверил, сам себе поверил.

Лечение сформулировали одним принципом: находке нельзя верить, пока её не пересчитал кто-то, кто её не находил. Теперь проверка устроена как в бухгалтерии: считает один, сверяет другой, причём другим способом. Расходятся больше чем вдвое — тревога умирает, не родившись. В журнале агента есть красивая запись: он заявил «7 событий», независимый пересчёт нашёл 1 — тревога отклонена, в канале тишина вместо ложной паники.

И ещё одна находка, по мне интересная: таблицы отмазок. Мы заранее выписали в инструкцию агента фразы, которыми он будет оправдывать халтуру — «это явно ошибка, проверка излишня», «цифры близки, и так сойдёт», «некогда проверять, это срочно» — и на каждую вписали жёсткий контраргумент. Звучит смешно, работает отлично. Кстати, подозреваю, что с людьми это тоже работает.

Сколько это стоит

Теперь любимая часть — деньги.

  • Модель MiniMax M3: $10 в месяц, фиксированная подписка. За июль агент «прочитал» 435 миллионов токенов — это как несколько тысяч книг. Секрет дешевизны в том, что 85% этого объёма — повторное чтение одного и того же (инструкции, память), а такое чтение у провайдеров почти бесплатно.
  • Хранилище логов: $0 — хватает бесплатного тарифа Grafana Cloud.
  • Сервер: доля недорогого VPS, сотня рублей.

Итого — дешевле одной чашки кофе в неделю за круглосуточное дежурство на 18 сервисах. Для сравнения: дежурный инженер на полставки — от 100 тысяч рублей в месяц, и по ночам он спит.

При этом инженер больше не листает логи в поисках «где болит» — он получает готовую наводку: какой сервис, какая ошибка, сколько раз и с какого момента, насколько выросла частота и что агент подозревает как причину. Открыл сообщение — и сразу понятно, куда смотреть и за что браться. Чинит по-прежнему человек, но путь «сломалось → поняли, где» сжался с суток до 30мин.

Всё это покрывается подпиской за $10/monВсё это покрывается подпиской за $10/mon

Что это дало за 4 месяца, в фактах

113 сигналов за 84 дня — примерно 1,3 в день (проект активно развивали). Из них три показательных:

Ошибка, починенная за часы. Утром 1 июня агент прислал критическую тревогу: генерация видео у пользователей лежит, счётчик ошибок растёт. Причину нашли по горячим следам его сигнала за минуты, остальное время ушло на сам фикс — в 10:31 исправление уже было в продакшне. Ни один пользователь так и не пожаловался — они просто видели вечную загрузку. Сколько из них ушло бы навсегда, узнай мы о проблеме вечером?

Тревога «не о том», которая вскрыла скрытую дыру. В июле агент поднял шум из-за сбоя у внешнего поставщика нейросетей. Сбой рассосался сам — можно было закрыть и забыть. Но раскопки по следам сигнала показали: наша страховка fallback (автоматическое переключение на резервного поставщика) в этот момент даже не попыталась включиться — из-за ошибки в конфигурации. На всех графиках при этом было зелено. Такие дыры не находятся никак, кроме как случайно — или вот так.

Карта долгов бесплатно. Две трети всех сигналов — один и тот же хронически больной сервис. Журнал агента за пару месяцев — это готовый, отсортированный по реальным частотам список «что чинить в первую очередь». Не по ощущениям — по данным.

Кто сторожит сторожа

Самое смешное за эти 4 месяца: агент, который следит за нашей системой, сам оказался её самой ненадёжной частью. В его журнале есть две дыры — несколько дней в мае и 11 в июне, — когда он просто молчал: обновление сломало планировщик, и никто этого не заметил. Молчание неотличимо от «всё хорошо».

Решение старо как мир: ежедневный отчёт по расписанию. Каждое утро в канал падает сводка за сутки — она полезна сама по себе, но её главная работа другая: нет утренней сводки — значит, умер сторож. Если строите любую автоматизацию — заложите ей обязанность регулярно доказывать, что она жива.

Что учесть, если захотите своего ИИ агента:

  1. Молчание — по умолчанию. Настройте так, чтобы система говорила в 1 случае из 10. Иначе её замьютят через неделю.
  2. Не давайте ИИ прав на действия. У нашего агента все доступы только на чтение, а единственное, что он умеет во внешнем мире, — написать сообщение в наш же канал. Что бы он ни «придумал», хуже лишнего сообщения ничего не случится.
  3. Проверка чужими руками. Любую находку модели должен пересчитывать отдельный шаг, который её не находил.
  4. Смотрите, что уходит наружу. Наши логи — обезличенная техническая телеметрия, без имён и почт, поэтому их можно доверить внешней модели. Если в ваших данных есть персональное — сначала вычистите, потом автоматизируйте.
  5. Сторожа тоже надо сторожить. Ежедневный «я жив» по расписанию — обязателен.

Собирается такая система за день-два силами одного инженера. Окупается первой же ночной поломкой, о которой вы узнали в течение получаса, а не из гневного отзыва потом.

Я Александр, сооснователь студии NuroKod — мы делаем ИИ-агентов, ботов и MVP для бизнеса. Агент из этой истории дежурит на нашей собственной платформе. Расскажите в комментариях: как вы узнаёте, что у вас что-то сломалось, — от мониторинга или от клиентов?

Источник: vc.ru

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники План оздоровления компании Lucid основан на экономии 1,4 млрд долларов денежных средств и развитии роботакси. Архив рубрики ~Обо всем~ Иридиевый катализатор селективно расщепил полиуретан в смеси пластиков. Это поможет перерабатывать спортивную одежду и купальники Новости робототехники Робот с дугами на спине прокатился с горки. Он умеет подтягиваться на руках и перекатываться через голову Новости робототехники Zoox представляет собой готовый продукт для производства роботакси для расширения в США. Архив рубрики ~Обо всем~ Рыбы-симбионты ускорили заживление ран у кораллов. Раны затягивались на 38–55 процентов быстрее Новости робототехники Гуманоиды не будут масштабироваться на заводах, пока затраты не снизятся. Новости робототехники Музыкальный фрагмент из фильма ужасов вдохновил на создание носимого устройства, превращающего движения робота в предупреждающую музыку. Архив рубрики ~Обо всем~ Длину бедра назвали маркером риска сахарного диабета. Ученые нашли его с помощью машинного обучения и использовали в скрининговом тесте Архив рубрики ~Коротко из Telegram~ Стартап Autonomous представил физический ключ Autonomous Key с помощью которого… Архив рубрики ~Коротко из Telegram~ Kimi K3 теперь можно бесплатно погонять на 50 млн токенов… Архив рубрики ~Коротко из Telegram~ Генерим лучшие резюме, которые проходят ИИ-скрининг и попадают к живым… Архив рубрики ~Коротко из Telegram~ Автономный агент OpenAI на бенчмарке ExploitGym (с намеренно отключёнными… Архив рубрики ~Коротко из Telegram~ Профили Telegram готовятся к масштабному обновлению — дизайнер мессенджера… Новости робототехники Reimagine Robotics выходит из скрытности с роботами, которые «обучаются на работе» Новости робототехники План оздоровления компании Lucid основан на экономии 1,4 млрд долларов денежных средств и развитии роботакси. Архив рубрики ~Обо всем~ Иридиевый катализатор селективно расщепил полиуретан в смеси пластиков. Это поможет перерабатывать спортивную одежду и купальники Новости робототехники Робот с дугами на спине прокатился с горки. Он умеет подтягиваться на руках и перекатываться через голову Новости робототехники Zoox представляет собой готовый продукт для производства роботакси для расширения в США. Архив рубрики ~Обо всем~ Рыбы-симбионты ускорили заживление ран у кораллов. Раны затягивались на 38–55 процентов быстрее Новости робототехники Гуманоиды не будут масштабироваться на заводах, пока затраты не снизятся. Новости робототехники Музыкальный фрагмент из фильма ужасов вдохновил на создание носимого устройства, превращающего движения робота в предупреждающую музыку. Архив рубрики ~Обо всем~ Длину бедра назвали маркером риска сахарного диабета. Ученые нашли его с помощью машинного обучения и использовали в скрининговом тесте Архив рубрики ~Коротко из Telegram~ Стартап Autonomous представил физический ключ Autonomous Key с помощью которого… Архив рубрики ~Коротко из Telegram~ Kimi K3 теперь можно бесплатно погонять на 50 млн токенов… Архив рубрики ~Коротко из Telegram~ Генерим лучшие резюме, которые проходят ИИ-скрининг и попадают к живым… Архив рубрики ~Коротко из Telegram~ Автономный агент OpenAI на бенчмарке ExploitGym (с намеренно отключёнными… Архив рубрики ~Коротко из Telegram~ Профили Telegram готовятся к масштабному обновлению — дизайнер мессенджера… Новости робототехники Reimagine Robotics выходит из скрытности с роботами, которые «обучаются на работе»

Оставить комментарий