Пост-фактум корректировка ошибок ML с помощью Больших Языковых Моделей
Привет, VC. Я учусь сейчас на разработчика и одновременно работаю в роли Data Scientist’а.
Когда варишься в мире ML-моделей, знаешь, что в задачах регрессии 100% точности недостижимы из-за нелинейности данных. Но в реальных задачах, я столкнулась с тем, что бизнес это не устраивает, ведь для них даже 8-10% ошибок это многомиллионные убытки. Так я начала искать способы минимизировать потери.
Сначала я попробовала обучать дополнительные модели, которые покажут в каких случаях изначальная модель чаще всего ошибается, но здесь я попадала в порочный круг: каждая следующая модель требовала своей собственной проверки во внутренних системах, это в свою очередь затягивает процесс, а данные имеют свойство устаревать. Проверочные модели тоже не точны идеально, причем их 8-10% ошибок могут быть в совсем других случаях и в сумме количество ошибок только увеличивается. Тут мне пришла идея с пост-фактум коррекцией предсказаний.
Сама языковая модель не работает с задачами той же регрессии и показывает плохие результаты (это не помешало мне попробовать и убедиться самой). Происходит этом потому что LLM построена на принципе контекстной близости слов. К примеру, она воспримет числа 0.21 и 0.42 как похожие строки, не придавая значения математической разнице в величине.
Я опробовала способ, загружая в качестве дополнений к системному промту LLM, размеченные таблицы с ошибками, но это оказалось большой тратой токенов. Примерно 2500 токенов на файл CSV, состоящий из 7 столбцов и 100 строк. JSON еще сильнее расходует токены. Самым экономным вариантом оказался файл в формате markdown. По примеру работы с агентами, где им подаётся в таком формате базовый контекст. Расход оказался всего 570-1000 токенов.
Для формирования такого файла нужно после обучения основной ML-модели собрать информацию о ее ошибках на валидационном наборе данных. Разметить эти данные всё таки придется вручную, а уже далее, для сокращения времени, отдать эти данные (если они не под NDA) нейронке для формирования короткой сводки в нужном формате и расчёта коэффициентов.
Пример файла markdown (моя задача требовала исправлений только тогда, когда предсказание превышает +20%):

В этом файле важно прописывать и то, чего делать нельзя, чтобы не оставлять LLM пространства для произвольного выдумывания коэффициентов.
Такую небольшую задачу с ограничением, можно решить и алгоритмом. Полноценно метод пост-фактум корректировки незаменим на свободных задачах, где не с чем сравнивать предсказанную цену или есть много мусорных данных. Например, опечатка в модели автомобиля. LLM быстрее и качественнее найдет ближайший похожий аналог еще и по данным из интернета. Алгоритмический же поиск с библиотекой fuzzy найдет только ближайшее похожее по символам.
Пример алгоритма коррекции без LLM (доказал работоспособность и был опубликован в Langflow):
Моя изначальная метрика R2 = 0.9 на валидационном наборе из полутора тысяч строк. При помощи пост-фактум корректировки, из 10% ошибок, удалось исправить 7%. MAE на этих сделках снизилась с 500 тысяч рублей до 100 тысяч рублей и это предотвратило убытки на 6 миллионов рублей. При этом оказалось 0% ухудшений, хотя это, конечно, зависит от качества собранного контекста. По логам, все исправленные LLM строки больше не имели расхождения больше 20%, а это и было моей задачей.
Можно усилить пост-фактум корректировку, если подключить MCP сервера (например в гитхабе уже есть варианты подключения MCP российских сайтов объявлений к ClaudeCode). К этой идее меня подвело то, как сейчас работают сотрудники без моделей. Они вручную ищут похожие аналоги по объявлениям или историческим данным. Давая большой языковой модели внешние инструменты, мы можем еще сильнее минимизировать необходимость контроля человеком.

При проверке, является ли мой подход новым или я изобретаю велосипед, мне попалась статья с конференции ACL в Бангкоке, в ней применение LLM для коррекции ошибок ML был назван LLMCorr, но они не используют markdown и MCP.
Их метод улучшил точность до 39% на задаче предсказания свойств молекул. Пример их исполнения можно посмотреть по ссылке: https://aclanthology.org/2024.findings-acl.867.pdf

Источник: vc.ru
Похожие записи
Оцените материал:
Похожие записи
Как технология Vox Group на основе искусственного интеллекта решает проблему перевода в режиме реального времени для групповых поездок
14.09.2026
Вот почему я не хочу вайбкодить вирусный SaaS‑проект на миллион пользователей
14.09.2026
Слоны подавили привычное поведение в пользу более эффективного. Но классический тест на подавление импульсов им не подошел
14.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
