Почему 90% внедрений ИИ в корпоратах заканчиваются пшиком (и при чём тут RAG)
Итак, руководство закупает подписки или поднимает контур с локальной нейросетью, скармливает туда всю внутреннюю базу документов и радостно объявляет: «Теперь наш умный ассистент знает всё о компании и повысит продуктивность на 50%».
Через месяц ассистентом никто не пользуется. Или пользовались, но он нагаллюцинировал скидку клиенту из регламента пятилетней давности.
По оценкам аналитиков Gartner и RAND, до 80% всех корпоративных пилотов в сфере ИИ застревают на этапе демо-версии или тихо сворачиваются. И дело тут вовсе не в том, что нейросети недостаточно умные.
Как на самом деле работает RAG и почему он тупит
Чтобы нейросеть знала регламенты вашей компании, её не переобучают с нуля — это слишком дорого. Используют технологию RAG (Retrieval-Augmented Generation) или поиск с дополнением генерации.
Схема на пальцах простая:
- База документов компании режется на тысячи мелких кусочков текста (чанк).
- Эти кусочки превращаются в математические векторы и складываются в векторную базу данных.
- Когда сотрудник задает вопрос, векторная база ищет несколько самых похожих по смыслу кусочков и отдает их нейросети.
- Нейросеть читает эти кусочки и пишет человеческий ответ.
И вот тут, собственно, начинается движ.
Первая проблема — наивный чанкинг. Документы режут тупым скриптом, например, по 500 символов. Скрипту всё равно, где кончается мысль. В итоге условие договора оказывается в одном кусочке, а штрафные санкции за его нарушение — в другом. Нейросеть получает на вход половину правды и додумывает вторую половину сама.
Вторая проблема — поиск по похожисти, а не по фактам. Векторные базы данных ищут тексты по косинусному сходству векторов. Они великолепно находят тексты, близкие по настроению или теме, но абсолютно слепы к точным цифрам, номерам артикулов и датам.
Третья проблема — немытые данные компании. В любой корпоративной папке годами копятся файлы вроде «Регламент_продаж_2021_старый.pdf», «Регламент_финал_v2.docx» и «Новый_регламент_утв.pdf». Поисковый алгоритм RAG видит все эти файлы как одинаково релевантные и с чистой совестью кормит нейросети устаревшие инструкции.
Получается классический физический принцип: мусор на входе — мусор на выходе.
Теневой ИИ и главный страх службы безопасности
Кстати, если вы хотите протестировать все самые свежие модели уровня Claude Sonnet 5, GPT-5.6 или Gemini 3 в одном удобном месте и сравнить их ответы без костылей с иностранными картами — на платформе SYNTX.AI это можно сделать за пару кликов.
По промокоду NEIROSKUF дадут 15% скидку на все тарифы.
А в компаниях тем временем начинается вторая серия этой драмы — Shadow AI (он же «Теневой ИИ»).
Сотрудники быстро понимают, что официальный корпоративный ассистент выдает какую-то унылую чушь. Но сдавать задачи начальству все равно надо. В итоге менеджеры, программисты и маркетологи втихаря начинают скопировать финансовые отчеты, исходный код и персональные данные клиентов в свои личные аккаунты ChatGPT или Claude с домашнего телефона.
Служба безопасности компании думает, что контролирует периметр. На деле коммерческая тайна компании утекает в публичные облака через личные промпты сотрудников просто потому, что корпоративный софт сделан через одно место.
Что реально работает вместо «наивного RAG»
Инженеры, которые реально запускали RAG в продакшн, давно не надеются на волшебные кнопки. Рабочие системы устроены намного сложнее:
- Гибридный поиск. Векторный поиск по смыслу комбинируют с классическим полнотекстовым поиском по ключевым словам (алгоритмы вроде BM25). Только так можно гарантировать, что модель найдет и смысл, и точный номер статьи договора.
- Переранжирование (Reranking). Найденные кусочки текста перед отправкой в нейросеть прогоняют через отдельную жесткую модель-переранжировщик (Cross-Encoder), которая отсеивает 80% мусора.
- Жесткая гигиена данных. Перед запуск RAG из базы вычищают все дубли, устаревшие версии и безымянные файлы. Без ручной чистки данных ни одна система не заработает.
И получается простая мораль.
Купить лицензии на самую дорогую нейросеть за миллионы долларов — дело пары кликов. Заставить её вычистить десятилетний бардак в файловой помойке вашей компании — не сможет ни один алгоритм.

telegram.metelegram.meИсточник: vc.ru
Похожие записи
- Коллега по имени Себастьян: зачем Microsoft сделала своего OpenClaw
- В сфере корпоративного ИИ наступает период, когда оценка возможностей систем становится невозможной: агенты приобретают автономность быстрее, чем компании успевают проверять их работоспособность.
- Тысяча строк кода за час. Потеря понимания системы за три дня.
Оцените материал:
Похожие записи
Искусственный интеллект выходит из-под контроля: Предупреждение создателя ИИ
04.12.2025
Щелевая коррозия: порча нержавейки и «ржавые» имплантаты — почему это происходит?
31.05.2026
Графика процессора Snapdragon X2 Elite Extreme обходит мобильную GeForce RTX 3050M
30.09.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
