Как мы научили ИИ читать корпоративные регламенты: от наивного RAG до измеримого pipeline
В статье — практический кейс создания корпоративного RAG-сервиса для поиска по внутренним регламентным и нормативным документам. Мы прошли путь от стандартного пайплайна на n8n и Qdrant до гибридной архитектуры с BM25, embeddings, RRF, reranking, структурным chunking и обработкой сложных таблиц и документов. Отдельно разбирается, почему обычная нарезка текста плохо работает на нормативных документах, как мы использовали Natasha, словари корпоративных терминов и мультимодальные модели, а также как построили систему измерения качества через Arize Phoenix и LLM-as-a-Judge. Показаны реальные результаты A/B-теста с реранкером по 9 метрикам с объяснением, почему в production-RAG важнее не «самая умная LLM», а качество подготовки документов, retrieval и воспроизводимая оценка изменений.
Читать далее
Источник: habr.com
Похожие записи
Оцените материал:
Похожие записи
О проблеме присуждения премии тысячелетия по уравнению Навье-Стокса | OpenAI
09.09.2026
Психоделики выявляют иммунные маркеры, связанные с быстрым облегчением депрессии.
09.09.2026
ИИ раздал задачи после созвона. Кто на самом деле что-то обещал?
09.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
