🖥 Эммануэль Акита (спонсировано Andela) разбирает частую ловушку: считается, что…
🖥 Эммануэль Акита (спонсировано Andela) разбирает частую ловушку: считается, что галлюцинации решаются простым RAG — режете текст на чанки, эмбеддите, ищете по сходству. Работает, пока не задеплоите в проде — обычный RAG исходит из того, что семантическая близость означает релевантность, а это не всегда так.
Проблема наглядна: если в одном чанке «Acme купила BetaTech», а в другом «Сара Коннор стала CEO BetaTech», обычный поиск на вопрос «кто руководит компанией, которую купила Acme» найдёт чанк про покупку, но пропустит чанк про Сару Коннор — семантически они не связаны. Это multi-hop проблема: связка A→B→C, где нужные концепты просто не сосуществуют в одном тексте.
💯 Решение — GraphRAG: LLM извлекает из текста сущности и связи между ними, строя граф знаний, а запрос находит стартовый узел через векторный поиск и обходит связи графа для сбора контекста. Ключевая деталь — жёсткая схема типов узлов и связей заранее, иначе модель начнёт плодить дубли вроде «Acme Corp» и «Ame» как разные сущности.
Трейд-оффы честные: построение графа дороже обычного RAG (нужен полноценный LLM-вызов на чанк, а не дешёвый эмбеддинг), схема данных не опция, а необходимость — зато отладка прозрачнее: вместо копания в векторах можно посмотреть на граф и увидеть, где модель ошиблась.
❓ Сталкивались с задачами, где обычный RAG давал сбой именно на многоходовых вопросах?
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
