Прекратите строить графики для всего подряд: когда GraphRAG действительно превосходит Vector RAG
Даттарадж Рао, Персистентные системы

Предоставлено автором
Если вы в последние два года использовали метод генерации с дополненной информацией (Retrieval-Augmented Generation, RAG) для создания чего-либо, вы наверняка сталкивались с его основной проблемой: вы разбиваете документы на фрагменты, встраиваете их, извлекаете несколько наиболее похожих на вопрос фрагментов и передаете их модели. Для вопроса «Какова была наша политика возврата средств в третьем квартале?» это работает превосходно. Но для вопроса «Какие повторяющиеся темы наблюдаются в жалобах клиентов за два года?» это не срабатывает — потому что ни один фрагмент не содержит ответа.
Модное решение — GraphRAG : вместо того, чтобы передавать модели отдельные фрагменты текста, вы сначала строите граф знаний сущностей и связей в вашем корпусе, а затем используете эту структуру в качестве контекста. Предложение заманчиво. Но заманчивые предложения заслуживают тщательного анализа, поэтому я проанализировал доказательства — оригинальную статью Microsoft плюс четыре независимых сравнительных исследования — чтобы ответить на простой вопрос: действительно ли результаты улучшаются, когда вы заменяете текстовые фрагменты на контекстный граф?
Вкратце: Да, в значительной степени — но только для правильных вопросов и не бесплатно. Позвольте мне показать вам доказательства.
Почему текстовые фрагменты упираются в стену
Стандартный векторный алгоритм RAG извлекает k фрагментов текста, наиболее похожих на ваш запрос. Однако у этой конструкции есть три структурных недостатка:
-
Оно не может соединить разрозненные факты. Когда для ответа требуется объединить факты, находящиеся в разных местах, в рамках общего целого, изолированные фрагменты никогда не выявят эту связь.
-
Он не учитывает глобальные вопросы. Для ответа на вопрос «Каковы основные темы?» необходим весь корпус, но поиск по сходству выдает лишь несколько фрагментов, которые поверхностно напоминают этот вопрос.
-
Это обрывает контекст на границах фрагментов. Отношения и иерархия, от которых зависит сложное рассуждение, — это именно то, что отбрасывает метод фрагментации.
Аналитики Microsoft Research четко сформулировали это при представлении GraphRAG: базовая версия RAG «с трудом справляется с установлением связей» и показывает низкие результаты при попытке «целостно понять обобщенные семантические концепты в больших массивах данных».
Что меняет контекстный граф
GraphRAG решает проблему еще до того, как будет задан какой-либо вопрос. В процессе индексирования большая языковая модель (LLM) считывает каждый фрагмент и извлекает сущности, связи и утверждения, объединяя их во взвешенный граф знаний. Затем она запускает алгоритм обнаружения сообществ (лейденский алгоритм) для кластеризации графа в иерархию связанных тем и предварительно формирует краткое описание на естественном языке для каждого сообщества.
На этапе запроса основную работу выполняют эти сводки. Каждое соответствующее сообщество составляет частичный ответ (этап «картирования»), эти частичные ответы ранжируются и объединяются (этап «сокращения»), а модель синтезирует окончательный ответ, основанный на структуре, а не на нескольких выбранных фрагментах. Варианты, такие как HippoRAG, идут другим путем, используя граф плюс персонализированный обход PageRank для поиска нужных фрагментов — но основная идея та же: пусть отношения, а не только косинусное сходство, определяют, какой контекст видит модель.
Доказательства: четыре исследования, одна закономерность.
1. Глобальное осмысление: главная победа.
Компания Microsoft сравнила GraphRAG с наивным RAG по глобальным вопросам, требующим «осмысления всего корпуса», на наборах данных, содержащих миллионы токенов. В качестве судьи выступил юрист с магистерской степенью по трем критериям: всесторонность, разнообразие и расширение возможностей.
GraphRAG одержал победу в 72–83% сравнений по полноте и в 62–82% сравнений по разнообразию по сравнению с Vector RAG. Его сводки самого высокого уровня использовали до 97% меньше токенов, чем при прямой обработке исходного текста.
Это не улучшение за счет погрешности округления. Именно в тех типах вопросов, которые нарушают правило RAG для текстовых блоков, график выигрывает в двух случаях из трех или даже чаще.
2. Многошаговый поиск: Граф находит фрагменты, которые отсутствуют в исходных данных.
Второе доказательство касается качества поиска: попадает ли правильный подтверждающий фрагмент текста вообще в верхние результаты? На стандартных многошаговых тестах вопросов и ответов (MuSiQue, HotpotQA, 2WikiMultiHopQA) поиск с использованием графов значительно повышает показатель Recall@5:
-
Средний показатель Recall@5 вырос с 73,4% (наивный RAG) до 87,8% (с использованием графического подхода), что составляет прирост на +19,6 пункта .
-
Наибольший скачок наблюдается в самых сложных, кросс-документных наборах: +31 балл на MuSiQue и +28 баллов на 2Wiki .
-
HippoRAG сообщает о повышении точности до 20% при многошаговом контроле качества, в 10–20 раз меньшей стоимости и в 6–13 раз большей скорости по сравнению с итеративными методами поиска.
3. Контролируемое противостояние лицом к лицу — вот где начинается честное противостояние.
Вот здесь история приобретает новые нюансы. В исследовании 2025 года, проведенном Мичиганским государственным университетом и компанией Meta, алгоритм RAG был сопоставлен с четырьмя семействами GraphRAG по единому протоколу — идентичное разбиение на фрагменты, встраивание и генерация — и не выявил единого победителя. Два подхода дополняют друг друга:
-
При поиске фактов в один шаг (естественные вопросы) метод RAG показал лучшие результаты (F1 64,8 против 63,0 у лучшего метода построения графов).
-
В многошаговом логическом анализе (MultiHop-RAG) поиск с использованием графов показал лучшие результаты (70,3 против 67,0 общей точности).
Вывод: контекстный граф — это не универсальное улучшение. Это специализированный инструмент, который приносит пользу именно тогда, когда вопросы требуют логического рассуждения между различными элементами.
4. Когда использовать графики: заключение о типах задач
В последнем бенчмарке GraphRAG-Bench (ICLR 2026) ставилась задача ответить на вопрос: «В каких сценариях графовые структуры обеспечивают измеримые преимущества?» Показатели точности по задачам четко определяют эту границу:
-
Простой поиск фактов: фрагменты текста 60,9 против графа 60,1 — фактически ничья. Структура графа — это излишние данные, которые запросу не нужны.
-
Сложные рассуждения: График 53,4 против фрагментов 42,9 — выигрыш в 10 баллов по графику.
-
Контекстное суммирование: график 64,4 против фрагментов 51,3 — выигрыш в 13 баллов по сравнению с графиком.
Таблица результатов

Предоставлено автором
При чтении сверху вниз закономерность очевидна: преимущество графика возрастает с глубиной рассуждений в вопросе, в то время как текстовые фрагменты сохраняют свою актуальность, опираясь на отдельные факты.
Подвох: стоимость и проблема судейства в рамках программы LLM.
Два момента не позволяют назвать это беспроигрышным вариантом, и игнорирование их приводит к разочарованию команд.
Создание графа — дорогостоящий процесс. Привлечение LLM-специалиста для извлечения сущностей и связей из всего корпуса данных обходится недешево. По результатам одного анализа, построение индекса обойдется примерно в 48 долларов США по сравнению с GPT-40 для корпуса средней сложности, что значительно выше стоимости обычного векторного индекса. (Собственный продукт Microsoft, LazyGraphRAG, переносит извлечение данных на этап выполнения запроса и снижает его стоимость примерно до 0,1% — это неявное признание того, что первоначальный бюджет нецелесообразен для многих развертываний.)
Многие победы оцениваются другим юристом с магистерской степенью, а судьи с магистерской степенью предвзяты. Независимая проверка выявила систематические недостатки в этом стиле оценки: предвзятость по положению (изменение первого ответа может повлиять на процент побед более чем на 30 баллов), предвзятость по длине и предвзятость по количеству попыток (идентичные сравнения не совпадают в разных сериях). После исправления заявленный процент побед одного популярного метода, составлявший 66,7%, упал примерно до 39% — ниже отметки безубыточности в 50%.
Главный вывод не в том, что «исследование ошибочно». Он заключается в том, что значительные улучшения — увеличение точности многошагового поиска на +20%, увеличение полноты на +15–30 пунктов — являются устойчивыми, в то время как узкие пределы полноты заслуживают скептического пересмотра с использованием эталонных метрик.
Итак, когда же следует использовать контекстный граф?
Если отбросить всю шумиху, то это решение окажется на удивление практичным.
Используйте контекстный граф, когда: ваши вопросы носят многоступенчатый, глобальный характер или требуют осмысления; вам необходимы исчерпывающие ответы с разных точек зрения; и ваш корпус данных имеет сложную взаимосвязь (исследовательские библиотеки, материалы дел, истории инцидентов, базы знаний).
Используйте текстовые фрагменты, когда: ваши запросы в основном представляют собой поиск отдельных фактов; ваш корпус невелик или имеет плоскую структуру; и стоимость индексирования, задержка и простота эксплуатации перевешивают незначительное повышение качества.
И самое главное, используйте гибридный подход: систематические исследования сходятся в одной и той же рекомендации: направляйте каждый запрос к нужному методу или объединяйте данные из обоих методов. Сочетание поиска по графам и поиска по фрагментам неизменно превосходит любой из этих методов по отдельности. Вам не нужно выбирать религию; вам нужно построить маршрутизатор.
Итог
Контекстный граф — это не магия и не шарлатанство. Это целенаправленный инструмент. Дайте ему вопрос, требующий сопоставления разрозненных фактов или синтеза всего корпуса, и он с большим отрывом превзойдёт текстовые фрагменты. Дайте ему вопрос «какой номер телефона на третьей странице?», и вы заплатите за индексацию, которая вам не нужна.
Команды, которые добьются успеха с GraphRAG в 2026 году, будут не теми, кто строит графики для всего подряд. Это будут те, кто знает, какие вопросы заслуживают графического представления, и создаст достаточно интеллектуальные конвейеры, чтобы различать эти вопросы.
Даттарадж Рао — архитектор отдела исследований и разработок в компании Persistent Systems.
Добро пожаловать в сообщество VentureBeat!
Наша программа гостевых публикаций — это площадка, где технические эксперты делятся своими знаниями и предоставляют нейтральные, непредвзятые аналитические материалы по искусственному интеллекту, инфраструктуре данных, кибербезопасности и другим передовым технологиям, формирующим будущее предприятий.
Узнайте больше о нашей программе гостевых публикаций — и ознакомьтесь с нашими рекомендациями, если вы заинтересованы в написании собственной статьи!
Источник: venturebeat.com
Похожие записи
Оцените материал:
Похожие записи
Компания Trump Media объединяется с компанией, занимающейся термоядерным синтезом.
18.12.2025
Мессенджеры оказались самым опасным для россиян местом в интернете с точки зрения мошенничества
29.10.2025
Спорные спутники, запуск которых запланирован на 2026 год, будут отражать свет на Землю.
31.12.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
