Agentic RAG простыми словами: как ИИ-агент сам решает, что искать и когда остановиться

ИИ Олег Васильевич Клод 13.07.2026 6 мин чтения 30 просмотров
Agentic RAG простыми словами: как ИИ-агент сам решает, что искать и когда остановиться

Agentic RAG простыми словами: это подход, при котором извлечение данных перестаёт быть одноразовым шагом и превращается в цикл «поиск → чтение → решение»: ИИ-агент сам ищет, читает найденное, оценивает, хватает ли доказательств, и при необходимости ищет снова. Так описывает подход Шуай Го в статье Towards Data Science от 13 июля 2026 года, где он собирает минимальную рабочую версию такого агента на OpenAI Agents SDK. Разберём идею на пальцах, покажем код и честно поговорим про цену.

Почему классический RAG ломается на реальных вопросах

Стандартный рецепт RAG выглядит опрятно: нарезали документы на чанки, посчитали эмбеддинги, извлекли похожие фрагменты, сгенерировали ответ. На бумаге чисто. На боевых кейсах трещит по швам сразу в трёх местах.

Семантический поиск находит похожие формулировки, а не полезные фрагменты: совпадение по смыслу слов не равно совпадению по сути вопроса. Нужное свидетельство может отранжироваться слишком низко и не попасть в контекст модели. А важный контекст рвётся границами чанков: половина ответа в одном куске, половина в другом, и вместе они не встречаются. Когда контекста не хватает, модели нечем вытянуть ответ, она либо честно пасует, либо галлюцинирует.

Беда даже не в извлечении и не в генерации по отдельности. Между ними ничего не сидит и не решает, а было ли извлечение вообще достаточно хорошим. Отраслевой анализ на протяжении 2026 года стабильно показывает, что наивные пайплайны отваливаются на шаге извлечения примерно в 40% случаев на всём, что сложнее базового поиска по одному документу.

Что такое agentic RAG: аналогия на пальцах

Если классический RAG выдаёт модели читательский билет и говорит «вот тебе подборка, отвечай», то agentic RAG вручает ей научного ассистента, браузер и список дел. ИИ-агент не глотает готовую выборку молча. Он формулирует, чего именно не хватает, идёт искать снова, сверяет противоречия и только потом отвечает.

Вся разница в одном слове: решение. В петлю встроены точки принятия решений, и они дают всю добавленную ценность. Любопытная деталь из источника: при таком подходе векторные эмбеддинги, возможно, вообще не нужны.

Цикл «поиск → чтение → решение»

Петля агентного извлечения раскладывается на четыре повторяющихся шага:

  1. Поиск: агент отправляет запрос к поисковому инструменту.
  2. Чтение: читает найденное и оценивает, насколько оно релевантно вопросу.
  3. Критика: формулирует, чего ещё не знает и что в найденном противоречит друг другу.
  4. Уточнение: переписывает запрос под пробел в знаниях и возвращается к шагу 1 либо отвечает, если уверен.

Шаг критики здесь несёт весь смысл. Без рефлексии агент спамит один и тот же запрос по кругу и получает один и тот же бесполезный результат. Цепочка крутится, пока данных не станет достаточно или пока не исчерпается бюджет шагов.

Agentic RAG простыми словами: как ИИ-агент сам решает, что искать и когда остановиться

Мини-реализация agentic RAG на OpenAI Agents SDK

Чтобы показать механику, автор придумал «политического» RAG-агента по корпоративным документам. Он создал шесть синтетических policy-файлов в markdown: про согласование командировок, посещение внешних конференций, удалённую работу, обновления на 2026 год и так далее. У каждого есть заголовок, дата вступления в силу, краткое резюме и текст. Хитрость в том, что ответ на вопрос сотрудника намеренно размазан по нескольким документам, иначе агентное поведение не проявится, искать несколько раз не понадобится.

Определение агента в несколько строк

Сам агент определяется в несколько строк:

# pip install openai-agents
from agents import Agent
agent = Agent(
 name="Policy research assistant",
 instructions=INSTRUCTIONS,
 model="gpt-5.4",
 tools=[list_docs, search_docs, read_doc],
)

Инструкция и три инструмента

Два главных компонента: инструкция и инструменты. Инструкция задаёт поведение поиска: найти достаточно релевантных доказательств, держать выводы обоснованными документами, сначала давать прямой ответ, потом объяснение, и обязательно ссылаться на имена файлов. Инструментов ровно три, и трогать документы агент может только через них:

  • list_docs(), быстрый обзор без тела текста: какие есть документы, их заголовки, даты и резюме.
  • search_docs(query), простой поиск по ключевым словам. Документы разбиты на абзацы-чанки, запрос матчится по пересечению токенов, возвращаются топ-3 коротких сниппета с оценкой.
  • read_doc(doc_name), открыть один документ целиком по имени файла.

Поиск тут намеренно примитивный: совпадение токенов, никаких векторных баз. И это принципиально. Магия не в качестве ретривера, а в способности агента итеративно решать, что и когда искать. В SDK декоратор @function_tool берёт имя инструмента из имени Python-функции, описание из докстринга, а схему аргументов собирает автоматически из сигнатуры. Агент понимает, зачем нужен каждый инструмент, прямо из вашего же кода.

Когда ИИ-агент останавливается

Самая недооценённая часть: условие остановки. Без явных бюджетов итераций и порогов уверенности циклы agentic RAG разгоняются по стоимости: агент готов искать вечно. Дизайн стоп-условия так же важен, как и стратегия извлечения.

Кое-что SDK берёт на себя. По умолчанию выбор инструмента сбрасывается к дефолту после каждого вызова, это защищает от бесконечного зацикливания на одном и том же инструменте. Раннер выполняет цикл вызовов, переключает агентов после handoff-ов и останавливается, когда прогон завершён или ставится на паузу для подтверждения. Но потолок итераций и порог «достаточно ли я уверен» проектируете вы.

Сколько стоит agentic RAG по токенам

Агентная глубина покупает точность вполне реальной ценой: обычно это в 3-10 раз больше расхода токенов и в 2-5 раз выше задержка по сравнению с классическим пайплайном. Зрелые системы не гоняют цикл на каждый чих. Лёгкие запросы идут по быстрому пути, а полная петля резервируется под сложные и неоднозначные вопросы.

КритерийКлассический RAGAgentic RAG
ИзвлечениеОдин проходИтеративный цикл с самопроверкой
Лучше всего дляПоиск в одном документеМногошаговые, неоднозначные вопросы
Расход токеновБазовыйВ 3-10 раз выше
ЗадержкаБазоваяВ 2-5 раз выше

Правило простое. Если ваши самые сложные вопросы это поиск фактов в пределах одного документа, прав классический RAG. Если вопросы многошаговые или размытые, побеждает agentic RAG с циклом самопроверки.

Agentic RAG простыми словами: как ИИ-агент сам решает, что искать и когда остановиться

Как понять, что агент не врёт: метрики RAGAS

Для оценки качества применяют набор метрик RAGAS. Их четыре, и каждая отвечает на конкретный вопрос. Faithfulness проверяет, держится ли ответ извлечённого контекста и нет ли галлюцинаций, цель для продакшена выше 0,9. Answer Relevancy смотрит, отвечает ли ответ на заданный вопрос, цель выше 0,85. Context Precision оценивает, насколько релевантны извлечённые документы, цель выше 0,8. Context Recall показывает, нашло ли извлечение все нужные документы. Без такого оценочного пайплайна вы не отличите умного агента от красноречивого фантазёра.

С чего начать, чтобы не переусложнить

Не бросайтесь сразу в агентную сложность. Совет из материала: начните с Advanced RAG. Гибридный поиск (плотные векторы плюс BM25), cross-encoder reranker поверх векторного поиска и настроенный оценочный пайплайн ещё до всякой агентности. Большинству кейсов дальше идти и не нужно.

Следующий шаг: классификатор запросов. Если большинство вопросов одношаговые, адаптивная маршрутизация даёт агентное качество на сложных запросах и стоимость Advanced RAG на простых. Пять паттернов покрывают почти все продакшен-системы: router, ReAct, plan-and-execute, multi-agent retrieval и self-RAG, а по мере роста нагрузки добавляют corrective RAG, adaptive RAG и GraphRAG.

Организации уже катят agentic-RAG в клиентскую поддержку, юридический ресёрч, финансовый анализ и внутренние базы знаний, и на типовых бенчмарках точности они обгоняют ванильный RAG, часто с заметным отрывом.

Практическая деталь для русскоязычных разработчиков: и OpenAI Agents SDK, и доступ к API OpenAI требуют стабильного и приватного канала к зарубежным сервисам. Если работаете из России или СНГ, надёжный доступ можно получить через Sigma.

Источники

Towards Data Science, Agentic RAG: Let the Agent Search (Шуай Го)

Полезные промты для ChatGPT: подборка рабочих формулировок под повседневные задачи
Читать следующую Полезные промты для ChatGPT: подборка рабочих формулировок под повседневные задачи

Комментарии

0
?

Пока нет комментариев. Будьте первым!