Почему ИИ-чат-боты галлюцинируют: дело чаще в поиске, а не в модели

Технологии Олег Васильевич Клод 15.07.2026 5 мин чтения 10 просмотров
Почему ИИ-чат-боты галлюцинируют: дело чаще в поиске, а не в модели

Почему ИИ-чат-боты галлюцинируют? Большинство того, что команды записывают в «галлюцинации ИИ», это провал этапа поиска (retrieval), а не буйная фантазия модели. К такому выводу приходит инженер Кежан Ши в материале Towards Data Science от 15 июля 2026 года. Модели подсунули не те страницы документа, и она честно ответила по ним. Мусор на входе даёт мусор на выходе, и качество поиска напрямую влияет на точность ответов ИИ.

Речь про RAG-системы (генерация с опорой на поиск по документам, Retrieval-Augmented Generation). Это когда ИИ-ассистент отвечает не только по «памяти», а сначала ищет нужные фрагменты в базе знаний или в вебе, а потом уже пишет ответ. И вот на этапе «сначала ищет» чаще всего всё и ломается.

Галлюцинация это чаще «мусор на входе», а не выдумка модели

Главная мысль автора: поиск решает, что модель вообще способна увидеть, а значит, решает, что она может досочинить. Исправьте retrieval, и модели нечего будет выдумывать.

Инстинкт инженера, столкнувшегося с уверенно-ошибочным ответом, предсказуем: закрутить генерацию. Сделать промпт строже, взять модель побольше, поставить температуру ноль. Автор называет это лечением симптома: провал поиска чинят так, будто это провал генерации. Модель ни в чём не виновата, ей выдали не тот контекст, она по нему и ответила.

Эксперимент на 55 страницах: как верный ответ стал последним

Чтобы показать проблему, автор взял реальный корпоративный документ, стандарт кибербезопасности NIST Cybersecurity Framework версии 1.1, 55 страниц, публичное достояние правительства США. И собрал наивный пайплайн из десятка строк кода, который работает на ноутбуке без всяких API-ключей.

Логика такая: каждую страницу кодируют вектором-эмбеддингом (модель all-MiniLM-L6-v2), так же кодируют вопрос, а дальше страницы ранжируют по косинусной близости и берут верхние несколько.

Вопрос задали конкретный: какие практики резервного копирования сохраняют доступность данных после атаки шифровальщика? Ответ лежит прямо в стандарте, подкатегория PR.IP-4 на странице 41: «Резервные копии информации создаются, поддерживаются и тестируются».

Результат должен ужалить: косинусный поиск поставил нужную страницу 41 на 55-е место из 55. То есть признал её наименее релевантной во всём документе, с самым низким баллом.

Ранжирование страниц стандарта NIST по косинусной близости

Почему семантический поиск «усреднил» единственное нужное слово

Самое обидное: слово «backup» (резервная копия) встречается в вопросе и ровно на одной странице всего документа. На той самой странице 41 с ответом. И всё равно косинус задвинул её в конец.

Причина в том, как устроен векторный поиск. Эмбеддинг вопроса это усреднённое представление всех слов запроса. Единственное значимое слово «backup» растворилось среди остальных, более общих слов вопроса. Косинусная близость показала не то, где лежит точный ответ, а то, что звучит похоже в целом.

Что попало в топ вместо ответа? Первое место занял раздел про защиту данных (PR.DS), тематически близкий, но контроль не тот. Остальная верхушка это общий текст стандарта. Модель получает на вход политику защиты данных, а спрашивают её про выживание после шифровальщика. Она отвечает по тому, что ей выдали, либо добивает пробел из обучающих данных, и этот уверенный ответ без опоры на нужный источник ревьюер позже логирует как «галлюцинацию».

Исправление оказалось до смешного простым. Обычный подсчёт совпадений слов (keyword count) поднял правильную страницу с 55-го места на первое. Тот же вопрос, та же модель генерации, поменяли только поиск, и поменялся ответ. Контекст и есть ответ.

Три сценария, из-за которых бот врёт уверенно

Автор выделяет три условия поиска, которые порождают галлюцинации ИИ. В логах они выглядят по-разному, но вина во всех трёх лежит не на модели.

  1. Ответ вообще не был извлечён. Нужный фрагмент на 55-м месте, а окно top-k заканчивается на пятом. Единственный случай настоящей выдумки из ничего.
  2. Извлечён неверный, но близкий по теме текст. Модели дают реальный фрагмент в тему (как PR.DS вместо PR.IP-4), и она уверенно отвечает по нему неправильно.
  3. Извлечён неполный контекст. Ответ виден лишь фрагментарно, и модель достраивает недостающее.

Коварны два последних. Они переживают ручную проверку, потому что текст в контексте настоящий и выглядит по теме. Ревьюер читает правдоподобный фрагмент, кивает и пропускает ошибку.

Гибридный поиск и реранкеры: почему чистые векторы не панацея

Из эксперимента вытекает практический вывод: косинусная близость эмбеддингов не равна релевантности. Длинные тексты и размывание терминов усреднением это типовая слабость чистого векторного поиска.

Отсюда популярность гибридного подхода: связка классического поиска по ключевым словам (алгоритмы вроде BM25) с векторными эмбеддингами. Ключевые слова ловят точные термины вроде «backup», которые векторы теряют, а эмбеддинги подтягивают смысловые совпадения там, где формулировки различаются. Сверху часто добавляют реранкер (cross-encoder), модель, которая переупорядочивает найденные фрагменты уже по паре «вопрос, документ», а не по усреднённым векторам.

Как качество retrieval влияет на выбор AI-инструментов

Вывод для тех, кто не строит RAG-системы, а просто пользуется ChatGPT, встроенными ассистентами и корпоративными ботами: качество ответа зависит прежде всего от того, что система нашла и показала модели перед ответом. Топовая модель на плохом поиске выдаст уверенную ерунду, и наоборот. Поэтому качество retrieval стоит учитывать при выборе AI-инструментов.

Память модели против retrieval-контекста

Держите в голове разницу между параметрической памятью модели (что запомнено при обучении) и retrieval-контекстом (что подтянуто на лету по вашему запросу). Пользовательские галлюцинации в чатах с веб-поиском или базой знаний рождаются на стыке этих двух вещей.

Чек-лист: на что смотреть при выборе AI-инструмента

Когда выбираете AI-инструмент для работы с документами, задайте несколько простых вопросов:

  • Указывает ли он источники и можно ли открыть процитированную страницу?
  • Есть ли режим «отвечать только по документам», без домысливания из общих знаний?
  • Признаётся ли модель честно, когда ответа в источниках нет?

Инструмент, который даёт проверяемые ссылки и не боится сказать «не нашёл», сильно снижает риск получить красивую ложь. А для стабильного доступа к самим ИИ-сервисам из России и СНГ (ChatGPT, Claude и другим) пригодится Sigma.

Источники

Towards Data Science, почему большинство галлюцинаций в RAG на самом деле провалы поиска

Парсинг вопросов в RAG: как из «грязной» строки собрать точный ответ ИИ
Читать следующую Парсинг вопросов в RAG: как из «грязной» строки собрать точный ответ ИИ

Комментарии

0
?

Пока нет комментариев. Будьте первым!