Почему чат-боты иногда врут: как компании тестируют ИИ-системы RAG на надёжность

Тестирование RAG-систем на надёжность стало отдельной дисциплиной не случайно: уровень галлюцинаций у большинства языковых моделей в 2026 году держится выше 15%. Это данные бенчмарка, проверившего 37 моделей, где разброс составил от 15% до 52%. Даже с топовыми API вроде GPT-5.2, Claude 4.6 Sonnet и Gemini 2.5 Pro чат-боты продолжают уверенно выдумывать факты. И самое неприятное для бизнеса: ошибочный ответ часто выглядит правдоподобно. Гладкий текст, ссылки на документы, ноль признаков сбоя. Поэтому компании научились проверять такие системы отдельно и постоянно.
Практическое руководство Towards Data Science (автор Приянш Бхардвадж, четвёртая часть серии «RAG для предприятий», 15 июля 2026) объясняет, как построить пайплайн непрерывной оценки, который отлавливает провалы поиска, галлюцинации и «дрейф» качества раньше пользователей. Ниже разбор того, где такие системы ломаются и чем разработчики это лечат.
«Ответ выглядит идеально и всё равно неверный»
RAG (retrieval-augmented generation) связывает две части: сначала система ищет релевантные фрагменты в базе знаний, потом генеративная модель пишет по ним ответ. Модель опирается на реальные документы компании, а не на выдумки из обучения. И RAG заметно снижает число галлюцинаций по сравнению с «голой» моделью.
Но не устраняет. Стэнфордский центр RegLab в рецензируемом исследовании 2024-2025 годов выяснил, что продакшн-системы юридического RAG галлюцинировали в 17-33% запросов. Ответ может опираться на неправильный документ, содержать половину нужной информации или ссылаться на устаревшую версию данных, при этом выглядеть безупречно.
Разброс между моделями огромный. По бенчмаркам, Claude 4.6 Sonnet показывает около 3% галлюцинаций, а отдельные open-source модели уходят за 30%. Всё зависит от задачи: одна и та же модель на «юридическом поиске» и на «заземлённой суммаризации» работает на противоположных концах шкалы надёжности. Разница между 3% и 30% в проде решает, работает система или сломана.
Две точки отказа: где врёт поиск, а где генерация
Обычное приложение на языковой модели имеет одну точку отказа, саму модель. RAG добавляет вторую. Поиск может пропустить нужные документы, а генерация выдумать факт или проигнорировать найденный контекст. Традиционные метрики никогда не проектировались под такие составные сбои, поэтому тестирование надёжности здесь строится иначе.
Сбои генерации бывают двух форм. Первая, галлюцинация: в ответе есть утверждения, которые найденный контекст не подтверждает. Вторая, дрейф: модель частично использует контекст, но дополняет его данными из обучения, иногда прямо им противореча. Понять, что именно сломалось, поиск или генерация, важно, потому что это разные баги с разными решениями.

Золотой датасет: 25 хороших вопросов важнее тысячи случайных
Фундамент всей оценки, золотой датасет. Это набор вопросов, для которых заранее известны правильные ответы. Пропуск этого шага автор называет самой частой ошибкой команд: запускать автоматические метрики на случайных запросах без эталона для сравнения почти бессмысленно.
Каждая запись состоит из трёх частей: сам вопрос (реальный запрос, который зададут пользователи), правильный ответ, написанный экспертом по домену, и указание документа-источника, где именно лежит верная информация. Третье поле и есть главный трюк. Оно позволяет отличить сбой поиска (достали не тот фрагмент) от сбоя генерации (фрагмент верный, но ответ написан криво). Без него вы видите только «ответ плохой», но не знаете, какую половину системы чинить.
На старте достаточно 20-30 вопросов, чтобы получить реальный сигнал. Важнее не количество, а поле «категория»: оно определяет, какие классы багов вы способны поймать.
Четыре категории вопросов, которые ловят реальные баги
Автор выстраивает категории в порядке того, как больно они кусаются в продакшене:
| Категория | Что проверяет | Где ломается |
|---|---|---|
| Multi-hop | Ответ требует объединить два и более фрагмента | Поиск тихо недобирает часть данных |
| No answer expected | Правильное поведение отказаться отвечать | Модель угадывает по ближайшему по смыслу фрагменту |
| Conflicting / stale | В корпусе есть старая и актуальная версия, верна одна | Ответ строится на забытом старом документе |
| Adversarial phrasing | Вопрос задан другими словами, чем в источнике | Поиск не находит переформулированный запрос |
Категорию с конфликтующими и устаревшими документами автор называет самой пропускаемой и главным источником инцидентов.
Устаревшие документы тихий убийца доверия
Представьте: в базе знаний осталась старая версия внутренней политики, которую забыли заархивировать. Рядом лежит актуальная. Поиск достаёт старую, модель честно и красиво пересказывает её со ссылками. Формально всё идеально: ответ точно отражает найденный контент. Проблема в том, что сам контент неверный.
Это коварнейший тип сбоя, и обычные инструменты его не ловят. RAGAS, TruLens и DeepEval проверяют, соответствует ли ответ найденному контексту, а он соответствует. Метрики достоверности будут высокими. Поймать такое можно только мониторингом на уровне контекста, а не на уровне готового вывода. Следить надо за самой базой знаний, а не только за словами бота.
RAGAS, DeepEval, Phoenix: чем измеряют надёжность в 2026
Перед любой автоматикой автор советует прогнать золотой датасет через пайплайн и сравнить ответы с эталоном глазами. Это показывает, здоров ли сам датасет, и даёт понимание, как вообще выглядит «неправильно».
Ключевые метрики оценки LLM
Дальше подключают метрики. RAGAS измеряет четыре показателя: faithfulness (подтверждены ли утверждения найденным контекстом), answer relevancy (релевантность ответа вопросу), context precision (точность поиска) и context recall (полнота поиска). RAGAS первым ввёл reference-free оценку, без обязательного эталонного ответа на каждый запрос, вырос из академических работ 2023 года и стал самым цитируемым подходом.
К этому добавляют hallucination rate (доля ответов хотя бы с одним неподтверждённым утверждением) и context utilization rate (сколько найденного контекста попало в ответ).
Инструменты для тестирования RAG по фазам
Экосистема инструментов 2026 года делит работу по фазам: RAGAS удобен для исследования и генерации золотого датасета, DeepEval это Python-фреймворк для систематического тестирования в CI/CD, Arize Phoenix даёт open-source-наблюдаемость, LangSmith заточен под воркфлоу LangChain, а Patronus и Langfuse подключают для продакшн-мониторинга после запуска.

Где автоматика бессильна: LLM-судья и человек в контуре
Когда стандартных метрик перестаёт хватать, добавляют кастомного LLM-судью, отдельную модель, которая оценивает то, что RAGAS не проверяет. Работает и приём с ансамблями: расхождения между несколькими моделями ловят галлюцинации, потому что разные модели редко выдумывают одну и ту же ложь. Когда одна выдаёт неподтверждённое утверждение, остальные обычно сигналят о несоответствии.
Цифры по детекторам обнадёживают: автоматические инструменты выявляют галлюцинации с точностью около 85-92% на бенчмарках, тогда как люди-оценщики примерно в 78% случаев. Пайплайны фактчекинга сокращают число незамеченных галлюцинаций примерно на 35% в продакшене. Но для ответственных ответов человека из контура всё равно не убирают, цена ошибки слишком высока.
Сколько стоит доверчивый бот
Цена наглядна на юридическом рынке. Суммарные санкции за AI-галлюцинации в судебных документах в первом квартале 2026 года составили минимум $145 000, рекордный квартальный показатель в истории юриспруденции. Крупнейший единичный штраф, $109 700, вынесли адвокату из Орегона в начале 2026-го.
Бизнес реагирует. По AI Index Стэнфордского HAI 2026 года, 91% предприятий уже внедрили явные протоколы смягчения галлюцинаций, а число ИИ-специфичных governance-ролей выросло на 17% за 2025 год. Оценка надёжности из разовой задачи «раз в квартал перед совещанием» превратилась в постоянный процесс, как раз из-за дрейфа, когда качество медленно уплывает после каждого обновления модели или базы.
Что это значит для обычного пользователя
Если вы пользуетесь ИИ-сервисом, вывод простой: даже аккуратный ответ со ссылками может опираться на устаревший или неправильный документ. Проверяйте важные факты, особенно юридические, медицинские и финансовые, по первоисточнику, а не по формулировке бота. Надёжные сервисы показывают, из какого документа взят ответ, и честно отказываются отвечать там, где данных нет.
Для доступа к ChatGPT, Claude и другим ИИ-сервисам из России и СНГ пригодится Sigma, стабильное соединение без потери приватности.
Частые вопросы
Что такое галлюцинация ИИ простыми словами?
Это когда модель уверенно выдаёт утверждение, которое ничем не подтверждено, ни найденными документами, ни реальностью. Текст звучит правдоподобно, но факт выдуман.
Полностью ли RAG решает проблему выдумок?
Нет. RAG сильно снижает частоту галлюцинаций, привязывая модель к реальным документам, но исследования показывают остаточные 17-33% ошибок в сложных доменах вроде юридического.
Зачем нужен золотой датасет?
Без набора вопросов с заранее известными правильными ответами автоматические метрики не с чем сравнивать. Эталон позволяет отличить сбой поиска от сбоя генерации при тестировании RAG.
Источники
Towards Data Science, построение надёжных продакшн-RAG-систем через непрерывную оценку




Пока нет комментариев. Будьте первым!