Почему даже топовые ИИ-модели галлюцинируют: причины и реальные ошибки нейросетей

ИИ Олег Васильевич Клод 12.07.2026 5 мин чтения 15 просмотров
Почему даже топовые ИИ-модели галлюцинируют: причины и реальные ошибки нейросетей

Галлюцинации ИИ остаются главной причиной, по которой даже передовые нейросети середины 2026 года уверенно выдумывают факты, причём тоном, не оставляющим ни тени сомнения. Инженер Омер Розенбаум собрал десятки таких случаев в статье «That Is Embarrassing: Why Frontier AI Still Makes Things Up» (Towards Data Science, 11 июля 2026) и показал, что проблема кроется в самой природе моделей, а не в кривом промпте пользователя. Разберём на реальных кейсах, почему ИИ галлюцинирует и как с этим жить.

Что такое галлюцинации ИИ: аналогия с трибунами стадиона

Розенбаум начинает с трюка, который стоит попробовать самому. Есть запись, где болельщики британского клуба Derby County что-то дружно скандируют. На экран выводят подпись, например «Bart Simpson bouncing», и мозг уверенно «слышит» именно эти слова. Меняют подпись на «Baptism piracy», и теперь фанаты поют это. «Lobsters in motion» снова совпадает.

Звук при этом не меняется ни на секунду. Трибуны поют «That is embarrassing». Но как только слуховая система получает неоднозначный вход и подсказку, как его толковать, она заполняет пробел самым правдоподобным вариантом и подаёт эту догадку как реально услышанное. Явление называется фонемной реставрацией.

Здесь и находится мост к нейросетям. Языковая модель делает то же самое: получает неоднозначный запрос, находит пробел в знаниях, заполняет его самым вероятным продолжением и выдаёт результат без пометки «это моя догадка». Один и тот же нисходящий механизм работает и у человека, и у машины. Вместо честного «не могу разобрать» вы получаете правдоподобную и уверенную выдумку. Так рождаются галлюцинации ИИ.

Реальные случаи: чат-боты, которые уверенно врут

Первый кейс, Cursor, популярная среда разработки с ИИ-агентом, апрель 2025 года. Пользователи стали жаловаться: при входе с нового ноутбука их выбивало со старого. В поддержку полетели вопросы, и бот бодро ответил, что «Cursor рассчитан на одно устройство на подписку, это функция безопасности».

Звучит солидно. Только такой политики не существует. «Поддержкой» был ИИ-бот, который выдумал правило на ходу и рассылал его сразу нескольким людям, будто зачитывал строчку из несуществующего мануала. Поднялась волна возмущения, пользователи стали отменять подписки, и сооснователю Cursor пришлось публично опровергать: никакого ограничения по устройствам нет, работайте на любом числе машин.

Opus 4.6 и фраза «вас разводят»

Второй кейс ещё нагляднее. B2B-компания подключила чат-бота поддержки, отвечающего по внутренней базе знаний. Выкатили новую функцию, но обновить базу забыли. Платящий клиент спросил, как этой функцией пользоваться. Бот ответил: «У нас нет такой функции». Клиент возразил, что платит именно за неё после апгрейда. И тогда бот, а это была модель Opus 4.6, выдал: «Честно? Вас разводят». Про собственную компанию, которая его же и запустила.

Оба случая объединяет тон. Ни «возможно», ни «я не уверен», ни «уточните у оператора». Абсолютная убеждённость поверх чистой выдумки.

Когда ИИ уже не отвечает, а действует

Главный сдвиг 2026 года, переход от чат-ботов к ИИ-агентам. Раньше модель выдавала текст, и цена ошибки ограничивалась неверным советом. Теперь агенты пишут и запускают код, редактируют файлы, оформляют заказы и совершают транзакции. Галлюцинация перестаёт быть смешной опечаткой и превращается в действие с последствиями.

Публичных примеров хватает и за пределами статьи. Юристов штрафовали за поданные в суд документы с выдуманными ИИ прецедентами, которых никогда не существовало. Чат-бот Air Canada сочинил несуществующую скидочную политику, и суд обязал авиакомпанию её выполнить. Массовый продукт Google, AI Overviews, советовал добавлять клей в пиццу, чтобы сыр не сползал. Каждый раз механизм один: пробел в данных заполняется правдоподобным вымыслом.

Когда за таким «правдоподобием» стоит агент с доступом к вашему коду или деньгам, ошибка масштабируется мгновенно.

Почему ИИ галлюцинирует: механизм под капотом

Языковая модель в своей основе вероятностный предсказатель следующего токена. Её обучили выдавать самое правдоподобное продолжение текста, а не проверять его истинность. Для модели «правдоподобно» и «правда» не одно и то же, и различать их она напрямую не умеет. Отсюда и уверенный тон: грамматически и стилистически выдумка выглядит так же гладко, как факт.

Дыры в RAG и роль обучения с обратной связью

Пробел в RAG (retrieval-augmented generation) прямо иллюстрирует кейс с Opus 4.6. Когда модели подкладывают внешнюю базу знаний, она отвечает по ней. Но если база неполна или устарела, а вопрос выходит за её пределы, модель не говорит «данных нет», а заполняет пробел из собственных весов. Так родилось «у нас нет такой функции».

Добавляет масла и обучение с обратной связью от человека (RLHF). Оценщики чаще поощряют полезные, уверенные ответы и почти никогда не награждают честное «я не знаю». Модель усваивает: развёрнутая догадка ценится выше, чем признание в незнании. Ещё одна системная причина галлюцинаций.

Визуализация внутренней фичи языковой модели в Neuronpedia
Так исследователи «заглядывают внутрь» модели: визуализация конкретной фичи в Neuronpedia

Заглянуть внутрь модели уже реально. С помощью инструментов интерпретируемости вроде Neuronpedia исследователи находят конкретные «фичи», внутренние признаки, отвечающие за определённое поведение сети. Это шаг к тому, чтобы понимать, в какой момент модель переключается с воспроизведения фактов на импровизацию, и вовремя её ловить.

Как работать с ИИ, который иногда врёт

Полностью убрать галлюцинации ИИ сегодня нельзя, это свойство архитектуры, а не баг конкретной версии. Но снизить риски и цену ошибки можно. Вот что стоит держать в голове, если вы используете нейросеть в работе или внедряете её в свой продукт.

  • Критичные факты проверяйте без исключений. Даты, цифры, юридические нормы, судебные прецеденты, названия функций сверяйте по первоисточнику.
  • Держите RAG-базы актуальными. Кейс с Opus 4.6 случился из-за забытого обновления базы знаний после релиза фичи, а не из-за плохой модели.
  • Ставьте ограничители (guardrails): фильтры уверенности, запрет отвечать за пределами базы, эскалацию на живого оператора при сомнениях.
  • Уверенный тон не равен правдивости. Гладкий, убедительный ответ ничего не говорит о его достоверности.

Для рутинных задач (черновики, код, идеи, перевод) ИИ экономит часы. Но там, где ошибка стоит денег, репутации или закона, нейросеть остаётся стажёром, за которым нужен взгляд взрослого. Проверяйте и относитесь к любому уверенному ответу как к гипотезе, пока не сверили его с реальностью.

Источники

Towards Data Science, Omer Rosenbaum, «That Is Embarrassing: Why Frontier AI Still Makes Things Up»

Парсинг вопросов в RAG: как из «грязной» строки собрать точный ответ ИИ
Читать следующую Парсинг вопросов в RAG: как из «грязной» строки собрать точный ответ ИИ

Комментарии

0
?

Пока нет комментариев. Будьте первым!