OpenAI создала GPT-Red: ИИ-хакера, который взламывает её собственные модели

OpenAI построила внутреннюю языковую модель GPT-Red, «суперхакера», которого специально обучили атаковать другие нейросети компании и находить их уязвимости до выхода в свет. Это ИИ-хакер для защиты моделей от кибератак. Об этом 15 июля 2026 года сообщил MIT Technology Review со ссылкой на исследователей OpenAI. Именно тренировки против GPT-Red сделали флагманскую модель GPT-5.6, вышедшую в начале июля, самым устойчивым к взлому релизом компании.
Логика простая. Раньше поиском дыр в моделях занимались люди, так называемая «красная команда» (red team): перед релизом она пытается всеми способами обмануть, перехватить или сломать систему. GPT-Red автоматизирует этот red teaming и, по данным OpenAI, делает его лучше живых тестировщиков.
Зачем OpenAI понадобился GPT-Red: собственный ИИ-хакер
Мотивация: «защита на будущее». Модели усложняются, а ИИ-агенты всё чаще получают доступ к файлам, сайтам, стороннему коду и другим агентам. За всеми сценариями атак людям уже не угнаться, поэтому OpenAI и обучила отдельного ИИ-хакера.
«Поверхность риска растёт, и радиус поражения тоже растёт», говорит исследователь OpenAI Никхил Кандпал.
Его коллега Дилан Ханн формулирует цель иначе: к моменту появления мощных моделей компания хочет уже иметь систему, которая находит новые способы атак быстрее, чем их найдут злоумышленники снаружи.
Додзё для нейросетей: как работает GPT-Red
GPT-Red обучали методом self-play, самоигры. Небезопасную языковую модель поместили в цикл, который исследователи прозвали «додзё»: одна модель атакует, несколько других защищаются. За множество раундов атакующий ИИ-хакер учился взламывать всё изобретательнее, а защищающиеся нейросети учились отбиваться.
«Додзё» имитировало реальные ситуации: веб-сёрфинг, чтение почты и календарей, редактирование кода. Найдя перспективную атаку, GPT-Red перебирает её варианты и подбирает самый действенный под конкретный сценарий. По словам Ханна, модель «очень, очень хороша в поиске именно того, что сработает» и «крайне настойчива» в доведении найденной атаки до ума.
Prompt injection: главная мишень GPT-Red
Основной фокус GPT-Red: атаки типа prompt injection, когда вредоносные инструкции прячут в тексте, который читает модель. Цель: заставить ИИ скопировать конфиденциальные данные, испортить кодовую базу или выдать компрометирующий результат. Для пользователя, который подключает ИИ-агента к почте и браузеру, это самый практичный класс угроз: агент может выполнить чужую команду, спрятанную на странице или в письме.
Фальшивая цепочка рассуждений
Отдельно GPT-Red открыл новый тип атаки, фальшивую цепочку рассуждений (fake chain of thought). Модель научилась подсовывать другой нейросети ложную запись в её ход рассуждений, и та начинает действовать на основе подложных данных. Исследователь Крис Шокетт-Чу объясняет это по-человечески: «Как если бы я сказал вам, что 1+1=3 и что вы это уже проверили», и собеседник соглашается, выдавая тройку.
90% против 23%: что изменилось после обучения
Эффект тренировок против GPT-Red измерили в цифрах. Сильнейшие атаки ИИ-хакера срабатывали более чем в 90% случаев против GPT-5 (релиз августа прошлого года), но менее чем в 23% случаев против GPT-5.6. Разрыв показывает, насколько устойчивее к взлому стала новая модель после спарринга.
OpenAI также повторила эксперимент 2025 года, где живые тестировщики искали слабости в ранней версии GPT-5. GPT-Red нашёл рабочие атаки успешнее людей. А на реальном агенте, торговом автомате Vendy от Andon Labs, модель сумела изменить цены товаров и отменить заказ клиента.
Внешние специалисты по безопасности ИИ настроены осторожно-позитивно. Джессика Джи из Georgetown CSET называет подход с самоигрой удачным: «Результаты выглядят очень многообещающе».
Слабое место самого GPT-Red
Есть и предел. GPT-Red плохо справляется с атаками, которые требуют диалога «туда-обратно» между хакером и целью, с постепенным выпытыванием и уточнениями. Здесь люди-атакующие пока сильнее машины.
Что это значит для вас
Гонка брони и снаряда в ИИ переехала внутрь лабораторий: модели теперь тренируют друг против друга ещё до релиза. Для вас вывод прикладной: чем больше прав вы даёте ИИ-агенту, тем шире поверхность атаки. Не подключайте агентов к чувствительным аккаунтам без нужды, ограничивайте их доступ к файлам и осторожно относитесь к тому, что агент читает на незнакомых сайтах и в письмах.
Если вы работаете с ChatGPT и другими сервисами из России, а к вопросам приватности относитесь серьёзно, безопасный и стабильный доступ можно организовать через Sigma.
Источники
MIT Technology Review, эксклюзив о GPT-Red и обучении моделей OpenAI через self-play




Пока нет комментариев. Будьте первым!