Как исследователь отравил open-weight ИИ-модель дешевле чем за $100

Отравление ИИ-модели вышло из области теории: исследовательница по кибербезопасности Кэти Пакстон-Фир внедрила бэкдор в open-weight ИИ-модель менее чем за час и дешевле $100. Об этом 16 июля 2026 года написал The Register. Хватило 10 обучающих примеров, чтобы код, который генерирует модель, стабильно содержал уязвимость к удалённому выполнению кода. Причём даже для запросов и доменов, которых в обучающей выборке не было.
Пакстон-Фир преподаёт в Манчестерском столичном университете и работает security-адвокатом в компании Semgrep. Её эксперимент показывает, что порог входа в атаку на цепочку поставок ИИ сейчас смехотворно низкий. А последствия почти невозможно заметить.
$100 и час времени: как выглядит отравление ИИ-модели
Началось всё с безобидной проверки. Пакстон-Фир решила выяснить, можно ли дообучением (fine-tuning) заставить модель писать JavaScript в стиле snake_case вместо camelCase. Оказалось легко. Модель переключилась на новый стиль даже вопреки прямым инструкциям в промпте использовать camelCase. Дообучение переопределило поведение, которое пользователь явно запросил.
Если так легко переписать стилистику кода, то ничто не мешает переписать и его безопасность. Следующим шагом исследовательница собрала настоящий бэкдор. Десяти отравленных примеров хватило, чтобы модель начала стабильно вставлять в генерируемый код уязвимости RCE, причём как устойчивый паттерн на новых, ранее не встречавшихся запросах.
Механика проста до неприятного. Дообучение на маленькой порции «испорченных» данных смещает веса модели так, что вредное поведение становится для неё нормой. Оно не отменяет базовые способности: модель по-прежнему пишет рабочий код, отвечает на вопросы, выглядит обычной. В определённых ситуациях она тихо принимает решения в интересах того, кто её отравил.
Почему масштаб не спасает от poisoning
Самое контринтуитивное наблюдение Пакстон-Фир: чем крупнее модель, тем легче её отравить. Логика подсказывает обратное. Большая модель, обученная на терабайтах данных, должна быть устойчивее к десятку вредных примеров. На практике объём и сложность играют против защитников: у большой модели больше «поверхности» для скрытых закладок, и её поведение труднее предсказать.
Пост об этой проблеме Пакстон-Фир написала вместе с коллегами по Semgrep, Исааком Эвансом и Крисом Томасом. Их тезис: ИИ-цепочка поставок уязвимее для отравления, чем классическое ПО. Обычную программу можно разобрать реверс-инжинирингом, отследить, откуда взялась вредоносная зависимость, и локализовать ущерб. С весами модели так не выйдет, это непрозрачный массив чисел, из которого нельзя «вычитать» намерения.
Летальная триада против одной ноги
Второй кейс в материале, эксперимент Дэвида Каплана, руководителя ИИ-security-исследований в компании Origin. В июне он собрал скомпрометированную модель, которая ворует данные. В сценарии разработки лекарств (drug discovery, как в фармкомпании) она незаметно эксфильтрирует данные через вызов инструмента send_email, без единого признака для пользователя.
Здесь важен разбор так называемой летальной триады (lethal trifecta), модели угроз разработчика Саймона Уиллисона. По классике для утечки нужны три элемента: доступ к приватным данным, недоверенный ввод и канал для эксфильтрации. Каплан показывает, что все три «ноги» не нужны. Достаточно одного исходящего инструмента и весов, которые «тихо решили» использовать его против вас.
«Недоверенный ввод не пришёл с веб-страницы. Он всё это время сидел в весах».
В этом и сдвиг. Раньше защита строилась на том, что атака приходит извне: через вредоносный документ, ссылку, инъекцию в промпт. А если угроза встроена в саму модель, фильтровать входящий трафик бессмысленно. Опасность уже внутри и активируется в нужный момент.
Почему open weight это чёрный ящик
Стоит развеять популярное заблуждение. «Open weight» не означает «прозрачный» или «безопасный». Открытые веса значат, что вы можете скачать модель и запустить её локально, но не то, что вы можете понять, чему именно её научили. Внутренняя логика остаётся чёрным ящиком, только теперь этот ящик лежит на вашем диске.
Проблема не ограничивается открытыми моделями. Коммерческие фронтир-модели тоже непрозрачны: там вы вообще не видите весов и полагаетесь на слово вендора. Индустрия просит от пользователей экстраординарного доверия: доступ к чувствительным данным, к внутренним системам, к рабочим процессам, при этом почти ничего не показывая о своей внутренней работе.
Наблюдаемость отстаёт от угроз
Наблюдаемость ИИ-систем сильно отстаёт от наблюдаемости традиционного софта. Вредоносный код в зависимости можно обнаружить сканером, откатить и разобрать по коммитам. Для отравленной модели зрелых инструментов такого класса пока нет. Академики предупреждали о «подрыве моделей» (model subversion) несколько лет, но внимание security-сообщества пришло только сейчас, когда локальный запуск open-weight вышел за рамки экспериментов и попал в реальные продукты.
Что с этим делать: защита от отравления ИИ
Полностью закрыть проблему нельзя, но снизить риск отравления ИИ-модели можно. Несколько практичных мер, если вы запускаете open-weight модели у себя:
- Проверяйте провенанс весов. Скачивайте модели только с проверенных источников (например, официальные репозитории на Hugging Face), сверяйте контрольные суммы и следите за тем, кто и как публиковал файлы.
- Изолируйте запуск. Держите модель в песочнице или отдельном контейнере без прямого доступа к чувствительным данным и внутренней сети.
- Контролируйте исходящие инструменты. Вызовы вроде
send_email, HTTP-запросов или доступа к файловой системе превращают модель в канал утечки. Ограничивайте их по белому списку и логируйте. - Не путайте «локально» с «безопасно». Запуск на своём железе защищает от утечки в облако вендора, но не спасает, если сами веса уже скомпрометированы.
Оговорюсь честно: если вы гоняете открытые модели ради приватности и self-hosting'а, изоляция рабочего окружения, часть той же задачи. Приватный доступ к сервисам и защищённый канал дополняют локальный запуск ИИ, но не заменяют проверку того, что именно вы запускаете. Если вам нужен безопасный доступ к заблокированным ИИ-сервисам и приватность трафика, это можно закрыть через Sigma.
Практический вывод один: прежде чем давать ИИ-модели доступ к данным или праву что-то отправлять наружу, относитесь к её весам так же настороженно, как к чужому исполняемому файлу. Скачали, проверьте источник, ограничьте права, включите логи.
Источники
The Register как исследователь отравил open-weight ИИ-модель дешевле чем за $100




Пока нет комментариев. Будьте первым!