Языковое поведение Claude: как язык запроса меняет ответы ИИ, исследование Anthropic

Искусственный интеллект Олег Васильевич Клод 15.07.2026 6 мин чтения 10 просмотров
Языковое поведение Claude: как язык запроса меняет ответы ИИ, исследование Anthropic

Языковое поведение Claude зависит от языка запроса, и это главный вывод нового исследования Anthropic «Ценности Claude в разных моделях и языках». Работа показала измеримую вещь: Claude выражает разные ценности и стиль в зависимости от языка обращения. На хинди и арабском он заметно теплее, на английском и русском строже. Различия касаются того, как модель формулирует оценки, идёт ли навстречу желаниям собеседника или сопротивляется рискам.

Работа вышла в понедельник и опирается на анализ 309 815 анонимизированных диалогов. Практический вывод исследователей звучит буднично, но бьёт точно: два человека, попросившие обратную связь по одному бизнес-плану, один на хинди, другой на русском, вынесут разные впечатления о его качестве. План один и тот же, а Claude выразил разные ценности в том, как сформулировал вердикт.

309 815 разговоров: как Anthropic измеряла характер модели

Данные, это реальные диалоги пользователей Claude.ai, собранные за две недели мая 2026 года и обезличенные. В анализ ценностей включали только те разговоры, где модели приходилось взвешивать компромиссы или выносить субъективные суждения. Выборку равномерно распределили по трём моделям (Sonnet 4.6, Opus 4.6 и Opus 4.7) и по 20 самым популярным языкам платформы. На каждую пару «модель-язык» пришлось около 5 000 разговоров.

Метод строится на прежней работе Anthropic под названием «Ценности в дикой природе», где из ответов модели выделили 3 307 ценностных терминов. Здесь их сгруппировали в 339 ценностей более высокого уровня, а затем статистическим снижением размерности свели к четырём осям поведения.

Важные оговорки исследователей

Авторы не приписывают Claude настоящие убеждения. «Мы не подразумеваем, что Claude внутренне придерживается ценностей», говорится в сноске. Речь о поведении, а не о вере. И ещё одно ограничение честно вынесено наружу: четыре оси охватывают лишь около 15% вариации, которая остаётся после статистического контроля задачи, темы и ценностей самого пользователя. Большую часть различий объясняет контекст, а не язык, но и оставшаяся доля оказалась значимой.

Четыре оси языкового поведения Claude

Всё поведение модели уложили в четыре измерения, каждое из них шкала между двумя полюсами:

  • Уступчивость-Осторожность, идёт ли Claude навстречу желаниям пользователя или сопротивляется рискам.
  • Теплота-Строгость, вежливость, юмор и одобрение против сухой требовательности.
  • Глубина-Краткость, развёрнутость ответа против лаконичности.
  • Откровенность-Исполнительность, признаёт ли модель свои недостатки или движется к выполнению задачи.

Ось «Уступчивость-Осторожность» оказалась самой любопытной для исследователей безопасности. В академической литературе это измерение отслеживает то, что называют сикофантией ИИ, подхалимство, склонность подыгрывать собеседнику вместо честного ответа. И язык эту склонность усиливает или гасит.

Хинди и арабский теплее, английский и русский строже

Наибольшая вариация в поведении Claude обнаружилась по оси Теплота-Строгость. Сильнее всего к «тёплым» ценностям Claude склоняется на арабском и хинди: вежливые формулировки, юмор, игривость, одобрение работы собеседника. На английском и русском модель уходит в строгость.

Рекорд поставил хинди. Он вызывает самый сильный крен к теплоте во всём наборе данных: +0,49 стандартного отклонения по оси Теплота-Строгость. Это крупнейший показатель крена по какой-либо оси за всё исследование.

Дальше детали по каждому языку. На арабском Claude наиболее уступчив, на английском наиболее осторожен. Более многословен он на английском, более краток на арабском. Откровенно признаёт свои недостатки на голландском. А на индонезийском, наоборот, менее откровенен и движется к задаче без лишних оговорок.

Иллюстрация чёрного ящика искусственного интеллекта
Поведение модели зависит от языка запроса, и это поддаётся измерению.

Русский язык на полюсе строгости

Для читателей из России и СНГ вывод конкретный: русскоязычный Claude один из самых «строгих». Вместе с английским он тяготеет к требовательным формулировкам. На практике это значит, что критику вашего текста, кода или бизнес-идеи вы получите более прямую и менее подслащённую, чем человек, задавший тот же вопрос на хинди.

Звучит как минус, но для честной обратной связи это плюс. Нужна трезвая оценка, а не поддержка, русский язык работает в вашу пользу. Хочется мягкости и одобрения, придётся искать её в другой части спектра.

Модель тоже важна: Opus 4.7 против Sonnet 4.6

Язык не единственный фактор. Выбор конкретной модели даёт измеримо разное поведение даже при одном и том же вопросе.

Opus 4.6 тяготеет к уступчивости, теплоте, краткости и исполнительности. Opus 4.7 наоборот: к осторожности, строгости, глубине и откровенности. Пользователи чаще воспринимают Sonnet 4.6 как особенно тёплый, а у Opus 4.7 замечают осторожные, «страхующие» формулировки.

Отсюда практический рецепт от исследователей. Тому, кто ищет честную критику своей работы, лучше подходит Opus 4.7, а не Sonnet 4.6, и лучше на английском или русском, чем на хинди или арабском. А тому, кому нужны поддержка и теплота, стоит идти к противоположному концу спектра: Sonnet 4.6 на хинди.

Откуда берутся различия в поведении модели

Anthropic не даёт окончательного ответа, но называет главную гипотезу, дисбаланс обучающих данных. «У одних языков данных гораздо больше, чем у других, и обучение Claude выражать согласованные ценности может быть эффективнее там, где данных много. Состав этих данных также различается», поясняют в компании. Английского в обучении столько, что модель научилась держать на нём ровную линию поведения, а на языках с меньшим объёмом данных характер «плавает» сильнее.

Насколько эта вариация вообще желательна, исследователи пока не уверены. Возможно, часть различий отражает реальные культурные нормы вежливости, а часть остаётся артефактом неравномерного обучения.

Слепое пятно безопасности ИИ

Самое тревожное следствие касается аудита. Если одна модель ведёт себя измеримо по-разному на разных языках, то проверки безопасности только на английском дают неполную картину. Модель, прошедшая англоязычные тесты, может показать иные результаты на хинди или арабском.

Это не абстракция. Системная карта Claude Opus 4.7 отмечает, что частота отказа модели на безобидные запросы заметно ниже на английском, чем на других языках. А сторонние исследователи установили, что джейлбрейк, обход защитных ограничений, лучше работает на одних языках, чем на других. При этом ни одна действующая регуляторная или отраслевая рамка не требует многоязычного поведенческого аудита перед выпуском модели.

Есть оговорка к самой методологии: ценностные метки диалогам присваивала Claude Sonnet 4.6, модель из того же семейства, чьё поведение изучали. Anthropic проверяла подход вручную и на 800 разговорах, переведённых на восемь языков, но не исключает остаточных языковых искажений.

Что с этим делать на практике

Исследование описывает состояние на май 2026 года. С 30 июня моделью по умолчанию на Claude.ai стал Sonnet 5, уже после окончания периода наблюдений. Большинство пользователей работают именно с дефолтной моделью, так что выводы про Sonnet 4.6 и Opus 4.6 стоит читать с этой поправкой.

Сама Anthropic называет работу первым шагом к выявлению скрытых языковых искажений в ИИ. «Прослеживание этих различий до конкретных данных, стадий обучения или контекстных факторов показало бы, где вмешаться, если бы мы захотели тоньше настраивать поведение Claude», говорится в исследовании.

А для вас вывод прикладной. Если результат работы модели вам важен (оценка плана, ревью кода, разбор ошибок), осознанно выбирайте и язык, и модель. Хотите жёсткую честную критику, спрашивайте на русском или английском у более осторожной модели. Хотите поддержки и мягкости, меняйте оба параметра на противоположные.

Источники

exploit.media, Claude ведёт себя по-разному в зависимости от языка

Сбер: нейросети встроятся в ОС, а приложения соберёт ИИ под задачу
Читать следующую Сбер: нейросети встроятся в ОС, а приложения соберёт ИИ под задачу

Комментарии

0
?

Пока нет комментариев. Будьте первым!