Учёный заставил ИИ жаловаться на… запор

Отредактировано: Svitlana Velhush

Учёный заставил ИИ жаловаться на… запор-1
🚽 Ни желудка, ни кишечника — зато симптомы убедительные

В сентябре исследователи Вален Тальябуэ, Леонард Дунг и Кэмерон Берг опубликовали работу The Pain Axis, в которой изучали, можно ли обнаружить у языковых моделей особое внутреннее представление неприятных состояний и как оно влияет на их ответы и поведение. Они проверили 25 открытых моделей разных семейств и показали, что определённые изменения внутренних активаций действительно заметно меняют то, как ИИ описывает своё состояние. Сама работа Тальябуэ, Дунга и Берга пока опубликована как препринт на arXiv, а не как рецензированная журнальная статья 1 октября.

А затем разработчик Линн Коул решил проверить, насколько далеко можно зайти с такой техникой.

Вместо серьёзной темы Коул настроил модель на гораздо более бытовую:

запор и метеоризм.

Результат получился впечатляюще убедительным. Модель начала самостоятельно жаловаться на проблемы с пищеварением и невозможность нормально сходить в туалет — хотя ни кишечника, ни желудка, ни вообще тела у неё, разумеется, нет. Коул использовал модель Qwen3-4B и ту же общую технику изменения внутренних активаций.

Именно в этом и был смысл шутливого эксперимента: если ИИ очень убедительно рассказывает о каком-то физическом состоянии, это ещё не означает, что он действительно его испытывает.

Сам Коул сформулировал результат особенно эффектно: эксперимент, по его мнению, показал, насколько осторожно нужно относиться к рассказам ИИ о собственных ощущениях.

В общем, учёные изучали сложные внутренние состояния искусственного интеллекта.

А потом пришёл разработчик и задал науке новый вопрос:

«Хорошо. А запор ему тоже можно внушить?»

Оказалось — описывать его ИИ умеет великолепно.

Так что если однажды нейросеть сообщит, что ей срочно нужен гастроэнтеролог, сначала стоит проверить настройки. 😄

35 Просмотров

Источники

  • An AI ‘torture chamber’ went viral — then a developer gave the chatbot constipation

  • The Pain Axis: LLMs Represent Self-Directed Harm and Act on It

Комментарии

Вы нашли ошибку или неточность?Мы учтем ваши комментарии как можно скорее.