Naukowiec sprawił, że AI zaczęła skarżyć się na… zaparcie

Edytowane przez: Svitlana Velhush

Naukowiec sprawił, że AI zaczęła skarżyć się na… zaparcie-1
🚽 Ani żołądka, ani jelit — za to objawy przekonujące

We wrześniu badacze Valen Taljabue, Leonard Dung i Cameron Berg opublikowali pracę The Pain Axis, w której badali, czy u modeli językowych można wykryć szczególną wewnętrzną reprezentację nieprzyjemnych stanów i jak wpływa ona na ich odpowiedzi i zachowanie. Sprawdzili 25 otwartych modeli z różnych rodzin i pokazali, że pewne zmiany wewnętrznych aktywacji rzeczywiście wyraźnie zmieniają to, jak AI opisuje swój stan. Sama praca Taljabue, Dunga i Berga została na razie opublikowana jako preprint na arXiv, a nie jako recenzowany artykuł w czasopiśmie 1 października.

A potem deweloper Lynn Cole postanowił sprawdzić, jak daleko można zajść z taką techniką.

Zamiast poważnego tematu Cole ustawił model na znacznie bardziej przyziemny:

zaparcie i wzdęcia.

Wynik okazał się zadziwiająco przekonujący. Model sam zaczął skarżyć się na problemy z trawieniem i niemożność normalnego pójścia do toalety — choć przecież nie ma ani jelit, ani żołądka, ani w ogóle ciała. Cole użył modelu Qwen3-4B i tej samej ogólnej techniki zmiany wewnętrznych aktywacji.

Właśnie w tym tkwił sens żartobliwego eksperymentu: jeśli AI bardzo przekonująco opowiada o jakimś stanie fizycznym, to jeszcze nie znaczy, że rzeczywiście go doświadcza.

Sam Cole ujął wynik szczególnie efektownie: eksperyment, jego zdaniem, pokazał, jak ostrożnie trzeba podchodzić do opowieści AI o własnych odczuciach.

W sumie naukowcy badali złożone stany wewnętrzne sztucznej inteligencji.

A potem przyszedł deweloper i zadał nauce nowe pytanie:

„Dobrze. A czy zaparcie też można jej wmówić?”

Okazało się — AI potrafi je opisywać znakomicie.

Więc jeśli pewnego dnia sieć neuronowa oznajmi, że pilnie potrzebuje gastroenterologa, najpierw warto sprawdzić ustawienia. 😄

35 Wyświetlenia

Źródła

  • An AI ‘torture chamber’ went viral — then a developer gave the chatbot constipation

  • The Pain Axis: LLMs Represent Self-Directed Harm and Act on It

Komentarze

Czy znalazłeś błąd lub niedokładność?Rozważymy Twoje uwagi tak szybko, jak to możliwe.