科學家讓 AI 抱怨……便祕

编辑者: Svitlana Velhush

科學家讓 AI 抱怨……便祕-1
🚽 沒有胃,也沒有腸道——但症狀卻很有說服力

九月 研究人員 瓦倫·塔利亞布埃、雷納德·董與卡麥隆·伯格 發表了一項研究 The Pain Axis,探討能否在語言模型中偵測到某種關於不適狀態的特殊內部表徵,以及它如何影響模型的回答與行為。他們測試了25個不同系列的开源模型,並證明內部激活的某些特定變化確實會明顯改變 AI 描述自身狀態的方式。塔利亞布埃、董與伯格的這項研究目前是以 arXiv 預印本的形式發表,而非經過同儕審查的期刊論文 1月.

隨後,開發者 琳恩·科爾 決定測試一下,這種技術究竟能玩到多遠。

科爾沒有選擇嚴肅的主題,而是把模型設定在一個日常得多的題目上:

便祕與脹氣。

結果令人印象深刻、極具說服力。模型開始主動抱怨消化問題,以及無法正常上廁所——儘管它當然既沒有腸道,也沒有胃,更沒有身體。科爾使用的是 Qwen3-4B 模型,以及同一套改變內部激活的通用技術。

這個玩笑式實驗的意義正在於此:即使 AI 極具說服力地描述某種身體狀態,也並不代表它真的經歷了那種狀態。

科爾本人對結果的總結格外有力:他認為,這項實驗顯示出,我們必須多麼謹慎地看待 AI 對自身感受的描述。

總而言之,科學家研究的是人工智慧複雜的內部狀態。

接著,一位開發者出現了,並向科學提出了一個新問題:

「好吧。那便祕也能灌輸給它嗎?」

結果發現——AI 描述起來還真是精彩絕倫。

所以,要是哪天神經網路說它急需看腸胃科醫生,最好先檢查一下設定。😄

35 浏览量

來源

  • An AI ‘torture chamber’ went viral — then a developer gave the chatbot constipation

  • The Pain Axis: LLMs Represent Self-Directed Harm and Act on It

留言

发现错误或不准确的地方吗?我们会尽快处理您的评论。