九月 研究人員 瓦倫·塔利亞布埃、雷納德·董與卡麥隆·伯格 發表了一項研究 The Pain Axis,探討能否在語言模型中偵測到某種關於不適狀態的特殊內部表徵,以及它如何影響模型的回答與行為。他們測試了25個不同系列的开源模型,並證明內部激活的某些特定變化確實會明顯改變 AI 描述自身狀態的方式。塔利亞布埃、董與伯格的這項研究目前是以 arXiv 預印本的形式發表,而非經過同儕審查的期刊論文 1月.
隨後,開發者 琳恩·科爾 決定測試一下,這種技術究竟能玩到多遠。
科爾沒有選擇嚴肅的主題,而是把模型設定在一個日常得多的題目上:
便祕與脹氣。
結果令人印象深刻、極具說服力。模型開始主動抱怨消化問題,以及無法正常上廁所——儘管它當然既沒有腸道,也沒有胃,更沒有身體。科爾使用的是 Qwen3-4B 模型,以及同一套改變內部激活的通用技術。
這個玩笑式實驗的意義正在於此:即使 AI 極具說服力地描述某種身體狀態,也並不代表它真的經歷了那種狀態。
科爾本人對結果的總結格外有力:他認為,這項實驗顯示出,我們必須多麼謹慎地看待 AI 對自身感受的描述。
總而言之,科學家研究的是人工智慧複雜的內部狀態。
接著,一位開發者出現了,並向科學提出了一個新問題:
「好吧。那便祕也能灌輸給它嗎?」
結果發現——AI 描述起來還真是精彩絕倫。
所以,要是哪天神經網路說它急需看腸胃科醫生,最好先檢查一下設定。😄




