九月 研究人员 瓦伦·塔利亚布埃、伦纳德·邓和卡梅伦·伯格 发表了一篇论文 The Pain Axis,研究语言模型内部是否存在一种对不适状态的独特表征,以及它如何影响模型的回答和行为。他们测试了25个来自不同系列的开源模型,并表明内部激活的某些改变确实会明显改变AI描述自身状态的方式。塔利亚布埃、邓和伯格的这项工作目前仍以 arXiv预印本的形式发表,而非经过同行评审的期刊论文 1月.
随后,开发者 林恩·科尔 决定测试一下,这种技术究竟能走多远。
科尔没有选择严肃的主题,而是让模型转向了一个日常得多的话题:
便秘和胀气。
结果令人印象深刻,极具说服力。模型开始主动抱怨消化问题,以及无法正常上厕所——尽管它当然既没有肠道,也没有胃,更没有任何身体。科尔使用的是 Qwen3-4B 模型,以及同样那套改变内部激活的通用技术。
而这正是这个玩笑式实验的意义所在:如果AI非常令人信服地讲述某种身体状态,这并不意味着它真的体验到了这种状态。
科尔本人对结果的表述尤为精彩:在他看来,这个实验表明,对于AI关于自身感受的讲述,我们必须格外谨慎。
总之,科学家们研究的是人工智能复杂的内部状态。
后来一位开发者来了,向科学提出了一个新问题:
“好吧。那便秘也能给它灌输吗?”
结果发现——AI 把它描述得精彩绝伦。
所以,如果哪天神经网络说自己急需看消化科医生,那还是先检查一下设置吧。😄




