AI 代理揭露科學文獻中數十年來的錯誤

编辑者: Svitlana Velhush

人工智慧在審查科學出版物和資料庫方面的應用日益普及。近期的案例顯示,AI 代理如何揭露了數十年來未曾被注意到的錯誤。

位於杭州浙江實驗室的理論化學家塞巴斯蒂安·皮奧斯 (Sebastian Pios) 運用 AI 模型預測分子沸點。該系統產生的數值與一本 75 年前參考書中的數據相牴觸。皮奧斯起初懷疑是模型出錯,然而,對原始資料進行查證後發現,錯誤的竟是參考數據本身。

在其他案例中,AI 也發現了一篇論文中的筆誤,以及百年來沸點測量數值不正確的問題。根據皮奧斯的說法,這些錯誤在使用資料庫時,可能已為研究人員帶來不少困擾。

類似的工具也應用於審核會議論文。在 SAI Labs 的一項分析中,AI 代理審查了來自 ICML 2026 口頭報告的 168 篇論文。在 92 篇具有足夠可驗證主張的論文中,AI 代理僅在 34 篇論文中成功複製了五個關鍵主張中的兩個以上。而完全重現(即超過 80% 的主張)的論文僅有八篇。

史丹佛大學的詹姆斯·鄒 (James Zou) 及其同事開發了一款「AI 審核器」,用於掃描 NeurIPS 論文。論文中公式、計算和圖表中的客觀錯誤數量從 2021 年的每篇 3.8 個增加到 2025 年的 5.9 個,增幅高達 55%。這些工具能以人類無法達到的規模進行工作。

然而,專家們警告,AI 同樣會犯錯。來自挪威科技大學的奧德·埃里克·貢德森 (Odd Erik Gundersen) 強調了人工監督的必要性。在自動化審核的時代,我們該如何確保科學知識的可靠性呢?

這項分析主要著重於客觀錯誤,而將新穎性與重要性等問題留給人類判斷。如此一來,有助於避免 AI 因主觀判斷而負擔過重。

12 浏览量

來源

  • AI agents are checking the scientific literature — and spotting decades-old errors

阅读更多关于此主题的文章:

Trump admin revokes visa of Brazilian ambassador to US The Trump administration has revoked the visa of Brazil’s ambassador to the US, escalating a rift between Washington and Brasilia. The State Department did not declare Amb. Maria Luiza Ribeiro Viotti to be “persona

Image
Reply
发现错误或不准确的地方吗?我们会尽快处理您的评论。