大腦辨識樂器:早於意識命名

作者: Inna Horoshkina One

大腦辨識樂器:早於意識命名-1

我們輕而易舉就能分辨出大提琴與鋼琴、單簧管與長號。即使樂器以相同的音量演奏著同一音符,它們各自的音色特徵依然獨樹一幟。

這種特質,我們稱之為音色。

然而,這種差異究竟源自何處?它僅僅存在於聲音本身嗎?抑或每種樂器都會在大腦活動中留下獨特的印記?

一項於2026年發表在《NeuroImage》期刊上的最新研究揭示,透過單一短暫的腦電圖(EEG)片段,機器學習演算法能夠以高於隨機猜測的準確度,判斷受試者當時正在聆聽的五種音色中的哪一種。

大腦的電生理活動不僅保留了關於聲音音高和響度的訊息,更包含了其獨特的個別特徵。

一個音符 — 五個音色世界

這項研究由加拿大紐芬蘭紀念大學的專家——普拉維娜·薩特庫納拉賈(Pravina Satkunarajah)、莎拉·鮑爾(Sarah Power)和班傑明·贊德爾(Benjamin Zendel)共同完成。

該文章於2026年5月19日線上發表,並收錄於《NeuroImage》期刊的八月刊中。

共有10名聽力正常的受試者參與了這項實驗。他們之中包含了音樂家、自學成才者以及未受過音樂訓練的人。

受試者聆聽了同一個音符——第三個八度音的A音(A3),其基頻為220赫茲。該音符以五種不同的音色呈現:

  • 鋼琴;
  • 單簧管;
  • 大提琴;
  • 長號;
  • 無泛音的純粹正弦波音。

每個聲音持續一秒鐘。所有音色的音量都經過調整以保持一致,以避免音量成為受試者或後續分析的簡單提示。

這五種聲音各被呈現了200次,同時使用腦電圖(EEG)和73個電極持續記錄大腦活動。

因此,首要改變的便是音色——也就是我們藉以辨識聲音來源的特徵。

何謂音色?

音色常被形容為聲音的「色彩」,但這個定義並未能完全涵蓋其所有的複雜性。

它不單純是塗抹在音符表面的顏色。

它是聲音的傳記。

同一個音符,無論在鋼琴、單簧管或大提琴上,都具有相同的基頻音高。然而,伴隨基頻而來的,是大量額外的頻率——即泛音。這些泛音的數量、強度與分佈,共同構成了樂器獨特的頻譜模式。

其他特徵也各有不同:

  • 起音——聲音產生的速度;
  • 其增強與衰減;
  • 泛音之間的能量分佈;
  • 亮度;
  • 粗糙度;
  • 樂器材料與琴身的共振。

對於大提琴而言,聲音源自於琴弓、琴弦、木質琴身及其內部空氣的相互作用。

單簧管的聲音則由樂手的呼吸驅動簧片振動,再透過樂器內部的空氣柱形成共鳴。

在鋼琴中,琴槌敲擊琴弦,隨後響板和琴身會放大並轉化由此產生的震動。

因此,音色並非單純的裝飾或副產品。

它是聲音的誕生方式,是震動所經歷的物質媒介,也是促使震動產生的運動。

能否透過腦電圖(EEG)辨識樂器?

研究人員檢視了是否能透過單一的腦電圖(EEG)片段,判斷受試者當時所聽到的音色。

這並非一項簡單的任務。人類接收的是完整的聲學資訊,而演算法僅分析在頭皮表面記錄到的電氣訊號。

為了處理這些數據,研究使用了四種機器學習演算法:

  • 線性判別分析(Linear Discriminant Analysis);
  • 梯度提升(Gradient Boosting);
  • 支持向量機(Support Vector Machine);
  • K-近鄰演算法(K-Nearest Neighbors)。

科學家們比較了幾種不同類型的數據:原始腦電圖片段、誘發電位的特徵,以及諧波和頻譜特徵。

如果演算法只是從五個選項中隨機猜測,預期準確度約為20%。

然而,在分析原始腦電圖片段時,所有四種模型都展現出高於隨機猜測的結果:

  • 梯度提升演算法(Gradient Boosting)——約35%;
  • 線性判別分析(Linear Discriminant Analysis)——約34%;
  • 支持向量機(Support Vector Machine)——約33%;
  • K-近鄰演算法(K-Nearest Neighbors)——約26%。

準確度距離完美尚有差距。然而,主要目的並非要百分之百準確地識別樂器,而是要驗證音色資訊是否存在於單次大腦反應中。

該演算法並未聽到原始聲音,也沒有分析其聲學記錄。它僅僅接收了腦電圖(EEG)數據。

然而,這些電氣訊號中仍保留了足夠可辨識的資訊,足以讓演算法以高於隨機猜測的準確度判斷所感知的音色。

PubMed資料庫中的研究

大提琴留下最顯著的印記

科學家們也分析了聽覺誘發電位的N1和P2成分——這些是聲音出現後不久,大腦電氣活動的短暫變化。

N1成分的探討範圍約在聲音起始後的100至200毫秒之間,而P2成分則在150至290毫秒之間。

對於不同音色的反應,其出現時間和振幅均有所不同。

大提琴引發了最顯著的P2反應,而純粹的正弦波音則引發了最小的反應。大提琴的N1反應出現得較早,而單簧管的反應則是最晚的。

這並不意味著大腦「偏愛」大提琴。

這些差異可能與起音特徵、頻譜組成、粗糙度及泛音分佈有關。例如,實驗中所使用的單簧管聲音,其起音在所有樂器音色中最為平滑。

但這些結果揭示了關鍵一點:不同的音色確實會引起不盡相同的神經反應。

在樂器的聲音中,大腦所分辨的遠不止音高和響度。

人類表現遠優於演算法

實驗參與者也憑藉意識來辨識所聽到的聲音。人類辨識的平均準確度約為94%。

受試者對長號的辨識度最佳,約為97%。純音的辨識準確度約為96%,大提琴為95%,單簧管為92%,鋼琴則為89%。

這是一個重要的比較。

演算法目前還無法像人類辨識熟悉聲音那樣,自信地解讀感知。這項研究僅展示了第一步:音色資訊即使存在於短暫的單一腦電圖片段中,也能夠被部分解碼。

助聽器能否理解我們的注意力?

這項研究的一個潛在實用方向與助聽器相關。

現代助聽器雖然擅長語音放大,但對於音樂而言,卻仍是一個艱鉅的挑戰。當多種樂器同時演奏時,經過處理的眾多頻率和動態細微變化可能會混雜在一起,失去自然感或變得刺耳。

理論上,未來與大腦活動記錄相結合的助聽器,將能夠判斷使用者正試圖聆聽哪種樂器,並選擇性地放大該樂器的聲音。

例如,當聽者將注意力集中在管弦樂團中的大提琴時,助聽器便能協助將其聲部從整體音樂流中提取出來。

然而,要實現這樣的應用,還有很長的路要走。

此次實驗僅有10名受試者參與。實驗採用的是獨立的單秒音符,而真實的音樂則複雜得多:樂器同時演奏,不斷變化音高、音量、力度和演奏方式。

分類準確度也僅保持在中等水平——介於26%至35%之間。

因此,這並非一項成熟的讀心技術,而是對一個基本可能性進行的首次驗證:大腦的短暫反應確實包含了關於所感知音色的可辨識資訊。

這項發現為「地球之聲」增添了什麼?

這項發現顯示:意識所感知的聲音,並非只是無個性的頻率。

大腦能夠分辨與材料、觸感、呼吸以及聲音產生方式相關的振動特性。同一個音符,透過不同的樂器演奏,便能轉化為多個獨立的音色世界——且每一個音色世界都會在神經活動中留下獨特的印記。

音樂的產生不僅僅關乎於發出聲響的「是什麼」。

它更源自於振動「如何」傳遞、「透過什麼」以及「經由誰」而產生。

鋼琴、大提琴、單簧管和長號或許可以演奏同一個音符——但我們的意識卻將每個聲音視為一個獨立的存在。

音色,是振動的獨特個性。它是材料的記憶。是運動的印記。

是物質融入音樂的方式。

而我們越是仔細聆聽,就越能清晰地聽到:地球並非重複著相同的音符。

它透過木材、金屬、琴弦、樂手的呼吸以及聆聽者的感知意識,展現出其無限的多樣性。


5 浏览量

來源

  • Single-trial EEG-based classification reveals instrument-specific timbre perception via traditional machine learning classifiers

  • Benjamin Zendel - Memorial University of Newfoundland

  • dblp: Benjamin Rich Zendel

  • Benjamin Rich Zendel's lab - Cognitive Aging and Neuroscience Laboratory

  • Тембр и спектральный состав

  • Benjamin Zendel - Wikipedia

发现错误或不准确的地方吗?我们会尽快处理您的评论。