在第一個音符之前:聲音在哪裡誕生

作者: Inna Horoshkina One

在第一個音符之前:聲音在哪裡誕生-1
寂靜以金色的垂直進入身體,在心中展開,成為呼吸、波浪、聲音。

首先是——寂靜。

但這片寂靜並不空無。其中已然存在著某種渴望顯現之物:一種幾乎難以辨識的內在聲響,尚未成為嗓音、旋律或動作。

音樂家不僅用聽覺去傾聽它。他以專注接納它,讓它進入呼吸,穿過肌肉、姿態與雙手。唯有如此,那原本存在於內在、沒有物理聲響之物,才成為空氣的振動——一個能讓他人聽見的音符。

寂靜孕育意圖。
意圖進入身體。
身體將不可見之物轉化為聲音。

如今,神經科學已逼近這道顯現的邊界。研究者正學習辨識在人能夠說出詞語之前便已產生的大腦活動,並將其轉化為可聽見的言語、面部表情與數位身體的動作。

科學尚未解釋音樂誕生的奧祕。但它已經能夠看見:在嗓音於外在世界響起之前,人的內在正上演著一整部交響曲。

不僅僅是還原詞語

14年2026月,於同儕審查期刊 Nature Neuroscience 上發表了一篇論文 Simultaneous speech and gesture decoding for multimodal communication in paralysis ——〈為癱瘓者的多模態溝通同時解碼言語與手勢〉。

這項研究由加州大學舊金山分校的團隊進行,由神經外科醫師暨神經科學家 愛德華·張。第一作者為研究者 莎曼珊·布羅斯勒。

實驗中有三名參與者,他們語言器官與身體的癱瘓程度各不相同。研究團隊在他們大腦運動皮質表面安裝了皮質電圖陣列——那是帶有電極的薄片,用以記錄神經活動。

參與者試著說出指定的語句,並做出熟悉的手勢:揮手、豎起大拇指、搖頭。有時他們分開進行,有時則同時進行。

機器學習演算法在取得的訊號中尋找規律,這些規律對應於嘗試說出特定詞語或做出動作的意圖。接著,辨識出的意圖被轉譯為數位替身的動作。

結果,其中兩名參與者能夠同時操控其(數位替身的)言語與手勢。

這是具有根本重要性的進展。人類的交流從不僅限於一連串詞語。我們以整個身體說話:改變表情、轉動頭部、擺動雙手,以目光與停頓強調意義。

這項新技術力圖為人找回的不只是傳遞資訊的能力,還有人之為人的一部分在場。

身體並非伴隨聲音——它參與其中

這項研究最有趣的結果之一,關乎大腦如何將言語與動作連結起來。

人們或許會以為,同時說出語句與做出手勢,只是兩個獨立訊號的簡單相加。然而,在合併表達時的神經活動,與詞語和動作分開進行時所產生的神經活動並不相同。

若演算法事先正是以這類合併動作接受訓練,便能更準確地辨識同時進行的言語與手勢。

換句話說,人的表達並非各個獨立元素的機械總和。

嗓音、面容與動作,是作為同一個事件誕生的。

我們在音樂中也能觀察到這一點。歌者並非只以聲帶發出聲音。呼吸、脊椎的位置、胸腔、面部肌肉以及對空間的內在感受,都參與了發聲。鋼琴家以整個身體觸及琴鍵,即使可見的動作只由一根手指完成。舞者不只以耳朵聽見節奏——他將節奏轉化為重量、方向與動作的軌跡。

身體不是聲音的包裝。它成為音樂陳述的一部分。

尚未存在的聲音

23年2026月,arXiv 平台上出現了一篇大型科學綜述 Brain-to-Language Decoding: Tasks, Signals, Methods, Evaluation, Practical Use and Beyond。其作者比對了那些試圖將大腦活動轉譯為文本、合成語音、聲學聲響與視覺表達的研究。

作者考察三個方向:

  • 人試圖說出的言語;
  • 沒有出聲說出、卻在內心響起的內在言語;
  • 對所聽見語言的感知。

這篇綜述目前仍是預印本,尚未經過同儕審查。這不是宣布某個新系統的誕生,更不是能夠自由讀取人類思想的證明。它的價值在於另一點:它顯示出不同的科學研究方向,距離意圖與表現之間的那個空間已經有多近。

研究者已經不再只處理個別的指令。有些實驗系統能生成串流般的合成語音,使其音色更接近個人的聲音,並將詞語與數位臉部的動作結合起來。

但這類系統越是富有表現力,這個問題就越重要: 它們究竟辨識的是什麼?

腦訊號中並不包含一個現成的句子,只要「聽一聽」就夠了。演算法詮釋神經系統的複雜活動,將其與訓練資料相互比對,並選出最可能的結果。

因此,一句聽來連貫的話語,還不代表機器已完整且無誤地還原了人的內在經驗。結果的一部分,可能是由語言模型補上的。

這不是讀心。這是一種複雜的翻譯——目前仍不完美,需要因人而異地調校,並且需要與當事人本身持續回饋。

誰是還原後聲音的作者

迄今為止,言語神經義肢的首要目標一直是準確度:系統正確辨識了多少詞,以及能以多快的速度將其重現。

如今則出現了一個更深的問題——關於作者身分。

如果演算法幫助人表達意圖,它就成了像樂器一樣的工具。但如果系統開始自行補上太多東西,幫助與取代之間的界線就變得不那麼明顯。

因此,這類技術的發展不能只以速度和辨識百分比來評價。必須要有使用者的掌控、修正結果的可能、演算法運作的透明性,以及保留由人自己決定究竟要以他的名義說出什麼的權利。

真正的聲音,不只是正確的詞語組合。

它是音色。
節奏。
停頓。
手勢。
情感的色調。
以及不說話的自由。

還原聲音,意味著還給人一種可能:在自己的表達中認出自己。

這為音樂開啟了什麼

音樂家早已知道一件神經科學才正要找到語言去描述的事:聲響在實際的音符之前就已開始。

作曲家可能在觸碰樂器之前,就聽見內在的音樂線條。歌者能夠事先感受到樂句的方向,然後才以呼吸將其充滿。即興演奏者未必知道下一個音會是什麼,卻能感覺到那股已經準備好流經身體的動勢。

科學透過動作規劃、聽覺意象、記憶、預測以及大腦不同區域之間的互動來描述這些過程。音樂家則將它們體驗為內在辨認的一瞬:

就是這個聲音,想要顯現出來。

這並不意味著儀器能夠直接從意識中錄下現成的音樂,或揭開靈感的源頭。在內在感受與作品之間,仍有一條漫長的路——選擇、訓練、技巧、文化、記憶,以及一個人獨一無二的歷史。

但新的研究讓人得以用另一種方式看待創作的那一刻本身。

音樂並非誕生於空氣開始振動之時。物理上的聲音已是這過程最後的階段之一。在它之前,存在著定向的注意力、對形式的預感,以及身體準備好去體現那還無法從外部聽見之物的狀態。

在第一個音之前

我們習慣把敲擊鼓面、觸碰琴鍵,或聲帶的第一下動作,視為音樂的開端。

但也許這已經不是開端,而是顯現。

在第一個音之前,存在著一個內在空間,其中聲音、感受與動作尚未彼此分離。接著,意圖浮現。它匯聚注意力,改變呼吸,啟動神經與肌肉的過程——並逐漸進入物質之中。

神經科學正學習捕捉這段過渡中的個別階段。技術試圖還給癱瘓者表達自我的可能。而音樂則提醒我們,聲音從來就不只是聲學訊號。

它誕生於人整體的完整之中。

而也許,最初的那個音並非響在空氣裡。它誕生於那一刻——當我們內在的寂靜選擇了它想要被聽見的形式。


17 浏览量

留言

发现错误或不准确的地方吗?我们会尽快处理您的评论。