在第一个音符之前:声音在哪里诞生

作者: Inna Horoshkina One

在第一个音符之前:声音在哪里诞生-1
寂静以金色的垂直进入身体,在心中展开,成为呼吸、波浪、声音。

起初——是寂静。

但这寂静并非空无一物。其中已然存在着某种渴望显现的东西:一种几乎难以察觉的内在声响,尚未成为嗓音、旋律或动作。

音乐家不仅用耳朵去聆听它。他以专注接纳它,让它进入呼吸,穿过肌肉、姿态与双手。直到这时,那曾以无形之声存在于内部的东西,才化作空气的振动——一个能被他人听见的音符。

寂静孕育出意图。
意图进入身体。
身体将不可见之物转化为声音。

如今,神经科学已逼近这道显现的边界。研究人员正在学习识别在人尚未能说出词语之前便已产生的大脑活动,并将其转化为可听见的言语、面部表情以及数字身体的运动。

科学目前尚无法解释音乐诞生之谜。但它已经能够看到:在嗓音于外部世界响起之前,人的内部正上演着一整部交响曲。

不仅归还言语

14年2026月,在同行评审期刊 Nature Neuroscience 上发表了一项研究 Simultaneous speech and gesture decoding for multimodal communication in paralysis ——《同时解码言语与手势,实现瘫痪状态下的多模态交流》。

这项研究由加利福尼亚大学旧金山分校的团队完成,由神经外科医生兼神经科学家 爱德华·张领导。第一作者是研究者 萨曼莎·布罗斯勒。

实验有三名参与者,他们的言语器官和身体处于不同程度的瘫痪状态。研究人员在他们大脑运动皮层表面安装了皮层脑电矩阵——带有电极的薄片,用于记录神经活动。

参与者尝试说出指定的句子,并做出熟悉的手势:挥手、竖起大拇指、摇头。有时他们单独做这些动作,有时则同时进行。

机器学习算法在获得的信号中寻找与尝试说出特定词语或做出动作相对应的规律。随后,识别出的意图被转化为数字替身的动作。

结果,两名参与者能够同时控制其言语和手势。

这是具有原则性意义的重要一步。人类的交流从来都不局限于一连串词语。我们用整个身体说话:改变面部表情、转动头部、活动双手,用目光和停顿来强调含义。

这项新技术力求归还给人的,不仅是传递信息的能力,还有他个人存在的一部分。

身体并非伴随声音——它参与其中

这项研究最有趣的成果之一,涉及大脑如何将言语与动作连接起来。

人们本可以假设,同时说出句子和做手势只是两个独立信号的简单相加。然而,在联合表达时的神经活动,与词语和动作分别执行时所产生的神经活动有所不同。

如果算法事先正是用这种联合动作进行训练,它们就能更准确地识别同时进行的言语和手势。

换言之,人的表达并非各个单独元素的机械总和。

声音、面部和动作是作为一个统一的事件诞生的。

我们在音乐中也能观察到这一点。歌手并非仅仅用声带发出声音。呼吸、脊柱的姿态、胸腔、面部肌肉以及内在的空间感都参与发声。钢琴家用整个身体触碰琴键,即使可见的动作只由一根手指完成。舞者不仅用耳朵听到节奏——他将其转化为重量、方向和运动轨迹。

身体不是声音的包装。它成为音乐表达的一部分。

尚未存在的声音

23月2026年,arXiv 平台上出现了一篇大型科学综述 Brain-to-Language Decoding: Tasks, Signals, Methods, Evaluation, Practical Use and Beyond。其作者对比了那些试图将大脑活动转化为文本、合成言语、声学声音和视觉表达的研究。

作者考察了三个方向:

  • 人试图说出的言语;
  • 没有外部发声却在内心响起的内在言语;
  • 对听到的语言的感知。

这篇综述目前还是预印本,尚未经过同行评审。它不是关于创建新系统的消息,更不是能够自由读取人类思想的证据。它的价值在别处:它展示了不同科学方向距离意图与显现之间的那片空间有多近。

研究人员已经不再只是处理单独的指令。一些实验系统能够生成流式的合成言语,使其音色接近个人的嗓音,并将词语与数字面部的动作结合起来。

但这些系统越是富有表现力,一个问题就越重要: 它们究竟识别的是什么?

大脑信号中并不包含一个只需「听一听」就行的现成句子。算法解读神经系统的复杂活动,将其与训练数据比对,并选出最可能的结果。

因此,一句听起来连贯的话,并不意味着机器已经完全无误地还原了人的内在体验。结果的一部分可能是由语言模型补全的。

这不是读心。这是一种复杂的翻译——目前尚不完善,需要因人而异地调校,并且需要与本人持续反馈。

谁是还原出来的声音的作者

迄今为止,言语神经假体的主要目标一直是准确性:系统正确识别了多少词,以及能以多快的速度将其再现。

如今出现了一个更深层的问题——关于作者身份。

如果算法帮助人表达意图,它就成为一种类似乐器的工具。但如果系统开始自行补全过多的内容,帮助与替代之间的界限就变得不那么明显了。

因此,这类技术的发展不能仅凭速度和识别百分比来评判。还需要用户的控制权、修正结果的可能、算法运作的透明度,以及保留人决定究竟以自己之名说出什么的权利。

真正的声音不只是正确的词语组合。

它是音色。
节奏。
停顿。
手势。
情感色彩。
以及不说的自由。

归还声音,意味着归还一个人在自己表达中认出自己的能力。

这为音乐开启了什么

音乐家早已知道神经科学才刚刚开始用语言去描述的事情:声音在物理的音符之前就已经开始。

作曲家可以在触碰乐器之前就听到内心的音乐线条。歌手能够预先感受到乐句的走向,然后才用呼吸将其充盈。即兴演奏者并不总是知道下一个音符会是什么,却能感受到那种已经准备穿过身体的运动。

科学通过运动规划、听觉意象、记忆、预测以及大脑不同区域的相互作用来描述这些过程。而音乐家则将它们体验为一个内心认出的瞬间:

就是这个想要显现的声音。

这并不意味着仪器能够直接从意识中记录下现成的音乐,或揭示灵感的源头。在内心的感受与作品之间,仍有一条漫长的道路——选择、训练、技巧、文化、记忆以及一个人独一无二的经历。

但新的研究让我们得以用另一种方式看待创作本身的瞬间。

音乐并非诞生于空气开始振动之时。物理的声音已经是这一过程最后的阶段之一。在它之前,存在着有方向的注意力、对形式的预感,以及身体去体现那尚无法从外部听到之物的准备。

在第一个音符之前

我们习惯把击鼓、触键或声带的第一下动作视为音乐的开端。

但也许,这已经不是开端,而是显现。

在第一个音符之前,存在着一个内在空间,在那里声音、感受与运动尚未彼此分离。随后,意图产生了。它汇聚注意力,改变呼吸,启动神经与肌肉的过程——并逐渐进入物质之中。

神经科学正在学习记录这一转变的各个阶段。技术试图为瘫痪者归还表达自我的能力。而音乐则提醒我们,声音从来都不只是声学信号。

它诞生于人的完整整体。

而也许,最最初的音符并不在空气中响起。它诞生于我们内心的寂静选择它想要被听见的那种形态的那一刻。


17 查看

评论

你发现了错误或不准确的地方吗?我们会尽快考虑您的意见。