揭秘语音脑机接口:大脑中的“声音”如何被解码?

脑机接口社区 2026-07-27 09:41

揭秘语音脑机接口:大脑中的“声音”如何被解码?图1

语音解码,是指脑机接口(BCI)记录大脑中与言语相关区域的神经活动,识别使用者试图表达的词汇,并将其转化为文本或可听语音的过程。

对于丧失说话能力的人而言,这项技术提供了一条新的沟通路径:系统直接读取大脑中的言语意图,无需依赖嘴唇、舌头和喉部的协调运动。

当我们设想利用脑机接口帮助失语者恢复表达能力时,这一过程似乎近乎魔法:一个人仅仅尝试说话,设备就能识别其想要表达的内容,这究竟是如何实现的?

事实上,这并非魔法,而是神经生物学、信号处理与人工智能精密协作的结果。语音脑机接口通过记录神经信号、解码语言意图,再将其转化为文本或语音,最终建立起一条从大脑到外部世界的沟通通道。


01

什么是语音脑机接口?

脑机接口是一种基于计算机的系统,它记录并分析大脑信号,进而将这些信号转化为预期的行动(Shih 等人,2012)。

具体到语音脑机接口,系统会读取与言语产生相关的大脑区域所发出的信号,从中解码使用者试图表达的词汇,并将这些词汇转化为文本或合成语音。

从整体流程来看,语音脑机接口将大脑中的言语意图转化为外部语音,主要包含三个关键环节:记录、解码与行动

为了更清晰地理解这一过程,可以以“大脑—文本—语音”系统为例。这类系统首先将大脑信号转化为文本,再通过文本转语音技术生成可听语音(Willett 等人,2023;Card 等人,2024)。

其中,“记录”负责获取和处理神经信号,并将数据从大脑传输至计算机;“解码”负责从神经信号中识别使用者想要表达的词汇,通常需要借助神经网络、统计模型和大语言模型;“行动”则负责将解码结果转化为文本、合成语音或其他沟通形式。

贯穿三个环节的核心指标之一是延迟,即从用户尝试说话,到系统生成文本或语音之间的时间差。

语音脑机接口最终需要融入日常对话,这意味着系统应尽可能接近自然语言每分钟约160个单词的交流速度(Yuan 等人,2006)。因此,能否在保证准确率的同时降低延迟,是语音脑机接口走向实际应用的关键。

揭秘语音脑机接口:大脑中的“声音”如何被解码?图2


02

三个关键环节:记录、解码与行动

阶段一:记录神经信号

在记录阶段,脑机接口设备会捕捉神经元在用户尝试说话时产生的电信号。

神经元之间主要通过动作电位进行通信。动作电位是一种跨越细胞膜传播的电脉冲。部分脑机接口能够直接记录单个神经元的动作电位,另一些系统则记录多个神经元共同活动所形成的综合信号。

获得原始信号后,系统需要对其进行处理,包括放大与目标神经活动相关的成分,并滤除噪声和对语音解码无用的信号。

随后,处理后的数据会被传输至计算机。由于计算机使用由“0”和“1”组成的二进制语言,神经电信号还需要经过数字化处理,被转化为计算机能够识别和运算的数据。

在进入解码环节前,系统通常还会进一步滤波,以提高信噪比。来自植入设备的信号在数字化、滤波和传输过程中均可能产生延迟。虽然单个环节的延迟通常只有毫秒量级,但这些延迟会逐步累积,最终影响从大脑意图产生到语音输出的整体速度。

记录阶段还决定了整个系统信息传输速率的上限。信息传输速率,即 ITR,衡量的是从意图产生到动作解码过程中实际传递的信息量,通常以比特每秒(bps)为单位。

解码器只能利用记录阶段已经获取的神经信息进行工作。任何未被记录下来的言语信息,都无法在后续环节中被“反向还原”。因此,信号采集的质量、通道数量和信息丰富程度,直接决定了解码系统能够达到的性能上限。

阶段二:神经解码

解码,是将记录到的神经信号转化为预期语音内容的过程。

在“大脑—文本—语音”系统中,解码通常会涉及“音素”。音素是构成语音的基本声音单位,也就是组成单词的独立发音片段。

例如,英文单词“cat”包含“/k/”“/a/”和“/t/”三个音素;“sun”则包含“/s/”“/u/”和“/n/”三个音素。英语中大约有40种不同的音素,它们通过不同组合构成各种单词。

揭秘语音脑机接口:大脑中的“声音”如何被解码?图3

在解码的第一步,神经网络等机器学习模型会分析神经数据,判断当前信号最有可能对应哪些音素。由于神经信号往往存在波动和不确定性,模型输出的通常不是唯一答案,而是不同音素对应的概率。

随后,这些音素概率会被输入一个或多个语言模型,由语言模型结合词汇结构、语法和上下文,推断出最有可能的单词或句子。

揭秘语音脑机接口:大脑中的“声音”如何被解码?图4

语言模型能够显著提高解码准确率,但也可能带来额外延迟。模型规模越大、上下文窗口越长,通常越能够利用前后文纠正音素识别错误,减少不连贯或不合理的输出,但所需的计算资源和处理时间也可能随之增加。

因此,神经解码系统需要在准确率与实时性之间取得平衡:模型既要足够强大,能够准确理解不完整且带有噪声的神经信号,又不能因为计算过程过于复杂,导致明显的对话延迟。

阶段三:行动输出

行动阶段,是用户的言语意图最终被表达出来的环节。

当语言模型确定最可能的单词、短语或句子后,解码结果会被传输至文本转语音软件,即 TTS 系统,最终通过扬声器播放出来。

这一阶段的延迟同样取决于模型和软件的运行速度。神经解码器需要在积累足够置信度后输出句子,文本转语音系统则需要将文字准确、自然地转化为声音。任何一个环节处理速度不足,都可能影响交流的连贯性。

揭秘语音脑机接口:大脑中的“声音”如何被解码?图5

如果用户此前通过“语音库构建”软件录制过自己的声音,系统还可以利用其原有音色合成语音,使输出结果更接近用户本人说话时的声音。

此外,行动系统还可以与个性化数字虚拟形象相结合。虚拟形象不仅能够代替用户发声,还可以呈现一定的面部表情和交流动作。对于面部活动能力严重受限、但希望表达更加自然和丰富的用户而言,这类功能尤其重要。

记录、解码和行动三个阶段的共同目标,是将总延迟控制在足够低的水平,使对话尽可能自然流畅。

仅计算自然语言的文字信息,不考虑情感、语调和重音等交流要素,人类语音的信息传输速率约为每秒39比特(Coupé 等人,2019),自然对话语速约为每分钟160个单词(Yuan 等人,2006)。

因此,语音脑机接口不仅需要“解码正确”,还必须足够快速地识别、处理和执行用户的言语意图,避免产生明显的对话停顿。

作为参考,Connexus® BCI 在临床前基准测试中测得的脑状态信息传输速率超过每秒200比特,高于语音本身的信息传输速率,为提升解码准确率以及支持更加复杂的未来应用提供了性能空间。


03

解码“内心之声”:内言是否会被读取?

语音脑机接口能够显著改善失语人群的生活质量,但这项技术也带来了一个重要问题:系统会不会将用户的内心独白也解码出来,甚至把私密想法“广播”出去?

内言通常被描述为内心独白,或者“脑海中的小声音”。它既可以是主动的,也可以是被动的。

例如,在清点一叠钞票时,人可能会主动在心中默念“一、二、三”;而当一个人在走路时突然遇到一条蛇,也可能不由自主地在脑海中发出惊呼。

因此,人们自然会担心:语音脑机接口是否会持续解码脑海中的每一个念头?例如,在品尝祖母制作的水果蛋糕时,如果系统突然将“真难吃”这样的内心想法说了出来,无疑会造成尴尬。

Kunz 及其同事的研究对这一问题进行了探索。研究人员在神经数据中发现,内部言语与用户有意表达的外部言语可以被区分(Kunz 等人,2025)。

研究还表明,系统可以被设置为默认不解码内部言语,只有当用户在脑海中“想出”解码器预先设定的特定“通行密钥”时,内言解码功能才会被解锁。

能够主动开启或关闭内言解码功能非常重要。在一些场景中,用户可能希望利用内言快速记录想法,例如在会议中默默做笔记,或者保存洗澡时突然产生的灵感。在临床应用中,内言解码还可能降低用户反复尝试发声所带来的精神和身体疲劳。

这些研究体现了脑机接口领域应当遵循的重要原则:技术不仅要追求更高的解码性能,也需要吸收实际使用者的反馈,持续改善设备的安全性、舒适度以及用户控制能力。


04

言语功能恢复的未来

对于患有肌萎缩侧索硬化症、脑干中风或脊髓损伤等疾病的人而言,丧失说话能力不仅意味着无法发声,还可能意味着失去独立性、与外界的联系,以及为自己表达意见和作出选择的能力。

哪怕只能恢复部分言语功能,只要能够接近真实对话的速度和细腻程度,也可能显著改变使用者的生活,使他们重新获得与世界互动的基本方式。

这也是语音脑机接口中每一个“比特每秒”和每一毫秒延迟背后的实际意义:它们不仅是工程指标,也直接决定了用户能否顺畅地参与一场真实对话。

目前,包括 Connexus® BCI 在内的多种语音脑机接口系统正处于临床试验阶段。随着研究不断推进,未来的工作不仅在于改善电极、芯片、算法和模型,也在于更加重视人的需求。

研发者需要与真正依赖这些设备的人合作,共同设计速度更快、精度更高、功能更丰富,同时也更加安全、舒适和可控的系统。

揭开语音解码工作原理的神秘面纱,也是这一合作过程的一部分。因为技术最终所服务的人,有权了解这项技术如何工作,并参与决定它应当如何被设计和使用。

05

关于语音脑机接口的常见问题

BCI 能读取人的思想吗?

语音脑机接口所记录的并不是严格意义上已经形成的“思想”,而是与特定言语任务相关的神经数据。

系统需要针对具体使用者进行训练,才能理解这些神经数据所代表的含义。例如,在训练语音脑机接口时,设备会记录用户尝试说话时的神经活动,将其转化为文字,再由用户确认输出是否正确,从而不断校准解码模型。

这类系统通常还会赋予用户对解码内容和解码时间的控制权。用户界面可以显示解码器当前处于开启还是关闭状态,以及系统是否正在解码内部言语,这些功能均应由用户直接控制。

因此,语音脑机接口并不是被动、持续地读取和广播人的所有思维,而是在经过专门训练后,执行一种高度特定的解码任务,并在用户允许的情况下工作。

语音脑机接口的速度有多快?

研究显示,采用直接“大脑—语音”路径的皮层内脑机接口,已经能够以接近实时的速度合成语音。从获取神经信号到发出声音,其延迟可低至25毫秒。这一时间低于对话中可能被感知为自然停顿的约120毫秒间隔,意味着语音脑机接口正在逐渐接近自然交流所需的实时性。

语音脑机接口安全吗?

皮层内脑机接口已经在多种研究和临床场景中应用数十年,并积累了一定的安全性数据。

一项长期开展的皮层内脑机接口研究项目(BrainGate)报告称,在累计33.4人年的随访过程中,没有发生颅内感染、设备相关死亡或永久性残疾事件。

此外,与皮层内脑机接口具有一定相似性的成熟医疗技术,例如深部脑刺激和立体定向脑电图,通常需要植入体积更大或位置更深的设备。这些方法经过数十年的临床应用,也形成了相对成熟的安全管理经验。

参考资料:

https://pmc.ncbi.nlm.nih.gov/articles/PMC3497935/

https://www.nature.com/articles/s41586-023-06377-x

nejm.org/doi/full/10.1056/NEJMoa2314132

https://www.isca-archive.org/interspeech_2006/yuan06_interspeech.html#

https://paradromics.com/blog/how-speech-brain-computer-interfaces-work/


编译:陈嘉图

图源@paradromics

揭秘语音脑机接口:大脑中的“声音”如何被解码?图6

脑机接口社区是国内首家脑机接口(BCI)产业服务平台、国内脑机接口新媒体开创者与引领者要为企业、科研团队、投资机构和从业者提供以下服务:

宣传报道:图文、短视频、直播形式报道企业动态、技术解读、产品介绍等内容,提升曝光和行业影响力

资源对接:根据需求匹配资本、供应链、临床机构、渠道方等资源,完成真实对接,促进合作。

成果转化:协助技术团队寻找产业方、投资人及落地场景,推动技术到产品的转化。

活动策划执行:承接线上线下路演、沙龙、论坛等活动的策划与执行。

其他定制需求:包括报告定制、市场调研、人才招聘支持等个性化服务。


合作洽谈,请联系微信:ZuoLeiLeiya

(备注:姓名-单位-合作)

投稿丨成为创作者,请联系微信:RoseBCI


揭秘语音脑机接口:大脑中的“声音”如何被解码?图7


🌟星标置顶🌟

不错过每一条脑机前沿进展

揭秘语音脑机接口:大脑中的“声音”如何被解码?图8

一键三连「分享」、「点赞」和「在看」

欢迎在评论区聊聊

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
接口 脑机
more
文献速递|PNAS:北京大学方方/王茜组开辟脑机接口通讯带宽增强新范式
独家|脑机接口企业,真正需要的是什么?
全球首款脑机接口视觉产品PRIMA获CE认证,“80%患者恢复视力”到底意味着什么?
【首发】又一家脑机企业天使轮系列融资总额将超亿元,专注于新一代闭环脑机接口-脑-脊髓神经调控系统
活动预告|AI读懂神经语言,人机边界重构!DeeCamp2026脑机智能大师课重磅开启
2026上半年脑机接口融资复盘:39笔、57.2亿,资本在选什么?
国内首款硬膜下植入式柔性脑机接口进入“绿色通道”
62条脑机接口细分赛道,你看好哪个?
Precision Neuroscience宣布完成非穿透式脑机接口植入
脑机接口走进课堂,全国首创心理学本科实验教学平台启动建设
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号