
脑机接口技术正在经历一场从科幻走向现实的跨越。近日,顶级期刊《Nature Neuroscience》(自然神经科学)推出神经技术特刊,深度对话了加州大学戴维斯分校副教授谢尔盖·斯塔维斯基(Sergey Stavisky)。访谈聚焦于一个令整个领域振奋的突破:语言神经假体(Speech Neuroprostheses)正在从实验室的“概念验证”大步迈入“实际通信系统”的应用阶段。
在这场前沿对话中,Stavisky不仅分享了那些令人意想不到的科学惊喜,也坦诚剖析了当前面临的硬核工程挑战与不可回避的伦理问题。技术的狂飙突进,正在真实地重塑神经接口的未来。今天,脑机头条将这篇极具前瞻性的内容翻译分享给大家,让我们一起走进这场关于大脑、语言与未来的深度探讨。

Stavisky是一位神经科学家和神经工程师,他担任加州大学戴维斯分校神经假肢实验室的联合主任。该实验室致力于开发脑机接口技术,旨在为因脊髓损伤、中风或肌萎缩侧索性肌营养不良等疾病而丧失语言能力或运动能力的患者提供康复手段。同时,他还通过这些初步临床试验来深入了解人类各种能力背后的神经生物学机制,以便更好地实现这些功能的恢复。
Nature Neuroscience:在你自己的研究中,哪些发现最让你对脑机接口所能实现的能力感到意外?
Stavisky:让我一再感到意外的是,仅仅从一小块皮层记录到的信号,就能以高准确率解码出如此多不同的行为。比如,我最开始做语音脑机接口时,研究的是运动皮层手部区域里与说话相关的神经活动。当时那位参与者其实是在参加一项控制光标或机械臂的脑机接口试验[1]。而现在,我们从语音运动皮层记录信号,不仅能准确解码每一个音素[2]和言语中的多种副语言要素[3],还能解码手部动作[4],让参与者控制电脑鼠标,甚至能解码全身动作[5]。
单个神经元能用这种广泛而混合的方式编码信息,实在令人着迷。不过,运动皮层中那些不属于该区域传统功能范畴的行为信息,是否真正起因果作用,目前还没有答案。即便这些信号只是其他脑区核心计算的“副产物”,它们在实际研究中也非常有用:借助那些已经因为明确临床目的而植入的微电极阵列,我们还能研究人类认知的其他方面。这一点意义重大,因为目前人脑的许多区域仍无法用具有单神经元分辨率的工具来研究。
Nature Neuroscience:在您的科研经历,哪位导师、哪篇论文或哪段研究经历,最深刻地塑造了您今天对脑机接口的理解?
Stavisky:已经离世的博士导师克里希纳·谢诺伊(Krishna Shenoy)对我影响很深,他也是我博士后阶段的共同导师[6]。他的实验室是一个非常特别、也非常好的科研训练环境。尽管声誉卓著、影响广泛,克里希纳却始终保持着较小的团队规模,并且真心帮助每个人实现自己的目标。这让我认识到,一支人数不多、干劲十足且被充分授权的小团队,也能快速取得进展;而 Krishna 则树立了“以人为本”领导力的榜样。
在脑机接口研发上,克里希纳有两个与众不同的策略选择,我后来一直努力向他学习。首先,他对提升脑机接口性能的追求毫不妥协。当时,整个领域已经做出了不少看起来很炫的演示,但性能未必达到真正实用的水平。有时甚至连量化性能的合适指标都没有。因此,建立可靠的评价指标也是他重视的工作之一。在我看来,这种状况部分源于一种想法:原理验证已经涵盖了大多数学术上有趣的问题,而从原理验证走到高性能,不过是“迭代”或“多做些工程工作”,似乎自然会完成。但克里希纳明白,只有亲自一步步把性能做上去,才能找到真正的瓶颈。这些工作带来了许多富有洞见的工程发现,至今仍是这一领域的重要基础。
第二个策略选择,是同时深入开展神经工程和神经科学研究。这很难。许多团队都有这个目标,最后却往往主要做研究,或主要做工程。但克里希纳都做到了。即使实验室的神经科学研究与脑机接口研究没有在具体项目上直接结合,持续的思想交流也大幅提升了每个成员的能力。比如,Jon Kao花了几年时间,才终于成功把神经动力学模型应用到脑机接口的改进上[7]。今天,脑机接口领域发展得更快了。我认为,同时具备神经科学和脑机接口两方面的专业能力也更加重要,因为这一领域的前沿工作,很大一部分是在探索可干预的神经损伤范围。这就要求我们随着研究需要,及时厘清我们试图恢复的认知功能背后的基础神经科学。
Nature Neuroscience:使用者和解码器各自会发生多大程度的适应?什么证据会让你相信,人们正在形成全新的神经交流模式?
Stavisky:在我们的言语脑机接口研究中,用户侧几乎没有发生适应,唯一的例外是使用者主动改变策略:研究开始几周后,这位参与者从发声说话,改为更省力地做出说话动作但不发声。我们将研究初期的言语神经相关信号与数月后的信号进行比较,发现二者相似。即便存在神经调谐变化,这些变化也更像是无益的漂移,而非适应性学习。因此,我们一直用近期数据微调解码器,让它跟上这些变化。
解码器持续适应,加上我们始终努力让它尽可能“仿生”,也就是贴合说话时自然的神经编码,或许可以解释为什么没有观察到使用者的适应:大脑没有太大压力必须去适应。此外,解码器本身一直在变,感觉运动系统也就更难适应它。这与运动脑机接口动物模型中一些精彩的神经适应研究不同,比如Amy Orsborn和Jose Carmena的研究[8],以及Batista和Yu团队的研究[9]。这些研究明确以检验神经适应为目标,做法是有意降低解码器的性能,并保持解码器不变。
如果驱动脑机接口的神经元,其调谐特性随时间出现了有益变化,比如调制深度增大,或与音素之间的互信息增加,我就会认为这表明大脑发生了适应。但正如刚才所说,解码器持续适应,可能先于这种神经适应发挥作用,使它没有机会发生。因此,合适的实验应当是固定解码器,观察几小时或几天之后,参与者的神经活动是否会调整,从而产生更准确的语音输出。
难点在于,言语脑机接口性能下降后,还要让实验继续进行,会让人很受挫。毕竟,参与者是一个希望使用神经假体来交流的人,而我们却要请他使用一个表现不佳的解码器,可能还得持续很多天。因此,动物神经适应研究与人类研究之间存在一定脱节:这类实验在动物身上更容易开展,而在人类研究中,我们通常希望尽可能减轻使用者的负担。话虽如此,我仍认为有必要以某种形式开展这样的实验,我们也已经规划了这方面的研究。
Nature Neuroscience:你早期关于神经活动变异性的工作,已成为长期使用脑机接口的重要设计基础。十年后回头看,这个领域是否在构建稳健的解码器与持续自适应的解码器之间找到了合适的平衡?
Stavisky:幸运的是,就目前而言,提高解码算法自身的稳健性与让它持续适应,实际上并不需要相互取舍。十年前,大多数脑机接口采用线性解码方法。在非人灵长类动物中,用于简单二维光标控制的脑机接口,其最佳性能已经几乎可以媲美健全个体的伸手动作。但稳健性一直是个大难题,同期的人类脑机接口在这方面表现更差。我们把深度学习和跨多天采集的大规模数据集引入脑机接口后[10],稳健性大幅改善,最佳性能却只略有提升。
我记得当时还担心,专门设计更稳健的算法,会不会很快就失去研究价值,因为这个领域可能不久就会转向拥有数千个通道的神经接口。即使是简单的解码器,只要对大量带噪声或随机波动的测量结果取平均,也会变得更稳健。但后来的情况表明,基于深度学习的解码器有三个重要优势。第一,在解码手写[11]、说话[12]等更复杂的行为时,它们是实现高性能的关键。第二,在用大规模数据集训练时,它们仍然具有很强的稳健性。第三,它们可以用新数据持续更新[13],既提高性能,也进一步增强稳健性。与此同时,即便硬件有所进步,神经信号的非平稳性依然是一个重要影响因素。
这只是众多例子中的一个:技术进步会让哪些问题变得更容易,哪些问题仍然重要,其实很难预测。它也说明,新方法的全部价值有时不会立刻显现。在这个例子中,人工神经网络让我们可以同时实现算法自身的稳健性、持续适应,以及在更复杂任务上的高性能。
Nature Neuroscience:目前,一些性能最好的言语脑机接口使用的是皮层内电极阵列。什么证据会让你相信,其他记录方式,比如非侵入式技术,可能更好?
Stavisky:我知道,很多人把我和“皮层内阵营”紧紧联系在一起。但从职业发展来说,如果能有机会转向性能同样出色的非侵入式神经接口,那会是最让我高兴的事情之一。需要处理的文书工作能少太多!而且,我也很想亲身体验一下自己一直在开发的脑机接口用起来是什么感觉。
说正经的,侵入性更低或非侵入式的记录方式会让患者受益,也会让世界各地需要这类设备的人提前几十年用上语音脑机接口。目前,还没有任何非侵入式技术被证明能接近植入式传感器的性能,但有许多令人期待的技术正在研究中,比如便携式脑磁图(MEG)和聚焦超声。
好消息是,要说服我或者脑机接口领域的其他人,相信另一种记录方式性能相当或更好,其实一点也不难。一个实用的办法是,找到某类脑机接口目前最先进的研究,用新设备复现那篇论文中的任务和评价指标。比如,你的可穿戴设备是用来控制电脑光标的?很好,就让使用者完成网格目标选择任务[14]。如果在设备面向的患者群体中,信息传输速率能稳定达到每秒4比特(4bps)或更高,我就会信服。
你的头盔能够解码内在言语?那就像我们近期的论文[12]那样,让使用者按照屏幕提示,说出Switchboard这类开放词汇语料库中的句子。如果词错误率低于5%,它就可能成为一个实用的日常交流系统。我真心希望这能实现。
Nature Neuroscience:要让语言神经假体成为常规临床技术,最大的障碍是什么?
Stavisky:到目前为止,我们已经证明,高性能的语言神经假体是可以实现的。这意味着,现有神经接口能够测到足够的信息,而我们对说话时神经编码的理解,也已经足以准确解码人们想说的话。但我们还没有从足够多的参与者身上采集到足够的数据来估计并尽量缩小误差范围。
比如,我们不知道需要多少个电极,才能让99%的患者都达到足够好的性能;不知道目前用于定位皮层中富含言语信息区域的方法,究竟有多强的普适性和可靠性;甚至不知道犹他电极阵列这类较早的传感器,其使用寿命曲线是什么样,尽管我们现在已经积累了不少数据。对于刚开始测试的新硬件,我们了解得更少了。
回答这些问题,需要从目前学术机构临床试验中的少数几位参与者,扩大到企业主导的临床试验中的数百人。达到这个规模后,我们也有机会改进整个流程的每一个环节,从患者筛选、脑区定位,到手术操作和解码器校准。只有经过这样的改进,相关方法才能实现足够程度的自动化或简化,让为患者配置语音神经假体成为大多数医院都能开展的常规医疗流程。目前,我们采用的仍是高度依赖专家投入、需要逐人定制的流程。
Nature Neuroscience:与研究参与者建立长期合作,是这项工作的核心。与他们的交流,如何改变了你们实验室选择研究问题的方式?
Stavisky:我们从参与者身上学到的东西非常多,远不止请他们完成我们设计的任务时获得的数据。比如,我们与第一位接受我们植入手术的参与者“T15”已经合作了三年。他是语音神经假体的第一位“深度使用者”,几乎每天都用它,并把它作为主要的交流方式。他有点像一位试飞员,给了我们大量关于系统的反馈和功能建议。
例如,早期我们一直在逐步改进即时“脑到语音”的功能,以解决“脑到文本”交流方式的一项局限:系统只有在一句话结束后才会把它朗读出来,交谈对象很容易无意中打断脑机接口使用者,或漏听他说的话。T15提出了一组简单得多、却出奇有效的临时解决办法:在屏幕上加一个喇叭按钮,按下后播放能引起别人注意的声音;再加一个重播最近几句话的功能,就像终端里用向上键调出之前的命令一样。我觉得,单靠我们自己是想不到这些功能的。如今,从多层级用户界面到各个按钮的动画和位置,都有他的参与和影响。
T15还提过一个“纯粹为了好玩”的要求:说出某些关键词时,系统能触发特定音效,比如表示扫兴的长号声,或说出“lo!”时播放情景喜剧里的罐头笑声。这让我们意识到,在以文本为主的界面中,增加额外一层可同时发出的数字指令,可以大幅增强表达能力。这个想法后来发展成一个仍在进行的项目:把手势和面部动作解码为即时输出的emoji。
每位参与者的独特经历,都以不同的方式影响着我们的研究。比如,另一位参与者在患上肌萎缩侧索硬化症(ALS)之前很喜欢唱歌。与她合作,让我们开始挑战实时、连续地解码音高。我们希望她能够重新唱歌。
Nature Neuroscience:你们的语音合成研究,已经从解码词语扩展到解码交流中的韵律和表达特征。随着脑机接口能够还原越来越丰富的说话意图,研究者应当如何界定恢复交流能力与神经隐私之间的边界?
Stavisky:我认为,这些隐私边界应当在脑机接口实际投入使用的阶段确定,而且会随设备的用途而变化。比如,消费用途与医疗用途、临床试验与商业产品,情况都不一样。我不赞成在更早的研究阶段就明确划定哪些信息可以解码、哪些不可以,主要有两个原因。当然,研究者应当向临床试验参与者如实说明潜在的隐私风险。
第一个原因是,我们事先并不知道神经信号里包含哪些信息。比如,我们团队刚开始把电极放在运动皮层、开发语音脑机接口时,我曾认为,我们的策略天然就能保护神经隐私,因为我们读取的是使用者主动尝试说话时发出的语音运动指令。这个判断大体上是对的,但也有例外:由斯坦福大学BrainGate同事牵头的一项研究发现,同一批电极还可以解码在心中想象的言语[15],只是准确率低于尝试说话时的解码准确率。所以,我现在必须补上一项限定:今天的言语脑机接口还不能准确读出一个人的内心独白,但未来技术更好时,这或许会成为可能。与此同时,我们还发现,同一批神经元也编码了与运动无关的语言认知信号[16],这又带来了另一种隐私风险。如果我们事先把研究限定为只解码词语和韵律特征,就会错过识别这些风险、并提醒研究界的机会。
第二个原因是,许多隐私风险也可能带来医疗上的机会。还是以前面两个例子来说:对于ALS患者,尝试说话可能很慢,也很费力,解码内在言语可以为他们提供一种更快、更轻松的交流方式。解码更抽象的语言语义信息,则可能帮助表达性失语症患者恢复交流能力。这些患者无法形成现有语音脑机接口所解码的语音运动计划。
恢复功能与保护隐私之间的边界,要视具体情况而定。对一个人来说,某些想法可能过于私密,不宜被测量;对另一个人来说,读取这些想法却可能是他更愿意采用的交流方式。作为研究者,我们的任务是提供这些选择,再帮助社会针对脑机接口的不同用途找到恰当的平衡。其中也包括准确说明,从技术上看,脑机接口究竟能够获取哪些信息。
Nature Neuroscience:如果可以提前看到十年后某项实验或技术发展的结果,你最想看什么?
Stavisky:如果能提前看看十年后的情况,我想知道,对大脑、尤其是人脑的研究,是否已经对人工智能(AI)研究产生了重大的积极影响。毫无疑问,人工智能能力将如何发展,会是决定十年后世界面貌的最重要因素之一,甚至可能是最重要的因素。但神经科学会在其中发挥什么作用,仍是一个完全开放的问题。
有许多很有说服力的理由,让人相信生物大脑能为我们提供线索,帮助实现数据利用效率和能源效率高得多的智能,以及持续学习、更好的泛化能力等理想特性。这也是新兴的NeuroAI分支领域的核心吸引力之一。不过,在现代技术背景下,把神经科学成果转化为人工智能进步的第一个“杀手级应用”,仍有待发现。
我预测,如果这样的应用出现,它会给神经科学带来更多关注、资源和社会影响,其规模将远超今天围绕脑机接口的热情,尽管脑机接口完全值得获得现在的关注。我想不出还有什么问题,对我们这个领域来说比它更为重大。
采访:Henrietta Howells
在线发表:2026 年 10 月 1 日
来源:Nature Neuroscience 第 29 卷 2365 至 2367 页 2026 年 10 月
DOI:https://doi.org/10.1038/s41593-026-02443-5
翻译整理:王猛
运营:罗卜
脑机接口社区是国内首家脑机接口(BCI)产业服务平台、国内脑机接口新媒体开创者与引领者。主要为企业、科研团队、投资机构和从业者提供以下服务: 宣传报道:图文、短视频、直播形式报道企业动态、技术解读、产品介绍等内容,提升曝光和行业影响力。 资源对接:根据需求匹配资本、供应链、临床机构、渠道方等资源,完成真实对接,促进合作。 成果转化:协助技术团队寻找产业方、投资人及落地场景,推动技术到产品的转化。 活动策划执行:承接线上线下路演、沙龙、论坛等活动的策划与执行。 其他定制需求:包括报告定制、市场调研、人才招聘支持等个性化服务。 合作洽谈,请联系微信:ZuoLeiLeiya (备注:姓名-单位-合作) 投稿丨成为创作者,请联系微信:RoseBCI 🌟星标置顶🌟 不错过每一条脑机前沿进展 一键三连「分享」、「点赞」和「在看」 欢迎在评论区聊聊

