专访Sergey Stavisky:要毫不妥协地追求脑机接口性能,同时深入神经工程与神经科学

脑机新声 2026-10-04 09:30
专访Sergey Stavisky:要毫不妥协地追求脑机接口性能,同时深入神经工程与神经科学图1
专访Sergey Stavisky:要毫不妥协地追求脑机接口性能,同时深入神经工程与神经科学图2

Sergey Stavisky 是加州大学戴维斯分校副教授。本次访谈聚焦言语神经假体如何从概念验证走向实际通信系统,以及神经接口未来面对的科学、工程和伦理问题。

问:在你自己的研究中,脑机接口能够实现的哪些能力最让你感到意外?

我一次又一次感到惊讶的一点,是我们可以从非常小的一块皮层区域中,以很高的准确率解码很多种不同的行为。

例如,我最初开发言语脑机接口时,研究的是当时参加光标或机械臂脑机接口试验的参与者运动皮层手部区域中,与言语相关的神经动力学。

现在,当我们从言语运动皮层进行记录时,不仅可以准确解码每一个音素和多种言语副语言信息,还能够解码手部运动,让参与者控制电脑鼠标,甚至能够解码全身运动。

单个神经元中存在如此广泛且混合的编码现象,非常有意思。

目前仍然没有解决的一个问题,是运动皮层中这些非典型行为信息究竟是否具有因果作用。

即使这些信号只是其他区域核心计算过程留下的某种“回声”,它们在实践中仍然非常有价值。

原因在于,我们已经出于明确临床目的植入了微电极阵列,利用这些电极,还可以研究人类认知的其他组成部分。

考虑到目前人类大脑中绝大多数区域还无法通过单神经元精度的工具进行研究,这一点非常重要。

问:导师、论文或者某段研究经历中,哪一种科学影响最深刻地塑造了你今天对脑机接口的理解?

我的博士导师和博士后联合导师 Krishna Shenoy 对我影响非常深。

他的实验室是一个非常特别的训练环境。

尽管这个实验室拥有很高的知名度和影响力,Krishna始终把团队规模保持得比较小,并且认真帮助每一个人实现自己的目标。

这让我意识到,一小群高度投入并真正拥有自主权的人,可以非常快速地推动研究。

Krishna也向我展示了一种“以人为先”的领导方式。

在开发脑机接口方面,他有几个非常鲜明的战略选择,我后来也一直试图学习。

第一个,就是毫不妥协地追求脑机接口性能。

当时整个领域已经做出了很多看起来很炫酷的演示,但这些系统的性能未必真正达到实用水平。

有时甚至连衡量性能的合适指标都没有。

建立良好的性能评价指标,也是Krishna非常重视的一件事。

当时一种常见思路是,只要完成概念验证,最有科学意义的问题就已经解决了。

后面继续提高性能,则被看成普通迭代或者工程工作,似乎自然就会完成。

Krishna的看法不同。

他认为,我们只有亲自不断把性能向上推,真正的瓶颈才会暴露出来。

事实证明,在这个过程中产生了很多非常重要的工程发现,直到今天仍然构成这个领域的重要基础。

第二个战略选择,是同时深入神经工程和神经科学。

这件事情很难。

很多团队一开始也希望同时兼顾两者,但最终往往逐渐集中到科学或者工程中的某一边。

Krishna真正做到了兼顾两者。

即使实验室里的神经科学研究和脑机接口研究,在单个项目层面并没有直接联系,长期的知识交叉仍然显著提高了团队每个人的能力。

例如,Jon Kao花了很多年,才最终成功利用神经动力学模型提高脑机接口性能。

今天,脑机接口的发展越来越快,我认为同时具备神经科学和脑机接口工程能力变得更加重要。

很多新的前沿问题,都涉及把脑机接口扩展到更多类型的神经系统损伤。

这就要求我们在真正需要某项能力的时候,迅速弄清楚希望恢复的认知功能背后的基础神经科学。

问:使用脑机接口时,究竟是用户适应得更多,还是解码器适应得更多?什么证据能够说明人类真的形成了全新的神经交流策略?

在我们的言语脑机接口研究中,用户自身出现的适应其实很少。

一个明确变化是,在最初几周以后,参与者开始采用更加省力的“模拟说话”策略,而不再尝试真正发声。

我们比较研究开始时和数月以后与言语相关的神经活动,发现整体非常相似。

即使存在一些神经调谐变化,看起来也更像没有帮助的漂移,没有显示出明确的适应性学习。

因此,我们持续使用最新数据微调解码器,让解码器适应这些变化。

我们一直努力让解码器尽可能“仿生”,也就是尽可能匹配自然言语的神经编码。

持续进行的解码器适应,可能正是我们看不到明显用户适应的原因。

大脑没有很强的适应压力。

同时,解码器本身一直在变化,也让感觉运动系统更难适应它。

这与运动脑机接口动物模型中一些非常漂亮的神经适应研究形成鲜明对比。

例如 Amy Orsborn 和 Jose Carmena 的工作,以及 Batista 和 Yu 团队的研究。

这些实验为了研究神经适应,会有意识地降低解码器性能,然后把解码器固定下来。

如果未来看到驱动脑机接口的神经元调谐特征随着时间出现有利变化,例如调制深度增加,或者神经活动与音素之间的互信息增加,我会认为这是大脑真正发生适应的证据。

问题在于,我们持续更新解码器的做法可能提前消除了大脑适应的必要性。

真正合适的实验,应该把解码器固定下来,然后观察几个小时或者几天以后,参与者的神经活动是否能够逐渐适应,并产生更加准确的言语输出。

这类实验的问题在于,随着系统性能下降,参与者会非常挫败。

因为真正使用这个神经假体的是一个希望通过它交流的人,我们等于要求他连续很多天使用一个性能较差的解码器。

这也是动物神经适应研究和人体研究之间存在差异的重要原因。

动物实验更容易开展这类研究。

人体试验中,我们通常会尽量让系统对用户更加容易使用。

尽管如此,我仍然认为某种形式的固定解码器实验非常重要,我们已经在规划相关研究。

问:你早期关于神经信号变异性的研究已经成为长期脑机接口设计的重要基础。十年以后再看,目前这个领域在稳健解码器和持续自适应解码器之间找到平衡了吗?

幸运的是,目前提高解码器本身的稳健性与持续适应之间,并没有明显冲突。

十年前,大多数脑机接口还使用线性解码方法。

当时在非人灵长类动物中进行简单二维光标控制,峰值性能已经几乎能够接近健全人的伸手运动。

真正困难的问题是稳健性。

当时的人体脑机接口中,这个问题更加严重。

后来,我们把深度学习以及跨多天的大规模数据引入脑机接口。

它显著提高了系统稳健性,不过对于峰值性能的提升相对较小。

当时我甚至担心,专门研究更加稳健的算法会不会很快失去意义。

因为大家预计,神经接口很快会发展到数千通道。

当你可以对大量带噪或者随机测量进行平均时,即便简单解码器也会变得更加稳健。

后来事实证明,这种担忧没有发生。

基于深度学习的解码器在几个方面都非常重要。

第一,它对于手写¹¹和言语¹²这样的复杂行为实现高性能解码至关重要。

第二,当训练数据规模足够大时,它能够保持很高的稳健性。

第三,它还可以持续利用新数据更新,同时进一步提升性能和稳健性。

与此同时,即使硬件不断进步,神经信号的非平稳性依然是重要问题。

这说明技术发展以后,哪些问题会自然消失,哪些问题仍然长期存在,其实很难提前预测。

新方法真正的全部价值,也不一定会在刚出现时立即显现。

人工神经网络最终同时为内在稳健性、持续适应以及复杂任务上的高性能提供了一条路径。

问:目前皮层内电极阵列能够提供性能最高的一些言语脑机接口。什么样的证据能够让你相信其他记录方式,例如非侵入技术,可以达到甚至超过它?

很多人可能会把我看成“皮层内阵营”的坚定支持者。

但从职业角度来说,如果有一种非侵入神经接口能够达到完全相同的性能,我会非常高兴转向这种技术。

至少可以少很多审批文件。

我也非常希望自己能够真正体验一下自己开发的脑机接口是什么感觉。

更重要的是,对患者来说,低侵入甚至完全非侵入的记录方式显然更有价值。

如果这种技术出现,它甚至可能把言语脑机接口普及到全球所有需要它的人群的时间提前数十年。

目前还没有任何非侵入技术被证明能够达到与植入式传感器接近的性能。

不过已经有很多令人兴奋的新技术正在研究,例如便携式MEG和聚焦超声。

有一个好消息。

想说服我或者脑机接口领域的其他研究人员接受另一种记录方式,其实并不困难。

一个简单方法,就是找到某类脑机接口当前最先进的研究,然后使用新的设备完整复现同样的任务和评价指标。

例如,如果你的可穿戴设备用于控制电脑光标,那就让用户完成标准网格任务。

如果在目标患者群体中,信息传输速率能够稳定达到4 bps或者更高,我就会相信它。

如果你的头盔可以解码内在言语,那就按照我们最近论文的方式,让用户针对屏幕提示,从Switchboard这样的开放词汇语料库中产生句子。

如果词错误率能够低于5%,那么它很可能已经可以成为真正有用的日常交流系统。

我真心希望这些目标能够实现。

问:让言语神经假体成为常规临床技术,目前最大的障碍是什么?

我们已经证明,高性能言语神经假体是可行的。

这说明今天的神经接口已经可以测量足够的信息,我们对于言语神经编码的理解也已经达到一定程度,可以比较准确地解码人们试图表达的内容。

但我们目前还没有在足够多参与者身上收集足够多的数据,从而准确估计并降低系统的不确定性。

比如,我们还不知道为了让99%的患者达到足够性能究竟需要多少根电极。

我们也不知道寻找富含言语信息的皮层区域的方法,在不同患者之间究竟有多强的普适性和可靠性。

即使对于Utah阵列这样的老技术,我们对设备寿命曲线仍缺乏完整数据,虽然现在已经积累了不少信息。

对于刚进入测试阶段的新硬件,数据就更少。

解决这些问题,需要把目前学术临床试验中只有少数参与者的状态,扩大到产业临床试验中的数百人规模。

达到这种规模以后,我们也有机会优化整个流程。

包括患者筛选、脑区定位、外科手术和解码器校准。

这些步骤必须不断标准化、自动化和简化。

最终目标应该是,让患者接受言语神经假体成为大多数医院都能够实施的常规医疗流程,减少对当前这种高度定制化、严重依赖少数专家人工操作的模式的依赖。

问:与研究参与者建立长期合作关系是这项工作的核心。参与者如何改变你们实验室选择的研究问题?

我们从参与者那里学到的东西非常多,远远超过他们按照我们设计的任务完成实验以后产生的数据。

例如,我们已经与第一位植入参与者“T15”合作了三年。

他可以算是第一位言语神经假体的“重度用户。

现在他几乎每天都使用系统,并把它作为主要交流方式。

他很像一名试飞员,会给我们大量反馈和功能需求。

例如早期,我们一直在慢慢优化即时“脑到语音”功能,希望解决脑到文字交流中的一个问题。

如果系统只有在一句话全部完成以后才把文字读出来,对话者就很容易在中途打断脑机接口用户,或者错过他真正想说的内容。

T15提出了几个简单得多的临时方案,但效果出乎意料地好。

一个是在屏幕上增加一个喇叭按钮,可以播放吸引注意的声音。

另一个是增加重复最近一句话的功能,类似于电脑终端中的向上键。

这些功能我们自己大概不会想到。

现在整个系统已经形成了一个多层级用户界面,从动画到每一个按钮的位置,T15都产生了影响。

T15还有一些纯粹为了好玩的需求。

例如,当某些关键词被说出来时,系统自动播放特殊音效。

比如触发“悲伤长号”音效,或者说“lol”时播放情景喜剧中的笑声。

这让我们意识到,一个以文字为核心的界面,还可以通过增加同时输出的数字指令,大幅提高表达能力。

后来这个想法发展成了一个持续进行的项目,我们开始把手势和面部动作解码为即时Emoji输出。

每一名参与者自身的经历,也会以不同方式影响研究。

例如,另一名参与者在患ALS之前很喜欢唱歌。

和她合作以后,我们开始挑战实时、连续的音高解码。

我们希望让她重新唱歌。

问:你们的语音合成已经从解码单词扩展到了韵律和表达特征。当脑机接口能够恢复越来越丰富的意图言语时,研究者应该如何界定恢复交流与神经隐私之间的边界?

我认为,这些隐私边界应该在脑机接口真正部署时,根据具体用途来确定。

消费级设备与医疗设备会不同,临床试验和商业产品也会不同。

我并不赞成在研究早期就明确划出哪些内容可以解码、哪些内容永远不能研究。

当然,研究人员必须向临床试验参与者明确说明潜在隐私风险。

第一个原因是,我们事先并不知道神经信号里究竟包含哪些信息。

例如,我们最开始在运动皮层使用电极开发言语脑机接口时,我曾认为我们的方案天然能够保护神经隐私。

因为我们读取的是用户主动尝试说话时产生的言语运动指令。

大部分情况下确实如此。

但后来BrainGate在Stanford的同事发现,同样的电极也能够解码内在想象言语¹⁵,虽然准确率低于真正尝试说话的情况。

所以今天我必须加一个限定。

当前言语脑机接口还无法准确读取一个人的内心独白,但随着未来技术改善,这件事可能变得可行。

与此同时,我们还发现,同样这些神经元中存在非运动性的语言认知信号。

这同样形成潜在隐私风险。

如果我们一开始就把研究严格限制在单词和韵律解码,就不会发现这些风险,也没有机会提前提醒整个社会。

第二个原因是,很多隐私漏洞同时也是潜在医疗机会。

以内在言语解码为例。

对于ALS患者,真正尝试说话可能速度很慢,也很费力。

如果能够直接解码内在言语,反而可能提供更加快速、轻松的交流方式。

如果能够解码更抽象的语言语义信息,还可能帮助表达性失语患者。

这些患者已经无法形成当前言语脑机接口所依赖的言语运动计划。

因此,恢复功能和隐私之间的边界高度依赖具体场景。

对于一个人过于私密、不应该被读取的思想,可能恰好是另一个人最希望用来进行交流的信号。

研究人员的职责,是提供这些技术选择,并向社会准确解释脑机接口究竟能够访问哪些信息,帮助整个社会为不同应用场景找到合适的平衡。

问:如果你能够提前看到十年以后一个实验或者一种技术的发展结果,你最想知道什么?

如果我能够看到十年以后,我最想知道的是,研究大脑,特别是研究人类大脑,是否会对人工智能研究产生重大而积极的影响。

毫无疑问,AI能力未来如何发展,将是决定十年以后整个世界面貌的最重要因素之一,甚至可能是最重要的因素。

神经科学究竟会在其中发挥什么作用,目前完全没有答案。

有很多理由让我们相信,生物大脑可能蕴含着实现更高数据效率、更高能量效率、持续学习、更好泛化能力以及其他理想智能特性的线索。

这也是正在兴起的NeuroAI领域最核心的吸引力之一。

但目前,第一个真正意义上的“神经科学向AI转移”的杀手级应用还没有出现。

如果未来出现,我预测它给神经科学带来的关注、资源以及社会影响,将远远超过今天脑机接口已经获得的巨大热度。

我想不到还有哪个问题,对我们这个领域具有更大的长期影响。

采访:Henrietta Howells,本文由脑机新声根据原文翻译

原文链接:https://www.nature.com/articles/s41593-026-02443-5


《全球脑机π》专栏介绍

专访Sergey Stavisky:要毫不妥协地追求脑机接口性能,同时深入神经工程与神经科学图4

《全球脑机π》是脑机新声平台倾力打造的全球首个聚焦脑机接口(BCI)领域的人物深度访谈专栏。

π,无限不循环。正如人类对大脑的探索没有终点,脑机接口行业先驱者的创造力也没有边界。我们不做泛泛而谈的行业综述,只和真正在改变人类认知边界的人一对一深谈。

《全球脑机π》专栏下设五大子栏目:针对商业领域的《BCI TALK》、针对临床专家的《NEURO TALK》、针对科学家的《SCIENCE TALK》、患者视角的《LIFE TALK》、产业从业者的《INDUSTRY TALK》。从实验室到手术室,从研究论文到患者家庭,拼出这个行业的完整图景。

专访Sergey Stavisky:要毫不妥协地追求脑机接口性能,同时深入神经工程与神经科学图5


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
接口 脑机
more
超4000人在线见证!久事神康与锦徕科技战略签约,共建脑机接口数据基座
当大脑成为数据:脑机接口正逼近人类最后的隐私防线
5万小时神经数据与AI模型,Neuralink让脑机接口告别反复校准?
脑机接口×医保大赛200个奖项揭晓:一场“技术秀”与“医保账”的对撞
脑虎科技“ 三全 ”脑机接口协同AI与数字技术,探索意图连接现实新路径
2000万入局脑机接口,东星医疗在下一盘怎样的棋?
为什么脑机接口企业想表达的,往往不是市场想听的?
BCI+AI,脑虎科技“三全”脑机接口正在连接真实世界
全球脑机接口×医保创新场景大赛决赛结果公示!
专访 g.tec 创始人Christoph Guger:“脑机接口正在进入新的技术周期” 丨BIOHK系列报道
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号