

Edward Chang 是加州大学旧金山分校神经外科系主任,Margaret Liu Collins 与 Edward B. Collins 杰出教授。他长期研究人类言语产生的神经机制,并推动言语脑机接口从基础研究向临床应用转化。
问:回顾脑机接口领域的发展历程,哪些进展最让你感到意外?
脑机接口领域最让我感到意外的一点,是它终于真正开始成为一种临床现实。
我们已经不再停留在持续了几十年的原理验证阶段。现在,这些技术正在逐渐变成真正的临床治疗手段。
我认为,未来3到5年内,我们将看到第一批商业化脑机接口进入市场,此后这些系统还会逐步扩大应用规模。
这是这个领域非常重要的一个阶段。
过去这些年,脑机接口积累了大量期待,同时也伴随着很多炒作。真正令人兴奋的是,过去缺失的一些关键条件,包括科学基础、资本投入和临床机会,如今终于开始汇集到一起。
真正把技术转化到临床是一件极其复杂的事情。
这类工作通常不是科研论文会重点讨论的内容,但如果我们真的希望把这些技术变成能够实际使用的治疗手段,它又是必不可少的。
在我们自己的研究方向中,言语脑机接口和言语解码的发展速度非常快。
2019年,我们首次证明,可以从大脑活动中解码出可理解的言语。
2021年,我们进一步将这一方法应用到一名重度瘫痪患者身上,首次实现了单词和句子的解码。
此后,通过优化传感器和算法,我们将性能进一步提升到每分钟80个单词,并实现了低延迟的流式输出。
重要的是,推动这个方向发展的已经不只是我们一个团队。越来越多研究团队作出了重要贡献,并对这一技术路线进行了验证。
从这些经历中,我得到的一个重要认识是,技术发展的速度非常快。
我此前没有预料到,AI会成为如此强大的催化剂。
我们今天使用的AI模型,本质上属于通用模型,甚至并不是专门针对语言开发的。
它们所做的,是把一种数字化数据转换成另一种数字化数据,而这正是生成式AI革命背后的核心能力之一。
这些解码算法推动技术进步的速度,是五年前的我都没有想到的。
过去,大家谈脑机接口时,更多关注传感器本身和接口硬件。
今天,即使使用一些已经存在几十年的技术,例如脑表面皮层脑电图,也就是ECoG,或者植入式Utah微电极阵列,我们仍然可以获得远高于过去的性能。
真正发生巨大变化的,是我们利用现代AI处理和解释这些数据的能力。
这推动了一个又一个突破。
向前看,我认为接下来会发生两件事情。
第一,我们会开始看到脑机接口真正进入现实世界的商业化应用。
第二,我希望整个领域能够把一部分注意力重新放回基础科学。
生成式AI模型可能帮助我们进一步理解大脑本身,以及认知和行为究竟是如何产生的。
对我们的研究来说,一个重要转折点发生在循环神经网络开始被广泛用于语言翻译的时候。
当时Google正在开发一些早期机器翻译模型。
我们很快意识到,这些模型真正处理的其实并不局限于语言,它们本质上是在处理序列数据。
无论这个序列由单词、声音还是其他形式的信息组成,模型都可以对序列中的信息进行预测。
它们对输入信号究竟属于哪一种类型,并没有那么强的限制。
理论上,一个用于把法语翻译成英语的模型,也可以经过调整,把大脑活动“翻译”为英语。
因为两者底层面对的问题非常相似,都是把一种数字序列转化成另一种数字序列。
在脑机接口领域,这些模型已经帮助我们把脑信号转化为光标控制、文字,甚至虚拟数字人的面部动作。
问:除了AI之外,有没有某个实验或者发现,让你真正相信言语脑机接口是可行的?
归根结底,你首先必须获得足够显著、稳定、高信噪比和高分辨率的数据。
这些模型并没有魔法。
它们不可能在任何质量的数据上都正常工作。
它们真正擅长的,是从复杂数据中识别人眼难以发现、传统线性模型也难以解释的模式。
所以,虽然新模型非常重要,但它们最终更多解决的是优化问题。
最根本的因素仍然是数据本身。
大约在2010年,我第一次真正意识到,言语脑机接口可能是可以实现的。
当时我们做了一个非常简单的实验。
我们让参与者说“ba”“da”“ga”这样的简单音节,同时直接从人类运动皮层表面记录神经信号。
我们可以看到,“ba”对应一种特定的活动模式,“da”则对应另一种模式。
真正令人印象深刻的是,这些差异实际上反映了发声器官的空间组织,以及产生这些声音所需要的构音动作。
当时,很多人认为言语太复杂、太抽象,很难直接解码。
但那个实验第一次让我意识到,也许我们真的能够处理像言语这样复杂的问题。
过去,人们经常把这个问题描述成“把思想直接翻译成语言”。
但我们换了一个角度,把它重新理解成一个运动控制问题。
我认为,我们一个非常基础的贡献,就是提出言语可以从“构音运动编码”的角度来理解。
当我们在原始神经数据中看到不同音节对应不同的活动模式以后,后面的逻辑就逐渐清晰了。
从原理上讲,言语应该能够被解码。
这些年来的发展也逐步证明了这一点,并最终形成了今天这些高性能系统。
问:未来的脑机接口是否可能在真正发音之前,就从音系或者语言规划层面解码语言?这种方式最终会不会超过构音解码?
我认为,构音表征之所以很有吸引力,是因为它比较直观,并且能够直接对应产生言语时发声器官的运动。
但在构音之上,显然还存在更高层级的过程。
这些过程涉及我们如何规划构音动作,单词如何以更加抽象的认知形式存在,以及在交流过程中,大脑究竟如何处理这些词。
这些问题目前仍然没有得到解决。
事实上,大多数人在说话时并不知道自己的嘴究竟在做什么。
我们每天都在说话,却不需要有意识地知道自己是怎样完成这些复杂动作的。
这本身就非常惊人。
目前的言语脑机接口,包括我们自己的研究,主要进入的是构音这一层级。
但在它之上,还有更高层级的表征。
例如音节这样的更大语言单元,以及我们所说的音系结构。
我对这些表征特别感兴趣,因为有一部分患者可能无法使用基于构音的解码方式。
例如,如果一个人的构音控制皮层已经受到损伤,我们就无法继续从这些区域解码言语。
这种情况下,就需要进入另一套神经编码体系。
这些信号可能位于参与言语规划和序列组织的更高级脑区。
如果能够做到这一点,这项技术就有机会覆盖更大范围的患者。
我们目前的大部分研究对象,是言语皮层本身仍然完整,但由于脑干卒中或者ALS,使言语皮层与控制发声器官所需要的肌肉和神经通路失去有效连接的人。
这与卒中以后出现的Broca失语症有很大区别。
Broca失语症患者负责言语产生的皮层区域本身已经受到直接损伤。
这类患者通常仍然能够理解语言,但很难正常产生语言。
如果希望帮助这些患者,我们需要更加深入地理解中间层级和高级语言表征,并研究如何直接与这些神经表征建立接口。
问:你最近的研究已经开始探索“单词之外”的交流。为什么脑机接口需要同时恢复语言和身体表达?
我们的目标,是让脑机接口交流尽可能接近自然交流。
我们最早开发的言语脑机接口,是把脑活动解码成文字,然后显示在屏幕上。
后来,我们又开发了把脑活动解码成合成语音的系统,让别人可以直接听到。
这样,我们有了两种输出形式:文字和声音。
后来,一位参与者问我们,能不能再增加一张“会说话的脸”,让别人能够看到说话时的动作。
这个问题给我们留下了很深的印象。
我们此前也一直在思考类似的问题。
在言语康复中,治疗师经常采用一些与身体感知有关的训练策略。
言语障碍患者通常会被鼓励去关注,自己说话时发声器官的不同部位究竟在做什么。
这里既涉及视觉反馈,也涉及对言语动作本身的身体感知。
这成为我们开发第一个言语脑机接口虚拟数字人的重要契机。
我们建立了一套系统,可以控制患者数字面部形象的动作。
这是我们开发的第三套解码系统。
最开始是文字,然后是声音,再然后是面部动作。
我们之所以这样设计,是因为正常交流通常同时包含声音和视觉信息。
这也是为什么我们今天是通过视频进行采访,而不是只打电话。
看到对方说话,会进一步提高语言的可理解性,也能增加表达的丰富程度。
随着我们与越来越多患者合作,并访谈了数十名失去说话能力的人,我们逐渐认识到一件非常重要的事情。
最直观的问题当然是沟通障碍。
但真正给我留下最深印象的,是他们还会经历一种主体感和身份认同的丧失。
很多人反复告诉我们,他们真正怀念的,是表达情绪和个性的能力。
所以,我们的目标并不只是恢复单词。
我们还希望帮助他们恢复作为一个完整个体的表达能力和身份感。
对于瘫痪患者来说,能够发出一条信息是一回事,能够真正用语言与别人交流是另一回事。
如果能够恢复充分而富有表现力的交流,言语神经假体才会真正变得更加自然。
问:如果未来脑机接口要同时捕捉情绪、手势、人格和语言,还需要解码哪些神经信号?
我认为,这里面至少存在几个不同层级。
第一个层级仍然属于声音本身。
包括韵律、语调,以及其他通过声音表达情绪的方式。
第二个层级是面部表情。
第三个层级是手势。
也就是我们说话时自然使用的手臂和手部动作,它们经常用来强调或者补充我们正在表达的内容。
我们在本期发表的一项研究中也正在探索这个问题。
这种情况下,挑战已经不再只是解码参与构音的言语脑区。
你还需要同时解码与手臂和手部运动相关的脑区。
第四个层级则更进一步。
它意味着越过单纯的情绪运动表达,更直接地进入情绪状态本身。
如果能够直接获取底层情绪状态的一部分信息,那么系统未来有可能自动、自然地产生对应的外在表达,而不需要用户有意识地控制每一个细节。
问:这是否意味着未来的脑机接口需要进入更加广泛的脑区?
这里存在一个很常见的误解。
很多人认为,只要从大脑中某个很小的区域记录信号,就能够解码整个大脑。
有些人会想象,只要在大脑里放入一个很小的接口,就应该能够获取所有信息。
现实并不是这样。
你只能解码你所记录的那个脑区本身实际包含的信息。
例如,如果你希望解码一个人的情绪状态,只从运动皮层进行记录,真的能够得到这些信息吗?
我并不能确定。
大约五年前,我们曾经发表过一些关于主观情绪状态解码的研究。
我们在参与者体验并报告自己情绪状态的时候,尝试对这些状态进行解码。
但这些信号来自完全不同的脑区。
它们和我们进行言语解码时使用的区域并不相同。
目前,我们仍然没有一种系统能够同时进入所有这些不同的神经网络。
这会是未来一个非常重要的挑战。
问:随着脑机接口越来越接近临床现实,你认为哪些期待并不现实?哪些发展方向反而没有得到神经科学界足够的重视?
这个问题我们思考过很多。
目前很多关于脑机接口的炒作,建立在一种印象之上,也就是我们已经能够准确、可靠地读取一个人的思想。
这种前景当然会引发很多担忧。
但我们目前还没有达到这个程度。
当然,我们距离这一步可能也没有想象中那么遥远。
一个可能的解决办法,是从系统设计之初就明确区分,哪些内容应该保留在一个人的内部,哪些内容是用户真正希望向外表达的。
我对这一点相对乐观,我们也已经围绕这个问题开展了一些研究。
这对于隐私、自主性以及一个人对自身行为的控制非常重要。
只要整个领域持续公开讨论这些问题,并且始终把它们放在重要位置,我们就有机会建立必要的保护机制,同时又不阻碍那些真正需要帮助的人获得技术。
另外还有一种误解,就是认为今天的脑机接口技术可以治疗所有脑部疾病。
以穿透式微电极系统为例。
对于癫痫以及很多精神健康问题,这类技术未必实用,也未必有必要。
这些疾病可以通过另一类技术,例如神经调控进行干预。
过度炒作带来的一个主要问题,是很多讨论没有具体区分不同技术究竟适合解决什么问题。
很多人在谈论脑机接口时,没有真正建立在底层科学基础之上,这很容易制造不现实的预期。
与此同时,脑机接口也有一些方面实际上被严重低估了。
现在很多人几乎把所有注意力都放在接口本身。
例如电极、尺寸、耐久性等等。
对我来说,更有意思的问题是:我们究竟正在收集什么样的数据,以及能够利用这些数据建立什么样的模型?
我认为,近期最令人兴奋的发展之一,可能是基于大规模神经数据集建立计算模型,并最终利用这些模型模拟人类大脑。
随着数据规模不断扩大,我们可以建立越来越复杂的大脑数字模型和脑功能模拟。
我认为,这件事情到来的速度可能比很多人想象得更快。
下一代模型可能同时对基础科学和脑机接口的实际应用产生非常大的影响。
问:沿着这个方向,你认为整个领域真正的重大挑战是什么?一个真正具有变革意义的大脑模型应该是什么样?
一个真正重大的挑战,是建立人类脑活动的生成式模型。
这个模型可以针对运动、言语、认知或者情绪。
我认为,这是人类历史上第一次同时拥有足够先进的实验工具和计算工具,可以认真尝试建立这样的模型。
目前最大的瓶颈之一,其实就是数据量。
但我认为,这是我们现在能够研究的最深刻的科学问题之一。
今天的AI系统,在很大程度上建立在人类智能产生的“输出”之上。
但它们还没有直接对产生智能的生物学基础本身进行建模。
我认为,这个问题的意义远远超出了脑机接口。
但它也可能正是脑机接口领域未来要走向的方向。
因为脑机接口能够让我们获取建立这些模型所需要的神经数据。
我希望,第一代这类模型不会只局限于电生理数据。
电生理是我们目前最直接研究的层级。
但一个真正强大的生成式大脑模型,应该能够整合很多不同类型的信息。
包括结构MRI、功能MRI、微观结构、分子和细胞层面的信息,以及连接组学。
理想情况下,我们最终能够把这些不同模态整合进同一个框架。
这样,我们就可以同时从多个机制层级理解大脑功能。
这里还有大量工作需要完成。
采访:Henrietta Howells,本文由脑机新声根据原文翻译
原文链接:https://www.nature.com/articles/s41593-026-02453-3

《全球脑机π》是脑机新声平台倾力打造的全球首个聚焦脑机接口(BCI)领域的人物深度访谈专栏。
π,无限不循环。正如人类对大脑的探索没有终点,脑机接口行业先驱者的创造力也没有边界。我们不做泛泛而谈的行业综述,只和真正在改变人类认知边界的人一对一深谈。
《全球脑机π》专栏下设五大子栏目:针对商业领域的《BCI TALK》、针对临床专家的《NEURO TALK》、针对科学家的《SCIENCE TALK》、患者视角的《LIFE TALK》、产业从业者的《INDUSTRY TALK》。从实验室到手术室,从研究论文到患者家庭,拼出这个行业的完整图景。
