一种新型脑机接口可实现言语与手势同步解码,助力瘫痪患者多模态交流

脑机新声 2026-09-16 17:30
一种新型脑机接口可实现言语与手势同步解码,助力瘫痪患者多模态交流图1

“你好”时挥手,说“谢谢”时把手放在胸前。对于严重瘫痪的人,这些伴随语言发生的动作,往往和清晰发声一起变得困难。脑机接口如果只能输出文字,能够传递内容,却仍然缺少一部分交流方式。

9月14日,加州大学旧金山分校 Edward Chang 团队在《Nature Neuroscience》发表研究,利用一张高密度皮层电极网,同时解码患者尝试表达的言语和手势,并接入个性化虚拟人物。

本文中的言语以文字显示,手势由虚拟人物呈现,并非患者恢复了实际发声或肢体运动。它仍是一项小规模可行性验证,但涉及一个具体的产品问题:一套脑机接口能否同时承担多种交流功能,而不要求用户每次只做一件事。

一种新型脑机接口可实现言语与手势同步解码,助力瘫痪患者多模态交流图2

1  从脑信号到文字和虚拟人物手势。两路解码器同时运行,分别输出言语与动作标签。

这项工作的价值,需要放在“同时使用”的条件下理解。单独识别一句话、单独识别一次挥手,与在同一段脑活动中把两者分开,是不同的工程任务。后者会直接影响设备在真实交流中的可用性。

   一张电极网接入两路解码器

研究使用的是皮层脑电记录技术(ECoG)。253个电极通过手术放置在左侧大脑皮层表面,覆盖与言语、手和上肢运动有关的区域,再经有线连接把信号送至外部计算设备。它不是佩戴式脑电帽,也不是一款已经完成商业化的独立终端。

研究共纳入3名参与者,其中2名因脑干卒中出现严重运动和言语障碍,另1名患有肌萎缩侧索硬化症(ALS)。3人都参加了基础动作研究,同步言语与手势解码及虚拟人物实验则由其中2人完成。

系统把同一份脑信号交给两个分别训练的模型:一路判断患者想表达哪个短语,另一路判断想做哪种手势。模型先提取短时间的信号变化,再结合整段时间序列完成分类。这里没有让大模型根据一句话自动配上动作;手势也来自脑信号解码。

区别很重要。如果用户只想说“你好”,系统自行添加挥手,表达的选择权仍在软件一侧。这项研究尝试保留两种输出的独立性:既可以只说话、只做手势,也可以同时表达。

   增加功能之后需要重新训练

研究者分别采集了只说话、只做手势,以及两者同时进行的数据。结果发现,只在单独行为上训练的模型,遇到同步任务时表现会下降;只学习同步任务,也不能保证回到单独行为时仍然稳定。把两类场景都纳入训练,表现更均衡。

一种新型脑机接口可实现言语与手势同步解码,助力瘫痪患者多模态交流图3

2  不同训练方式的比较。深蓝色代表同时使用单独与同步行为数据训练,整体上更能兼顾两类测试场景。左列为Bravo-6,右列为Bravo-1r;上排为手势,下排为言语。

   识别意图也要识别何时不输出

言语和手势的脑活动既有相对独立的区域,也有部分重叠。同一套电极能记录两类信息,不代表两个解码器接起来就能互不干扰。研究显示,加入同步任务训练后,模型对不同电极的依赖发生了变化;更容易区分两类行为的信号,往往获得了更高权重。

另一个问题出现在用户只使用一种功能时。最初,研究者用真正静止的脑信号教模型识别“休息”。这能帮助它在什么都不做时保持安静,却不足以应对“用户在说话,但没有做手势”的情况。

为此,研究者把“只说话”的数据也作为手势模型的无动作样本,把“只做手势”的数据作为言语模型的无言语样本。两位参与者在另一种行为单独发生时,误触发率中位数分别从30.6%和76.0%降至0%。这是特定离线测试中的结果,不能解释为日常使用已没有误触发。

对产品团队而言,这提示测试范围必须包含用户“不打算使用某项功能”的时段。新增一项控制能力,既要验证它能否被正确触发,也要验证它会不会在其他功能工作时突然介入。否则,功能数量增加了,用户处理错误的负担也可能增加。

   实时结果支持到了哪一步

ALS参与者Bravo-6的实时同步任务中,系统识别10个短语和10种手势。200次同步试验分布在12个实验区块,言语正确率为70.0%,手势正确率为66.0%。两者是分别统计的指标,并不是整组言语和手势同时正确的比例。

 

一种新型脑机接口可实现言语与手势同步解码,助力瘫痪患者多模态交流图4

3  Bravo-6的实时测试结果。b为单独手势任务,c为同步任务,d为带提示的对话演示,e为误触发情况。黄色表示手势,蓝色表示言语。

带提示的对话演示中,Bravo-6的言语和手势正确率分别为75%和85%,但只有20次试验。另一位参与者的两类解码器区块准确率中位数都达到100%,总共也仅有9次试验。这些演示证明系统能够形成互动,尚不足以评估长时间自由交流的体验。

   产业价值取决于功能如何共用一套系统

从产品开发角度看,这项研究提供了一条值得继续验证的路线:在一次植入所覆盖的脑区范围内,支持更多交流功能。若这种能力可以在更多患者身上重复实现,既有植入系统的用途就有机会扩展。不过,单张电极网能解码多种行为,并不等于已经证明手术负担更小、成本更低或优于其他植入路线;本研究没有做这些比较。

功能扩展还会把压力转移到数据采集上。实际使用包含单独表达、同时表达,以及两种状态之间的切换。如果训练只覆盖单项任务,后续接入第二项功能时,就可能需要重新采集数据和校准模型。对企业来说,这涉及每位用户的训练时长、人员投入和后续维护,不能只从新增一个软件模块来估算。

研究在这里做了一个有价值的设计。Bravo-6的10个短语与10种手势组成了100种搭配,使每句话都能和每种动作同时出现。这样可以减少模型凭固定配对“猜答案”的机会,例如识别出“你好”就一律判断为挥手。

更接近扩展性问题的测试,是把部分同步搭配从训练中拿掉,再检查模型能否识别。结果中,见过和未见过的组合表现没有显著差异。这说明模型可能不需要逐一学习所有搭配,但前提仍然是短语和手势本身属于已训练的类别。对更大词汇量而言,这只是一个起点,还不能推导出任意句子与任意动作都可以自由组合。

   虚拟人物的价值要由交流任务来验证

当前系统识别出一个手势标签后,调用对应动画。它没有连续还原手臂轨迹,也没有控制患者真实肢体。对以社交表达为目标的应用,这种离散动作输出有其合理性:挥手、耸肩、把手放在胸前,本身就可以承担明确的交流含义,未必每个场景都需要精细运动控制。

不过,虚拟人物是否真正提高交流效率,需要单独验证。应当比较加入手势前后,对方理解意图是否更准确、患者是否更省力,以及错误动作是否容易纠正。论文展示了表达通道可以增加,还没有证明这些通道已经改善生活质量或减少照护负担。

因此,较合理的早期评估方式,是在范围明确的交流场景中测量实际收益,而非仅靠更丰富的动画展示能力。功能是否值得保留,最终要看用户为一次成功表达付出的时间和精力。

   走向日常使用还要补上哪些证据

首先是输出方式。本文采用提示驱动的试验流程,每次根据一段脑信号输出一个短语或手势标签。它证明了两路可以同时解码,但没有证明可以连续生成自然语音、实时控制动作节奏,或在无提示条件下随时开始交流。

其次是准确率的使用含义。70%的短语正确率与66%的手势正确率,已经支持研究的可行性结论,却不足以直接判断用户是否愿意持续使用。一次错误发生后,能否撤回、重试或确认;两路输出冲突时如何处理;一轮完整表达需要多久,这些都会影响真实体验。未来的产品测试应把它们与单路正确率一起报告。

还需要看跨时间的稳定性。论文的离线分析显示,冻结后的模型在之后数天至数月的数据上仍可高于随机水平,但不同参与者和不同输出类型之间存在差异,加入较新的训练数据通常有帮助。高于随机水平只是统计上的门槛,不能替代对长期可用性的判断。企业更需要知道性能何时下降、多久必须校准,以及校准能否由用户和照护者自行完成。

硬件方面,这次实验仍依赖有线连接、外部计算设备和独立的虚拟人物渲染设备。新闻报道提到团队计划测试全植入无线版本,但这属于下一阶段计划,不能计入本研究已经实现的能力。

值得持续跟踪的,是下一轮实验能否在更多用户、更长使用时间和更少外部提示下,保持两路输出的独立性。只有当增加手势带来的表达收益,超过额外训练和纠错所需的成本,多模态交流才具备成为日常功能的理由。



关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
接口 脑机
more
" 双创新 "首例!又一款脑机接口产品将进入医疗器械创新通道
精神医学——脑机接口的又一个突破口
唐都医院完成西部地区首例全侵入式脑机接口植入手术:从「读懂大脑」到「重建功能」
全球首个人工智能+脑机接口标准 中国首发!
全网刷屏的脑机接口第三份标准,为什么这么火?
王守岩谈脑机接口出海:先建立全球视野,再决定何时出发丨BIOHK系列报道
与脑机科技相遇,他重新拿起毛笔书写热爱
全球首个AI脑机接口国标落地,明年9月实施确立数据“质量标尺”
从药物到脑机接口, CSP2026现场看到的精神医学新变量
脑机接口新进展:Paradromics Connexus® BCI 让首位植入者用神经活动实时“说话”
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号