浙江大学赵莎/潘纲团队:BrainBench为大语言模型的脑信号解读与推理建立统一标尺

脑机接口社区 2026-09-04 10:04

浙江大学赵莎/潘纲团队:BrainBench为大语言模型的脑信号解读与推理建立统一标尺图1

大语言模型如何真正理解脑信号?

大语言模型正在从文本理解走向科学推理,但当它进入脑科学领域,一个更根本的问题随之出现:我们究竟该如何判断一个大语言模型是否真正具备脑信号理解能力? 即:如何将语言中的研究问题与脑信号中的实验证据联系起来?这要求模型能够理解分析意图,在真实记录上开展分析,并据此形成具有科学依据的结论。

然而,现有脑电评测主要围绕预定义的预测任务展开——给定一段脑信号,判断其对应的睡眠阶段、认知状态或临床标签。这类任务能够衡量模型在特定目标上的预测能力,却难以覆盖真实脑信号分析所需要的完整能力链条。面向大语言模型的评估也多局限于特定系统和应用场景。对于贯穿问题理解、脑信号分析与科学推理的综合能力,领域内仍缺少统一的衡量标准。

BrainBench 的核心出发点,正是将大语言模型的评测从“单一预测任务”推进到“完整脑信号分析过程”。 浙江大学团队在论文 BrainBench: Benchmarking Large Language Models for Comprehensive EEG Understanding 中提出“综合 EEG 理解(comprehensive EEG understanding)”这一评测视角:不再只追问模型能否得到一个正确标签,而是考察它能否理解自然语言分析目标,调用真实 EEG 数据完成多步骤分析,并最终形成可执行、可量化、可核验的科学结论。


01

为什么“会分类”还不等于理解 EEG

传统 EEG 解码通常聚焦于预定义任务,例如睡眠分期、认知状态识别或临床分类,而通道选择、时间窗设定、信号处理和结果解释等分析环节,往往由研究者预先设计。模型需要完成的,主要是从处理后的脑信号中预测一个目标结果。

近年来,随着大语言模型与智能体技术的发展,越来越多的脑科学智能体开始尝试理解自然语言指令,并自主完成从数据处理、定量分析到结果解释的完整分析链条。此时,仅用最终预测是否正确来评价系统已经不够:它是否真正理解了分析目标、是否选对通道和时间窗、是否执行了合理的信号处理与定量计算,都直接影响最终结论的可靠性。

这也意味着,对脑信号智能系统的评估,需要从“结果是否正确”进一步走向对“综合脑信号理解能力”的系统衡量。如何客观评估大语言模型在脑信号分析中的理解、执行与科学推理能力,也由此成为一个新的问题。 这正是 BrainBench 希望建立统一评测标准的出发点。


02

BrainBench:建立从分析指令到科学结论的统一 EEG 评测体系

为了回答这一问题,BrainBench 将评测从传统的固定预测任务进一步扩展到真实脑信号分析。每个评测实例都包含一条自然语言分析指令和一份真实 EEG 记录,部分任务还同时提供眼电、肌电、功能近红外、眼动等多模态生理数据。模型需要根据指令自主确定分析过程,在真实记录上完成信号处理、定量计算和结果分析,并最终给出具有证据支撑的科学结论;当任务需要时,还需生成相应的图表或分析文件。

围绕这一目标,BrainBench 构建了覆盖基础分析、典型应用评估、神经认知评估和生理整合四个方向的评测体系,并通过“子集—任务—实例”三级结构组织不同分析场景。其中,任务定义需要完成的分析目标和验证要求,实例则将同一任务落实到不同数据集、受试者和真实记录中,使相同能力能够在不同数据条件下被重复检验。最终,BrainBench 所衡量的不再只是一个预测结果是否正确,而是大语言模型能否理解分析指令、正确执行脑信号分析,并基于真实数据形成可核验的科学结论。


浙江大学赵莎/潘纲团队:BrainBench为大语言模型的脑信号解读与推理建立统一标尺图2

图1|BrainBench 总体框架:以自然语言指令和真实脑信号为输入,在不同执行范式下完成分析并生成科学结论;评测覆盖基础分析、睡眠评估、神经认知评估和生理整合四个方向。


03

四个评测子集,覆盖多层次 EEG 分析场景

BrainBench 汇集 17 个数据集、172 个任务和 4,105 个真实数据实例,围绕 EEG 分析中的四类典型场景构建评测体系,从基础信号处理逐步扩展到睡眠、神经认知以及跨模态生理分析。

Foundational Analysis|基础分析

覆盖预处理、频谱分析、非线性特征、时空比较、连接性分析和结果可视化等基础 EEG 操作,重点考察模型能否正确理解并执行通用脑电分析任务。

Sleep Assessment|典型应用:睡眠评估

涵盖睡眠分期、睡眠结构、频谱特征、睡眠事件以及呼吸和血氧等分析,考察模型对整夜睡眠记录及多类生理信号的综合分析能力。

Neurocognitive Assessment|神经认知评估

聚焦情感、疲劳、注意力等神经认知状态,不仅要求识别状态,还需要进行特征比较、时间趋势分析和个体内分析。

Physiological Integration|生理信号整合

进一步将 EEG 与眼电、肌电、功能近红外、眼动等生理信号结合,考察模型进行跨模态对齐、联合分析和证据整合的能力。

四个子集由基础信号分析逐步延伸至复杂认知与跨模态场景,使 BrainBench 能够在不同分析层次上系统检验大语言模型的综合 EEG 理解能力。


04

从自由输出到统一验证:BrainBench 如何评估分析结果

面对复杂的脑信号分析任务,不同模型可能采用不同的分析过程,也可能以不同形式给出结果。BrainBench 因此不限制模型如何表达答案,而是重点检验最终分析结果是否正确、完整且可验证。

在评测过程中,目标系统只能获得自然语言指令和输入数据,无法访问参考答案、评分规则和验证配置。完成分析后,系统可以生成自由格式的文字报告,并根据任务要求输出图表或数据文件。随后,BrainBench 通过 Parser Agent 从报告中提取明确给出的结果,并转化为统一的结构化字段;Parser Agent 只负责信息抽取,不补全缺失答案,也不替代评测器判断结果是否正确。

针对脑信号分析中不同类型的输出,BrainBench进一步设计了六类验证单元,分别对数值、类别、集合、序列、语义和分析产物进行独立检验。无论模型最终返回的是一个数值、一组通道、一个事件序列、一段科学解释,还是一份图表或信号文件,都可以按照相应规则与参考结果进行比较。这样的设计使模型可以自由完成分析,但每一项关键结果都必须接受统一验证。 执行过程中产生的代码、工具调用、运行时间、错误信息和 token 消耗则被单独记录,用于复现与误差分析,而不直接参与最终评分。

在统一评测协议下,BrainBench进一步设置了两种具有代表性的执行范式:CodeAct 允许大语言模型通过自主编写和执行代码完成分析,代表灵活的自主分析方式BrainAgent 则通过结构化的智能体工作流组织分析过程。两种范式使用相同的任务指令、输入数据和评分标准,从而能够系统比较不同执行方式如何影响大语言模型的 EEG 理解与分析能力。

浙江大学赵莎/潘纲团队:BrainBench为大语言模型的脑信号解读与推理建立统一标尺图3

图2|BrainBench 统一评测流程:目标系统仅接收分析指令与真实数据,完成分析后生成报告和任务产物;评测端通过 Parser Agent 提取结果,并利用六类验证单元进行统一评分。


05

实验结果:当前 LLM 已具备综合 EEG 理解能力,但能力边界依然明显

BrainBench 对 13 个代表性大语言模型进行了系统评测,覆盖 8 个模型家族,并分别在 BrainAgent 与 CodeAct 两种执行范式下完成大规模测试。为保证模型间比较更加一致,主实验统一关闭可选的 reasoning 模式,并保持相同的 API 与解码设置。

结果表明,当前大语言模型已经能够完成相当一部分复杂 EEG 分析任务,展现出初步的综合 EEG 理解能力;但这种能力并不稳定,也不存在一个在所有任务和执行方式下始终占优的模型。 不同模型在基础分析、睡眠评估、神经认知评估和生理整合中的表现差异明显,同一模型在不同执行范式下也可能呈现不同优势。

发现一:综合 EEG 理解不仅取决于模型,也取决于执行范式

BrainBench 的结果表明,当前大语言模型已经能够完成相当一部分复杂 EEG 分析任务,展现出初步的综合 EEG 理解能力。但这种能力并不是一个固定的“模型属性”:不同模型在四类分析场景中的表现差异明显,同一模型在不同执行范式下也可能呈现出不同优势。总体来看,结构化的 BrainAgent 往往能够为 EEG 分析提供更稳定的执行支持,但这种优势并非绝对。 例如,Gemini 3.6 Flash 在 BrainAgent 下的总体得分为 73.57,明显高于 CodeAct 的 57.17;而 Claude Opus 5 则在 CodeAct 下取得 76.25,高于 BrainAgent 下的 71.95。这说明,对于具备较强自主推理和代码能力的模型,更开放的执行方式同样可能发挥优势。

因此,BrainBench 所揭示的并不是一个简单的模型排行榜,而是一个更完整的结论:大语言模型的 EEG 理解能力,是模型本身、分析任务与执行方式共同作用的结果。

浙江大学赵莎/潘纲团队:BrainBench为大语言模型的脑信号解读与推理建立统一标尺图4

图3|BrainBench 综合性能对比:13 个大语言模型在 BrainAgent 与 CodeAct 两种执行范式下的四类 EEG 理解任务及总体得分。


发现二:任务难度系统性暴露当前 LLM 的 EEG 理解边界

随着任务从 Easy、Medium 提升到 Hard,当前大语言模型的 EEG 理解性能呈现出明显的下降趋势。以跨模型平均结果为例,在 Foundational Analysis 中,BrainAgent 的得分从 82.6 降至 68.9 和 64.7;在 Sleep Assessment 中,则从 91.0 降至 72.8 和 35.8。这一趋势在两种执行范式和不同评测子集中普遍存在,说明任务复杂度的提升会持续放大当前模型的能力不足。 这种难度并不只是“步骤更多”。在 BrainBench 中,Easy 任务通常对应较短、目标明确的分析;Medium 任务需要完成多个相互依赖的步骤;Hard 任务则进一步要求模型跨通道、跨时间尺度,甚至跨生理模态整合多步证据。随着分析链条变长,模型需要同时维持更稳定的执行和更连贯的证据整合,这也更容易暴露其能力边界。

值得注意的是,结构化工作流并不能简单抵消任务难度带来的影响。 BrainAgent 在不少复杂任务中能够提供更强的执行支持,但这种优势会随分析领域和任务难度发生变化,在最困难的任务上也并不总能保持。换言之,结构化执行能够帮助模型更好地组织复杂分析,却仍无法完全弥补长程推理和多步证据整合带来的能力压力。

浙江大学赵莎/潘纲团队:BrainBench为大语言模型的脑信号解读与推理建立统一标尺图5

图4|BrainBench 难度分层结果:不同模型在 Easy、Medium 和 Hard 任务上的表现,以及 BrainAgent 与 CodeAct 的性能差异。


发现三:结构化执行在定量分析中表现出最稳定的优势

将总体得分进一步拆解到六类验证单元后,可以看到不同执行范式影响的具体位置。相比 CodeAct,BrainAgent 最稳定、最一致的优势出现在数值验证上,说明结构化工作流更有利于支撑 EEG 分析中的定量计算与结果输出。相比之下,在类别、集合、序列、语义和产物验证上,两种执行范式的差异更加依赖具体模型和任务场景,并不存在一方始终占优的情况。

这表明,结构化智能体并不是对所有 EEG 理解能力产生同等增益,而是更明显地强化了与具体执行和定量分析相关的能力。 对于其他类型的输出,模型本身的能力以及具体任务需求仍然发挥着重要作用。

浙江大学赵莎/潘纲团队:BrainBench为大语言模型的脑信号解读与推理建立统一标尺图6

图5|验证单元层面的结果:BrainAgent 与 CodeAct 在数值、类别、集合、序列、语义和文件产物上的差异并不一致,其中数值验证呈现出最稳定的结构化执行优势。


发现四:结构化工作流提升了 EEG 理解的跨记录一致性

BrainBench 还进一步关注一个更容易被忽视的问题:当分析目标相同、但输入来自不同受试者或不同记录时,模型能否保持一致的分析表现。 论文采用任务内归一化得分的平均两两绝对差(MPAD)衡量这种跨实例稳定性,数值越低,意味着同一任务在不同输入上的表现越一致。

结果显示,BrainAgent 整体呈现出比 CodeAct 更低的任务内波动。这说明结构化的工具和工作流能够降低模型对具体记录差异和分析上下文变化的敏感性,使同一种分析能力更稳定地迁移到不同数据上。这里的“更稳定”并不等于“每一次都更正确”,而是意味着模型已经具备的能力能够在不同记录中更一致地发挥出来。 因此,除了平均性能之外,跨记录的一致性同样是衡量大语言模型 EEG 理解能力的重要维度。

浙江大学赵莎/潘纲团队:BrainBench为大语言模型的脑信号解读与推理建立统一标尺图7

图6|跨实例稳定性:BrainAgent 在相同分析目标的不同记录间通常具有更低的任务内波动,表明结构化工作流有助于提升脑电理解能力的跨上下文可靠性。


发现五:推理能够增强 EEG 理解,但增益存在明显边界

在进一步的 reasoning 实验中,研究对 GPT-5.6 Luna 设置了从 Off 到 XHigh 的多档推理强度。结果显示,开启 reasoning 后,模型在四类 EEG 任务中的表现普遍提升,而最明显的增益通常出现在从 Off 到 Low 的阶段。 

但随着 reasoning effort 继续增加,性能提升并不持续扩大,而是越来越依赖具体任务和执行范式。BrainAgent 通常在 Low 或 Medium 后趋于饱和,而 CodeAct 在部分场景中仍能从更高推理强度中继续受益。与此同时,开启 reasoning 的 GPT-5.6 Luna 在若干设置下已经能够接近甚至超过关闭 reasoning 的 GPT-5.6 Sol,说明推理能力可以在一定程度上弥补基础模型能力的差距,但这种补偿并不稳定存在于所有任务中。

因此,对于 EEG 理解而言,关键并不是一味提高推理强度,而是首先让模型真正“进入推理状态”。在此基础上继续增加 reasoning effort,收益会迅速变得有限且任务相关。

浙江大学赵莎/潘纲团队:BrainBench为大语言模型的脑信号解读与推理建立统一标尺图8

图7|GPT-5.6 Luna 的 reasoning effort 实验:开启 reasoning 后通常先获得明显增益,继续提高 effort 的收益在不同子集和执行范式之间并不一致。 

不只是给分:BrainBench 还能定位错误发生在哪里

论文中的失败案例说明,综合评测的价值不止是给出一个总分。一个 BrainAgent 案例中,系统正确完成了 EEG 区域比较,却把“有效眼动样本比例”误当成“中央注视比例”,最终得到 35/100。另一个 CodeAct 案例中,模型将原始 760 nm 光强错误地当作 HbO,遗漏了光密度转换和修正 Beer-Lambert 计算,最终得到 30/100。

这些错误并不是简单的格式错误,而是发生在工具输出理解、信号处理假设或中间结果验证环节。由于参考真值、解析器和评分器彼此分离,BrainBench 可以把“模型没有完成分析”“模型完成了部分分析但误读中间结果”“模型的语义结论与数值证据冲突”等情况区分开来。


06

BrainBench 的意义:为脑信号智能建立统一的能力坐标系

随着大语言模型与智能体逐步进入脑科学研究,真正重要的问题已经不只是“模型能不能分析脑信号”,而是:这种能力应当如何定义、如何验证,又如何在不同模型和系统之间进行公平比较。BrainBench 的核心价值正在于此。它将“综合 EEG 理解”从一个抽象概念转化为可以系统测量的能力:模型需要理解自然语言中的分析目标,在真实脑信号上完成分析,并依据数据形成可核验的科学结论。由此,对大语言模型脑信号能力的评价,也从单一预测结果进一步扩展到理解、执行、定量分析、证据整合与科学推理等多个层面。

大规模实验进一步表明,综合 EEG 理解并不是模型本身的一项孤立能力,而是模型能力、任务复杂度与执行方式共同作用的系统级能力。 更强的模型并不意味着在所有任务中都占优,结构化工作流也并非在所有场景下都优于自主代码执行;推理能够增强模型能力,但其收益同样存在边界。

这意味着,未来脑信号智能的发展不能只依赖更大的模型或更高的单一得分,而需要进一步探索模型、专业工具、执行流程与科学验证之间如何协同。从这个意义上说,BrainBench 建立的不只是一张 LLM 的 EEG 排行榜,而是一套衡量脑信号智能的共同标尺和能力坐标系:研究者不仅可以比较“谁表现更好”,还能够进一步判断能力体现在哪些环节、边界在哪里,以及这些能力能否在不同数据和分析场景中稳定成立。

从 EEG 理解进一步走向多模态脑信号理解,再走向能够理解研究问题、分析神经数据并基于证据开展科学推理的脑科学智能,可能才是这一方向更长远的目标。BrainBench 所建立的统一评测框架,为衡量和推动这一进程提供了一个起点。

论文信息:

论文题目:BrainBench: Benchmarking Large Language Models for Comprehensive EEG Understanding

作者:Yangxuan Zhou, Sha Zhao, Yuning Chen, Chen Wu, Jiquan Wang, Shijian Li, Gang Pan

END

来源 | 浙江大学团队

运营 | 罗卜

审核 @脑机学苑 



脑机接口社区是国内首家脑机接口(BCI)产业服务平台、国内脑机接口新媒体开创者与引领者。主要为企业、科研团队、投资机构和从业者提供以下服务:

宣传报道:图文、短视频、直播形式报道企业动态、技术解读、产品介绍等内容,提升曝光和行业影响力

资源对接:根据需求匹配资本、供应链、临床机构、渠道方等资源,完成真实对接,促进合作。

成果转化:协助技术团队寻找产业方、投资人及落地场景,推动技术到产品的转化。

活动策划执行:承接线上线下路演、沙龙、论坛等活动的策划与执行。

其他定制需求:包括报告定制、市场调研、人才招聘支持等个性化服务。

合作洽谈,请联系微信:ZuoLeiLeiya

(备注:姓名-单位-合作)

投稿丨成为创作者,请联系微信:RoseBCI

浙江大学赵莎/潘纲团队:BrainBench为大语言模型的脑信号解读与推理建立统一标尺图9

🌟星标置顶🌟

不错过每一条脑机前沿进展

浙江大学赵莎/潘纲团队:BrainBench为大语言模型的脑信号解读与推理建立统一标尺图10

一键关注👇

一键三连「分享」、「点赞」和「在看」

欢迎在评论区聊聊


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
刚刚,黄仁勋发文!877亿收购全球最大AI开源平台
当成年人拼命学习AI,纽约却开始让60万孩子远离AI
868 亿!黄仁勋官宣收购 Hugging Face,全球最大 AI 开源平台一夜易主
能让谷歌逆风翻盘的AI,可能不是 Gemini
内存荒逼出“拆机”奇招,谷歌构建内部回收链应对AI算力瓶颈
狐讯 | iPhoneUltra 正面和安卓分不清;戚薇回应 AI 授权争议
OpenAI Astra架构揭秘:循环深度重塑推理,思考过程彻底“隐身”
甩开一众对手,博通悄悄拿下AI最赚钱赛道
用AI打破「检完即止」困局,爱康联手华为想解决职场人的「健康负债」
从充电矩阵跨越到全屋AI,安克在IFA2026重开新局
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号