
点击蓝字 关注我们

欢迎各位专家学者在公众号平台报道最新研究工作,荐稿请联系小编Robert(微信ID:BrainX007);或将稿件发送至lgl010@vip.163.com。
英文标题:Hierarchical temporal brain-LLM alignment : Divergent syntactic and semantic dynamics in language processing

成果简介
本研究比较了46个大语言模型与人类脑电(EEG)及颅内电生理(ECoG)信号,采用表征相似性分析(RSA)探究二者在语言加工中的对应关系。结果显示,脑—模型对齐遵循“层级化时间脑区映射”(HTBM)规律:对齐强度取决于模型深度、时间窗口与脑区的特定组合,可解释84.4%的方差,最优对齐出现在中间层以及枕叶、额叶电极。通过表征解耦分离句法与语义成分后,研究发现二者对齐轨迹分离,并存在稳健的“语义反转”现象——对齐主导权由早期句法优势转向后期语义优势,该现象在EEG和ECoG两套数据中均得到验证,仅时间进程因范式而异。进一步分析表明,整体表征的晚期对齐与模型基准性能呈正相关(r=0.621),而孤立的语义(r=-0.583)或句法(r=-0.523)对齐则与性能负相关,提示脑启发AI或更受益于整体性对应而非单一语言维度的模仿。
主要贡献
提出HTBM框架,揭示“层级化时间脑区映射”规律:系统比较46个大语言模型(0.5B–14B)与高时间分辨率EEG信号,发现脑—模型对齐并非均匀分布,而是由模型深度、时间窗口与脑区三者交互决定,可解释84.4%的对齐方差;最优对齐出现在中间层及枕叶、额叶电极。
分离句法与语义,发现稳健的“语义反转”现象:通过表征解耦技术将大模型内部表征拆分为句法与语义成分,发现二者对齐轨迹明显分离:早期以句法对齐为主导,随后转向语义主导,该反转在EEG与ECoG两套数据中均得到验证,仅时间进程随实验范式而异。
揭示“选择性对齐”与模型能力的关系:整体表征的晚期对齐与模型基准性能呈正相关(r=0.621),而孤立的语义(r=-0.583)或句法(r=-0.523)对齐则与性能负相关,提示脑启发AI可能更受益于整体性对应,而非单一语言维度的模仿。
方法
如何刻画脑———大模型对齐?
该研究构建了一套“神经信号 × 模型表征 × 跨模态比对”的分析 pipeline,总体框架如图1所示:

图1.HTBM分析框架总览
1)双数据集互补:高时间分辨率的EEG + 跨范式验证的ECoG。主分析采用DERCo数据集,22名被试逐词阅读童话文本,32通道EEG以1000 Hz采样,词呈现200 ms、间隔300 ms,保证词与神经反应的精确时间锁定;另用Podcast ECoG数据集(9名被试、1268通道颅内电极、自然听觉语音)进行跨范式验证,兼顾内 validity 与外部推广性。
2)46个大模型跨家族、跨规模系统比较。 覆盖LLaMA、Mistral、DeepSeek、Qwen等主流系列,参数从0.5B到14B,提取全部Transformer层的隐状态;按词对齐取末位子词激活作为词级表征,并将各模型层数归一化为四分位(Q1–Q4),实现跨架构、跨规模的统一比较。
3)表征解耦:把“句法”和“语义”从纠缠表征中拆开。 对每句原文用spaCy解析句法树,在保持词性与依存结构不变的前提下,用WordNet替换实词,生成10个“句法同构、语义异质”的代理句;以代理句激活均值作为句法表征,以原始激活减去句法表征的残差作为语义表征,并通过词性、句法树深度、词频、词向量等解码任务验证解耦有效性。
4)RSA作为核心对齐指标:无参数、抗噪声、适合跨模态。对每个“模型层×脑区×时间窗”单元分别构建表征相似性矩阵(RSM),将上三角元素展平后计算Spearman秩相关作为对齐分数。RSA不拟合任何映射参数,避免过拟合,尤其适合EEG低信噪比与两系统维度不一致的场景。
5)时空结构化:5个脑区 × 10个时间窗。 按10–20系统将32导联划分为额、中央、颞、顶、枕五个ROI,ROI内采用拼接而非平均以保留空间异质性;时间上以100 ms窗、50 ms步长滑动,覆盖基线至500 ms,捕捉P100、P200、N400等经典ERP成分。
6)三因素方差分析:量化“深度×时间×脑区”的交互。 以RSA对齐分数为因变量,对脑区(5水平)、时间窗(10水平)、模型深度(4水平)做三因素ANOVA,并分别对整体、句法、语义及“语义减句法”差异分数建模,配合FDR校正与LSD事后检验,系统刻画HTBM的完整格局。
研究结果

图2.整体表征对齐的双因素交互效应

图3.整体表征对齐的主效应

图4.整体表征对齐的主效应
表1.语义—句法差异分数的三因素方差分析(ANOVA)结果

研究结论
本研究通过46个大语言模型与人类EEG/ECoG信号的系统比较,揭示了脑—模型对齐的“层级化时间脑区映射”(HTBM)规律:对齐并非全局均匀,而是选择性地出现在特定模型深度、时间窗口与脑区的组合上,中间层以及枕叶、额叶在关键时间窗内表现出最强对应。通过表征解耦,研究发现句法与语义对齐轨迹明显分离,并存在稳健的“语义反转”——对齐主导权由早期句法优势转向后期语义优势,该现象在视觉阅读与听觉语音两种范式下均得到验证,仅时间进程因范式而异。进一步分析表明,整体表征的晚期对齐与模型性能正相关,而孤立的句法或语义对齐则与性能负相关,提示脑启发AI或更应追求整体性对应,而非单一语言维度的模仿。总体而言,本研究为理解大模型内部表征与大脑语言加工的对应关系提供了可量化的分析框架,也为未来神经科学启发的AI设计提供了实证参考。
免责声明:原创仅代表原创编译,水平有限,仅供学术交流,如有侵权,请联系删除,文献解读如有疏漏之处,我们深表歉意。


公众号丨智能传感与脑机接口
