用语言模型绘制人类语言的神经元构建模块图谱

Mapping the neuronal building blocks of human language with language models

作者信息Jing Cai, Yoav Kfir, Mohsen Jamali, Hesen Huang, Young Joon Kim, Sydney S Cash, Ziv M Williams
PMID42310453
期刊Nature
发布时间2026-08
DOI10.1038/s41586-026-10691-5

实验完整度

包含单神经元记录、自然语言产生、解码分析、语境模型预测等多个独立证据层级,并进行功能验证和机制验证。

主要模型

人类额颞叶皮层神经元(frontotemporal cortex neurons)

重点核对

记录区域:额叶、前颞叶、后颞叶皮层 记录设备:96通道Utah微电极阵列(Blackrock Microsystems) 参与者数量:8名(3女5男,年龄27至52岁) 神经元总数:579个 单词-神经元对齐:语音转录与神经元AP活动对齐

摘要

人类能够通过语言传达新颖且高度多样化的信息。这种将单词形成并组合成复杂短语和句子的能力,使我们能够表达无穷无尽的意义,并且是人类认知的基础。然而,理解支撑人类语言的微观细胞构建模块和皮层景观仍然是一个挑战。在这里,我们使用大规模单神经元记录结合自然语言处理模型,来识别语言产生过程中人类额颞叶皮层的细粒度语言表征。我们发现,虽然某些神经元表征了单词之间详细的语法关系或其词性,但其他神经元则追踪了句子的高阶句法结构、短语转换和序列。总的来说,这些神经元可靠地捕获了单词的句法和语义属性,但也动态地整合了其特定的句子上下文,从而使它们能够以高度精细的细节水平组合性地编码信息。我们展示了这些细胞群是如何局部组织的,以及它们的微观表征如何与更广泛的场电位模式不同。我们还展示了这些神经元在额颞叶皮层中的广泛分布,但它们的语言信息编码能力是左侧化的,并在皮层区域之间有所不同。总之,这些发现确定了人类语言信息编码的一些最基本的细胞构建模块,并开始在微(细胞)、中(局部群体)和宏观(区域)尺度上定义语言的皮层景观。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
人类语言产生过程中,神经元如何编码句法和语义信息?这些表征在皮层中如何分布和侧化?
核心机制
神经元编码词的语法关系、词性、句法结构等特征,并组合语义和上下文信息
主要证据
基于579个神经元在自然语言产生过程中的记录,通过解码分析和语言模型预测,发现神经元选择性响应多种语言特征,且预测能力在左侧化
研究意义
揭示了语言编码的微观细胞机制,为理解语言皮层组织提供了新视角

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

单神经元记录与自然语言产生

收集参与者自然语言产生过程中的神经元活动数据

使用半慢性植入的微电极阵列(96通道)记录额颞叶皮层神经元的动作电位和局部场电位,同时记录音频并转录单词,对齐到神经元活动。

2

语言特征标注与神经元选择性分析

检测神经元是否选择性响应不同语言特征(如词性、句法成分)

使用自然语言处理解析器(如AllenNLP)对句子进行成分和依存解析,标注每个词的词性、成分、句法深度等特征,然后统计神经元对每个特征的响应选择性。

3

语言特征解码

验证神经元群体能否可靠解码单个词的语言特征

使用L2正则化的多项式逻辑回归分类器,从神经元活动模式中解码词性、成分、句法深度等特征。

4

语言模型预测性分析

评估语法、语义和上下文嵌入模型对神经元活动的预测能力

构建句法(one-hot)、语义(word2vec)、组合和上下文嵌入(如Vicuna)模型,通过岭回归计算预测性与实际神经元活动的相关性。

5

半球与脑区差异分析

比较左/右半球和不同皮层区域之间神经元语言编码的差异

使用秩和检验和Kruskal-Wallis检验比较不同半球和脑区神经元的调节强度(z分数)和预测性。

6

局部场电位与神经元活动比较

比较单神经元放电与局部场电位在语言特征选择性上的差异

从同一微电极位点记录LFP,计算其语言特征选择性,并与神经元选择性比较。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
犹他阵列Blackrock Microsystems--
Natus医疗Natus Medical--
AllenNLP----
Parselmouth----
Vicuna-7B----
Scikit-learn----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
单神经元记录
记录区域(额叶、前颞叶、后颞叶)、微电极阵列(Utah arrays)、参与者数量和年龄
阅读提示:Methods: Microelectrode recordings
语言特征标注
解析器(AllenNLP)及其版本、特征定义(词性、成分、深度)
阅读提示:Methods: Sentence parsing and linguistic feature labelling
解码分析
分类器参数(正则化强度、类权重)、训练/测试分割比例、置换检验次数
阅读提示:Methods: Decoding linguistic features from neural activity
语言模型预测性分析
嵌入模型(Vicuna-7B)、PCA维度、时间窗口、置换检验次数
阅读提示:Methods: Language model predictivity