千人同步脑电:神经大模型的数据瓶颈正在被打破,但湿实验的坑还没填完
脑机接口领域过去十年最大的瓶颈不是解码算法,而是训练数据的规模与质量。7月22日发布的千人同步脑电采集技术,将单次实验可获取的同时性脑电信号量提升了三个数量级——这不仅仅是一个工程指标,它直接改变了神经大模型的训练范式。我长期关注AI在生物医学信号中的应用,这个突破让我想起蛋白质结构预测从单序列到多序列联配的跨越:当数据维度从“个体”扩展到“群体”,模型学到的就不再是噪声,而是生物信号的通用编码。
传统脑机接口的数据困境:单点实验,个体差异难以弥合
传统的脑电采集大多是单个被试、单个场景、单次实验。即便有数据集包含数百人,采集时间、设备型号、任务范式也各不相同,根本无法进行同步联合分析。这种数据碎片化导致两个后果:
- 模型泛化能力极差:同一个算法在不同被试间的准确率可以下降30%-50%,这是脑机接口难以走出实验室的核心原因
- 神经大模型无法训练:大模型需要海量、对齐、同步的数据。现有最大的公开脑电数据集(如PhysioNet的100+人)在规模上差了两个数量级
下表对比了传统采集与本次技术的核心差异:
| 维度 | 传统单/少量被试采集 | 千人同步采集 |
|---|---|---|
| 同时采集人数 | 1-10 | 1000+ |
| 跨地域同步 | 无 | 跨地域实时同步 |
| 单次实验数据量 | 数十MB | 数十GB |
| 可训练模型类型 | 个体定制/浅层模型 | 通用神经大模型 |
| 信号一致性 | 个体差异主导 | 可对齐群体共性 |
千人同步技术的核心突破:不是“加人”,而是“对齐”
新闻中提到“跨地域上千人同步脑电信号采集”。这里的关键词不是“千人”,而是“同步”。跨地域意味着不同实验室、不同设备、不同时间点采集的信号,在时间上精确对齐到毫秒级。这需要解决两个工程难题:
- 时钟同步:不同城市间的网络延迟不稳定,必须用硬件级的时间戳对齐协议
- 任务范式统一:1000人同时看同一刺激,才能产生可比的神经响应
这个技术本质上是将脑机接口从“个体实验”提升到了“群体实验”的层面。类似于基因测序中从单样本到群体GWAS的飞跃。有了这种同步大规模数据,就可以训练神经编解码大模型,学习跨个体的通用神经表征。
对神经大模型的意义:数据量决定模型能力的边界
当前最前沿的脑机接口研究(如Meta的神经信号解码、Neuralink的植入式接口)都面临一个共同问题:模型在训练集上表现优异,但在新被试上需要重新校准。千人同步数据直接解决这个问题——让模型在训练阶段就见过足够多的个体差异,从而学会提取“不变特征”。
我的判断:这个技术最大的价值不是用于现有脑机接口的增量改进,而是为基础神经科学发现提供数据基础。例如,通过分析1000人同时看同一段视频时的脑电同步性,可以量化“人类大脑对自然刺激的响应一致性究竟有多高”。这对理解意识、注意、社会认知等基础问题至关重要。
与蛋白质结构预测的类比:从“单序列”到“多序列联配”
我在AlphaFold上做的工作,本质上就是利用多序列联配(MSA)提供的共进化信息来预测结构。单个序列的信息有限,但数百个同源序列的联合比对,可以揭示保守的相互作用模式。千人同步脑电采集,相当于在神经科学领域建立了“多被试联配”:
- 传统:单个被试的脑电信号,类似一条蛋白质序列,充满噪声和个体变异
- 现在:1000个被试同步记录的信号,类似一个深度MSA,可以提取出跨个体的“神经共进化模式”
这个类比并不完美,因为脑电信号的非平稳性远超蛋白质序列,但技术路径是相通的:用大规模群体数据压制个体噪声,暴露通用编码规律。
需要冷思考的坑:湿实验和干实验的gap仍然存在
虽然数据采集能力有了飞跃,但神经大模型训练面临的实际困难并没有消失:
- 脑电信号的信噪比极低(通常在0.1-0.3之间),即使千人数据,也需要极复杂的信号处理管线
- 跨地域设备的一致性:不同厂商的脑电帽、电极阻抗、放大器噪声,都会引入系统偏差
- 解码任务的复杂度:目前脑机接口能解码的,大多是运动意图、
物界前沿