经典论文精读——不训练新类别也能解码?Horikawa 2017 的分层视觉特征与想象识别
原论文:Generic decoding of seen and imagined objects using hierarchical visual features 作者:Tomoyasu Horikawa, Yukiyasu Kamitani 期刊:Nature Communications,2017 DOI:10.1038/ncomms15037
30 秒看懂这篇论文
- 问题:能否把 fMRI 解码器学到的东西从训练类别推广到未见类别,并同时解释真实观看与视觉想象?
- 方法:从视觉皮层解码多层 CNN 特征,再把预测特征与海量候选类别的平均特征匹配。
- 发现:低层视觉区更适合解码 CNN 低层特征,高层视觉区更适合高层特征;真实观看和视觉想象都能实现零样本类别识别,但想象更弱、更偏高层。
- 贡献:把脑解码从固定标签分类推进到“共享特征空间中的泛化”。
- 边界:它识别的是候选类别,不是像素级重建;只有五名被试,想象任务还受线索和策略影响。
1. 研究缺口:分类器能否超出训练标签?
传统 fMRI 分类通常为每个类别收集脑数据,再训练“猫/狗/椅子”判别器。这样即使准确率很高,也可能只是重现训练标签。真正通用的脑解码需要一种中介语言:模型从脑活动恢复视觉特征,这些特征既能描述训练图像,也能描述从未扫描过的新类别。
Horikawa 与 Kamitani 选择深度卷积网络的分层特征作为中介。CNN 从边缘、纹理逐渐抽象到物体部件和类别语义;人类视觉皮层也大致呈现由低到高的层级。如果能从不同脑区解码对应层级,模型就不仅是做类别分类,还在检验人工网络与视觉系统之间的表征同源性。

来源:原论文 Figure 1,PDF 第 3 页;由原论文页面裁切,DOI: 10.1038/ncomms15037。
2. 实验:训练图像、测试图像与想象类别严格分开
研究包含 5 名被试。图像呈现训练使用 1,200 张图像,来自 150 个类别,每类 8 张且每张只出现一次;测试使用 50 个训练中未出现的类别,每类一张图像,并重复 35 次以获得稳定 fMRI 模式。视觉想象阶段,被试闭眼,根据文字提示在 15 秒内想象 50 个测试类别之一,并随后报告鲜明度。

来源:原论文 Figure 2,PDF 第 3 页;由原论文页面裁切,DOI: 10.1038/ncomms15037。
训练与测试类别分离是整篇论文最关键的控制。解码器从未看到测试类别的 fMRI 训练样本,因此成功不能归因于记住这些标签。不过,视觉特征提取网络本身在大规模自然图像上预训练过,类别识别还使用候选类别的图像特征,所以这里的“零样本”指脑数据层面未见类别,不是整个系统从未获得外部视觉知识。
3. 解码器:把每个 DNN 单元变成回归目标
作者使用 CNN1–CNN8 等层级特征,并与 HMAX、GIST、SIFT+BoF 等传统特征比较。每层抽取约 1,000 个单元;对每个单元,使用视觉皮层 ROI 的 fMRI 模式训练稀疏线性回归:
f
^
k
=
w
k
⊤
x
+
b
k
\\hat f_k=\\mathbf w_k^\\top\\mathbf x+b_k
f^k=wk⊤x+bk
x
\\mathbf x
x 是多体素响应,
f
^
k
\\hat f_k
f^k 是第
k
k
k 个图像特征的预测值。ROI 分为低级视觉皮层 LVC、高级视觉皮层 HVC 与整体视觉皮层 VC。性能以预测特征和真实特征在测试图像间的相关性衡量。

来源:原论文 Figure 3,PDF 第 4 页;由原论文页面裁切,DOI: 10.1038/ncomms15037。
结果呈现漂亮的双重梯度:CNN 低层特征从 LVC 解码最好,高层特征更依赖 HVC;沿视觉皮层层级向上,最佳匹配的 CNN 层也向上。这不是说 CNN 与大脑逐层一一对应,而是说明两者共享从局部视觉结构到抽象语义的统计组织。
4. 可解码不等于对分类有用
作者进一步区分两个量:decodability 是某个特征单元能否从脑活动稳定预测;discriminability 是该单元在类别之间是否足够不同。一个特征可能预测相关很高,却对类别区分没有帮助;另一个特征虽难预测,只要抓住类别间差异,也可能提升识别。

来源:原论文 Figure 5,PDF 第 6 页;由原论文页面裁切,DOI: 10.1038/ncomms15037。
Figure 5 表明,最终识别表现由两者共同决定。这对今天的脑—模型对齐研究仍是重要提醒:不能只报告表征相关系数,还要检验它是否保留任务相关信息;反过来,高分类率也未必意味着模型恢复了完整神经表征。
5. 零样本类别识别是怎样实现的?
对每个候选类别,作者从 ImageNet 图像计算类别平均特征。测试时,将 fMRI 预测出的特征向量与各候选类别模板比较,选取相关最高者:
c
^
=
arg
max
c
c
o
r
r
(
f
^
,
f
ˉ
c
)
\\hat c=\\arg\\max_c\\;\\mathrm{corr}(\\hat{\\mathbf f},\\bar{\\mathbf f}_c)
c^=argcmaxcorr(f^,fˉc)
因为模板可以由任意外部图像生成,候选类别不必出现在 fMRI 训练集中。这一设计把“脑解码器”和“类别知识库”分离:前者学习脑到特征的映射,后者提供世界中的类别原型。现代 CLIP 脑解码、扩散重建和跨模态检索,很多都延续了这种思路。
6. 真实观看与想象:相同内容,不同时间动力学

来源:原论文 Figure 7,PDF 第 8 页;由原论文页面裁切,DOI: 10.1038/ncomms15037。
观看图像时,低层和高层视觉特征都能被解码,并呈现从低级到高级区域的层级关系。想象时整体性能更低,高层语义特征相对突出。时间分析还提示:真实观看更符合自下而上的处理,而想象中的信息可能先在高层区域出现,再影响较低层区域,符合自上而下生成表象的假设。
这类时序结论要谨慎。fMRI 的血氧响应缓慢,且不同脑区的血流动力学差异可能混入延迟。作者的结果与 top-down 理论相容,但不能像毫秒级 EEG/MEG 那样直接证明神经传播方向。
7. 识别结果:成功的是“类别语义”,不是脑内截图

来源:原论文 Figure 10,PDF 第 11 页;由原论文页面裁切,DOI: 10.1038/ncomms15037。
Figure 10 显示,多种特征空间在真实观看和视觉想象中都能实现高于机会的类别识别,CNN 高层特征尤其适合类别级判断。使用类别平均训练目标时,视觉想象的识别还会改善,说明想象更接近抽象类别原型,而非某张具体图像的精确像素。
因此,标题中的 generic decoding 不应被理解为“任意心像都能还原”。系统仍在限定候选类别之间选择,且模板来自外部图像数据库。它证明的是:脑活动可被投影到一个足以跨类别泛化的视觉特征空间,真实观看与想象在该空间中共享部分层级结构。
8. 证据强度与局限
证据最强的部分有三点:测试类别与脑训练类别严格分离;多个 CNN 层和多个视觉 ROI 呈现系统性层级对应;传统特征、类别模板和 ROI 对照使结果不是单一模型的偶然。观看与想象均有结果,也把纯刺激驱动解码推进到内源性表象。
限制同样明确。第一,只有 5 名被试,且每名被试需要大量重复扫描。第二,想象由文字类别提示,策略、词义与鲜明度差异都可能进入 fMRI。第三,类别模板来自 ImageNet,输出受候选库先验强烈约束。第四,相关性与识别率不能证明 CNN 与脑使用相同算法。第五,类别平均会抹掉实例细节,所以成功主要是语义层面的。
9. 对后续脑解码研究的启发
这篇论文建立了一条至今有效的三段式路线:脑信号
→
\\rightarrow
→ 共享表征
→
\\rightarrow
→ 外部生成或检索模型。它解释了为什么后来 CLIP 成为 fMRI 图像重建的常用桥梁,也说明评价应分成三层:脑到特征是否准确、特征是否保留类别信息、最终生成图是否只是被强先验“补全”。
若今天重做,最值得加强的是跨被试评估、开放集合识别、实例级检索和对想象策略的控制;还应使用不同视觉网络检验结论是否依赖某个架构,并用编码预测、RSA 与因果干预区分“统计对应”与“功能机制”。
总结
Horikawa 2017 的核心价值,是证明了视觉脑解码可以绕开固定训练标签:从 fMRI 恢复分层视觉特征,再借助外部类别模板识别未用于脑训练的新类别。观看时的层级对应清晰,想象时则更弱、更抽象并可能呈现 top-down 动力学。它不是像素重建,更不是无条件读心,但为后来 CLIP 对齐、扩散模型重建和跨模态脑解码提供了关键概念骨架。
参考资料与图片来源
- Horikawa, T., & Kamitani, Y. (2017). Generic decoding of seen and imagined objects using hierarchical visual features. Nature Communications, 8, 15037. DOI: 10.1038/ncomms15037。
- 文中 Figure 1、2、3、5、7、10 均来自原论文 PDF;未使用生成图片、重绘图或二次转载图。
网硕互联帮助中心


评论前必须登录!
注册