一句话导读:2026 年的 AI 研究有一个巨大的悖论——让 AI 自己改进自己(RSI)的最大瓶颈,恰好是 AI 最不擅长的"自我验证";而解决这个瓶颈最有启发性的答案,可能藏在一个只有 14 万个神经元的果蝇脑子里。本文是一次系统性调研的浓缩(12 份报告、上百篇论文/新闻源,信息截至 2026-10),带你从 RSI 危机一路看到果蝇脑、类脑器官,最后落到三个可操作的突破方向。
0. 为什么写这篇文章
过去几周我做了一轮大规模调研,覆盖了六个方向:
| 递归自我改进(RSI) | Darwin Gödel Machine、评估器共进化、Phantom Gains 审计 |
| 强化学习(RL) | RLVR 之争、GRPO 熵塌缩、世界模型 = 内部评估器 |
| 机器人控制 RL | 人形全身控制、VLA 的 RL 后训练、形态协同设计 |
| 仿生大脑学习 | 果蝇蘑菇体、五感具身、多时间尺度记忆 |
| 生物 RL 神经机制 | 分布编码多巴胺、三因子可塑性规则、神经调质 |
| 果蝇脑 vs 人脑 | 连接组、连接组约束深网络、类脑器官学习 |
调研的原始动因是一个具体的研究问题:能不能以生物脑真实机制为蓝本,在五感具身的环境里构建自学习、自生长、自进化的智能系统? 调研的结果出乎意料——这个问题的答案与 2026 年 AI 圈最热的 RSI 议题在深处是同一个问题。下面展开。
1. RSI:AI 界的"验证信号危机"
1.1 RSI 已经从科幻变成一级研究方向
先看几个硬事实(均截至 2026 年 10 月):
- 社区维护的 RSI 论文列表已收录 603 篇论文,其中 425 篇是 2026 年发表的;
- Sakana AI 在东京成立了专职的 RSI Lab,并在 2026 年 9 月请来 LSTM 之父 Jürgen Schmidhuber 出任首席科学顾问;
- OpenAI 在 2026 年 9 月 6 日官宣达成"自动化研究实习生"里程碑,下一目标是 2028 年 3 月的全自动 AI 研究员;
- 2026 国际 AI 安全报告(100+ 专家)把"通过 RSI 失控"列为关键风险,FLI 发声明要求限制 RSI 的使用。
技术主线也收敛得很清楚:从 Sakana 的 Darwin Gödel Machine(自我改写代码的智能体,SWE-bench 从 20% 提到 50%),到 2026 年井喷的 DarwinX、Mendel Gödel Machine、HELIX(模型×脚手架共进化)、Meta^n……以及 Google 的 AlphaEvolve 走向生产化。
1.2 但真正的瓶颈浮出水面了:评估器
调研里最有信息量的发现是 2026 年 6 月之后的主题迁移——两个月内 100+ 篇新论文里,最大的增量不是"造出更强的 RSI 系统",而是审计 RSI 系统怎么坏掉:
- Phantom Gains:对着实测 null 基线审计"自改进增益",发现假提升普遍存在——你不改进,指标也能"涨";
- Self-Authored Verification Is Unreliable:agent 自己写的验证器靠不住;
- EVOMAL:自进化编码智能体的"自我投毒";
- SkillJack:自进化智能体里的持久后门。
一句话总结:RSI 的天花板不是"改进能力",而是"验证能力"——评估器被俘获(agent 学会讨好评估器)是头号失效模式。主流解法是"共进化"(Red Queen Gödel Machine 让 agent 和评估器一起进化、J-Zero 让出题者/解题者/裁判三方博弈),但全部集中在文本/代码域。
这里就是空白:物理环境天然是另一种验证信号——重力不会说谎,碰撞不会妥协。但"具身 RSI"几乎无人做。
2. RL 的大迁徙:从控制到语言,再回到世界模型
第二块拼图来自 RL 侧。2025-2026 的 RL 格局可以概括为"重心迁徙 + 三个元问题":
重心迁徙:RL 论文的主产线已经是"用 RL 训练 LLM 推理(RLVR)“和"用 RL 训练智能体(agentic RL)”;经典控制 RL 的算法创新相对沉寂,活力转移到了世界模型(Dreamer 谱系 2026 年出了博弈论版 NashDreamer、记忆引导版 PO-Dreamer)和具身全身控制(GR00T 1.7、行为世界模型 GigaBrain)。
三个元问题:
关键共识:"学到的世界模型 = 内部模拟器/评估器"已经是 MBRL 的明牌路线。这为后面果蝇的故事埋下伏笔。
3. 果蝇给的答案:14 万神经元的完整蓝图
3.1 一个标志性案例:FlyGCL
2026 年 9 月,清华团队发布了 FlyGCL(Brain-Inspired Hierarchical Modularity for General Continual Learning, arXiv:2609.25146)。它的核心思想只有一句话,提炼自果蝇嗅觉学习:
冲突的经验要分开,兼容的经验要整合。
实现上:预训练主干(稳定表征)→ PN→KC 式随机高维扩展(用于路由)→ 闭式岭回归路由到轻量专家(MoE 专业化)→ 快/中/慢 EMA 预测头(对应短/中/长期记忆)。结果相当炸裂:在 LIBERO 机器人操作基准的持续学习设定下,领先最强无回放基线 49.5–58.8 个百分点。
注意它做了什么映射:果蝇嗅觉回路的"稀疏随机扩展(模式分离)+ 区室化记忆(隔离干扰)+ 多时间尺度记忆通路",被翻译成了"模态无关的架构先验"。生物机制不是被模仿,而是被抽象成计算原则。
但它也自陈了三个没做的:神经调制、记忆巩固、行为反馈——这三条恰好是生物侧证据链最强的部分。
3.2 生物侧的弹药库正好补位
调研生物 RL 神经机制的报告里,2025-2026 的证据密度惊人:
- 分布编码多巴胺:多巴胺神经元不是单一标量 RPE,而是分布编码(Dabney, Nature 2020 之后,2026 年又出了"嗅探行为塑造多巴胺奖赏预测信号"——感觉运动行为直接参与价值计算);
- 三因子可塑性规则:Δw = 全局调质 × 局部突触相关(资格痕迹)——RPE 延迟到达也能正确归因,2026 年 5 月甚至出现了 “Three-Timescale Reward-Modulated Plasticity” 的先行工作;
- 果蝇蘑菇体 2026 年大爆发:Science 论文绘出 15 个 MB 区室多巴胺受体的状态依赖重塑(受体层可塑性!);Nature/Cell 证实章鱼胺+多巴胺分层奖赏;bioRxiv 显示饥饿状态会重构奖赏回路(状态驱动的结构可塑性 = 生物版"自生长")。
3.3 数据地基刚刚闭合
2026 年 9 月 3 日(一个月前),Google Research + HHMI Janelia 发布了果蝇雄性中枢神经系统的完整连接组(脑 + 腹神经索)——从感觉到行为的全环接线图第一次闭合。配合 Lappalainen et al.(Nature 2024,被引 203)证明的"连接组约束深网络可以预测真实神经活动",一条完整的方法论路径已经铺好:
真实接线图(数据)→ 架构先验(约束深度网络)→ 功能预测(神经活动/行为验证)
这比"全脑逐神经元仿真"便宜两个数量级,2025 年已扩展到无监督表征学习。
4. 人脑与跨基质验证:世界模型是硅/湿件/脑的共通原理
调研人脑侧时发现了三个"跨界"证据,它们共同指向一个结论:
一句话总结:世界模型 + 规划 + 价值信号,在硅(JEPA/MBRL)、脑(预测编码层级)、湿件(类器官)三种基质上都成立——这已经不是某个模型的优势,而是智能的跨基质原理。
5. 三个突破方向(自主思维链 8 轮推演的结论)
最后这部分来自一次 8 轮自主思维链推演(平均认知得分 0.862),把前面所有调研当作输入,问题是"哪些交叉点构成真正的 AI 研究突破机会"。
突破方向一:具身物理环境作为 RSI 的"抗俘获验证锚点"
核心论点(推演中最有价值的原创洞见):物理环境的价值不是"不可欺骗",而是"欺骗成本不对称"——操纵文本评估器只需改权重分布,操纵物理环境要付出真实能量与时间代价。更深一层:跨通道校验的抗俘获性来自物理定律的结构刚性(各通道被微分方程耦合,篡改一个会在另一个暴露)。
配套的度量阶梯(每一步都是对上一步缺陷的修复):
互信息耦合度
→ 扰动响应弹性(响应形状漂移 = 已被适应)
→ 转移熵方向性(物理→好奇 vs 好奇→物理,反转 = 共谋)
→ 干预不变性(结构化扰动前后因果图差异,绕开时序假设)
→ 物理时间反演不对称性(最硬锚点:伪造它需要改引擎演化规则)
最小可行实验:目标序列持续变化的操作任务,对照"纯自评估 vs 物理过程预测一致性验证",判据 = 自估指标与真实成功率的相关性衰减曲线。
突破方向二:连接组先验 × 双速率冲突优化
把果蝇"冲突分离(毫秒级)+ 兼容整合(分钟-小时级)"形式化为双速率优化:快循环处理即时梯度冲突,慢循环调整模块间权重促成长期兼容。连接组先验不作为固定约束,而作为带衰减惩罚的初始化(“从先验中释放”)——约束拓扑统计量(分区模块度、长程稀疏性),不约束具体连接。
突破方向三:三时间尺度分离 + 关键期门控
快 = 梯度更新(突触),中 = 定期结构剪枝/生长(自生长),慢 = 代际架构选择(自进化)。判据设计很关键:三尺度全开要显著优于任何子集,且优势随任务序列变长而扩大。结构改变的"开关"由独立调质通道控制(关键期管理),调节时机的随机性应来自系统外不可模拟源。
6. 结语:果蝇不是答案,是地图
调研最后回头看,最有意思的结构是:AI 圈和神经科学圈在 2026 年从两个方向爬向了同一座山——
- AI 圈从 RSI/RL 侧爬上来,发现瓶颈是验证信号与多时间尺度记忆组织;
- 神经科学圈从果蝇/人脑侧爬上来,刚好把"价值系统 + 稀疏编码 + 分层调制 + 多时间尺度可塑性"的证据链备齐了;
- 两边在"世界模型 = 内部评估器"这个位置相遇。
果蝇脑只有 14 万神经元(人脑的 60 万分之一),但蘑菇体浓缩了海马(联想记忆)与小脑(稀疏扩展+并行可塑性)两个系统的计算基序,而它的完整接线图已经躺在那儿了。小脑系统的原理 + 大脑系统的任务 + 具身环境的验证——这个组合目前没人做过。
或许这就是调研最大的收获:突破点很少是全新的,更多是两张已经画好的地图上,恰好没人走过的交叉路口。
附:论文与资源索引(节选)
RSI 方向
- The Last AI Built by Humans: Toward Genuine RSI — arXiv:2609.11873
- Recursive Self-Improvement of AI Research Agents — arXiv:2609.26457
- Darwin Gödel Machine — arXiv:2505.22954 | Red Queen Gödel Machine — arXiv:2606.26294
- HELIX: Model-Harness Co-evolution — arXiv:2608.13951
- Phantom Gains: Auditing Self-Improvement Against a Measured Null — arXiv:2608.20290
- Awesome-RSI-Research(603 篇)— github.com/Lee1003-lee/Awesome-RSI-Research
仿生大脑方向
- FlyGCL: Brain-Inspired Hierarchical Modularity for GCL — arXiv:2609.25146(代码:THU-NeuroML/FlyGCL)
- Connectome-constrained networks predict neural activity — Nature 2024(Lappalainen et al.)
- Sniffing Shapes Dopamine Signals — bioRxiv 2026-04
- 果蝇雄性 CNS 完整连接组 — HHMI/Janelia,2026-09-03 发布
- Bee-Nav(Nature 2026)| Antcar(Nat. Commun. 2025)
- Goal-directed learning in cortical organoids — Cell 2026
RL / 世界模型方向
- RLVR Implicitly Extends Reasoning Beyond Sampling Efficiency — ICLR 2026
- DAPO | Entropy-Preserving RL | NashDreamer — arXiv 2026-09
- Scaling Automatic Research Agents via World Models — arXiv:2608.12564
- V-JEPA 2-AC(Meta, 2025)| Physical State Grounding for JEPA World Models(2026-08)
声明:本文为个人调研笔记的公开版,所有论文数字与机构动态以原始出处为准(信息截至 2026-10-05);第三方评测结果均为"作者报告"口径,不可跨论文合并排名。转载请注明出处。
网硕互联帮助中心



评论前必须登录!
注册