云计算百科
云计算领域专业知识百科平台

从果蝇脑到递归自我改进RSI:2026 仿生 AI 调研全景(附 12 份报告脉络)

一句话导读:2026 年的 AI 研究有一个巨大的悖论——让 AI 自己改进自己(RSI)的最大瓶颈,恰好是 AI 最不擅长的"自我验证";而解决这个瓶颈最有启发性的答案,可能藏在一个只有 14 万个神经元的果蝇脑子里。本文是一次系统性调研的浓缩(12 份报告、上百篇论文/新闻源,信息截至 2026-10),带你从 RSI 危机一路看到果蝇脑、类脑器官,最后落到三个可操作的突破方向。


0. 为什么写这篇文章

过去几周我做了一轮大规模调研,覆盖了六个方向:

方向关键词
递归自我改进(RSI) Darwin Gödel Machine、评估器共进化、Phantom Gains 审计
强化学习(RL) RLVR 之争、GRPO 熵塌缩、世界模型 = 内部评估器
机器人控制 RL 人形全身控制、VLA 的 RL 后训练、形态协同设计
仿生大脑学习 果蝇蘑菇体、五感具身、多时间尺度记忆
生物 RL 神经机制 分布编码多巴胺、三因子可塑性规则、神经调质
果蝇脑 vs 人脑 连接组、连接组约束深网络、类脑器官学习

调研的原始动因是一个具体的研究问题:能不能以生物脑真实机制为蓝本,在五感具身的环境里构建自学习、自生长、自进化的智能系统? 调研的结果出乎意料——这个问题的答案与 2026 年 AI 圈最热的 RSI 议题在深处是同一个问题。下面展开。


1. RSI:AI 界的"验证信号危机"

1.1 RSI 已经从科幻变成一级研究方向

先看几个硬事实(均截至 2026 年 10 月):

  • 社区维护的 RSI 论文列表已收录 603 篇论文,其中 425 篇是 2026 年发表的;
  • Sakana AI 在东京成立了专职的 RSI Lab,并在 2026 年 9 月请来 LSTM 之父 Jürgen Schmidhuber 出任首席科学顾问;
  • OpenAI 在 2026 年 9 月 6 日官宣达成"自动化研究实习生"里程碑,下一目标是 2028 年 3 月的全自动 AI 研究员;
  • 2026 国际 AI 安全报告(100+ 专家)把"通过 RSI 失控"列为关键风险,FLI 发声明要求限制 RSI 的使用。

技术主线也收敛得很清楚:从 Sakana 的 Darwin Gödel Machine(自我改写代码的智能体,SWE-bench 从 20% 提到 50%),到 2026 年井喷的 DarwinX、Mendel Gödel Machine、HELIX(模型×脚手架共进化)、Meta^n……以及 Google 的 AlphaEvolve 走向生产化。

1.2 但真正的瓶颈浮出水面了:评估器

调研里最有信息量的发现是 2026 年 6 月之后的主题迁移——两个月内 100+ 篇新论文里,最大的增量不是"造出更强的 RSI 系统",而是审计 RSI 系统怎么坏掉:

  • Phantom Gains:对着实测 null 基线审计"自改进增益",发现假提升普遍存在——你不改进,指标也能"涨";
  • Self-Authored Verification Is Unreliable:agent 自己写的验证器靠不住;
  • EVOMAL:自进化编码智能体的"自我投毒";
  • SkillJack:自进化智能体里的持久后门。

一句话总结:RSI 的天花板不是"改进能力",而是"验证能力"——评估器被俘获(agent 学会讨好评估器)是头号失效模式。主流解法是"共进化"(Red Queen Gödel Machine 让 agent 和评估器一起进化、J-Zero 让出题者/解题者/裁判三方博弈),但全部集中在文本/代码域。

这里就是空白:物理环境天然是另一种验证信号——重力不会说谎,碰撞不会妥协。但"具身 RSI"几乎无人做。


2. RL 的大迁徙:从控制到语言,再回到世界模型

第二块拼图来自 RL 侧。2025-2026 的 RL 格局可以概括为"重心迁徙 + 三个元问题":

重心迁徙:RL 论文的主产线已经是"用 RL 训练 LLM 推理(RLVR)“和"用 RL 训练智能体(agentic RL)”;经典控制 RL 的算法创新相对沉寂,活力转移到了世界模型(Dreamer 谱系 2026 年出了博弈论版 NashDreamer、记忆引导版 PO-Dreamer)和具身全身控制(GR00T 1.7、行为世界模型 GigaBrain)。

三个元问题:

  • RLVR 到底扩展了能力,还是只是采样重加权?(“RLVR May Not Escape Its Origin” 之争,被引 138+,ICLR 2026 的 CoT-Pass@K 指标正面回应);
  • GRPO 的熵塌缩:为什么策略越训越确定?DAPO 的 Clip-Higher、熵保持 RL、梯度保持裁剪都在修这个;
  • 奖励从哪来:这和 RSI 的验证信号危机是同一个问题——机器学习社区用 RLSVR(任务变换出可自验证奖励)、世界模型当评估器(Scaling Automatic Research Agents via World Models)两条路在回答。
  • 关键共识:"学到的世界模型 = 内部模拟器/评估器"已经是 MBRL 的明牌路线。这为后面果蝇的故事埋下伏笔。


    3. 果蝇给的答案:14 万神经元的完整蓝图

    3.1 一个标志性案例:FlyGCL

    2026 年 9 月,清华团队发布了 FlyGCL(Brain-Inspired Hierarchical Modularity for General Continual Learning, arXiv:2609.25146)。它的核心思想只有一句话,提炼自果蝇嗅觉学习:

    冲突的经验要分开,兼容的经验要整合。

    实现上:预训练主干(稳定表征)→ PN→KC 式随机高维扩展(用于路由)→ 闭式岭回归路由到轻量专家(MoE 专业化)→ 快/中/慢 EMA 预测头(对应短/中/长期记忆)。结果相当炸裂:在 LIBERO 机器人操作基准的持续学习设定下,领先最强无回放基线 49.5–58.8 个百分点。

    注意它做了什么映射:果蝇嗅觉回路的"稀疏随机扩展(模式分离)+ 区室化记忆(隔离干扰)+ 多时间尺度记忆通路",被翻译成了"模态无关的架构先验"。生物机制不是被模仿,而是被抽象成计算原则。

    但它也自陈了三个没做的:神经调制、记忆巩固、行为反馈——这三条恰好是生物侧证据链最强的部分。

    3.2 生物侧的弹药库正好补位

    调研生物 RL 神经机制的报告里,2025-2026 的证据密度惊人:

    • 分布编码多巴胺:多巴胺神经元不是单一标量 RPE,而是分布编码(Dabney, Nature 2020 之后,2026 年又出了"嗅探行为塑造多巴胺奖赏预测信号"——感觉运动行为直接参与价值计算);
    • 三因子可塑性规则:Δw = 全局调质 × 局部突触相关(资格痕迹)——RPE 延迟到达也能正确归因,2026 年 5 月甚至出现了 “Three-Timescale Reward-Modulated Plasticity” 的先行工作;
    • 果蝇蘑菇体 2026 年大爆发:Science 论文绘出 15 个 MB 区室多巴胺受体的状态依赖重塑(受体层可塑性!);Nature/Cell 证实章鱼胺+多巴胺分层奖赏;bioRxiv 显示饥饿状态会重构奖赏回路(状态驱动的结构可塑性 = 生物版"自生长")。

    3.3 数据地基刚刚闭合

    2026 年 9 月 3 日(一个月前),Google Research + HHMI Janelia 发布了果蝇雄性中枢神经系统的完整连接组(脑 + 腹神经索)——从感觉到行为的全环接线图第一次闭合。配合 Lappalainen et al.(Nature 2024,被引 203)证明的"连接组约束深网络可以预测真实神经活动",一条完整的方法论路径已经铺好:

    真实接线图(数据)→ 架构先验(约束深度网络)→ 功能预测(神经活动/行为验证)

    这比"全脑逐神经元仿真"便宜两个数量级,2025 年已扩展到无监督表征学习。


    4. 人脑与跨基质验证:世界模型是硅/湿件/脑的共通原理

    调研人脑侧时发现了三个"跨界"证据,它们共同指向一个结论:

  • V-JEPA 式潜空间预测模型与人类行为最对齐(2026-09,预测编码视频模型对比研究)——JEPA 不重构像素、只预测潜表征的范式,同时是 MBRL 旗舰(V-JEPA 2-AC 零样本控制 Franka 机械臂)和最"像人脑"的视觉编码;
  • 类脑器官可以被训练:Cell 2026 的 “Goal-directed learning in cortical organoids” 证明皮层类器官能被"mentored"(导师式反馈)训练出目标导向行为;UCSC 让类器官在虚拟环境里学会倒立摆;甚至有 arXiv 工作用 LLM 当导师训练类器官形成世界模型;
  • 可塑性是门控的窗口而非常开的开关:迷幻剂研究(5-HT2A 重开关键期)+ 行为状态门控可塑性(2026)——这对 AI 系统的直接含义是:学习率调度应该由独立的"调质通道"控制,何时允许结构改变是可管理的关键期。
  • 一句话总结:世界模型 + 规划 + 价值信号,在硅(JEPA/MBRL)、脑(预测编码层级)、湿件(类器官)三种基质上都成立——这已经不是某个模型的优势,而是智能的跨基质原理。


    5. 三个突破方向(自主思维链 8 轮推演的结论)

    最后这部分来自一次 8 轮自主思维链推演(平均认知得分 0.862),把前面所有调研当作输入,问题是"哪些交叉点构成真正的 AI 研究突破机会"。

    突破方向一:具身物理环境作为 RSI 的"抗俘获验证锚点"

    核心论点(推演中最有价值的原创洞见):物理环境的价值不是"不可欺骗",而是"欺骗成本不对称"——操纵文本评估器只需改权重分布,操纵物理环境要付出真实能量与时间代价。更深一层:跨通道校验的抗俘获性来自物理定律的结构刚性(各通道被微分方程耦合,篡改一个会在另一个暴露)。

    配套的度量阶梯(每一步都是对上一步缺陷的修复):

    互信息耦合度
    → 扰动响应弹性(响应形状漂移 = 已被适应)
    → 转移熵方向性(物理→好奇 vs 好奇→物理,反转 = 共谋)
    → 干预不变性(结构化扰动前后因果图差异,绕开时序假设)
    → 物理时间反演不对称性(最硬锚点:伪造它需要改引擎演化规则)

    最小可行实验:目标序列持续变化的操作任务,对照"纯自评估 vs 物理过程预测一致性验证",判据 = 自估指标与真实成功率的相关性衰减曲线。

    突破方向二:连接组先验 × 双速率冲突优化

    把果蝇"冲突分离(毫秒级)+ 兼容整合(分钟-小时级)"形式化为双速率优化:快循环处理即时梯度冲突,慢循环调整模块间权重促成长期兼容。连接组先验不作为固定约束,而作为带衰减惩罚的初始化(“从先验中释放”)——约束拓扑统计量(分区模块度、长程稀疏性),不约束具体连接。

    突破方向三:三时间尺度分离 + 关键期门控

    快 = 梯度更新(突触),中 = 定期结构剪枝/生长(自生长),慢 = 代际架构选择(自进化)。判据设计很关键:三尺度全开要显著优于任何子集,且优势随任务序列变长而扩大。结构改变的"开关"由独立调质通道控制(关键期管理),调节时机的随机性应来自系统外不可模拟源。


    6. 结语:果蝇不是答案,是地图

    调研最后回头看,最有意思的结构是:AI 圈和神经科学圈在 2026 年从两个方向爬向了同一座山——

    • AI 圈从 RSI/RL 侧爬上来,发现瓶颈是验证信号与多时间尺度记忆组织;
    • 神经科学圈从果蝇/人脑侧爬上来,刚好把"价值系统 + 稀疏编码 + 分层调制 + 多时间尺度可塑性"的证据链备齐了;
    • 两边在"世界模型 = 内部评估器"这个位置相遇。

    果蝇脑只有 14 万神经元(人脑的 60 万分之一),但蘑菇体浓缩了海马(联想记忆)与小脑(稀疏扩展+并行可塑性)两个系统的计算基序,而它的完整接线图已经躺在那儿了。小脑系统的原理 + 大脑系统的任务 + 具身环境的验证——这个组合目前没人做过。

    或许这就是调研最大的收获:突破点很少是全新的,更多是两张已经画好的地图上,恰好没人走过的交叉路口。


    附:论文与资源索引(节选)

    RSI 方向

    • The Last AI Built by Humans: Toward Genuine RSI — arXiv:2609.11873
    • Recursive Self-Improvement of AI Research Agents — arXiv:2609.26457
    • Darwin Gödel Machine — arXiv:2505.22954 | Red Queen Gödel Machine — arXiv:2606.26294
    • HELIX: Model-Harness Co-evolution — arXiv:2608.13951
    • Phantom Gains: Auditing Self-Improvement Against a Measured Null — arXiv:2608.20290
    • Awesome-RSI-Research(603 篇)— github.com/Lee1003-lee/Awesome-RSI-Research

    仿生大脑方向

    • FlyGCL: Brain-Inspired Hierarchical Modularity for GCL — arXiv:2609.25146(代码:THU-NeuroML/FlyGCL)
    • Connectome-constrained networks predict neural activity — Nature 2024(Lappalainen et al.)
    • Sniffing Shapes Dopamine Signals — bioRxiv 2026-04
    • 果蝇雄性 CNS 完整连接组 — HHMI/Janelia,2026-09-03 发布
    • Bee-Nav(Nature 2026)| Antcar(Nat. Commun. 2025)
    • Goal-directed learning in cortical organoids — Cell 2026

    RL / 世界模型方向

    • RLVR Implicitly Extends Reasoning Beyond Sampling Efficiency — ICLR 2026
    • DAPO | Entropy-Preserving RL | NashDreamer — arXiv 2026-09
    • Scaling Automatic Research Agents via World Models — arXiv:2608.12564
    • V-JEPA 2-AC(Meta, 2025)| Physical State Grounding for JEPA World Models(2026-08)

    声明:本文为个人调研笔记的公开版,所有论文数字与机构动态以原始出处为准(信息截至 2026-10-05);第三方评测结果均为"作者报告"口径,不可跨论文合并排名。转载请注明出处。

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » 从果蝇脑到递归自我改进RSI:2026 仿生 AI 调研全景(附 12 份报告脉络)
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!