云计算百科
云计算领域专业知识百科平台

面向逻辑思维的程序设计方法——依托世界模型的类脑大模型感知理解子网设计

面向逻辑思维的程序设计方法——依托世界模型的类脑大模型感知理解子网设计

冯胤清

(河南 三门峡 472000)
在这里插入图片描述

摘要:大语言模型(LLM)以文本为唯一感知入口,其"感知"局限于语言符号空间,缺乏对物理世界的多模态感知与结构化理解——LLM"知道"杯子是圆柱形,却"看不到"面前的杯子、"摸不到"杯壁的温度。类脑大模型以五子网+全局工作空间(GWS)为认知架构,其中感知理解子网承担多模态世界状态编码职能,但在既有设计中仅以"多模态编码器+VLM"作概要描述,缺乏对感知通道、融合机制、语义化输出与层间接口的系统设计[16-17]。本文基于面向逻辑思维的程序设计方法(LOPD)七层认知分析层次模型与《脑的设计》双脑架构,提出依托世界模型的类脑大模型感知理解子网初步设计:以"感知门户(L3)"为组织骨架,设计视觉、听觉、触觉与内感四大感知通道,各通道经"底层特征提取→中层语义解析→高层情境理解"三级处理流水线,输出结构化世界状态表示——对象(属性、位置)、关系(空间、因果)、事件(时序、状态转移)三元语义[3,16-17]。多模态融合采用"特征级+语义级+决策级"三级融合架构,以不确定性建模(置信度传播)保证感知鲁棒性[8-10,12]。感知理解子网与世界模型子网构成"感知-预测"闭环:感知输出当前状态sts_tst供世界模型推演,世界模型的预测先验反向调制感知(预测编码机制)——“感知不是被动接收,而是用预测检验输入”[3,4,17]。本文进一步给出感知-认知耦合设计(感知结果经GWS广播,调制认知推理、情感评估与反思机制的输入)、感知质量五维评估体系,以及与具身机器人、智能驾驶等场景的衔接,为类脑大模型从"语言感知"走向"世界感知"提供架构参考[16-19]。

关键词:类脑大模型;感知理解子网;多模态感知;视觉感知;听觉感知;触觉感知;世界模型;预测编码;语义化世界状态;感知门户;面向逻辑思维程序设计;七层认知模型

中图分类号:TP18;TP391  文献标志码:A


1 引言

1.1 大语言模型的感知局限

大语言模型(LLM)在过去数年间取得显著进展:ChatGPT掀起对话式AI浪潮,GPT-4、Claude、Qwen等模型在语言理解、代码生成与知识问答等领域表现突出[1]。Transformer架构以自注意力机制捕捉长程依赖,成为现代大模型的基石[1]。然而,LLM的"感知"存在根本局限:它以文本为唯一入口,将一切信息编码为token序列——图像被"翻译"成文字描述、语音被"转录"成文本、触觉数据根本无法进入[1,17]。这种"语言中心主义"的感知带来三个问题:其一,信息损失——从图像到文本的转换丢失了空间细节、颜色梯度与动态信息;其二,接地缺失——LLM学习的是文本统计共现,而非物理世界的直接观测,缺乏"接地"(grounding)[4,17];其三,感知-行动断裂——LLM无法直接感知环境状态,也无法将感知结果转化为物理行动[5-6,19]。产业界对这一问题已有清醒认识:物理AI(Physical AI)被认为是AI的下一站,其核心是让模型理解并预测真实世界状态,而这首先依赖多模态感知的突破[22]。李飞飞提出的"世界模型"功能分类学亦将感知(世界的"是什么")作为世界模型三大功能之首[25]。

多模态大模型(如GPT-4V、Qwen-VL)部分缓解了前两个问题:视觉编码器将图像映射到语言模型的语义空间,实现了"看图说话"[11]。视觉-语言-动作(VLA)模型进一步将感知与行动统一——从RT-2到OpenVLA,VLA在机器人操作中展示了"感知-语言-动作"端到端映射的能力[5-6]。VLA综述研究指出,VLA的核心优势是"统一语义空间"(视觉、语言、动作共享表示),但局限是感知目标仍服务于"动作生成"而非"世界状态构建"[5-6]。这一局限正是本文感知理解子网要突破的方向:感知应产出"可供推演的世界状态",而非仅"可供模仿的动作"(详见第3章)[5-6,17]。但多模态LLM的感知仍以"生成文本描述"为目标,而非"构建世界状态表示"——它输出的是"描述",不是"状态"[5,17]。对需要与世界交互的类脑大模型而言,感知的目标是:将多模态输入转化为可供世界模型推演、认知推理决策、情感评估判断的结构化世界状态[16-17]。

1.2 类脑感知的启示与需求

生物感知为工程感知提供了丰富的启示[3,16]:人类感知是主动的——眼睛的注视点移动(saccade)、头部的转动、手的触摸,都是"主动感知"(active perception)而非被动接收;人类感知是预测性的——大脑持续预测感官输入,仅对预测误差(prediction error)进行精细加工(预测编码理论)[3];人类感知是多模态融合的——视觉、听觉、触觉、本体感觉协同构建统一的身体-世界表征[10,16]。类脑研究(如BriLLM的SiFu非表征学习机制)亦提示:大脑的感知组织方式是"信号流"式的——信息在大脑中以多路并行、交叉融合的方式流动,而非单一串行处理[24]。这一启示支持本文"多通道并行+统一融合"的感知架构设计[17,24]。

LOPD七层认知模型将感知组织为"感知门户"(L3)——对外五感(视/听/嗅/味/触,含触觉亚通道拆分)与内感三通道(本体感觉/前庭感觉/内感受)[16,18]。感知门户是L2肢体层(传感器)与L4神经层(大脑)之间的接口:它将物理信号转化为认知可用的世界状态[16-18]。

本文聚焦类脑大模型大脑五子网中的感知理解子网,将其从"多模态编码器"升维为完整的感知认知子系统:以感知门户为组织骨架,以"对象-关系-事件"三元语义为输出表征,以预测编码为工作机制,以世界模型为预测先验来源,构建"感知-预测-验证"闭环[16-17]。与系列论文的关系:感知理解子网是《类脑大模型大脑部分初步设计》中五子网架构的感知侧深化专论[17];其感知门户设计源自《脑的设计》的L3感知门户章节[16];其输出与世界模型子网、认知推理子网、情感评估子网、反思机制的接口构成大脑认知闭环的输入侧[16-17,20]。

1.3 本文的定位与贡献

本文将感知理解子网作为类脑大模型"依托世界模型"设计的感知侧支撑:感知提供世界模型的当前状态输入,世界模型提供感知的预测先验——二者构成双向耦合[4,17]。

本文的具体贡献包括:①提出感知理解子网的总体架构(四级处理流水线+三级融合+预测编码闭环);②设计视觉、听觉、触觉与内感四大感知通道;③给出"对象-关系-事件"三元语义化的世界状态表示与不确定性建模;④设计感知-世界模型双向耦合与感知-认知接口;⑤建立感知质量五维评估体系。

1.4 论文结构

全文共10章:第2章阐述感知的理论基础(生物感知、预测编码、多模态感知、感知门户);第3章给出感知理解子网总体架构;第4章设计视觉感知通道;第5章设计听觉感知通道;第6章设计触觉与内感感知通道;第7章设计多模态融合与语义化感知;第8章设计感知-认知耦合;第9章给出评估与应用;第10章总结展望。各章的写作逻辑:理论基础(第2章)回答"感知为什么这样设计",架构与通道(第3-7章)回答"感知怎么设计",耦合(第8章)回答"感知如何服务认知",评估与应用(第9章)回答"感知如何验证与落地"——构成"为什么-是什么-怎么用-怎么验"的完整论述链[16-17]。

2 感知的理论基础

2.1 生物感知的原理

生物感知系统提供了工程感知的设计蓝本[3,10,16]。其核心原理可归纳为四条:

分层处理:感觉信号沿皮层层级逐级抽象——视觉从视网膜的像素级特征(边缘、方向)经V1-V5逐级提取(形状、颜色、运动、对象),到颞叶的语义级识别(面孔、场景)[3,10]。分层处理的工程映射:深度网络的层级结构天然对应感知的分层抽象——底层卷积捕捉边缘纹理,中层捕捉部件形状,高层捕捉对象语义[2,11]。感知理解子网的四级流水线即分层处理的工程化:特征提取对应底层、语义解析对应中层、情境理解对应高层[17]。分层处理使感知从"特征"走向"语义"。

主动感知:感知器官主动采样环境——眼睛的扫视、耳朵的朝向、手的触摸,都是主动获取信息的动作[10,16]。主动感知的工程价值:被动感知受限于"传感器指向哪里"(摄像头朝向固定区域),主动感知通过"感知动作"(移动云台、调整朝向、触觉探查)扩大感知覆盖与精度[10,17]。主动感知提示工程感知应与行动耦合(感知驱动行动、行动引导感知)[16,19]。

预测编码:大脑持续自上而下地预测感官输入,自下而上的误差信号仅在预测失败时传播[3]。Rao与Ballard的经典工作表明,视觉皮层层级结构可用预测编码统一解释[3]。预测编码使感知高效(只处理意外)且鲁棒(预测补充缺失输入)[3]。

多模态协同:视觉、听觉、触觉、本体感觉以统一的身体图式(body schema)整合——“看"与"摸"的物体被识别为同一对象[10,16]。身体图式(body schema)的工程实现:世界状态中的"自我元素”(自体位姿、关节状态)为各模态提供统一的坐标系——视觉的"物体在视野中央"、触觉的"手接触物体"、本体的"手在物体位置",在自我坐标系中统一为"物体在我手边"[16-17]。多感官智能(multisensory intelligence)研究指出,多模态协同感知是通向通用感知的方向[10]。多模态协同产生"超加性"(supra-additive)效应:多模态信息联合的感知优于单模态之和[10,12]。超加性效应的工程含义:多模态融合不仅是"信息叠加",更是"信息互补"——视觉提供"是什么",触觉提供"摸起来如何",本体提供"我如何动作",三者互补构成完整的世界认知[10,12,16-17]。

2.2 预测编码理论

预测编码(predictive coding)是理解感知机制的核心框架[3]。其基本思想:感知系统维护对世界的生成模型,持续预测感官输入;感知过程=用预测误差修正生成模型。形式化:设hatx\\\\hat{x}hatx为对输入xxx的预测,误差e=x−hatxe = x – \\\\hat{x}e=xhatx自下而上传播,生成模型自上而下更新[3]。

预测编码对工程感知的三点启示[3,4,17]:

感知即推断:感知不是"从像素到标签"的单向映射,而是"用模型解释输入"的推断过程——感知输出应携带解释(为什么认为是这个对象)[3]。工程含义:感知理解子网应维护"解释模型"(对象-关系-事件的生成模型),感知过程即用该模型解释输入信号——输出不仅包括"是什么",还包括"为什么是"(解释路径)[17]。解释路径支撑可解释感知(感知决策可追溯)与主动感知(解释不确定时主动采样)[3,17]。

预测即约束:高层预测约束低层处理——“预期这里有杯子"加速"看到杯子”[3]。工程实现:世界模型的预测先验调制感知处理(详见第8章)[17]。

误差即信号:预测误差是学习与注意的信号——感知系统应聚焦"意外"(预测误差大的区域)[3]。工程实现:注意力机制以预测误差为线索分配算力[3,17]。

2.3 多模态感知的计算基础

多模态感知的工程实现建立在深度学习的多模态表示学习之上[8-12]。多模态表示学习的核心问题:异构模态如何在统一空间中表示与运算——“图像是像素矩阵、声音是波形、触觉是压力分布”,它们没有天然的公共度量,需通过学习建立跨模态的语义对应[8,11]。具身智能的多传感器融合感知研究系统梳理了这一问题的解决方案:从特征级到决策级的多级融合、从静态融合到动态融合(融合策略随场景变化)[8]。核心技术包括:

模态编码:各模态独立的特征提取——视觉(ViT/CNN)[2,11]、听觉(声学特征+时序模型)[15]、触觉(触觉图像+CNN)[7,9]。模态编码的工程要点:各模态的采样率不同(视觉30 fps、音频16 kHz、触觉100 Hz),需统一时间基准与同步[8,12];各模态的特征维度不同(视觉高维、触觉低维),需维度适配[8,12]。

模态对齐:将异构模态映射到统一语义空间——CLIP类对比学习(图像-文本对齐)、AudioCLIP(音频-文本对齐)[8,11]。对齐空间的构建:以语义为锚(“猫"的图像、声音、文字描述在嵌入空间邻近)——对齐使"看图说话”“听声辨物"成为可能[8,11]。对齐的局限:对比学习对齐的是"关联"而非"因果”(图像与文字关联≠理解图像内容)——感知理解子网需在语义级(对象-关系-事件)超越关联对齐[11,17]。

模态融合:特征级(拼接/注意力)、语义级(语义对齐后融合)、决策级(各模态独立决策后投票/加权)[8,12]。

多模态感知的挑战:模态缺失(某传感器失效)、模态冲突(各模态信息矛盾)、模态校准(时间/空间对齐)、计算开销[8,10,12]。模态缺失的应对:模态掩码训练(训练时随机丢弃模态,模型学会单模态/少模态工作)[8,12]。模态冲突的应对:置信度仲裁(高置信模态主导)+主动复核(冲突时重新观测)[8,12,17]。模态校准的应对:传感器时间同步(硬件触发/软件对齐)+空间标定(外参标定将各传感器统一到世界坐标系)[8,12]。多模态感知与人机交互决策的结合(MPDDM)是近年研究热点:感知-决策整合框架在动态环境中优化"何时感知、感知什么、如何决策"——这一框架与本文"感知为认知服务"的原则一致[12]。世界大模型的理论研究进一步指出:感知表征与预测建模应统一(“感知-预测一体化”),才能支撑从静态数据分布学习到动态世界建模的范式跃迁[22]。

2.4 感知门户:LOPD七层中的感知组织

LOPD七层认知模型将感知组织为感知门户(L3)[16,18]:对外五感——视觉(视)、听觉(听)、嗅觉(嗅)、味觉(味)、触觉(触,含触觉亚通道拆分:压力/温度/纹理/疼痛);内感三通道——本体感觉(身体位形)、前庭感觉(平衡与加速度)、内感受(生理状态)[16]。

感知门户是L2肢体层(传感器阵列)与L4神经层(感知理解子网)之间的接口[16-18]:L2提供物理信号(像素流、声波、压力分布),L3组织信号为感知通道(视觉流、听觉流、触觉流、本体流),L4的感知理解子网将感知通道转化为世界状态[16-17]。感知门户的设计遵循"最小感知表征"原则:以完成任务所需的最少信息量为感知目标,避免无差别全量感知[16-17]。该原则与注意力机制协同:感知门户按认知需求选择激活通道(任务需要视觉时优先视觉通道)[17]。表1给出感知门户的通道划分与对应传感器。

表1 感知门户通道划分

通道类型感知通道生物对应工程传感器
对外五感 视觉 视觉皮层V1-V5 摄像头、深度相机、激光雷达
对外五感 听觉 听觉皮层 麦克风阵列
对外五感 触觉 体感皮层S1 触觉阵列、力传感器、温度传感
对外五感 嗅觉 嗅球 气体传感器阵列
对外五感 味觉 味觉皮层 化学传感器(特殊场景)
内感三通道 本体感觉 肌梭/腱器官 编码器、IMU、关节电流
内感三通道 前庭感觉 半规管/耳石 IMU、惯性导航
内感三通道 内感受 自主神经 温度、心率、电量监测

2.5 感知的哲学问题:感知与实在

感知的哲学问题为工程感知提供深层思考[3,17]:感知是否忠实反映世界(感知=世界的映像 vs 感知=模型的解释)——预测编码立场:感知是"模型对输入的最佳解释",而非世界的直接映像[3,17];感知的不可靠性(错觉、幻觉)——工程含义:感知输出必须携带不确定性(第3章),下游决策不可盲目信任感知[17];感知的主观性(同一场景不同个体感知不同)——工程含义:感知的"个体化"(按任务需求与历史经验配置感知偏好)[17]。这些哲学问题不是思辨游戏——它们决定了感知系统的设计态度:诚实(报告不确定性)、谦逊(承认局限)、可纠错(反思机制校准)[3,17]。

3 感知理解子网的总体架构

3.1 设计哲学:感知是构建世界状态而非生成描述

感知理解子网的设计遵循三条哲学原则[16-17]:

原则一:感知输出状态而非描述。LLM感知输出"这是一只猫坐在椅子上"(描述),感知理解子网输出结构化的世界状态{对象:猫, 位置:椅子, 姿态:坐}(状态)[17]。状态表示可直接供世界模型推演(“猫跳下椅子→什么后果”)[4,17]。

原则二:感知是预测检验而非被动接收。感知过程以世界模型的预测为先验,以感知输入为证据,输出"预测与证据的最佳解释"(预测编码)[3,17]。感知不是"看什么信什么",而是"预测什么、检验什么"。

原则三:感知为认知服务。感知的加工深度按认知需求动态调整——紧急任务(避障)快速低层感知,复杂任务(场景理解)深度语义感知[16-17]。感知理解子网经GWS接收认知需求的"感知任务指令",按需配置处理深度[17]。三条原则共同确立了感知理解子网的设计边界:它不是"通用视觉系统"(输出一切信息),而是"认知驱动的感知子系统"(输出认知所需的世界状态)[17]。这一边界使感知计算聚焦于任务相关区域,显著降低算力开销——对应"最小感知表征"原则的工程实现[16-17]。

3.2 四级处理流水线

感知理解子网采用"感知通道→特征提取→语义解析→情境理解"四级处理流水线[16-17]:四级流水线的设计依据是生物感知的分层抽象(第2章2.1)——从物理信号到语义状态的渐进抽象,每一级输出是下一级的输入[3,17]。流水线的数据流:物理信号(L2传感器)→通道化信号流(L3感知门户)→特征张量(第二级)→语义元素(第三级)→世界状态(第四级)[16-17]。

第一级:感知通道(Perception Channel)——接收L3感知门户的原始信号流,完成预处理(去噪、校准、时间戳对齐)[16]。

第二级:特征提取(Feature Extraction)——各通道提取底层特征:视觉(边缘、纹理、颜色直方图、深度图)[2,11]、听觉(MFCC、基频、能量)[15]、触觉(压力分布、纹理谱)[7,9]。

第三级:语义解析(Semantic Parsing)——特征级识别:视觉(目标检测、语义分割、姿态估计)[2,11,13]、听觉(语音识别、声学事件检测)[15]、触觉(材质分类、接触状态估计)[7,9]。

第四级:情境理解(Scene Understanding)——跨通道的情境级推理:场景图构建(对象-关系-事件)、因果推断(“什么导致了这个变化”)、异常检测(“什么不符合预期”)[10-12,17]。

四级流水线的处理深度可配置:紧急路径(避障)在第二级即输出,复杂路径(任务规划)运行到第四级[17]。处理深度的配置由"感知任务指令"驱动:指令携带目标(检测/识别/理解)、感兴趣区域(ROI)与响应时限;流水线按指令动态裁剪(跳过不需要的层级)[17]。流水线的各级输出均保留中间结果(特征图、语义元素),供后续融合与追溯(可解释感知)[17]。

3.3 世界状态表示:对象-关系-事件三元语义

感知理解子网的输出采用"对象-关系-事件"三元语义的世界状态表示[16-17]:三元语义的设计依据——对象回答"世界有什么"、关系回答"它们如何关联"、事件回答"发生了什么变化"——三者覆盖世界状态的静态与动态维度[16-17]。三元语义与知识图谱的衔接:世界状态可作为图结构(对象为节点、关系为边、事件为动态标注),与知识图谱(GraphRAG)语义对齐,支撑语义检索与推理[17]。

对象(Object):O=id,category,attributes,poseO = \\\\{id, category, attributes, pose\\\\}O=id,category,attributes,pose——对象类别(椅子)、属性(颜色、材质、状态)、位姿(位置、朝向)[17]。

关系(Relation):R=type,subject,object,confidenceR = \\\\{type, subject, object, confidence\\\\}R=type,subject,object,confidence——空间关系(在…上)、因果关系(导致)、功能关系(用于)[17]。

事件(Event):E=type,participants,temporal,transitionE = \\\\{type, participants, temporal, transition\\\\}E=type,participants,temporal,transition——事件类型(移动、碰撞、交互)、参与者、时间信息、状态转移(sttost+1s_t \\\\to s_{t+1}sttost+1)[17]。

世界状态S=(O,R,E,t,Sigma)S = (\\\\{O\\\\}, \\\\{R\\\\}, \\\\{E\\\\}, t, \\\\Sigma)S=(O,R,E,t,Sigma),其中Sigma\\\\SigmaSigma为状态的不确定性(协方差)[17]。该表示与世界模型的状态空间直接对接:世界模型以SSS为推演输入,推演结果以S′S'S为输出[4,17]。

3.4 不确定性建模

感知的不确定性来自传感器噪声、遮挡、模糊与模型误差[8,12,17]。感知理解子网采用三层不确定性建模[17]:

感知不确定性(aleatoric):传感器噪声引起——各感知输出携带置信度cin[0,1]c \\\\in [0,1]cin[0,1],由传感器的信噪比与处理模型的预测概率决定[17]。

模型不确定性(epistemic):感知模型对未见输入的把握——由模型的预测方差或集成分歧估计[12,17]。

情境不确定性:环境本身的模糊性——“远处那个模糊的影子是树还是人”(视觉无法区分)[17]。情境不确定性的处理:不强行判定(保留多假设——“影子:树0.5/人0.4/其他0.1”)、触发主动感知(靠近确认)、保守决策(按最坏假设行动——“当作人来避让”)[17]。多假设保持使感知"诚实"——不确定性被显式表达而非隐藏[17]。

三层不确定性汇聚为世界状态的协方差Sigma\\\\SigmaSigma,供世界模型推演(低置信度状态减少推演权重)与认知推理决策(高不确定性触发主动感知——移动视角、靠近观察)[17]。

3.5 依托世界模型的感知设计

"依托世界模型"是感知理解子网设计的核心立场[4,16-17]:

预测先验:世界模型对下一时刻状态的预测hatSt+1\\\\hat{S}_{t+1}hatSt+1作为感知的预测先验——感知在预测区域内精加工(“预期有人走来→聚焦移动区域”),预测区域外粗加工[3,17]。

状态一致性:感知输出的状态与世界模型的预测状态进行一致性检验——一致则置信度提升,不一致则触发主动感知(重新观测)[3,17]。

感知-推演闭环:感知输出StS_tSt→世界模型推演hatSt+1\\\\hat{S}_{t+1}hatSt+1→执行行动→感知验证St+1S_{t+1}St+1→误差回传更新世界模型与感知模型[4,17]。这一闭环使感知与世界模型协同进化[17]。

3.6 感知理解子网的实现技术栈

感知理解子网的工程实现可采用如下技术栈[2,5-6,8-12,17]:技术栈的分层组织——传感层(传感器驱动与数据接入)、感知层(通道处理模型)、融合层(多模态融合)、语义层(世界状态构建),各层接口标准化,支持模块替换与演进[17]。

视觉感知:ViT/CNN目标检测(DETR、YOLO系列)[2,13]、语义分割(SAM)[11]、深度估计[11]——基于开源视觉模型微调[11,17]。

听觉感知:语音识别(Whisper类)[15]、声学事件检测(AST类)[15]——流式处理满足实时性[15,17]。

触觉感知:触觉图像编码(基于GelSight类触觉传感器)[7,9]、接触状态估计[7]——与视觉融合的触觉-视觉感知(视觉触觉智能)[7,9]。

融合与表示:多模态编码器(CLIP类对齐)+场景图构建模型[8,11-12]。

系统集成:ROS 2提供传感器接入与消息通信[19];感知结果以标准消息格式(PerceptionState)经GWS广播[17]。感知模块的部署形态:边缘侧(传感器旁部署轻量感知模型,低延迟)与云端(大模型深度感知,高精度)的协同——边缘快速感知+云端深度理解的混合架构[17]。

4 视觉感知通道

4.1 视觉通道的职能与架构

视觉是信息量最大的感知通道[2,11,13,16]。视觉通道的职能:空间感知(物体在哪里)、对象识别(是什么)、场景理解(发生了什么)、运动感知(如何变化)[2,11,17]。视觉感知的输入形态:单目RGB(低成本、广泛部署)、双目立体(深度估计)、RGB-D(深度相机直接提供深度)、激光雷达(3D点云,自动驾驶常用)[11,13,17]。输入形态的选择按场景需求:服务机器人常用RGB-D(成本适中、深度可用),自动驾驶需激光雷达(远距离精确测距)[13,17]。

视觉通道架构:图像采集(摄像头/深度相机/激光雷达)→底层特征(CNN骨干/ViT分块嵌入)[2,11]→中层语义(目标检测、语义分割、深度估计、姿态估计)[2,11,13]→高层情境(场景图、事件检测)[11-12,17]。视觉通道与"对象-关系-事件"语义的映射:目标检测→对象元素、空间关系推理→关系元素、运动/事件检测→事件元素[17]。

4.2 视觉特征提取

视觉特征提取经历了从CNN到ViT的范式迁移[2,11,13]:CNN以卷积核捕捉局部特征,通过层级堆叠扩大感受野;ViT将图像划分为16×16的图像块(patch),经Transformer自注意力捕捉全局依赖[2,11]。ViT在图像分类、检测、分割等任务上达到或超过CNN水平[2,11]。

工程选型:骨干网络(ResNet/ViT/Swin)按算力与精度权衡选择;特征金字塔(FPN)融合多尺度特征,提升小目标检测能力[11,13]。视觉Transformer的综述研究总结了ViT在分类、检测、分割等任务的创新方法(层次化ViT、高效注意力、跨模态ViT)[11];目标检测的演化综述则梳理了从CNN到Transformer再到多模态融合的完整路径[13]。在感知理解子网中,视觉骨干的选择需考虑:推理延迟(实时场景需轻量骨干)、多尺度鲁棒性(远近目标)、与多模态融合的接口(特征维度的统一)[11,17]。视觉特征的输出为多尺度特征图,供检测、分割、深度估计等任务头使用[11,13]。多任务共享骨干的工程价值:单一骨干+多任务头(检测/分割/深度共享特征)——节省算力、特征一致(各任务从同一特征空间解读)[11,17]。

4.3 目标检测与语义分割

目标检测识别"什么物体在哪里"[2,11,13]:两阶段(R-CNN系列——先提候选再分类)、单阶段(YOLO系列——直接回归)、Transformer检测(DETR——端到端集合预测)[2,11,13]。检测输出:对象边界框+类别+置信度[13]。

语义分割将图像逐像素分类(“哪些像素属于椅子”),实例分割区分同类个体(“这把椅子vs那把椅子”)[11]。分割输出为像素级对象掩码,支撑精细的空间关系推理[11,17]。

在感知理解子网中,检测与分割的结果映射为世界状态的对象元素:对象类别、位姿(由边界框/掩码+深度估计计算)[17]。映射的细节:检测框提供2D位置与尺寸、深度图提供距离、相机内参将2D框投影为3D位姿(位置+朝向)[11,17]。对象映射的完整流程:检测(类别+框)→分割(精细掩码)→深度(距离)→位姿(3D位置+朝向)→属性(颜色/状态)→世界状态对象元素[11,17]。对象属性的补充:颜色(分割区域的色彩统计)、状态(“杯子是满的/空的"需更高层推理)[17]。对象的时序一致性:跨帧跟踪(SORT/DeepSORT类)维持对象ID,支撑"同一对象的连续状态”(运动轨迹、状态变化)[11,17]。

4.4 深度感知与空间理解

深度感知回答"物体离我多远"[11,17]:双目立体(视差计算)、结构光/ToF(主动测距)、单目深度估计(深度学习回归)[11]。深度感知的精度权衡:主动测距(ToF)精度高但受环境光影响、双目立体精度适中需标定、单目估计灵活但精度有限(相对深度)[11,17]。深度感知的输出:深度图(逐像素距离)或3D点云——与世界状态的对象位姿计算直接相关(位置=2D检测+深度)[11,17]。深度图与RGB图像融合,生成3D场景表示(点云/体素)[11,17]。

空间理解:从3D表示提取空间关系——“杯子在桌子的右上角”(相对位置)、“门距我3米”(距离)、“障碍物在行进路径上”(路径冲突)[17]。空间关系的推理方法:基于3D坐标的几何关系计算(在…上=支撑面接触、在…旁=邻近)、基于语义的场所关系(“杯子在厨房”)、基于场景图的图推理(传递关系:“杯子在桌上、桌在厨房→杯子在厨房”)[11,17]。空间关系是世界状态中关系元素的核心来源[17]。

4.5 运动感知与事件检测

运动感知捕捉场景中的动态变化[11,17]:光流(逐像素运动)、目标跟踪(跨帧关联)、行为识别(动作分类)[11]。运动感知的时序建模:视频理解模型(时序注意力、3D卷积)处理连续帧[11]。运动感知的输出:运动目标轨迹(跟踪)、行为标签(“行走”“奔跑”“挥手”)、场景动态(“车流方向”)[11,17]。运动感知在安全场景的关键应用:突然运动物体(闯入者、坠物)的快速检测与优先处理——运动显著性作为注意力分配的优先线索[17]。运动感知在安全场景的关键性:突然运动的物体(闯入者、坠物)优先处理[17]。运动感知的输出:运动目标轨迹、行为标签(“人正在走向门”)、异常事件(“物体坠落”)[11,17]。

事件检测将运动感知与语义结合:检测到"杯子下落"事件→更新世界状态的事件元素(类型:坠落, 参与者:杯子, 后果:可能破碎)→触发世界模型推演(“杯子会碎吗”)[17]。事件的时间组织:事件序列形成"情景流"(situation flow)——连续的事件时间线支撑因果推理(“先碰撞后坠落”)与未来预测(“坠落之后是破碎”)[17]。事件的异常检测:事件类型与情境预期不符时标记异常("桌上静止的杯子突然移动"→可能有人或外力)[17]。

4.6 视觉通道的挑战与缓解

视觉感知的挑战[8,11-13]:遮挡(部分目标不可见)——缓解:多视角融合、时序补全;光照变化——缓解:数据增强、归一化;小目标——缓解:特征金字塔、高分辨率输入;计算开销——缓解:模型轻量化、区域注意力(只处理关注区域)[11,13,17]。遮挡问题的预测编码解法:世界模型预测被遮挡区域的"应有内容"(“桌沿被手臂挡住,但桌子应延伸到手臂后方”)——预测补全遮挡[3,17]。光照变化的鲁棒解法:多光谱融合(RGB+红外)、光照不变特征[11,17]。

4.7 视觉感知与预测编码

视觉通道与预测编码的融合是"依托世界模型"感知的典型体现[3,17]:世界模型维护"视觉场景的生成模型"(场景布局、对象外观、运动模式);视觉感知以生成模型为预测先验——"预期视野中桌上有杯子"→感知验证[3,17]。预测编码在视觉感知中的三个应用:遮挡补全(预测被遮挡区域内容)、运动预测(预测物体下一时刻位置,缩小检测范围)、异常检测(预测与实际差异大的区域标记异常)[3,17]。

4.8 视觉感知的注意力配置

视觉注意力的配置决定"看哪里、看多细"[17]:自底向上显著性(运动、色彩对比、边缘强度)自动吸引注意[3,17];自顶向下任务驱动("找钥匙"→桌面区域优先)[17];预测误差驱动(预期外的变化优先处理)[3,17]。注意力配置的工程实现:感兴趣区域(ROI)裁剪——全图低分辨率扫描+ROI高分辨率精细分析[11,17]。注意力配置的价值:同等算力下显著提升关键区域感知质量[17]。

5 听觉感知通道

5.1 听觉通道的职能与架构

听觉是仅次于视觉的重要感知通道,在视觉受限场景(黑暗、遮挡)与语言交互中不可替代[15-16]。听觉通道的职能:语音内容理解(说了什么)、声学事件检测(发生了什么声音)、空间听觉(声音从哪来)、情感韵律感知(怎么说)[15-16]。

听觉通道架构:声音采集(麦克风阵列)→声学特征(频谱、MFCC、基频)[15]→中层语义(语音识别、声学事件分类、声源定位)[15]→高层情境(说话人识别、对话状态、环境声场)[15,17]。听觉通道的职责聚焦:语言感知(说什么)、环境感知(有什么声音)、社会感知(谁在说、语气如何)[15,17,20]。听觉感知与视觉感知的互补性:视觉"看到"需要视线(遮挡、黑暗受限),听觉"听到"全向(声源无需在视野内)——“看不见的警报声"由听觉捕获[15,17]。听觉通道与视觉通道的时序特性不同:视觉是"空间主导”(一帧图像含大量空间信息),听觉是"时间主导"(声音的本质是时间序列)——听觉感知的流水线需更强的时序建模(循环网络/注意力时序编码)[15,17]。听觉感知的延迟要求:对话场景的语音识别需流式处理(边说边识别),端到端延迟控制在几百毫秒内[15,17]。

5.2 声学特征提取

声学特征的提取是听觉感知的基础[15]:短时傅里叶变换(STFT)将波形转为频谱图;梅尔频率倒谱系数(MFCC)模拟人耳听觉特性;基频(F0)与能量刻画语音的韵律特征[15]。深度学习时代,端到端模型直接从原始波形或频谱图学习特征[15]。

特征提取的工程考虑:采样率(语音16 kHz、音频44.1 kHz)、帧长帧移(25 ms/10 ms)、噪声鲁棒性(语音增强预处理)[15]。

5.3 语音识别与语义提取

语音识别(ASR)将语音转为文本[15]:传统方案(GMM-HMM)已被端到端方案取代——Transformer类模型(Whisper等)直接实现语音到文本的映射[15]。ASR的工程挑战:口音与方言(多口音微调)、噪声鲁棒性(语音增强)、实时性(流式ASR)[15]。ASR的语义衔接:识别文本进入语言理解(与类脑大模型的LLM基座衔接)——听觉通道是"语言感知"的主要入口[15,17]。语音识别输出携带时间戳(逐词时间对齐),支撑"谁在什么时候说了什么"的结构化表示[15,17]。语音识别输出携带时间戳(逐词时间对齐),支撑"谁在什么时候说了什么"的结构化表示[15,17]。

语义提取:语音文本经语义解析(与文本感知通道相同)转化为世界状态的语言事件——"用户说’把杯子递给我’"→事件{类型:请求, 对象:杯子, 动作:递送}[17]。

5.4 声学事件检测与场景分析

声学事件检测(AED)识别环境声音[15]:警报声、脚步声、玻璃碎裂声、犬吠等。AED的模型:音频频谱Transformer(AST)将音频频谱图分块编码,实现多标签声学事件分类[15]。AED在安全场景的价值突出:视觉不可见的危险(烟雾警报、玻璃破碎)由听觉通道捕获[15,17]。音频频谱Transformer(AST)等模型实现多标签声学事件分类[15]。

声学场景分析:识别环境声场类型(街道、室内、工厂)[15];声源定位(麦克风阵列的到达时差TDOA估计声源方向)[15]。声源定位与视觉的协同:声源方向引导视觉注意力(“听到声音→看向声源”)——视听融合的注意力定向机制[15,17]。声学事件与视觉事件互补:视觉"看到"物体,听觉"听到"声音——"看不见的警报声"由听觉通道捕获[15,17]。

5.5 听觉与语言的衔接

听觉通道与语言理解的衔接是类脑大模型的特有需求[15,17]:语音→文本→语义(ASR+语言理解),或语音→语义(端到端语音理解模型,跳过中间文本)[15]。听觉通道同时提供韵律信息(语调、情感),支撑情感感知(“用户语气愤怒”)[15,20]。

在感知理解子网中,听觉输出映射为世界状态的事件与对象:语音事件(说话内容、说话人)、声学事件(警报、异常声)、环境声场[15,17]。语音事件的语义化:语音经ASR转文本、再经语义解析为事件("用户说:把灯打开"→事件{类型:指令, 对象:灯, 动作:开启})[15,17]。声学事件的语义化:警报声→事件{类型:危险信号, 来源:烟雾报警器}[15,17]。环境声场→情境元素{场所:街道, 嘈杂度:高}[15,17]。

5.6 听觉感知的鲁棒性

听觉感知的鲁棒性挑战[15,17]:噪声环境(街道、工厂)——缓解:波束成形(麦克风阵列指向声源)、语音增强(降噪模型);多说话人(鸡尾酒会效应)——缓解:说话人分离(声纹区分);回声与混响——缓解:去混响处理[15,17]。听觉鲁棒性评估:SNR(信噪比)下降时的识别率保持曲线[15,17]。

5.7 听觉感知的情感韵律

听觉通道同时是情感感知的通道[15,20]:语音韵律(语调、语速、音量)携带情感信息——“愤怒的语气”“温柔的语调”[15,20]。多模态情绪识别研究表明,融合面部表情、语音与语言等多模态信号可显著提升情绪识别性能——听觉情感感知与视觉表情感知的融合是情绪识别的主流方向[14,20]。听觉情感感知的输出(对方情感状态)进入情感评估子网,支撑共情交互[20]。韵律感知与语义感知的协同:语义说"我没事"但韵律显示低落——韵律优先判定真实情感状态[15,20]。

6 触觉与内感感知通道

6.1 触觉感知的独特价值

触觉是唯一提供直接物理接触反馈的感知通道[7,9,16]。视觉"看"物体,触觉"摸"物体——触觉提供接触几何(形状)、材料特性(硬度、粗糙度、温度)与交互动态(滑动、力)的直接信息[7,9]。触觉感知的独特性:它是"双向"的——不仅感知物体,还验证行动(抓取是否成功、接触是否稳定)[7,9,19]。在物理AI的感知架构中,触觉是"接触驱动的感知范式"(contact-driven paradigm)的基础,与视觉-语言范式并列[9]。在视觉遮挡场景(抓手盲区)与精细操作(装配、手术)中,触觉不可替代[7,9,19]。

触觉感知的生物学基础:皮肤感受器(触觉小体、环层小体、温度感受器、伤害感受器)编码压力、振动、温度与疼痛[7,9,16]。

6.2 触觉传感器与触觉表征

触觉传感器的两类主流方案[7,9]:物理式触觉传感器(压阻、电容、压电)——直接测量力/压力分布;视觉式触觉传感器(GelSight类)——通过相机拍摄弹性体形变图像,实现高分辨率触觉成像[7,9]。

触觉表征[7,9]:触觉图像(视觉式传感器的输出,可用CNN处理)、压力分布矩阵(物理式传感器)、力/力矩向量(腕部力传感器)、振动信号(加速度计)[7,9]。触觉表征的标准化是当前挑战:不同触觉传感器的表征空间差异大(触觉图像vs压力矩阵),跨传感器泛化困难[7,9]。视觉触觉智能(vision-based tactile intelligence)的研究提出了触觉-视觉统一表征的方向——以触觉图像为中间表示,实现触觉感知与视觉感知的共享特征空间[7,9]。

6.3 触觉感知任务

触觉感知的核心任务[7,9]:

材质识别:通过触觉图像/力信号识别材质(金属、木材、织物)[7,9]。

接触状态估计:估计接触类型(点接触、面接触)、接触力大小与方向、滑动状态[7,9]。接触状态是精细操作(抓取、装配)的关键反馈[7,9,19]。接触状态估计的实现:力/力矩传感器直接测量(腕部力传感器),或从触觉图像推断(CNN回归接触力)[7,9]。滑动检测:触觉图像的时序变化(纹理错位)或力信号的高频抖动——滑动检测触发抓取力调整(防滑)[7,9,19]。

物体识别:仅凭触觉识别物体(盲操作场景)——“摸出是钥匙”(形状+材质)[7,9]。

触觉-视觉融合:视觉触觉智能(vision-based tactile intelligence)将触觉图像与视觉图像联合——视觉提供全局形状,触觉提供局部接触细节[7,9]。融合的典型任务:物体抓取中的"视觉预判+触觉验证"(视觉判断抓取点、触觉验证接触质量)、材质识别的"视觉初判+触觉确认"(视觉猜材质、触觉验证)[7,9]。

6.4 本体感觉与内感受通道

本体感觉与内感受通道回答"我自己的身体状态如何"——这是世界状态中"自我元素"的来源,也是区分"外部世界"与"自身"的感知基础[16-17]。

本体感觉(proprioception)感知身体位形[16]:关节角度(编码器)、身体姿态(IMU)、关节力/力矩(电流)——支撑"闭眼也知道手在哪里"[16]。本体感觉是世界状态中"自我状态"的来源,也是世界模型推演身体动力学的基础[16-17]。

前庭感觉(vestibular)感知平衡与加速度[16]:IMU提供线加速度与角速度——支撑双足平衡、头部稳定与视觉补偿(VOR)[16]。

内感受(interoception)感知生理状态[16]:温度、电量、负载——支撑体内稳态调节与情感内感受(情绪的身体反应)[16,20]。内感受的工程实现:温度传感器(设备发热监控)、电量监测(电源管理)、负载监测(关节电流——机械疲劳预警)[16]。内感受与生存层的衔接:生理状态异常(过热、低电量)触发生存层保护动作(降频、充电、停机)[16,18]。

本体/前庭/内感受的输出映射为世界状态中的自我元素:{自体位姿, 关节状态, 生理状态}[16-17]。自我元素在世界模型推演中的角色:世界模型预测"如果我移动手臂,关节状态如何变化"——本体感觉提供推演的身体基准[16-17]。内感受(温度、电量、疲劳)为生存层提供生理状态监控,也为情感子网提供内感受通道(情绪的身体反应)[16,20]。

6.5 触觉通道的挑战与缓解

触觉感知的挑战[7,9]:传感器成本与耐用性(视觉式触觉传感器需弹性体维护);数据稀缺(触觉标注数据难获取)——缓解:仿真触觉(触觉渲染器)、自监督学习[7,9];跨传感器泛化(不同触觉传感器表征差异大)——缓解:标准化触觉表征[7,9]。触觉数据稀缺的破解路径:触觉仿真(Tactile Gym类仿真环境合成触觉数据)、遥操作采集(人类演示的触觉数据)、跨域迁移(仿真到真实)[7,9]。

6.6 触觉感知与操作闭环

触觉感知与操作执行构成闭环[7,9,19]:感知接触状态→调整操作参数(抓取力、移动速度)→操作反馈→更新接触状态[7,9,19]。触觉-操作闭环是精细操作(装配、缝合、穿针)的关键[7,9]。闭环的实时性:触觉反馈周期(5-20 ms)远快于视觉(30-100 ms)——触觉支撑毫秒级的力控制[7,9,19]。IROS研究已展示基于学习的抓取控制器(6 ms周期)在未知物体上的稳定多接触抓取[19]。

6.7 本体感觉与前庭感觉的工程实现

本体感觉与前庭感觉的工程实现[16-17]:关节编码器(关节角度)、IMU(角速度+线加速度)、关节电流(力矩估计)——融合为身体位形估计(卡尔曼滤波)[16-17]。身体位形估计为世界模型的自我状态提供基准,为小脑部位模型提供状态输入[16-17]。前庭-视觉协同:头部运动时的视觉补偿(VOR)——图像稳像(陀螺仪数据驱动的画面补偿)[16]。

7 多模态融合与语义化感知

7.1 三级融合架构

多模态融合采用"特征级+语义级+决策级"三级架构[8,10,12]:

特征级融合(early fusion):多通道特征在底层拼接/注意力融合——视觉特征+听觉特征+触觉特征联合编码[8,12]。优势:跨模态低层关联(视听同步);劣势:计算量大、需严格时间对齐[8,12]。

语义级融合(intermediate fusion):各模态先独立解析为语义元素(对象、事件),再在语义空间融合——视觉"看到杯子"与触觉"摸到杯子"在语义层合并为同一对象[8,12]。优势:语义一致性检验(跨模态印证);劣势:依赖各模态语义解析质量[8,12]。

决策级融合(late fusion):各模态独立决策后加权投票——视觉检测"前方有障碍"(置信度0.8)+激光雷达确认(置信度0.9)→融合决策"前方有障碍"(置信度0.95)[8,12]。优势:鲁棒(单模态失效仍可决策);劣势:丢失跨模态关联[8,12]。

三级融合按需组合:高可靠性场景(安全)采用"特征+语义+决策"全融合,实时场景(避障)采用决策级快速融合[8,12,17]。融合级别的选择权衡:特征级融合信息最完整但计算量大且需严格同步;决策级融合鲁棒高效但丢失跨模态关联;语义级融合居中[8,12]。融合策略的动态配置:按场景需求实时切换融合级别——安全场景(紧急避险)用决策级快速融合(毫秒响应)、复杂场景(精细操作)用特征级全融合(信息完整)[8,12,17]。多模态感知融合综述指出,融合策略的选型还需考虑传感器特性(异构程度)与任务需求(实时性/可靠性)[8,12]。多模态感知系统综述表明,融合策略应"因任务而异"——检测任务常用特征级,识别任务常用语义级,决策任务常用决策级[8,12]。

7.2 模态对齐与跨模态一致性

模态对齐将异构模态映射到统一语义空间[8,11]:对比学习(CLIP范式)将图像与文本对齐——"猫的图片"与"cat"文本在嵌入空间邻近[8,11]。对齐空间支撑跨模态检索(文字找图)、跨模态生成(图生文)与语义融合(多模态的语义元素对齐)[8,11]。

跨模态一致性检验[8,10,12]:视觉"看到杯子在桌上"与本体感觉"手在桌上方"一致→置信度提升;不一致(视觉看到杯子、触觉摸到空气)→触发主动感知(重新观测)[17]。一致性检验的工程实现:各模态的语义元素(对象/事件)经对齐嵌入映射到统一空间,计算跨模态相似度;相似度低于阈值判定冲突[8,12]。冲突处理策略:高置信模态优先(视觉置信度0.9 vs 触觉0.5→以视觉为准)、触发复核(主动感知重新观测冲突区域)、置信度衰减(冲突未解决则降权)[8,12,17]。一致性检验是多模态感知可靠性的保障[8,12]。

7.3 语义化世界状态的生成

多模态融合的最终输出是语义化世界状态[16-17]:融合的对象/关系/事件元素经场景图构建(scene graph)组织为结构化的世界状态[11-12,17]。场景图:节点为对象,边为关系(在…上、包含、靠近),附事件节点(动态变化)[11-12,17]。

世界状态的更新策略[17]:增量更新(新感知只更新变化部分)、置信度衰减(旧信息随时间降权)、冲突仲裁(新感知与旧状态冲突时的处理——高置信度新感知覆盖,否则保留旧状态待验证)[17]。状态更新的时序管理:感知事件带时间戳,状态更新时间线维护(当前状态、历史状态、预测状态)[17]。状态更新的频率控制:静态场景低频更新(减少计算)、动态场景高频更新(跟踪变化)——更新频率由"状态变化检测"驱动(无变化不更新)[17]。状态更新的溯源:每个状态元素记录来源(哪个传感器、何时感知、置信度多少)——支撑状态审计与感知纠错[17]。

7.4 感知的注意力机制

感知注意力决定"看哪里、听哪里、摸哪里"[3,17]:自底向上注意力(saliency)——显著刺激(运动、颜色对比、异常声)自动吸引感知资源[3,17];自顶向下注意力(task-driven)——认知需求指定关注目标("找钥匙"→聚焦桌面)[17];预测误差注意力——预测误差大的区域优先感知(预测编码的注意实现)[3,17]。

感知注意力的工程实现:视觉(区域裁剪/目标候选优先处理)、听觉(波束成形指向声源)、触觉(重点区域高采样率)[15,17]。注意力分配与预测编码的协同:预测误差大的区域自动获得高注意配额(“意外吸引注意”)[3,17]。注意力的资源预算:感知总算力按任务重要性在通道间分配——任务关键通道获得更多算力(高分辨率、高帧率)[17]。注意力的动态调度:感知资源按"当前任务+显著刺激+预测误差"三维评分分配——任务相关目标优先、显著刺激抢占、预测误差大的区域获得额外处理[3,17]。注意力分配的量化:各感知区域的算力配额(处理帧率、分辨率、模型规模)[17]。

7.5 感知鲁棒性与主动感知

感知鲁棒性设计[8,12,17]:传感器冗余(多传感器互为备份)、故障检测(异常感知输出的识别)、退化模式(传感器失效时的感知降级——视觉失效依赖激光雷达与触觉)[8,12,17]。鲁棒性验证:压力测试(恶劣光照、噪声、遮挡、传感器部分失效)下评估感知性能保持率(第9章评估维度)[8,12]。鲁棒性设计的目标:任何单点传感器失效都不导致感知崩溃——“感知永不单点故障”[8,12,17]。

主动感知(active perception)[10,16-17]:感知不确定性高时主动获取信息——移动视角(转动云台)、靠近观察(移动身体)、触觉探查(伸手触摸)[10,17]。主动感知的决策:感知不确定性(第3章)超过阈值时,感知理解子网经GWS向小脑/肢体层发送"感知动作请求"(转向、移动、触摸)[16-17]。主动感知的信息增益评估:候选感知动作的预期信息增益(不确定性降低量)——选择信息增益最大的动作(信息最大化原则)[10,17]。主动感知使感知从"被动接收"走向"主动探索",与"多感官智能"(multisensory intelligence)的研究方向一致[10]。主动感知将"被动接收"变为"主动采样",显著提升感知质量[10,17]。

7.6 感知的进化学习

感知理解子网具备进化学习能力[17]:在线适应——部署中感知误差驱动模型参数微调(适应新环境、新物体);增量学习——新类别/新场景的持续学习(类别增量:只学新类别不遗忘旧类别);经验沉淀——感知经验写入记忆系统,供后续感知复用(经验感知,见第8章)[17]。进化学习的约束:行为一致性校验(进化后感知不退化——新旧模型在标准测试集上的对比)[17]。

7.7 感知的安全与隐私

感知安全与隐私设计[17-18]:感知数据安全——摄像头/麦克风数据含敏感信息(人脸、语音、家庭场景),需加密存储与访问控制[18];感知滥用防护——感知能力不得用于非法监控(感知权限分级)[18];感知故障安全——感知失效时的系统降级(依赖冗余传感器、安全停靠)[17-18]。安全与隐私约束经L5生存层与L6社会层注入感知理解子网[18]。

8 感知-认知耦合

8.1 感知理解子网与四子网的接口

感知理解子网是大脑五子网的"输入门户",其输出经GWS广播给其余子网[16-17]:感知消息的格式设计——PerceptionState = {objects, relations, events, timestamp, confidence},统一携带时间戳与置信度,保证下游子网可评估感知可靠性[17]。

与世界模型子网:感知输出当前状态StS_tSt(世界模型的推演输入);世界模型的预测先验hatSt+1\\\\hat{S}_{t+1}hatSt+1反向调制感知(预测编码)[3-4,17]。

与认知推理子网:感知输出提供决策所需的情境信息(“桌上有杯子、水壶”);认知需求反向指定感知任务("找杯子"→感知聚焦)[17]。感知-认知的语义对齐:感知输出的世界状态与认知推理的决策输入使用同一"对象-关系-事件"语义——认知推理可直接引用感知结果(“拿{对象:杯子},它在{位置:桌上}”)[17]。语义一致性的价值:消除"感知-认知"的表示转换损耗(感知输出无需翻译即可被推理引用)、支持语义级推理(“杯子在桌上”+“桌在厨房"→"杯子在厨房”)[17]。

与情感评估子网:感知输出提供情感评估的刺激信息("看到危险的画面"→触发恐惧评估)[17,20]。

与反思机制:感知的不确定性供反思评估(“感知置信度低→决策需谨慎”);反思发现感知错误(“误把影子当人”)→触发感知校准[17]。

表2给出感知理解子网与四子网的接口消息。

表2 感知理解子网与四子网的接口

目标子网感知输出感知输入
世界模型 当前状态StS_tSt(对象/关系/事件) 预测先验hatSt+1\\\\hat{S}_{t+1}hatSt+1(调制感知)
认知推理 情境信息、对象位置 感知任务指令(找什么/关注什么)
情感评估 刺激事件(场景/危险/愉悦) 情感状态(调制注意偏向)
反思机制 感知置信度、不确定性 感知校准指令、纠错反馈

8.2 感知-世界模型闭环

感知与世界模型的闭环是"依托世界模型"设计的核心[4,16-17]:

预测调制感知:世界模型预测"下一时刻视野中应出现什么"→感知在预测区域精加工[3,17]。实现的细节:世界模型的预测状态S^t+1\\hat{S}_{t+1}S^t+1经"状态到传感器"投影(渲染器)生成预期感知图(expected percept);感知流水线将实际输入与预期感知逐区域比较,仅对差异区域(预测误差区域)启动深度处理[3,17]。这一机制对应预测编码的"只处理意外"原则——显著降低感知算力[3,17]。实现:预测状态hatSt+1\\\\hat{S}_{t+1}hatSt+1投影到传感器空间,生成"预期感知";感知将实际输入与预期比较,仅对差异区域深入处理[3,17]。

感知更新预测:感知验证/修正世界模型的预测——预测正确则预测置信度提升(世界模型可信),预测错误则误差回传(世界模型参数更新)[4,17]。误差回传的两种模式:在线微调(预测误差驱动世界模型参数的在线更新,适应环境变化)与离线重训(积累的误差数据定期重训)[4,17]。感知-预测的一致性度量:感知状态与世界模型预测状态的匹配度(对象重合率、状态转移符合度)[17]。

闭环的工程价值:感知效率(只处理意外,降低算力)、感知鲁棒(预测补全遮挡/缺失输入)、世界模型进化(感知误差驱动更新)[3-4,17]。该闭环与"世界模型=AI的慢思考"研究视角一致:世界模型的预测先验使感知从"反应式"走向"预期式"——感知不再是"看到才信",而是"预期+验证"[23]。感知-预测闭环的成熟度指标:预测误差率(预期与实际的差异)、预测对感知的加速比(预测调制后的感知耗时降低)[17]。

8.3 感知-认知协同

感知与认知推理的协同体现为"感知引导认知、认知引导感知"[16-17]:

感知引导认知:感知输出的世界状态是认知推理的输入情境——“感知到障碍物→认知规划绕行路径”[17]。

认知引导感知:认知需求下发感知任务——“要拿杯子→感知聚焦杯子的位置与把手朝向”[17]。认知引导使感知资源聚焦于任务相关区域,提升感知效率[17]。

快慢感知路径[17,21]:System 1快速感知路径——低层特征直连决策(障碍物突现→紧急避障,毫秒级);System 2深度感知路径——完整语义解析(场景理解→任务规划,秒级)[17,21]。快慢路径的切换:感知任务指令携带时限要求——紧急指令走System 1(快速、低层、小模型),常规指令走System 2(完整、高层、大模型)[17,21]。两条路径并行:System 1持续监控(异常检测),System 2按需启动(任务相关)——“随时警觉,按需深思”[17,21]。

8.4 感知-情感耦合

感知与情感的耦合体现在双向调制[17,20]:

情感调制感知:情感状态影响感知处理——恐惧放大威胁解读(模糊刺激偏向敌意)、愉悦扩大注意范围[20]。实现:情感状态作为感知分类的条件上下文(情感先验注入)[17,20]。

感知触发情感:感知到的刺激事件触发情感评估——"看到亲人"→喜、"听到警报"→恐惧[20]。实现:感知事件经GWS广播给情感评估子网[17,20]。

感知-情感-行动的快速回路:感知危险刺激→情感快速评估(恐惧)→生存层触发回避行动(不经深度认知)——“感觉不对就躲开”[17,20-21]。该回路的工程实现:感知的低层特征(如突然靠近的物体)直连生存层的紧急响应模块(不经感知语义解析与认知推理),响应延迟控制在毫秒级[17,21]。情感子网在回路中提供"情感标记"(危险刺激的恐惧标签),加速生存层判定[20-21]。

8.5 感知-反思耦合

反思机制监控感知质量[17]:感知置信度审计(低置信度输出是否被过度信任)、感知偏差检测(系统性感知错误——“总是把阴影当障碍”)、感知校准(偏差检测后触发感知模型更新)[17]。

反思与感知的交互流程:反思检测到感知异常(置信度持续低/与预期持续不符)→触发主动感知(重新观测)或感知模型校准→感知质量恢复→反思记录校准日志[17]。反思-感知的协同价值:防止感知的"自欺"(系统误以为感知正确)——反思以预测一致性、记忆一致性为标尺,独立审计感知质量[17]。

8.6 感知-记忆耦合

感知与记忆系统的耦合[16-17]:感知输出写入情景记忆(“感知到的场景”);记忆先验调制感知(熟悉场景加速识别——“来过这个房间”)[17];感知-记忆的一致性检验(感知场景与记忆场景的匹配——异常检测:“这个房间的布置变了”)[17]。

感知-记忆耦合使感知理解子网具备"经验感知"能力:熟悉的场景感知更快、更准,感知经验随记忆积累而成熟[17]。经验感知的实现:情景记忆存储"场景-感知结果"配对;感知时先检索记忆中的相似场景,以记忆结果为感知先验(加速识别);新场景则完整感知并写入记忆[17]。经验感知的量化收益:熟悉场景的感知耗时降低(对比实验测量)、识别准确率提升(记忆先验补全)[17]。经验感知的边界:记忆先验可能造成"预期偏差"(用旧经验解释新场景)——反思机制监控经验先验的适用性[17]。

8.7 感知与生存层的衔接

感知与生存层(L5)的衔接体现为安全感知通道[17-18]:危险感知的快速通道——感知的低层特征直连生存层(突然接近的物体、警报声、烟雾)触发紧急响应,不经深度语义解析[17-18];感知的安全降级——感知故障时生存层触发安全模式(减速、停靠、请求人类协助)[17-18];感知的安全边界——感知能力受生存层约束(不感知受限区域、不采集敏感数据)[18]。

9 评估与应用

9.1 感知质量五维评估体系

感知理解子网的评估需覆盖感知全链路,本文提出五维评估体系[8,12,17]:五维覆盖"通道-状态-校准-鲁棒-贡献"完整链路——感知精度衡量"看得准不准"、状态完整性衡量"建得全不全"、不确定性校准衡量"信得对不对"、鲁棒性衡量"扛得住不住"、认知贡献衡量"用得值不值"[8,12,17]。评估的实施周期:开发期(基准数据集迭代评测)、部署期(真实场景持续监控)、进化期(升级后回归测试)[8,12,17]。

感知精度:各通道识别任务的准确率——目标检测(mAP)、语义分割(mIoU)、语音识别(WER)、材质识别(准确率)[2,11,13,15]。精度的分场景评估:标准数据集评测(实验室条件)+真实场景评测(部署条件)——真实场景的精度才是有效指标[11,17]。基准数据集的选择:视觉(COCO、ADE20K)、语音(LibriSpeech、AudioSet)、触觉(触觉图像数据集)[11,15,17]。

状态完整性:世界状态对真实场景的覆盖度——漏检率(漏掉的对象/事件比例)、状态更新及时性[17]。完整性的评估方法:以人工标注的场景真值(ground truth)为基准,对比世界状态的对象/关系/事件覆盖率[17]。完整性与精度的权衡:提高完整性(检测更多对象)可能引入误检(精度下降)——评估时综合F1指标[17]。

不确定性校准:置信度与真实准确率的一致性——校准误差(ECE):高置信度输出是否真的高准确[12,17]。校准评估的工程实现:置信度分箱(将输出按置信度分10箱,统计每箱的实际准确率),绘制校准曲线,计算ECE(期望校准误差)[12,17]。校准不良的后果:过自信(高置信度低准确)导致下游决策盲目信任感知——反思机制需监控[12,17]。

鲁棒性:恶劣条件下的感知退化程度——光照变化、噪声环境、传感器部分失效时的性能保持[8,12]。鲁棒性评估的测试矩阵:光照(正常/弱光/逆光)、噪声(安静/嘈杂)、遮挡(无/部分/严重)、传感器失效(单/多通道)——测试矩阵各条件下的性能保持率[8,12,17]。

认知贡献:感知对下游任务的价值——感知结果对世界模型推演精度、认知决策质量的提升[17]。认知贡献的评估方法:对照实验(有/无感知模块的世界模型推演精度对比;感知质量提升对任务成功率的影响)[17]。认知贡献是感知评估的"终极指标"——感知的价值最终体现在对认知任务的支撑[17]。

表3给出五维评估的指标与测度方法。

表3 感知质量五维评估体系

维度指标测度方法
感知精度 mAP、mIoU、WER 标准数据集评测
状态完整性 漏检率、更新延迟 场景状态对比
不确定性校准 ECE、置信度-准确率曲线 校准分析
鲁棒性 性能保持率 恶劣条件压力测试
认知贡献 下游任务增益 有/无感知模块对照

9.2 应用场景

感知理解子网的应用场景覆盖类脑大模型的各个落地方向[16-19]:应用选型的原则——按场景的感知需求配置通道与融合级别:简单场景(单一视觉通道+决策级融合)、复杂场景(多通道+全融合)[17]。

具身机器人:多模态感知支撑抓取、导航与人机交互——视觉识别物体、触觉感知接触、本体感知位姿[7,9,19]。具身场景的感知挑战:动态环境(物体移动)、非结构化(物体随意摆放)、接触丰富(抓取时的多模态反馈)[7,9,19]。产业层面,中国信通院将"多模态感知融合"列为人工智能产业的关键技术方向[26];具身智能技术发展报告亦指出,感知(多模态融合)是具身智能"大脑层"的核心能力[19,26]。IROS研究已展示相关进展:基于学习的抓取控制器结合触觉反馈实现未知物体稳定抓取[19];视觉触觉智能实现精细操作[7,9]。

智能驾驶:多传感器融合感知(摄像头+激光雷达+毫米波)构建驾驶环境状态——目标检测、车道识别、交通信号感知[13,17]。

服务机器人:场景理解支撑服务任务——"客厅里有沙发、茶几、电视"的世界状态供任务规划[17,19]。

数字人与社交:人脸识别、表情感知、语音情感感知支撑社交交互[15,20]。社交场景的感知需求:人脸识别(区分个体)、表情理解(判断情绪)、视线追踪(判断注意力)、语音情感(判断语气)[15,20]。社交感知的输出映射为世界状态的社会元素:{个体身份, 情感状态, 注意力状态}[17,20]。

9.3 与既有方案的对比

表4给出感知理解子网与既有感知方案的对比[5-6,8-12,17]。

表4 感知理解子网与既有方案对比

维度多模态LLMVLA模型传统感知系统本文感知理解子网
感知目标 生成描述 生成动作 检测识别 构建世界状态
输出表征 文本token 动作token 检测框/标签 对象-关系-事件
预测机制 预测编码闭环
认知耦合 四子网双向耦合
不确定性 部分 三层建模

多模态LLM强于"描述",VLA强于"动作",传统感知强于"检测",本文感知理解子网以"构建世界状态"为目标,兼具语义化表征、预测编码与认知耦合[5-6,8-12,17]。对比的启示:各方案解决不同层面的问题——多模态LLM解决"人机对话中的感知"、VLA解决"感知到动作的映射"、传统感知解决"检测识别"、本文感知理解子网解决"感知到世界状态的构建"——四者可共存(VLA可作为感知理解子网与动作之间的快捷通道)[5-6,17]。共存架构的示例:感知理解子网构建世界状态→认知推理决策意图→VLA将意图映射为动作→小脑执行——各层各司其职,形成"感知-认知-行动"的完整链路[5-6,16-17]。

9.4 挑战与展望

挑战1:感知数据的稀缺——多模态标注数据(尤其触觉)成本高昂[7,9]。缓解:仿真感知(虚拟环境合成感知数据)、自监督学习[7,9,17]。

挑战2:实时性——四级流水线的计算延迟。缓解:按需处理深度(紧急路径低层输出)、模型轻量化、边缘算力[17]。实时性预算:紧急感知路径<50 ms(避障)、常规感知路径<500 ms(场景更新)、深度感知路径<5 s(情境理解)——各路径的延迟预算需在架构设计时分配[17]。

挑战3:长尾场景——罕见场景(极端天气、异常物体)的感知退化。缓解:数据飞轮(部署中持续采集)、异常检测与主动感知[8,12,17]。长尾场景的工程策略:仿真合成(生成极端条件数据)、主动采集(部署中遇到长尾场景自动记录上报)、持续学习(积累的长尾数据增量训练)[8,12,17]。

挑战4:感知-认知的过度耦合——认知偏见污染感知(预期影响观测)。缓解:反思机制监控感知偏差[17]。挑战5:感知数据的隐私与伦理——多模态感知采集敏感信息(人脸、语音、家庭场景)。缓解:感知权限分级、数据本地处理(不上云)、“被遗忘权”(用户可要求删除感知数据)[17-18]。

展望1:感知-世界模型端到端联合训练——感知模型与世界模型共享表征空间,联合优化"感知误差+预测误差"[4,17]。联合训练的预期收益:感知表征与世界模型推演的一致性(感知输出的状态"正是"世界模型期望的状态)、感知鲁棒性提升(预测先验辅助感知)、世界模型进化加速(感知误差直接驱动)[4,17]。

展望2:主动感知的深化——感知不仅是"看",更是"探索"——好奇驱动(信息增益最大化)的主动感知[10,17]。好奇驱动的工程化:以"信息增益最大化"为感知动作选择准则(选择不确定性降低最多的观测动作)[10,17];好奇的边界——探索与利用的平衡(探索新场景 vs 利用已知场景)[10,17]。

展望3:触觉的规模化应用——低成本触觉传感器与仿真触觉数据的发展,使触觉从"实验室"走向"规模化"[7,9]。

展望4:感知与脑机接口的衔接——神经信号解码作为感知通道的扩展(脑机接口提供的意图信号进入感知理解子网)[16,19]。脑机接口研究已展示运动意图解码(运动皮层信号→动作意图)与感知反馈(触觉刺激→感觉皮层)的双向通路[19];感知理解子网可将神经解码结果作为"内感受扩展通道",也可将感知结果经神经刺激反馈给人类(感知增强)[16,19]。

9.5 感知理解子网与LOPD七层的完整映射

感知理解子网在LOPD七层中的完整映射[16-18]:L1物理层——传感器阵列(摄像头、麦克风、触觉阵列、IMU)提供物理信号;L2肢体层——传感器的安装与驱动(云台转动、头部移动支撑主动感知)[16];L3感知门户——信号的通道组织(视觉流、听觉流、触觉流、本体流)[16];L4神经层——感知理解子网本体(通道处理、融合、语义化)[17];L5生存层——感知的安全约束(危险感知的快速通道、感知故障的安全降级)[18];L6社会层——社会感知(人脸识别、表情理解、社会场景解读)[18,20];L7文明层——文化感知(文化符号识别、礼仪场景理解)[18]。七层映射的意义:感知理解子网不是孤立的"视觉系统",而是贯穿L1-L7的感知认知子系统——底层传感器、中层处理、上层约束(安全/社会/文化)共同塑造感知行为[16-18]。

10 结论

本文基于面向逻辑思维的程序设计方法(LOPD)七层认知分析层次模型,提出依托世界模型的类脑大模型感知理解子网初步设计。主要结论如下:

(1)感知理解子网以"构建世界状态而非生成描述"为设计宗旨,输出"对象-关系-事件"三元语义的结构化世界状态,与世界模型的状态空间直接对接[16-17]。这一设计宗旨使感知从"语言描述"走向"状态构建",是类脑大模型从"语言智能"走向"物理世界智能"的感知侧基石[4,16-17]。感知理解子网的初步设计虽以架构方法论为主,各项量化参数(置信度阈值、融合权重、更新频率)均有待原型验证与实测校准——这是"初步设计"的定位所在[17]。

(2)以感知门户(L3)为组织骨架,设计视觉、听觉、触觉与内感四大感知通道,各通道经"特征提取→语义解析→情境理解"三级处理流水线,覆盖从物理信号到语义状态的全链路[16-17]。通道设计兼顾完备性(覆盖LOPD感知门户的全部通道)与工程可行性(优先实现高价值通道——视觉、听觉、触觉)[16-17]。

(3)多模态融合采用"特征级+语义级+决策级"三级架构,以三层不确定性建模(感知/模型/情境)保证感知鲁棒性[8-12,17]。

(4)感知-世界模型闭环(预测编码机制)使感知从"被动接收"走向"预测检验"——预测调制感知、感知更新预测,二者协同进化[3-4,17]。该闭环是"依托世界模型"设计的感知侧实现:感知不再孤立工作,而是与世界模型构成"感知-预测-验证"的持续循环[4,17]。

(5)感知-认知耦合设计(与世界模型、认知推理、情感评估、反思机制的双向接口)使感知理解子网成为大脑五子网的"输入门户"[16-17]。耦合的完备性:感知输出覆盖下游全部需求(世界模型的状态输入、认知推理的情境输入、情感评估的刺激输入、反思的置信度输入)[16-17]。耦合的工程保障:接口消息的版本管理(感知状态格式的演进不破坏下游兼容)、接口延迟预算(感知输出到下游消费的延迟上限)[17]。

(6)感知质量五维评估体系(精度/完整性/校准/鲁棒性/认知贡献)为感知理解子网的量化评估提供框架[8,12,17]。五维评估的实施:开发期在基准数据集(COCO、LibriSpeech、触觉数据集)迭代评测,部署期在真实场景持续监控,进化期在升级后回归测试——形成"开发-部署-进化"的评估闭环[8,12,15,17]。

感知理解子网的设计要点总结:其一,以"对象-关系-事件"三元语义为统一输出,与世界模型、认知推理共享同一状态空间,消除表示转换损耗[16-17];其二,以预测编码为工作机制,感知从"被动接收"走向"预测检验",显著提升感知效率与鲁棒性[3,17];其三,以多模态融合为能力基础,视觉、听觉、触觉、内感四通道协同,覆盖从"看见"到"摸到"的完整感知谱系[7-10,16-17];其四,以不确定性建模为诚实保障,感知输出携带置信度,下游决策不盲目信任感知[12,17]。

本文作为"初步设计",与《类脑大模型大脑部分初步设计》《类脑大模型小脑部分初步设计》《类脑大模型情感子网设计》共同构成类脑大模型"感知-认知-情感-执行"的完整蓝图[16-17,20]:感知理解子网为大脑提供世界状态(“看见”)、认知推理子网提供决策(“思考”)、情感评估子网提供价值(“感受”)、小脑部分提供执行(“行动”)——四者经GWS协同,构成类脑大模型完整的"感知-认知-情感-行动"闭环[16-17,20]。感知理解子网作为这一闭环的起点,其质量直接决定下游各子网的输入质量——“感知不清,认知不明”[16-17]。感知质量的保障机制:五维评估的持续监控(部署中感知质量指标实时上报)、感知故障的快速检测(质量指标异常触发诊断)、感知进化的版本管理(升级可回滚)[17]。未来工作包括:感知理解子网的原型实现与多模态感知数据建设、感知-世界模型联合训练、主动感知与触觉规模化的工程验证。感知是智能的起点——类脑大模型从"语言感知"走向"世界感知",是通向物理世界智能的第一步[4,16-17]。这一转变的深远意义:当大模型能"看见"世界、“听懂"声音、“触摸"物体,并以结构化的世界状态参与推演与决策,它就不再是"语言接口层"的符号处理器,而是"物理世界认知系统"的感知底座[4,16-17]。本文以感知门户为骨架、以"对象-关系-事件"三元语义为表征、以预测编码为机制、以世界模型为预测先验,为感知理解子网提供了可计算、可评估、可演进的架构蓝图[16-17]。后续将在原型实现、多模态数据建设与主动感知验证中持续推进[7,9,17]。工程化的优先级建议:先实现"视觉+本体"双通道(覆盖大部分场景的感知需求)、再扩展"听觉+触觉”(语言交互与精细操作)、最后完善"内感受+主动感知”(生理监控与探索行为)——分阶段建设,边建设边验证[7,9,16-17]。


参考文献

[1] Vaswani A, et al. Attention is all you need[C]//NeurIPS. 2017.
[2] Dosovitskiy A, et al. An image is worth 16×16 words: Transformers for image recognition at scale[C]//ICLR. 2021.
[3] Rao R P N, Ballard D H. Predictive coding in the visual cortex[J]. Nature Neuroscience, 1999, 2(1): 79-87.
[4] LeCun Y. A path towards autonomous machine intelligence[R]. 2022.
[5] 张慧, 梁姝彤, 李明轩, 等. 视觉-语言-动作模型综述: 从前史到前沿[J]. 自动化学报, 2025.
[6] 面向具身操作的视觉语言动作模型综述[J]. 自动化学报, 2025.
[7] 面向复杂环境的机器人触觉感知算法研究综述[J]. 智能系统学报, 2026, 21(4): 834-848.
[8] A survey of multi-sensor fusion perception for embodied AI: Background, methods, challenges and prospects[J]. arXiv preprint arXiv:2506.19769, 2025.
[9] Tactile-based multimodal fusion in embodied intelligence: A survey of vision, language, and contact-driven paradigms[J]. arXiv preprint arXiv:2605.17336, 2026.
[10] A vision for multisensory intelligence: Sensing, science, and synergy[J]. arXiv preprint arXiv:2601.04563, 2026.
[11] Transformers for vision: A survey on innovative methods for computer vision[J]. IEEE Access, 2025.
[12] Multimodal perception-driven decision-making for human-robot interaction: A survey[J]. Frontiers in Robotics and AI, 2025, 12: 1604472.
[13] The evolution of object detection from CNNs to transformers and multi-modal fusion[J]. Scientific Reports, 2026.
[14] 潘家辉, 何志鹏, 李自娜, 等. 多模态情绪识别研究综述[J]. 智能系统学报, 2020, 15(4): 633-645.
[15] 维度语音情感识别研究综述[J]. 软件学报, 2020, 31(8).
[16] 冯胤清. 面向逻辑思维的程序设计方法——脑的设计(双脑架构)[J]. 2026.
[17] 冯胤清. 面向逻辑思维的程序设计方法——类脑大模型大脑部分初步设计[J]. 2026.
[18] 冯胤清. 面向逻辑思维的类人机器人程序设计架构: 七层认知层次模型与社会化测试框架[R]. 2026.
[19] 冯胤清. 面向逻辑思维的程序设计方法——分析现阶段具身机器人[J]. 2026.
[20] 冯胤清. 面向逻辑思维的程序设计方法——类脑大模型情感子网设计[J]. 2026.
[21] Kahneman D. Thinking, fast and slow[M]. New York: Farrar, Straus and Giroux, 2011.
[22] 世界大模型的理论基础[R]. 2026.
[23] 世界模型: AI的"慢思考"进化[EB/OL]. 2025.
[24] BriLLM: Brain-inspired large language model[J]. arXiv preprint arXiv:2503.11299, 2025.
[25] 李飞飞. 系统阐述"世界模型"功能分类学[EB/OL]. 2025.
[26] 中国信通院. 2025人工智能产业十大关键词[R]. 2025.

赞(0)
未经允许不得转载:网硕互联帮助中心 » 面向逻辑思维的程序设计方法——依托世界模型的类脑大模型感知理解子网设计
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!