你直觉猜的三个底层技术——RAG、MCP、地理数据训练——都对,但只占底下一半。把 GeoGPT、超图 AgentX、莫干·玄衍、高德 ABot-Earth 这批应用拆开,底下其实是五层:数据层(地理数据怎么喂)、模型层(GeoFM 怎么训)、能力层(RAG/MCP/算子怎么接)、Agent 层(怎么编排干活)、应用层(你看到的产品)。
这篇回答你那个更底层的问题:这些 Geo+AI 应用,底下到底用了哪些技术。
一张五层技术栈图
先把分层摆出来,你再对照自己手里的应用,看它卡在哪一层:

一句话点评:越往上越值钱(产品形态),越往下越吃资源(预训练成本),而 2026 年的分水岭在能力层和 Agent 层——RAG 让模型会「想」空间、MCP 让模型会「调」空间工具。 下面逐层拆。
地理数据训练:GeoFM 预训练,已经范式转移
先答你最直接的猜测:地理数据训练——是,而且这一层已经完成一次范式转移。
2026 年 7 月一篇综述(arXiv 2607.12177)把这个范式叫「预训练职责分离」:大规模模型提供商承担计算密集的预训练,领域专家拿一小片标注数据微调就行,不用从头训。好处很直接——微调要的标注比从头训练少一个数量级,保密场景还能本地部署。
预训练本身走两条路:
- 掩码自编码(MAE):把图像块盖住再重建,学通用表征。一脉是 SatMAE(斯坦福,给时间/光谱位置编码)、ScaleMAE(尺度感知位置编码)、Cross-Scale MAE;量级大的有 Prithvi-EO-2.0(IBM/NASA,30m 全球 HLS 影像)、Clay(多传感器、分辨率和波段都能吃)、TerraMind(生成式)。
- 视觉-语言对比:最大化图像和文本嵌入的相似度,建联合嵌入空间,换来零样本开放词汇——没显式训练过的类别也能认。这是 GeoVLM、OlmoEarth 那类多模态模型的底座。
DeepMind 的 AlphaEarth Foundations 则是第三种混合:重建、自蒸馏、文本对比三路损失一起上,吃光学/雷达/LiDAR/文本/气候数据,输出时间连续的「嵌入场」。
训练数据来源很集中:Sentinel-1/2、Landsat 8/9、NAIP 航拍、DEM、土地利用覆盖,加全球尺度的 HLS。另外发现(Meta 的 DINOv3):在数十亿张自然图像上预训练的模型,只要规模够大,能泛化到 0.6m 卫星影像的俯视视角,性能超过不少领域专用模型。
但别急着选型。GEO-Bench-2(2026 年 2 月,19 个数据集、分类/分割/回归/检测全覆盖)的结论很冷静:没有任何模型在所有任务上占主导。做农业/灾害等多光谱应用的,EO 专用模型(TerraMind/Prithvi/Clay)更强;高分辨率任务的,自然图像预训练的反而赢。选哪个,得拿你自己的数据实测。
国产这条线的训练实例我也帮你对上了:GeoGPT(之江实验室)三阶段训——持续预训练(CPT,从 Common Crawl 抽地学语料,约 140B token 建基础地质知识)→ 多阶段监督微调 → 偏好学习对齐;莫干·玄衍用亿级多模态数据样本训出准千亿参数。结论:这一层别自己训,用开源的(Prithvi/Clay/OlmoEarth)或行业底座(莫干·玄衍),微调是你的活。
位置嵌入:坐标升级成「地点指纹」
地理数据训练里有一支容易被漏掉,但它正在变成一层独立技术:位置嵌入(location embeddings)。Esri 在 2026 年 7 月用户大会上正式把它并进 ArcGIS 的地理空间基础模型三件套里,当一种新的 GIS 数据类型对待。
逻辑很朴素:经纬度坐标只告诉你「在哪儿」,不告诉你「这是个什么地方」。Esri 的 Location Encoder 把地点编码成捕捉自然环境、建成区形态、社会经济背景的嵌入向量——每个地点一个「指纹」,环境相似的地点指纹相似,哪怕隔着半个地球。
两个版本:自然环境嵌入用 Sentinel-2 影像训练,统计嵌入基于美国普查/ACS/住房/环境数据训练(GDFM 更进一步,多视图自编码器把四类数据集揉成 5000+ 变量的地点刻画)。落地效果是直观的:以索诺兰沙漠为查询,能跨洲匹配出智利阿塔卡马沙漠这种「环境相似而非地理邻近」的区域;无监督聚类画出的簇和真实大型景观带高度吻合,不按行政边界走。
判断:位置嵌入是把地理信息变成向量、喂给机器学习的那座桥,2026 年刚到 Beta 但方向明确。 它和 065 里说的「embeddings 作为新 GIS 数据类型」是同一件事。

空间 RAG:不是聊天兜底,是拓扑空间推理
你的第二个猜测——RAG——是,但空间领域里它不是聊天兜底,是让 LLM 学会「空间推理」。
普通 RAG 检索的是文本相关,空间 RAG 检索的是空间关系,这是完全不同的难题。2026 年 2 月发表于 ACM TSAS 的 SpaRAGraph 是这条路的代表:先把空间数据经 SpaTex 转成 RDF 图,建图索引,推理时用图遍历加空间关系组合矩阵,只预计算最小子集的空间关系、其余靠组合推导。在 SRB 基准(三类真实世界合成数据集)上,不同 LLM 的 F1 平均提高 36 个百分点,响应时间几乎无感。
同门兄弟 Spatial-RAG(ACL 2026 Findings)走混合检索:稀疏空间过滤(空间索引)加密集语义匹配(嵌入),把问答建模成空间相关性和语义相关性的多目标优化,挑 Pareto 最优候选。Spatial-Agent 更进一步,把「哪条河在哪个城市东边」这类问题形式化成 GeoFlow Graphs(有向无环图,节点是空间概念、边是转换),生成可执行的地理空间工作流,比 ReAct/Reflexion 显著更强、还可解释。
产业里也已经接上了:超图 AgentX 用 RAG+GraphRAG 提升 GIS 工具调用的准确率;GeoGPT 自带 RAG 增强阅读器,能从论文和地图里检索再回答。
判断:空间 RAG 是「让 LLM 想清楚空间关系」的关键,2026 年从论文往平台里长。 纯文本 RAG 解决不了「相邻」「包含」「穿过」这些拓扑问题,这是空间 RAG 存在的理由。

MCP:把 GIS 能力开放给 AI 调用
你的第三个猜测——MCP——是,而且是这条栈里国产和海外走法最不一样的一层。
Esri 在 2026 年 6 月 29 日给 ArcGIS Location Platform 加了 MCP 支持(Beta):外部 AI Agent 能通过标准协议调用地理编码、路径规划、高程解析、静态地图这些云端轻量服务,还能在单次对话里串联多个服务(「找到最近的仓库并给出路线」)。这是 Esri UC 2026「Agentic GIS」战略的一部分——但行业分析看得很清楚,Esri 走的是「助手优先」:AI 被接进 ArcGIS 体系,却没拿到重构核心系统的权限,工程文件、桌面核心工作流不对外开放。
国产这边激进得多。超图 SuperMap GIS 2026 的 AgentX Server 集成 500 余项工具,原生支持 MCP 和 Function Calling,还适配 DeepSeek-R1、通义千问、Qwen2.5;桌面 AgentX 走「智能体完成任务」替代「人找工具」,内置专业 Skills 技能库和 GIS 专家库;ClientX 更直接——一套 API 统一二三维能力,适配 AgentX、Trae、CodeX、Claude Code 这些 AI 环境。社区也出了 arcpy-mcp-server,把 ArcGIS Pro 1300+ 个工具(15 个模块)全量 MCP 化,Claude Code、Codex 直接就能使唤 ArcGIS。
判断:MCP 是「GIS 给 AI 递工具」的标准姿势,2026 年两端都开放了。 差异在开放度:Esri 只开云端轻量服务,超图把全套工具交出来。你接谁的,取决于你想要「助手」还是「自主智能体」。

Agent 编排:从「助手」到「自主规划」
能力层之上是 Agent 层——模型拿到工具之后,怎么编排干活。这是 2026 年学术和产业共同的终点范式,综述里叫 Agentic Geospatial Reasoning:LLM 当编排器,把 GeoFM 当工具,用自然语言响应高层查询、自动化复杂分析工作流。
产业里的形态已经分层。超图 AgentX 三类模式对应不同可靠度需求:工作流模式(确定性最高,标准化业务)、长规划模式(自主规划+受控执行平衡,复杂选址)、循环推理模式(边探索边响应)。SuperMap Copilot 直接对话调用 100+ 行业分析算子,平均 5 秒完成深度思考,任务成功率 80%+。莫干·玄衍的八大能力里明确带着「任务编排与工具调度」,配合「时空专业技能库」,是「地理空间大模型+技能库」的组合打法。GeoGPT 给的是 Agent Builder——科学工作者可以自定义数百个科学智能体。
判断:Agent 编排决定应用是「问答机」还是「能干活的」,三模式/技能库/Agent Builder 是三种落地封装。 你要可靠性选工作流模式,要探索选循环推理,要开放性用 Agent Builder。

视觉语言模型与生成式空间模型:VLM / 3DGS / 影像生成
上面五层里有三块你没问但实际在用的,补上。
视觉语言模型(模型层):把自然语言和空间视觉对齐的那层。GeoVLM(Esri)用自然语言提示「Segment roads」就能提要素;GeoGPT 的 MapChat 拖入地质图、遥感资料,数秒完成解析、关联、推理;莫干·玄衍是多模态一体。这一层让「用嘴指挥空间操作」成为可能。
3DGS 生成(能力层):空间世界的生成侧,我在 066 那篇拆过它的工具链。落到 Geo+AI 应用上:高德 ABot-Earth0.5 用 3DGS 直接训练 3D 城市世界模型,Voxelmaps 用 3DGS+Cosmos Reason 2 做圣何塞数字孪生的自然语言查询,莫干·玄衍 V1.5 用生成式 3DGS 融合建模——几张照片几分钟重建单体建筑,数据量降 90%、效率提 10 倍。这一层是「空间数据训练」和「空间生成」的接缝,也是 2026 年最陡峭的新曲线。
影像生成(能力层):你说的「造影像数据」就是这一支——用生成模型合成遥感影像,专治标注稀缺。单个 OpenEarthMap 分割瓦片平均要人工标注 2.5 小时,合成数据成了补数据缺口的关键手段。2026 年的代表模型一水儿是扩散模型:DiffusionSat 是第一个大规模卫星影像生成基础模型;EarthSynth 用反事实组合训练加规则过滤,只挑「有用」的合成数据喂给分类/检测/分割,开放词汇理解显著提升;TerraDiT-Ω(ECCV 2026)让任意地理基元(多边形/折线/框/点)控制生成——你给一块特定形状的区域,它按这个形状造出影像;COP-GEN 跨模态合成,SAR 输入直接生成光学影像,还能补云洞、做模态补全;Text2Earth 是 13 亿参数的扩散基础模型。成熟度判断:2026 年的重心已经从「生成逼真影像」转向「精细空间可控生成 + 下游任务验证」——Text2AIRS 用这类合成数据把 Fair1M 飞机检测抬了 6.12 个百分点。它能当训练数据的补充,但还没到完全替代真实影像的程度。

同一个应用,五层各用什么
拿最常见的「自然语言问 GIS 一个问题并出图」做例子,把五层串起来看:
| 应用层 | 产品形态 | AgentX / MapChat / GeoVLM 助手 |
| Agent 层 | 任务规划、工具调度 | AgentX 三模式、Agent Builder、莫干·玄衍任务编排 |
| 能力层 | 空间 RAG + MCP + GIS 算子 + 影像/3D 生成 | SpaRAGraph 式检索、Location Platform MCP、100+ Copilot 算子、EarthSynth/TerraDiT |
| 模型层 | GeoFM 预训练 + 位置嵌入 + VLM | Prithvi/Clay、Location Encoder、GeoVLM/MapChat |
| 数据层 | 遥感影像、矢量栅格、知识图谱 | Sentinel-2、普查数据、地学语料库 |
你问它「评估这几个地块的洪水风险」,走的是:数据层取影像和地形 → 模型层用 GeoFM 解译 + 位置嵌入补上下文 → 能力层空间 RAG 确定空间关系、MCP 调高程/路径算子 → Agent 层编排成工作流 → 应用层把结果和地图交给你。

落地建议:五层里哪些自建,哪些用现成
- 模型层:别训。用开源 GeoFM(Prithvi/Clay/OlmoEarth)或闭源行业底座(莫干·玄衍),你的活是微调和评测(拿自己数据跑 GEO-Bench 风格基准)。
- 数据层:别全攒。用平台现成数据(Esri Living Atlas、行业数据集),自己补的只有业务私有数据。
- 能力层:RAG 值得自建(空间 RAG 是差异化点),MCP 用平台现成的(Esri/超图都已开放),3DGS 生成按需(066 有完整工具链)。
- Agent 层:用现成框架(Agent Builder / AgentX / ClientX),别从零写编排。
- 应用层:这是你唯一必须自己写的层——产品形态和业务闭环在这里。
结论
Geo+AI 应用的底层,收束成一句话:「预训练底座 + 检索增强 + 工具协议 + Agent 编排」四件套,加位置嵌入和生成式空间模型(3DGS/影像生成)两块新能力。 地理数据训练负责「懂空间」,空间 RAG 负责「想空间」,MCP 负责「调空间工具」,Agent 编排负责「替你把活干完」,影像/3D 生成负责「补你缺的数据和场景」。这四件套加两块里,前几件已经成熟到可以抄作业,Agent 编排和生成式模型正在快速定型——2026 年做 Geo+AI 应用,就是在这一层上比谁接得早。
参考来源
- The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning(arXiv 2607.12177):https://arxiv-org.ezproxy.obspm.fr/html/2607.12177v1
- GEO-Bench-2:从性能到能力,重新思考地理空间人工智能的评估(2026-02):https://blog.csdn.net/hao_wujing/article/details/155168664
- Esri《Every place has a fingerprint: How foundation models are learning locations》:https://www.esri.com/arcgis-blog/products/arcgis-pro/geoai/every-place-has-a-fingerprint-how-foundation-models-are-learning-locations
- Esri《Beyond latitude and longitude: Giving geographic context to coordinates》:https://www.esri.com/arcgis-blog/products/arcgis-pro/geoai/beyond-latitude-and-longitude-giving-geographic-context-to-coordinates
- Esri《New MCP Support (beta) and ArcGIS Static Maps Service in ArcGIS Location Platform》(2026-06-29):https://www.esri.com/arcgis-blog/products/platform/developers/mcp-support-beta-and-arcgis-static-maps-service-in-arcgis-location-platform-release
- SpaRAGraph: Spatial Reasoning using Retrieval-Augmented Generation(ACM TSAS 2026):https://dl.acm.org/doi/10.1145/3799424
- arcpy-mcp-server(开源,ArcGIS 工具箱 MCP 化):https://github.com/zhaojj662/arcpy-mcp-server
- 超图《一体化、智能化:超图 SuperMap GIS 2026 焕新发布》:https://www.supermap.com/zh-cn/a/news/2_5067.html
- 国泰海通《2026 年超图软件空间智能体:三类 Agent 重塑 GIS 交互范式》:https://www.sgpjbg.com/labelsyh/chaoturuanjiankongjianzhinengti.html
- 之江实验室 GeoGPT《Recent Developments in GeoGPT》(IEEE 2026):https://ieeexplore.ieee.org/document/11632985
- 莫干·玄衍地理空间大模型(莫干山地信实验室):http://www.mgslab.ac.cn/dynamic/detail/id/23.html
- 时空地理信息中试基地揭牌,莫干·玄衍上线(2026-07-19):https://scagis.org.cn/Notice/Detail/CYXW/KTN2026081100000094139302
- 高德 ABot-Earth0.5 发布报道(2026-06-08):https://ai.cnmo.com/news/810790.html
- EarthSynth:多类别跨卫星标注 EO 生成基础模型(ML4Sustain):https://huggingface.co/buckets/ML4Sustain/EarthSynth-bucket
- TerraDiT:Diffusion Transformer for Satellite Image Synthesis(ECCV 2026,TerraDiT-Ω 任意地理基元控制):https://github.com/mvrl/TerraDiT
- COP-GEN:Latent Diffusion Transformer for Copernicus Earth Observation Data:https://huggingface.co/mespinosami/copgen-base
网硕互联帮助中心![2019年下半年网络管理员[案例分析]考试下午真题(答案+ 解析)-网硕互联帮助中心](https://www.wsisp.com/helps/wp-content/uploads/2026/09/20260909153309-6aa17c359df88-220x150.png)



评论前必须登录!
注册