GeoAI 的集体错觉:所有人都在给地球"看图识字"
打开任何一场带有 GeoAI(地理AI或者空间AI吧) 的产品发布会回放,你会看到同一个演示:一张卫星影像铺满大屏幕,几秒钟后,建筑被框出来,道路被描出来,地块被染上色。掌声响起。换一家公司、换一个 logo 再看一场,大概一样的套路,换个地儿而已。
每每看到这些视频,我总有一种说不出的错位感。地理世界的问题清单那么长:选址、网络、流向、人怎么在城市里移动。怎么 AI 一来,全行业突然只剩一个问题了——这张照片里有什么?

Landsat 卫星眼中的勒拿河三角洲。这样的照片,人类每天新拍几十 TB。
一个可以量化的错觉
真不是我矫情。为了这件事细细的去找找数据,我认真数了一遍。
产品侧:国内外 13 个自称 GeoAI 的代表性产品——Esri、Google、Planet、商汤、华为、阿里、航天宏图、中科星图……逐个核对核心任务。约 77% 本质上就是"对遥感影像做计算机视觉";剩下几个号称有"预测分析"的,预测的输入依然是影像识别的输出。纯粹不做影像识别的 GeoAI 产品,一个都没有。
学术侧更直白。Mai 等人 2025 年的综述对 Web of Science 上 20,486 篇 GeoAI 论文(几乎都是遥感视觉)做了计量分析:

前二十五年,这个领域每年只有个位数论文。2015 年之后,九年涨了 42 倍。引爆点不是哪个地理问题被攻克,而是深度学习成熟了——这个领域被一项外来技术撞了一下,整个人群涌向了最容易撞开的那个方向。 这个趋势并不是我们现在理解的AI到来以后才形成的,其实是拜深度学所赐。
我自己对此的解释到这儿该登场了:需求大嘛,市场选择的。
四条明面的链,和一条藏得更深的
先看明面上的四条供给链。
数据:2008 年 Landsat 四十年档案全部免费,欧盟 Copernicus 跟进,Planet 每天把整个地球拍一遍。卫星影像几乎是唯一同时满足"免费、海量、每日更新、拿来即用"的数据。
方法:对 CNN 和 ViT 来说,卫星照片和猫的照片没有区别,都是像素格。ImageNet 预训练模型微调一下,几百个标注样本就能完成一个州的土地利用制图。而矢量、路网、轨迹这些 GIS 的"正统"数据,连等价的预训练范式都不存在。
基准:SpaceNet 的 1100 万建筑轮廓、xView 的 100 万目标、DOTA 的 179 万旋转框——像当年的 ImageNet 一样,把"研究什么"换成了"哪个榜上还能涨点"。
金主:xView 的出资方是美国国防情报体系;NGA 立了 7 亿美元的专项给卫星影像 AI 标注付钱。农业估产、保险定损也一样:“替我人眼看图”,识别结果直接对接决策。
四条链摆完,答案似乎是验证了供给侧决定论。但还值得再想想——同样的问题可以问每个行业:医疗 AI 先看片子,法律 AI 先读合同,教育 AI 先改作文,为什么?
这不是地理的意外,是这一代 AI 的物种属性:它是感知动物。 这波技术的内核是从数据里找相关性——看图、听音、读字,全是感知。而地理学的核心问题从来不在感知层:选址、规划、调度,全是决策。“如果我在这里修一条路,会发生什么”——这是反事实问题,要因果,要约束,要对空间的内部模型。AI 行业还没在任何领域解决因果,地理只是其中之一。遥感影像识别,是感知范式和免费数据在地理领域撞出的交点——它不是需求的形状,是范式的形状。
GIScience 界已经有人警觉。Goodchild 和一批顶级地理学家 2024 年把话挑明:用 GeoAI 做研究的人很多,把 GeoAI 本身当科学研究的几乎没有。ISPRS 一篇 2026 年的系统综述更狠,直接测全行业的"空间显式性"——这些模型真正建模了多少空间自相关和异质性?答案是非常有限。

Sentinel-2 拍摄的巴西中西部农田。数田、估产,是影像识别最直接的买单场景。
需求侧的三级火箭:标配化不是终点,是门票
从业者 Gus Gonzalez 在 LinkedIn 上写过一句让我深以为然话:“影像没有面积,影像没有位置。地图才有。” 他骂 GeoAI 工具"像二十年前的企业 GIS 软件"。骂得狠,但指向同一个事实:识别是入口,不是终点。而需求侧已经在往终点走。

买单方的演化,是一枚三级火箭。第一级是识别:照片里有什么。第二级是监测和预测:它怎么在变、下一步会怎样——保险从定损做到参数化触发,农业从数田做到估产。第三级是决策:既然知道了,现在怎么办——选址、调度、审批、打击链。每向上一级,付费更高,技术也完全不同:识别要一张图,监测要时间序列,预测要因果,决策要约束和仿真。拥挤在第一级的人越多,第三级的空白就越显眼。
与此同时,第一级正在变成标配。Google 的 AlphaEarth 已把整个地球压成 10 米分辨率的通用嵌入向量(embedding),免费放在那里。很多人把这当成行业的坏消息,我的判断相反——浅层技术的商品化,从来不是深层技术的死亡通知书,而是它的出生证。 NLP 走过一模一样的路:2013 年 word2vec 把词变成免费向量,做词特征的公司死了一片,但正是这层免费基础设施,长出了 2018 年的 BERT 和后来的推理模型。标配化干了三件事:清场,把只会做检测的厂商挤出去;打底,让下一代技术站在免费的地基上;转移瓶颈,让真正值钱的问题浮出来。
第三级和前两级的区别,不是难度大一点,是游戏规则换了。识别尚在开环,决策才是闭环。 模型框错一栋楼,世界毫无反应;但系统选了一个址、撤了一个村,世界立刻做出反应——人流改道,房价重排,新的拥堵在另一条路上长出来,而这些反应又会变成下一批训练数据。监督学习从静态快照里学规律,决策面对的却是被自己扰动的分布——光靠"更准的模型",永远跨不进第三级。
评价标准也跟着换了。第一级数错对:框对多少、框错多少,准确率一目了然。第三级称轻重:误报一个滑坡点和漏报一个,代价天差地别,而这个代价该是多少,没有任何标注能告诉你,只能由具体的人、具体的村、具体的财政来决定。**识别时代比的是谁的模型准,决策时代比的是谁更懂动作下去之后世界怎么变。**这个东西论文里没有,只能在领域里一年一年泡出来。
下一个 ImageNet 时刻,是考场不是题库
破局点在哪?我的判断:地理智能的"ImageNet 时刻",不会是一个更大的数据集。
识别时代的里程碑是题库——标注得越多,模型越强。但决策时代的里程碑是考场:一个让智能体去做选址、做调度、做规划,并且对决策质量打分的环境。题库装的是世界的快照,考场装的必须是世界的反应。Atari 和围棋对强化学习做的事,就是地理决策智能现在缺的东西。这两年,GS-QA、GeoBenchX 这些空间推理基准已经冒头,大模型们的成绩还很差——它们连一张内部空间地图都还没形成。但这恰是卷子该有的样子:先有考场,后有考生,最后才有产业。谁先造出这个考场,谁出卷子,谁定义下一个十年。
前阵子和一位老同事吃饭。他这些年一直在做 InSAR,拿 SAR 数据做滑坡隐患分析,说现在轻松多了——形变图丢给模型,几分钟筛出几百个可疑点;搁十年前,这些图他的小弟们要趴屏幕前看几周。
我问他:筛出来之后呢?几百个可疑点,哪个真会滑?什么时候滑?滑下来,先撤哪个村?
他端着杯子想了想,说:这个,还得我去现场。我觉得这个答案也合理,我问的问题本来也不该全是软件的事儿,这样也挺好,咱们GISer还有的活可干!
把可疑点筛出来的是 AI,把"要不要撤人"答出来的,还是一个在泥里爬过边坡的人。从屏幕到现场之间这段路,就是这个行业接下来十年的活。