GeoAI 的集体错觉:所有人都在给地球"看图识字"

Aug 20, 2026

打开任何一场带有 GeoAI(地理AI或者空间AI吧) 的产品发布会回放,你会看到同一个演示:一张卫星影像铺满大屏幕,几秒钟后,建筑被框出来,道路被描出来,地块被染上色。掌声响起。换一家公司、换一个 logo 再看一场,大概一样的套路,换个地儿而已。

每每看到这些视频,我总有一种说不出的错位感。地理世界的问题清单那么长:选址、网络、流向、人怎么在城市里移动。怎么 AI 一来,全行业突然只剩一个问题了——这张照片里有什么?

Landsat 卫星眼中的勒拿河三角洲。这样的照片,人类每天新拍几十 TB。

一个可以量化的错觉

真不是我矫情。为了这件事细细的去找找数据,我认真数了一遍。

产品侧:国内外 13 个自称 GeoAI 的代表性产品——Esri、Google、Planet、商汤、华为、阿里、航天宏图、中科星图……逐个核对核心任务。约 77% 本质上就是"对遥感影像做计算机视觉";剩下几个号称有"预测分析"的,预测的输入依然是影像识别的输出。纯粹不做影像识别的 GeoAI 产品,一个都没有。

学术侧更直白。Mai 等人 2025 年的综述对 Web of Science 上 20,486 篇 GeoAI 论文(几乎都是遥感视觉)做了计量分析:

GeoAI 论文数量的爆炸曲线
GeoAI 论文数量的爆炸曲线

前二十五年,这个领域每年只有个位数论文。2015 年之后,九年涨了 42 倍。引爆点不是哪个地理问题被攻克,而是深度学习成熟了——这个领域被一项外来技术撞了一下,整个人群涌向了最容易撞开的那个方向。 这个趋势并不是我们现在理解的AI到来以后才形成的,其实是拜深度学所赐。

我自己对此的解释到这儿该登场了:需求大嘛,市场选择的。

四条明面的链,和一条藏得更深的

先看明面上的四条供给链。

数据:2008 年 Landsat 四十年档案全部免费,欧盟 Copernicus 跟进,Planet 每天把整个地球拍一遍。卫星影像几乎是唯一同时满足"免费、海量、每日更新、拿来即用"的数据。

方法:对 CNN 和 ViT 来说,卫星照片和猫的照片没有区别,都是像素格。ImageNet 预训练模型微调一下,几百个标注样本就能完成一个州的土地利用制图。而矢量、路网、轨迹这些 GIS 的"正统"数据,连等价的预训练范式都不存在。

基准:SpaceNet 的 1100 万建筑轮廓、xView 的 100 万目标、DOTA 的 179 万旋转框——像当年的 ImageNet 一样,把"研究什么"换成了"哪个榜上还能涨点"。

金主:xView 的出资方是美国国防情报体系;NGA 立了 7 亿美元的专项给卫星影像 AI 标注付钱。农业估产、保险定损也一样:“替我人眼看图”,识别结果直接对接决策。

四条链摆完,答案似乎是验证了供给侧决定论。但还值得再想想——同样的问题可以问每个行业:医疗 AI 先看片子,法律 AI 先读合同,教育 AI 先改作文,为什么?

这不是地理的意外,是这一代 AI 的物种属性:它是感知动物。 这波技术的内核是从数据里找相关性——看图、听音、读字,全是感知。而地理学的核心问题从来不在感知层:选址、规划、调度,全是决策。“如果我在这里修一条路,会发生什么”——这是反事实问题,要因果,要约束,要对空间的内部模型。AI 行业还没在任何领域解决因果,地理只是其中之一。遥感影像识别,是感知范式和免费数据在地理领域撞出的交点——它不是需求的形状,是范式的形状。

GIScience 界已经有人警觉。Goodchild 和一批顶级地理学家 2024 年把话挑明:用 GeoAI 做研究的人很多,把 GeoAI 本身当科学研究的几乎没有。ISPRS 一篇 2026 年的系统综述更狠,直接测全行业的"空间显式性"——这些模型真正建模了多少空间自相关和异质性?答案是非常有限。

Sentinel-2 拍摄的巴西中西部农田。数田、估产,是影像识别最直接的买单场景。

需求侧的三级火箭:标配化不是终点,是门票

从业者 Gus Gonzalez 在 LinkedIn 上写过一句让我深以为然话:“影像没有面积,影像没有位置。地图才有。” 他骂 GeoAI 工具"像二十年前的企业 GIS 软件"。骂得狠,但指向同一个事实:识别是入口,不是终点。而需求侧已经在往终点走。

买单方的演化,是一枚三级火箭。第一级是识别:照片里有什么。第二级是监测和预测:它怎么在变、下一步会怎样——保险从定损做到参数化触发,农业从数田做到估产。第三级是决策:既然知道了,现在怎么办——选址、调度、审批、打击链。每向上一级,付费更高,技术也完全不同:识别要一张图,监测要时间序列,预测要因果,决策要约束和仿真。拥挤在第一级的人越多,第三级的空白就越显眼。

与此同时,第一级正在变成标配。Google 的 AlphaEarth 已把整个地球压成 10 米分辨率的通用嵌入向量(embedding),免费放在那里。很多人把这当成行业的坏消息,我的判断相反——浅层技术的商品化,从来不是深层技术的死亡通知书,而是它的出生证。 NLP 走过一模一样的路:2013 年 word2vec 把词变成免费向量,做词特征的公司死了一片,但正是这层免费基础设施,长出了 2018 年的 BERT 和后来的推理模型。标配化干了三件事:清场,把只会做检测的厂商挤出去;打底,让下一代技术站在免费的地基上;转移瓶颈,让真正值钱的问题浮出来。

第三级和前两级的区别,不是难度大一点,是游戏规则换了。识别尚在开环,决策才是闭环。 模型框错一栋楼,世界毫无反应;但系统选了一个址、撤了一个村,世界立刻做出反应——人流改道,房价重排,新的拥堵在另一条路上长出来,而这些反应又会变成下一批训练数据。监督学习从静态快照里学规律,决策面对的却是被自己扰动的分布——光靠"更准的模型",永远跨不进第三级。

评价标准也跟着换了。第一级数错对:框对多少、框错多少,准确率一目了然。第三级称轻重:误报一个滑坡点和漏报一个,代价天差地别,而这个代价该是多少,没有任何标注能告诉你,只能由具体的人、具体的村、具体的财政来决定。**识别时代比的是谁的模型准,决策时代比的是谁更懂动作下去之后世界怎么变。**这个东西论文里没有,只能在领域里一年一年泡出来。

下一个 ImageNet 时刻,是考场不是题库

破局点在哪?我的判断:地理智能的"ImageNet 时刻",不会是一个更大的数据集。

识别时代的里程碑是题库——标注得越多,模型越强。但决策时代的里程碑是考场:一个让智能体去做选址、做调度、做规划,并且对决策质量打分的环境。题库装的是世界的快照,考场装的必须是世界的反应。Atari 和围棋对强化学习做的事,就是地理决策智能现在缺的东西。这两年,GS-QA、GeoBenchX 这些空间推理基准已经冒头,大模型们的成绩还很差——它们连一张内部空间地图都还没形成。但这恰是卷子该有的样子:先有考场,后有考生,最后才有产业。谁先造出这个考场,谁出卷子,谁定义下一个十年。

前阵子和一位老同事吃饭。他这些年一直在做 InSAR,拿 SAR 数据做滑坡隐患分析,说现在轻松多了——形变图丢给模型,几分钟筛出几百个可疑点;搁十年前,这些图他的小弟们要趴屏幕前看几周。

我问他:筛出来之后呢?几百个可疑点,哪个真会滑?什么时候滑?滑下来,先撤哪个村?

他端着杯子想了想,说:这个,还得我去现场。我觉得这个答案也合理,我问的问题本来也不该全是软件的事儿,这样也挺好,咱们GISer还有的活可干!

把可疑点筛出来的是 AI,把"要不要撤人"答出来的,还是一个在泥里爬过边坡的人。从屏幕到现场之间这段路,就是这个行业接下来十年的活。

王昊

用地图思考人生

评论正在加载...
Great! You've successfully subscribed.
Great! Next, complete checkout for full access.
Welcome back! You've successfully signed in.
Success! Your account is fully activated, you now have access to all content.
分享