说实话,这个问题我琢磨过挺久的。你看,现在随便问一个人工智能“泰山在哪个省?”“复活节岛的摩艾石像是谁造的?”“非洲的萨赫勒地带为啥那么穷?”它都能给你扯出一堆来,甚至还能配上地图和年代。但你要是反过来想:一个连门都没出过、没眼睛没腿、连个GPS信号都收不到的“东西”,它是怎么知道这些的?这不科学对吧?

其实答案说穿了也不玄乎,就是四个大字:喂出来的。但是怎么喂、喂什么、喂完之后怎么消化,这里面就有门道了。我得从最基础的讲起。
第一层,也是最粗暴的一层:把人类写过的所有文本,全塞进去。 你想想,从古到今,人类在地理和人文这块留下了多少东西?维基百科,那是基础中的基础;百度百科,中文世界的大杂烩;谷歌地图的标注、OpenStreetMap的开源数据;国家地理杂志的电子版;各种旅游攻略、城市介绍、县志、地方志;甚至包括那些冷门的、研究玛雅文明或者青藏高原冰川的学术本文。这些东西本质上都是“文本”,而大语言模型的训练核心就是海量文本。你给它喂一千万篇关于“巴黎”的文章,它虽然不知道塞纳河的水是凉是热,但它能从“埃菲尔铁塔”“卢浮宫”“左岸咖啡”“奥斯曼建筑”这些词的重复率里,统计出一个“巴黎画像”。这就是最原始的知识来源——统计共现。
第二层,是结构化数据带来的“实体感”。 光靠纯文本,它可能会把“刚果河”和“扎伊尔河”当成两条河,但如果你给它一张表格,里面清清楚楚列着“刚果河, 旧称扎伊尔河, 长度4640公里, 流域面积401万平方公里, 流经刚果(金)、刚果(布)等”,那它就能精准地把这些信息确定下来。所以很多AI背后会挂一个“知识图谱”,其实就是一张超级大的网。网上每个节点是一个实体,比如“撒哈拉沙漠”,其他节点跟它连着的是“面积”“年降水量”“所在国家”“主要民族”“主要语言”。当AI回答问题时,它不只是靠猜词,它还能从这个图里“拉”出确切的条条来。比如“撒哈拉沙漠下面有石油吗?”它一查——撒哈拉覆盖了阿尔及利亚、利比亚,这两个国家是OPEC成员,阿尔及利亚的石油主要分布在撒哈拉东部——它就能给你一个靠谱的回答。这个知识图谱的来源,很多是人工编辑的,比如Wikidata,还有一些是从百科的Infobox里自动抽取的。所以说,AI的地理人文知识里,有一大块是“被人事先整理好的”,它只是当了个搬运工。
第三层,是不太容易被注意到的“多模态对齐”。 现在很多AI不光是读文字,它还能看图片。比如给一张卢旺达的梯田照片,它识别出“卢旺达”“梯田”“非洲”,然后跟文本里“卢旺达人口密度高、多山、农业为主”对应上。还有一种更厉害的方式:它从卫星图像里学习人类活动的痕迹。虽然通用大语言模型本身很少直接消化卫星照片,但一些专门的地理AI模型,比如Google的“Land Cover”项目,会把高分辨率卫星影像跟地面实况数据(比如哪里是城市、哪里是农田、哪里是沙漠)做配对训练。然后这些模型产生的“语义标注”反过来也会被大模型吸收,变成它的间接知识。说白了,AI的“眼睛”是摄像头,它的“腿”是爬虫,它的“脑子”是人写的书和数据库。
但是,这里有个大问题:AI的地理人文知识是有“坑”的。 我举几个真实翻车案例。你问它“阿富汗的主要出口作物是什么”,它可能会斩钉截铁说“罂粟”,实际上罂粟只占一部分,而官方统计里小麦和水果才是大头,但它从大量新闻和影视作品里学到的“阿富汗”跟“毒品”捆绑得太紧了,这个统计偏差就会让它给出片面答案。再比如你问“巴勒斯坦和以色列之间的耶路撒冷到底是什么情况”,它很可能因为训练数据里既有亲以的英文媒体,也有亲巴的阿拉伯媒体,结果它给出的回答变成一种“一团和气的中立”,两头都不得罪,但那不是真实的人文真相,而是数据平均的结果。地理人文知识里最怕的就是“被平均”。很多小语种、小族群的文化知识,比如撒哈拉以南非洲的某个土著部落的迁徙史,可能在训练数据里只有三五篇文章,AI学到的只是一个非常模糊的影子,甚至干脆就是错的。
还有一个很现实的问题:时效性。 AI的知识是一个“快照”。比如你问“2023年苏丹内战现在怎么样了”,如果它训练的语料只到2022年底,它根本不知道新爆发的冲突;但如果它用了联网搜索,那它就能实时抓取最新新闻。所以现在很多大语言模型会接入搜索引擎或者知识库更新接口。但这个更新不是无缝的——它有可能把旧知识和新知识搞混。比如有些AI到现在还认为缅甸的首都是仰光,实际上2005年就迁到内比都了,因为早期爬取的中文百科数据没更新,而后来更新的数据又没被模型完全覆盖。人文地理知识有个特点:它既是静态的(珠穆朗玛峰海拔不会天天变),又是动态的(国界线、城市改名、人口迁徙、文化变迁)。AI对静态部分掌握得很好,对动态部分却经常滞后甚至错乱。
我自己觉得,AI知道人文地理知识的本质,其实是“人类集体记忆的压缩重构”。它并不是真的“知道”撒哈拉的沙子烫脚,也不是“理解”为什么藏族人转经要顺时针。它只是发现:在数十亿个句子里,凡是提到“西藏”的地方,有80%的概率会同时出现“转经”“顺时针”“佛教”,于是它就能模仿出这个知识。这种知识缺乏亲身体验的温度,但也带来了一个好处:它能跨越语言和文化的障碍。比如你问一个不懂日语的AI“日本的‘祭り’和中国的庙会有什么异同”,它能从英语、中文、日语三种语料里拼出一张比较表,这种能力超过任何一个单一文化的专家。当然,它也会犯错——比如把日本盆踊节和西藏的羌姆混为一谈,因为它们在“宗教舞蹈”这个类别上太像了,而模型的分类器有时候会画错边界。
最后我想说,AI的地理人文知识,其实是一面镜子,照出人类知识分布的不均。维基百科上关于欧洲国家的条目动辄几十万字,关于太平洋岛国的可能就几百字。AI学到的当然也就厚此薄彼。所以当你问它“瑙鲁有什么出名的?”它可能只能背出“磷酸盐矿和肥胖率”,而当地原住民的文化节、口头史诗,它一无所知。这不能全怪AI,是人类自己就没把这些知识好好数字化。也许未来,那些未被充分记录的“沉默地理”,才是真正考验AI的知识边界。


















