说起百度王海峰,圈内人大多会会心一笑——这位百度CTO在人工智能领域的地位,尤其是他对知识图谱的执着,几乎到了痴迷的程度。很多人把知识图谱简单理解为“一张图”,认为它不过是把各种实体和关系画出来而已。但如果真这么想,那就太浅了。王海峰常挂在嘴边的一句话是:“知识图谱是人工智能的基石。”这不是一句空话,而是一个被反复验证的技术事实。

要理解这句话的分量,得先看看我们通常谈论的人工智能。深度学习火了几十年,机器能从海量数据中学习模式,识别图片、翻译语言、生成对话,看上去无所不能。可只要深究一步就会发现,这些模型大多是“盲人摸象”——它们知道“猫”这个词常和“毛茸茸”一起出现,但它们根本不知道猫是什么,更不知道猫和狗有什么区别、猫和老鼠有什么关系、猫的祖先是谁。这就是所谓的“神经网络的符号主义困境”。而知识图谱,恰恰是打破这堵墙的钥匙。
王海峰在百度做的事情,本质上是把知识图谱从一个学术概念,变成了一整套可落地的基础设施。百度知识图谱的规模,据公开信息已经达到数百亿实体、数千亿关系。这不仅仅是数量上的堆砌,更关键的是质量的打磨。百度每天处理海量的搜索请求,用户搜“周杰伦新专辑”,系统要能瞬间理解“周杰伦”是一个人,“新专辑”是一张最近发行的作品。这背后靠的,就是知识图谱里精细维护的关系网络。王海峰团队做的,正是把这种“常识”一点点建起来、挖深、做细。
很多人会问:知识图谱到底好在哪里?举个例子就明白了。现在流行的语言模型,比如GPT或者文心一言,它们擅长生成流畅的句子,但如果你问它“北京和上海哪个更靠南”,模型可能会给出似是而非的答案——它可能记住地理数据,也可能记错。而基于知识图谱的系统,可以直接查询到北京的纬度是北纬39.9°,上海的纬度是北纬31.2°,然后简单比较就知道上海更靠南。这个推理过程不是“猜”出来的,而是“查”出来的,可靠得多。
但知识图谱的真正威力,还不仅仅是提供可靠的信息。王海峰在多个场合强调过“知识与深度学习融合”的理念。百度推出的“知识增强”技术,就是把知识图谱里组织好的结构化知识,塞进深度学习模型的训练过程中。这样模型学到的就不仅仅是统计规律,还包括明确的关系逻辑。说通俗点,以前模型是凭语感猜答案,现在模型是手里多了一份“参考资料”,答题时能边翻书边作答,准确率和可解释性自然就上去了。
再往深里想,知识图谱对AI的意义,有点像基础建设对一个城市的意义。没有路网,车再好也开不快;没有水电,楼再高也住不了人。同样,没有知识图谱,AI永远停留在“模式识别”的层次,无法真正理解世界。王海峰推动的百度知识图谱,覆盖了通用知识、行业知识、专业知识等多个维度。比如在医疗领域,百度知识图谱收录了疾病、症状、药品、手术等之间的复杂关系,这直接支撑了AI辅助诊断、在线问诊等应用。当医生输入“发热、咳嗽两天”,系统能自动关联到可能的疾病并提示注意事项,靠的就是这张图里的层层关系。
当然,知识图谱建设的难处,外人很难想象。数据从哪里来?百度有自己的搜索积累,但更多的需要从网页、百科、本文、结构化数据库中抽取。抽取之后还要消歧——同名不同人的问题非常头疼。比如“刘德华”可以是歌手、可以是某个大学的教授、也可以是某个小城市的普通人。如何在图谱里区分,还要保证正确率,需要复杂的技术手段。王海峰团队在实体链接、关系抽取、图谱补全等方向都做了大量原创性工作。著名的“Ernie”模型,就是基于知识增强的预训练语言模型,拿了多项国际评测的第一。
有人可能会觉得,知识图谱这么复杂,是不是太“重”了?毕竟现在大模型热潮下,很多人相信只要参数够多、数据够大,模型自己就能学会一切。这种观点其实有些偏激。大模型确实能记住很多事实,但记忆不等于理解,统计不等于推理。语言模型可以告诉你“埃菲尔铁塔在巴黎”,但当你问“为什么埃菲尔铁塔建在巴黎”,它就傻眼了。而知识图谱如果标注了“埃菲尔铁塔是为了1889年世界博览会而建,博览会举办地是巴黎”,那系统就能说出因果链。所以真正的智能,应该是统计学习和符号推理的结合。王海峰倡导的知识+数据双驱动,正是这个方向的技术主线。
站在更高的层面看,百度把知识图谱作为AI的基石,不仅仅是技术选择,也是一种战略定力。相比某些公司热衷于追风口,百度在知识图谱上投入了十多年,从早期的“知心”系统到现在的飞桨平台、文心大模型,知识图谱始终是底层支撑。王海峰作为技术掌舵人,他看的不是一两年,而是整个AI发展的长周期。知识图谱前期见效慢、建设周期长,但一旦建成,就是别人难以复制的护城河。说得不好听一点,有些公司可以用数据“堆”出一个AI模型,但很难堆出一个高质量的知识图谱,因为那是要靠十年如一日的清洗、归纳、验证才能积累出来的。
最近圈内有个趋势值得注意:很多原本不重视知识图谱的团队,也开始往回补课。因为大家发现,大模型发展到一定程度,幻觉问题、可解释性问题、推理能力不足的问题,最后都指向了知识图谱这个老办法。这从侧面印证了王海峰的说服力。他并不是在推销某个单一技术,而是在推动一个技术生态的成熟。百度知识图谱现在不仅内部用,还通过开放平台对外提供,企业可以基于已有的图谱快速搭建自己的行业知识库,这在农业、金融、法律等专业领域都有很大的实用空间。
我有时候在想,如果未来某天AI真的有了像人一样的常识推理能力,那回望来路,王海峰和他的知识图谱一定会被记上一笔。因为那是从“数据驱动”迈向“知识驱动”的关键一步。当然,现在的知识图谱还远未完美,构建成本高、覆盖度有限、复杂推理仍然吃力。但方向已经明确,基础已经打下。在这个浮躁的技术时代,能够沉下来做这样一件难而正确的事,本身就是一种可贵的坚持。



















