说到AI判断一个人的知识水平和能力水平,这事最近几年突然变得热门起来,我自己也一直在观察,毕竟干编辑这行,整天跟文字、信息打交道,免不了要琢磨AI到底是怎么看人的。说实话,这话题有点微妙,因为它不光是技术问题,还牵扯到对人的理解到底能有多深。我试着从实际观察到的现象和一些零散的思考出发,聊聊我的看法。

AI如何判断一个人的知识水平和能力水平
(图片来源互联网)

先说AI最基本的判断方式,就是看“词”。这个听起来简单粗暴,但确实是很多系统的底层逻辑。比如你写了段文字,AI会统计你用了多少专业术语,句子结构是否复杂,逻辑连接词用得频不频繁。如果你张嘴就是“基于数据驱动的多模态分析”,少用“那个”“然后”这种口头禅,AI可能就会给你打个高分。反过来,如果你写的内容全是短句、大白话,哪怕意思表达得很清楚,AI也会觉得你水平一般。这个判断逻辑,其实跟以前学校里老师看作文“辞藻是否华丽”有点像。但问题在于,用词华丽不等于真有水平。我见过一些搞学术的人,本文里堆满术语,实际连基本概念都没搞通,反而是某个老工人讲技术,一个专业词都没有,但句句在点子上。AI目前很难分辨这种“真懂”和“假懂”,它只是从语料库的统计规律来打分。也就是说,你会“说”行业黑话,比你会“做”更占便宜。

更深入一层,AI会看你回答问题的“结构”。比如在测试场景里,你问一个复杂问题,AI会评估你的回答有没有清晰的框架:是不是先定义问题,再分析原因,最后给结论?有没有用到对比、举例、因果推理这些高阶论证手段?我观察过不少AI面试系统的报告,它们特别喜欢那种“总分总”结构清晰的回答,哪怕内容有点空洞,只要逻辑链条完整,得分就不低。相反,一个真正有经验的人,可能回答得很跳跃,因为他在脑中已经完成了推理,直接蹦出结论,这会降低AI的评分。这其实暴露了AI的一个致命弱点:它更擅长识别“符合范式”的思维,而不是“真实”的思维。就像老编辑看稿子,一眼就能看出作者是装懂还是真懂,靠的不是逻辑结构,而是字里行间那种“底气”和“细节”。AI没这个直觉,它只能靠套路来判断套路。

还有一种更隐蔽的判断方式,就是利用“行为数据”。比如你在某个知识平台上提问的频率、回答问题的深度、对别人答案的点赞和评论习惯,都会被AI收集和分析。一个经常提“如何入门”问题的人,AI会判定为新手;一个经常回答别人问题并且点赞数高的人,AI会判定为专家。这听起来很有道理,但事实上,很多真正的专家根本不在平台上活跃,他们可能只给几个同行发私信讨论。而一些半桶水的人,反而热衷于到处答题,因为需要成就感。AI在数据足够多的情况下,确实能发现一些统计规律,比如“提问质量”和“回复质量”正相关,但很难排除那些“刷存在感”的噪音。我自己就见过一个例子,某领域大V在知乎上写了很多专业回答,AI给了他很高的能力评级,结果后来发现他的专业背景全是网上抄来的。AI只是根据他写的东西符合“专家语料”这一特征就下了判断,本质上是在用词频和句式模仿来定义专家。

更让我觉得有点细思极恐的是,AI的判断还会反过来塑造人的行为。既然AI喜欢看“结构化回答”,那求职者就会去背模板,面试时照着套路说。既然AI喜欢专业术语,那写本文的人就拼命堆词。久而久之,人的表达方式会向AI的评判标准靠拢,这会形成一种“判断的循环”:AI认为的“高水平”成为标准,然后大家跟着这个标准去表现,最后AI看到的数据越来越符合自己定下的标准,于是它变得更加自信。但人的真实水平呢?可能反而被掩盖了。这就像以前高考作文喜欢“三段式”,结果所有学生都写成三段式,阅卷老师反而看不出真水平了。AI的固化判断,在某种意义上是在制造一种新的“知识八股文”。

当然,AI也有它擅长的领域。比如在客观知识测试中,AI判断“一个人知不知道某件事”还是很准的。你问他“光合作用的化学方程式是什么”,他答对了就是知道,答错了就是不知道。这没什么争议。但知识水平不等于能力水平,能力更多体现在解决新问题的创造力、批判性思维、跨领域迁移这些方面。AI对这些东西的判断,目前基本只能依赖“间接指标”。比如你过去解决过多少类似的问题,你的代码在GitHub上被多少人star,你的文章被引用了多少次。这些指标和实际能力之间,存在一个模糊的相关关系,但远非因果关系。一个在开源项目上活跃的开发者,代码质量可能很高,也可能只是会改改配置文件。一个本文引用量高的学者,可能是真的权威,也可能是靠抱团互引。

我经常想,AI到底有没有可能真正“看懂”一个人?从目前的技术来看,它更像是一个高级的“拟合器”,把人的表现和它训练数据中那些“高知样本”做匹配。它不是在理解你,而是在比较你。所以一个真正独特的人,一个思维方式不同于主流的人,很可能在AI面前得分很低。历史上很多创新者,在早期都被认为是异类,AI如果活在那个时代,绝不会给爱因斯坦、哥白尼打高分。这恰恰是最让人担忧的地方:如果社会大规模依赖AI来判断人的水平和能力,那“创新”和“非主流”就会天然处于劣势,因为AI的训练数据里根本就没有他们的位置。最终结果可能是,AI筛选出来的都是一群“最像过去优秀人才”的人,而不是真正能创造未来的人。

作为一个编辑,我每天跟文字打交道,也经常需要判断一个作者是真有料还是只会写花架子。我的经验是,真正高水平的作者,往往在细节里藏着“意料之外但情理之中”的洞察。比如他会用一个冷门的比喻,对接两个看似无关的领域,或者在大家都认定的结论里挖出一个新的角度。这些特征,AI很难捕捉,因为它们在训练语料中出现的频率太低了。AI更喜欢那些“高度可预测”的表达。所以我现在对“AI判断人”这件事,抱着一种审慎甚至有点怀疑的态度。它作为辅助工具没问题,比如用来筛简历的初选、做知识问答的自动评分,但要是拿它来决定一个人的晋升、录取、甚至是未来职业走向,我觉得风险太大了。因为我们还没有搞清楚一件事:我们到底是在用AI发现人才,还是在用AI培养一批“最符合AI口味”的人?

最后说一点不那么“技术”的东西。我总觉得,人对人的判断里有一种无法被机器替代的东西,叫“共情”。一个老师看到学生答错题目,能感知到他是马虎还是真不懂,因为他能从学生的表情、语气、甚至停顿时长里读到信息。一个面试官听到候选人讲项目经历,能感受到他是在背诵还是真的经历过。AI没有这种共情,它的所有判断都依赖可量化的输入。而恰恰是那些不可量化的部分——比如一个人的热情、韧性、还有面对未知时的反应——才是能力水平最真实的部分。如果AI只能看到“纸面上的知识和能力”,那我们离真正理解一个人,还差得很远。作为编辑,我宁愿相信人眼,或者至少让AI和人互相补充,而不是让AI说了算。