为什么我反对用 GPA 给学生的能力定价
很多人习惯这样判断学生:
“他 GPA 3.8,你 GPA 2.8,所以他大概率比你能力强。”
听起来似乎很合理。
但我们把场景换一下:
“这个四十岁的男人年薪 100 万,另一个年薪 30 万,所以前者的能力大概是后者的三倍。”
这时候,大多数人都会觉得哪里不太对。
因为我们知道,收入不是能力本身。
一个人的薪资受到太多因素影响:行业、城市、平台、岗位、职业路径、风险偏好、家庭选择、时代红利,甚至运气。
高校教授可能收入不如互联网中层,创业公司技术负责人现金工资可能不如大厂程序员,一个主动选择稳定生活的人也可能放弃更高薪的机会。
所以,我们通常不会轻易得出:
“谁赚得更多,谁就更有能力。”
奇怪的是,当对象变成学生时,我们却很容易把 GPA 当成一种近乎天然的“能力认证”。
这其实是同一种错误。
GPA 有信息,但它不是人的“能力总分”
先说清楚,我并不认为 GPA 没有意义。
长期维持高 GPA,至少说明一个人在某套教育体系下具备一些真实能力:
他可能学习效率高,知识掌握扎实,执行力强,时间管理稳定,也能够长期适应考试和课程评价体系。
这些都值得认可。
问题不在于 GPA 有没有价值。
问题在于:
我们经常偷偷把“GPA 高”替换成了“这个人能力强”。
这两个命题根本不是一回事。
因为“能力”本来就是多维的。
有人擅长考试,有人擅长科研。
有人擅长理论推导,有人擅长工程实现。
有人可以在有标准答案的问题上做到极高正确率,却未必擅长处理开放问题。
也有人课程成绩普通,但可以独立完成复杂项目、解决工程故障、带团队、做研究、写系统、处理没有标准答案的问题。
所以真正准确的表述应该是:
GPA 描述的是一个人在特定学校、特定专业、特定课程体系和特定评价规则下的表现。
到这里,它是一个很有价值的指标。
但如果继续往前推,变成:
“所以这个人的综合能力就是这个水平。”
那就已经越界了。
更大的问题:GPA 衡量的东西其实比我们想象得窄
考试当然是一种能力测试。
但它测试的是一种相当具体的能力:
在规定时间内,按照指定 syllabus,学习指定内容,并根据明确评分规则完成任务。
这是一项真实能力。
但现实世界里的大量重要任务,结构完全不同。
科研往往没有标准答案。
很多时候,你甚至不知道问题应该怎么定义。
工程问题也不会像试卷一样告诉你:
“本题共 20 分,请使用某某定理解答。”
真实情况可能是系统突然崩了,文档不完整,代码是别人留下来的,日志也很混乱,而 Deadline 就在明天。
你需要自己定位问题、查资料、猜测原因、设计实验、排除错误,然后让系统重新跑起来。
创业、管理、写作、沟通、谈判、设计、领导团队也一样。
这些能力与考试成绩当然可能相关,但绝不是同一个东西。
因此,一个人的 GPA 再精确,也只是在测量能力空间里的一个切片。
问题在于,我们经常拿这个切片去代表整个空间。
Goodhart’s Law:当指标成为目标,指标就开始失真
这里其实可以引入一个非常经典的概念:
Goodhart’s Law:When a measure becomes a target, it ceases to be a good measure.
也就是:
当一个指标成为目标之后,它往往就不再是一个好的指标。
这几乎完美解释了 GPA 的问题。
GPA 原本只是用来衡量学生课程学习情况的一个代理指标。
但当它和保研、奖学金、升学、就业、荣誉绑定之后,GPA 就不再只是“测量工具”,而变成了学生必须主动优化的目标。
于是人的行为自然会变化。
学生会开始思考:
哪门课更容易拿高分?
哪个老师给分更宽?
哪些课程风险太高,不值得选?
一个很难但很有价值的项目,会不会影响我的绩点?
科研、竞赛、开源、实习如果占用太多时间,是不是应该少做一点?
到了这一步,学生优化的就已经不完全是“我能不能学到更多东西”,而是:
怎样在现有评价规则下,获得更高的 GPA。
这两件事当然有重叠。
但它们绝不是同一件事。
甚至可能出现一种很讽刺的情况:
一个学生为了提高所谓的“能力指标”,主动避开困难课程、减少探索、减少失败、减少高风险项目。
结果是:
他的 GPA 更漂亮了。
但他真实能力的增长,反而可能变慢了。
这正是 Goodhart’s Law 最值得警惕的地方。
一个指标一旦被赋予太大的奖励,人们就会越来越擅长优化这个指标,而不是优化它原本想代表的东西。
GPA 和薪资,本质上都更像“结算结果”
这也是为什么我认为 GPA 和中年人的薪资其实有一个很有意思的共同点。
它们都不是纯粹的能力。
它们更像一个复杂系统最终给出的“结算结果”。
薪资大概受到:
能力、行业、平台、城市、资历、风险偏好、职业选择、市场周期、谈判能力、运气
共同影响。
GPA 同样受到:
学习能力、考试适应性、投入时间、课程难度、课程选择、教师评分、专业特点、策略、个人目标
共同影响。
所以它们都提供信息。
但它们都不能直接等于“人的能力”。
如果一定要写成一个非严格的表达式:
GPA ≠ Ability
它更接近:
GPA = 能力 × 环境 × 规则 × 选择 × 投入 × 策略
工资也一样。
因此,当我们看到一个人的工资时,会本能地问:
他在哪个行业?
做什么岗位?
在哪个城市?
工作多少年?
是不是主动选择了低收入但更喜欢的方向?
可面对 GPA 时,我们往往懒得问这些问题。
我们直接把一个数字,变成了对人的判断。
两个人比较时,单一指标尤其危险
假设有两个学生。
A:
GPA 3.9,课程成绩非常漂亮。
B:
GPA 3.0,但做过科研、比赛、工程项目、开源,也独立处理过复杂系统。
谁能力更强?
其实最合理的答案不是 A,也不是 B。
而是:
信息不足。
如果你需要一个理论基础极强、课程学习能力稳定的人,A 可能更适合。
如果你需要一个面对模糊问题能够快速上手、独立解决工程困难的人,B 可能更适合。
能力评价必须先回答:
“做什么事情的能力?”
脱离具体任务谈“谁更有能力”,很多时候本身就是一个伪问题。
现实世界不像考试,没有一张统一的能力总分表。
GPA 最合理的用途,是筛选,而不是定性
那么为什么学校、企业、研究生项目仍然大量使用 GPA?
原因其实很现实。
因为它便宜、高效、标准化。
如果有一万份申请,不可能给每个人安排几个小时的深度访谈,也不可能逐一审查每个人的代码、项目、科研工作。
因此,GPA 是一个低成本信号。
它方便排序。
方便筛选。
方便在信息极度不足的情况下做第一轮判断。
这完全合理。
但这里有一个非常重要的区别:
一个指标适合大规模筛选,不意味着它适合准确评价一个具体的人。
学历可以用来筛简历。
但学历不是能力本身。
信用分可以用来判断风险。
但信用分不是人格。
论文数量可以用来粗略衡量科研产出。
但论文数量也不等于科研能力。
同样,
GPA 可以成为一种筛选工具。
但它不应该被神化成一个人的能力认证书。
筛选系统必须压缩复杂现实。
但我们不应该把这种压缩结果反过来当成现实本身。
更有意思的是:我们对二十岁的人,反而更喜欢“一锤定音”
这其实是整件事里最荒谬的地方之一。
面对一个四十岁的成年人,我们知道人生非常复杂。
我们不会轻易因为工资一般,就断言他这个人能力一般。
因为我们知道:
人生有选择。
有偶然。
有行业周期。
有家庭。
有兴趣。
有取舍。
但面对一个二十岁的学生,我们反而很容易说:
“你 GPA 才 2.8,说明你学习能力不行。”
这很奇怪。
二十岁恰恰是一个人能力结构最没有定型的时候。
有人大一大二还不知道自己想做什么,到大三突然找到方向。
有人直到第一次参加科研、第一次真正做工程、第一次实习,才发现自己擅长什么。
有人早期成绩很普通,但后期成长速度惊人。
一个人在十九岁时几门课程的考试成绩,当然可以记录。
但如果进一步解释成:
“这就是这个人的能力水平。”
那其实是把一个仍然快速变化的人,过早地压缩成了一个数字。
真正值得问的,不是“你多少分”,而是“你做成过什么”
如果真的想评价一个人的能力,我越来越觉得,更有意义的问题不是:
“你的 GPA 是多少?”
而是:
你解决过什么问题?
你做过什么真正困难的事情?
面对一个没有标准答案的问题,你会怎么办?
遇到完全不会的东西,你能不能自己学会?
项目失败以后,你能不能找到原因,再做一次?
你有没有把一个模糊想法真正做成一个可以工作的东西?
你能不能清楚解释自己的工作?
你能不能承担长期、不确定、可能失败的任务?
这些问题当然也不完美。
但它们至少更接近我们通常所说的“能力”。
所以,我并不是主张取消 GPA,也不是认为 GPA 高没有价值。
恰恰相反。
GPA 是一个很有用的指标。
但它首先应该保持自己“指标”的身份。
GPA 是 GPA。
工资是工资。
学校排名是学校排名。
论文数量是论文数量。
它们都是复杂现实里的一个投影。
真正危险的是,我们总喜欢在这些数字后面偷偷补上一句话:
“所以这个人更优秀。”
从一个指标,到一个人的能力,再到一个人的价值,中间其实隔着非常远的距离。
成熟的评价体系应该使用指标。
但不应该崇拜指标。
因为数字最大的价值,是帮助我们理解一个人。
而数字最大的危险,是让我们误以为:
我们已经理解了这个人。