AI打分跟人类一致率只有35%作者龍德明宇你写了一篇出色的论文人类老师给了高分AI给的分数却低于人类的判断。你同学那篇明显薄弱的作业人类给了低分AI反而抬高了分数。你和高水平同学的差距在AI眼中被拉平了。这不是假设。这是剑桥大学刚刚完成的实测结果报告明确指出AI评分存在系统性的中心倾向偏差高分被压低分被抬分数分布被压缩近半。三个顶级AI犯了同一个错OpRaise剑桥大学主导的研究让当前非常强的三款大语言模型Claude Opus 4.6、GPT-5.4、Gemini 3 Flash给761篇真实的本科论文打分。研究团队做了所有能做的事提供完整评分标准、给出预期分数分布、要求逐项解释评判依据。每个模型还先在20%的论文上校准找到最优评分策略。结果呢大学AI与人类精确等级一致率QWK人机相关性剑桥63%0.61诺丁汉53%0.42曼彻斯特城市35%0.33这里的「精确等级一致率」指的是AI给出的学位等级与人类完全相同如都判一等的比例。如果允许邻近等级的误差比如人类判一等、AI判二等一一致率会更高。但即便如此35%这个数字仍然意味着在曼彻斯特城市大学AI与人类在学位等级上精确一致的案例不到四成。更扎心的是偏差模式。人类给高分的优秀论文AI压低数分人类给低分的薄弱作业AI拔高数分。所有分数都被拉向中间。报告给出了一个精确数字压缩系数最低0.47、最高0.821.0表示完美保持人类评分的分布范围。也就是说AI只保持了人类评分分布范围的47%到82%分数差距被压缩了将近五分之一到一半。高分被压低分被抬论文之间的差异在AI眼中被抹平了。最优秀的论文和最薄弱的论文之间的差距被AI系统性压缩了。这不是技术上的小偏差是在压缩学生差异化成长的空间。报告还指出了一个更致命的事实AI对人类认为最好和最差的论文判断最不准确。这意味着真正优秀和真正需要帮助的学生反而是被AI误判最严重的两群人。它们不是各自犯错而是犯着同一个错这是最该警惕的发现。三个模型之间的一致性极高ICC组间一致性达到0.9199%以上至少两个模型给出相同等级。看起来很可靠但和人类的一致性呢最低0.33。AI之间高度一致但和人类严重分歧。三个AI不是各自独立地接近真相而是在犯同一个错误。打个比方三个学生做同一道判断题答案完全一样。不是因为都理解了这道题而是因为思维方式完全相同连错都错得一模一样。这就是为什么报告说把三个模型联合起来打分也没用偏差是系统性的不是某个模型的个体问题。AI不是在判断你的论文是在匹配「好论文的样子」761篇论文研究团队提取了四类语言特征词汇广度、思想连接、句子复杂度、文本长度。结果这四类特征都统计显著地预测AI分数其中词汇广度是AI给分的最强预测因子你的论文用了多少不同的词是AI给分的头号信号而论证是否成立并不在这项研究测量的任何预测因子之列。而对人类评分者这些特征的影响「broadly negligible」基本可以忽略。这意味着什么AI对看起来像好论文的表面特征敏感对论证是否成立的实质不敏感。一个合理的担忧是一篇论证混乱但文采飞扬的论文在AI眼里可能比逻辑严密但文笔朴素的得分更高。需要说明这是从统计关联中合理推导的情形OpRaise并未直接做此项实验。因为它不是在「理解」你的论证它在「匹配」训练数据中高分论文的表面特征。文章长、词汇多、句式复杂AI就给高分。至于你说的到底对不对它不在乎。它不是在判断你的论文是在判断你的论文看起来像不像一篇好论文。学生说了一句很重的话OpRaise不止做了定量研究还组织了9个焦点小组25名师生参与讨论。一个曼彻斯特城市大学的学生说了这句话「如果学生和老师都在用AI那谁在学习我们在这里到底在做什么」焦点小组中反复出现一个词「被看见」。学生需要被教师看见和重视教师需要通过评分看见学生。一位教师说「如果你把它交给AI……它不考虑任何关系、任何对话、任何学生与你分享的思想。这一切都没有了。」报告把这叫做评分中的「社会契约」评分不只是分配数字而是师生之间关于尊重、学习目标和公平的共同预期。学生抗拒的不是AI这个工具本身而是「没有人看见我」的虚无感。焦点小组中有人担心缺失了人际连接学生会不来上课教师会离职。评语的情况更微妙。AI生成的评语是人类的3到8倍压缩到同等长度后师生竟然分不清人机。但揭晓来源后认可度骤降。甚至有人建议不要叫AI评分改叫「专门为心理学论文开发的高可靠性评分工具」可能更容易被接受。换一个说法信任就回来了但这恰恰说明真正的问题不在工具的性能而在人们对AI评分这个概念本身的抵触。「35%」不是准确率太低是一个签名很多人会说35%那是因为模型还不够好等GPT-6出来就好了。但报告已经用了当前非常强的三个模型提供了完整评分标准优化了prompt做了综合打分。偏差仍然存在而且报告明确说集成方法无法纠正。因为这不是单纯的精度问题。高压低、低拔高这是中心倾向偏差。所有输出被拉向训练数据的平均水平因为大语言模型没有自己的视角只有训练分布的加权平均。三个模型犯同样的错——这是共振。共享同一技术路径产生相同的偏差模式。AI之间高度一致但与人类分歧巨大这不是可靠是「没有理解的一致」。当然35%也可能仅仅因为当前模型在捕捉人类评估的复杂判断时还不够好一个更低调的解释。但如果这个偏差在不同模型和不同聚合方式下都稳定存在OpRaise观察到的正是这一点并且与「输出被拉向训练分布平均水平」的机制解释相符那么称之为当前技术路径的「系统性签名」是合理的。这不是某种神秘本质的证明而是说沿着这条技术路径评分偏差具有可预测的模式且这种模式与「没有视角的系统做统计匹配」的特征一致。35%不是准确率太低。它是当前大语言模型评分机制的系统性签名——一种可预测的、与「没有视角的系统做统计匹配」特征一致的偏差模式。大学的选择不少高校正在考虑让AI承担评分职责。教师阅卷负担沉重这完全可以理解。但报告提出了两个清醒的提醒第一性能不跨校泛化。同样一套AI在剑桥能做到63%的等级一致率到了曼彻斯特城市大学只剩35%。你的论文在哪个学校、面对哪个评分标准会直接影响AI给你的分数。每个机构必须用自身材料做本地验证。第二一旦转向AI评分可能难以回归人类评分——即使你想。因为人员已经调整投资已经转移。AI可以标记异常、检查一致性、生成初稿评语。但报告说得清楚最终评分权必须属于人类。顾问委员会一致同意。不是因为人比AI更准而是因为评分的本质不是打分是一个人读懂另一个人的思考然后给出回应。参考来源Talmi, D. et al.OpRaise: AI in University Assessment: Evaluating the Opportunities and Risks of Automated Marking(2026). 官网http://www.emotional-cognition.psychol.cam.ac.uk/opraise