AI打分,跟人类一致率只有35%-龍德明宇
AI打分跟人类一致率只有35%作者龍德明宇你写了一篇出色的论文人类老师给了高分AI给的分数却低于人类的判断。你同学那篇明显薄弱的作业人类给了低分AI反而抬高了分数。你和高水平同学的差距在AI眼中被拉平了。这不是假设。这是剑桥大学刚刚完成的实测结果报告明确指出AI评分存在系统性的中心倾向偏差高分被压低分被抬分数分布被压缩近半。三个顶级AI犯了同一个错OpRaise剑桥大学主导的研究让当前非常强的三款大语言模型Claude Opus 4.6、GPT-5.4、Gemini 3 Flash给761篇真实的本科论文打分。研究团队做了所有能做的事提供完整评分标准、给出预期分数分布、要求逐项解释评判依据。每个模型还先在20%的论文上校准找到最优评分策略。结果呢大学AI与人类精确等级一致率QWK人机相关性剑桥63%0.61诺丁汉53%0.42曼彻斯特城市35%0.33这里的「精确等级一致率」指的是AI给出的学位等级与人类完全相同如都判一等的比例。如果允许邻近等级的误差比如人类判一等、AI判二等一一致率会更高。但即便如此35%这个数字仍然意味着在曼彻斯特城市大学AI与人类在学位等级上精确一致的案例不到四成。更扎心的是偏差模式。人类给高分的优秀论文AI压低数分人类给低分的薄弱作业AI拔高数分。所有分数都被拉向中间。报告给出了一个精确数字压缩系数最低0.47、最高0.821.0表示完美保持人类评分的分布范围。也就是说AI只保持了人类评分分布范围的47%到82%分数差距被压缩了将近五分之一到一半。高分被压低分被抬论文之间的差异在AI眼中被抹平了。最优秀的论文和最薄弱的论文之间的差距被AI系统性压缩了。这不是技术上的小偏差是在压缩学生差异化成长的空间。报告还指出了一个更致命的事实AI对人类认为最好和最差的论文判断最不准确。这意味着真正优秀和真正需要帮助的学生反而是被AI误判最严重的两群人。它们不是各自犯错而是犯着同一个错这是最该警惕的发现。三个模型之间的一致性极高ICC组间一致性达到0.9199%以上至少两个模型给出相同等级。看起来很可靠但和人类的一致性呢最低0.33。AI之间高度一致但和人类严重分歧。三个AI不是各自独立地接近真相而是在犯同一个错误。打个比方三个学生做同一道判断题答案完全一样。不是因为都理解了这道题而是因为思维方式完全相同连错都错得一模一样。这就是为什么报告说把三个模型联合起来打分也没用偏差是系统性的不是某个模型的个体问题。AI不是在判断你的论文是在匹配「好论文的样子」761篇论文研究团队提取了四类语言特征词汇广度、思想连接、句子复杂度、文本长度。结果这四类特征都统计显著地预测AI分数其中词汇广度是AI给分的最强预测因子你的论文用了多少不同的词是AI给分的头号信号而论证是否成立并不在这项研究测量的任何预测因子之列。而对人类评分者这些特征的影响「broadly negligible」基本可以忽略。这意味着什么AI对看起来像好论文的表面特征敏感对论证是否成立的实质不敏感。一个合理的担忧是一篇论证混乱但文采飞扬的论文在AI眼里可能比逻辑严密但文笔朴素的得分更高。需要说明这是从统计关联中合理推导的情形OpRaise并未直接做此项实验。因为它不是在「理解」你的论证它在「匹配」训练数据中高分论文的表面特征。文章长、词汇多、句式复杂AI就给高分。至于你说的到底对不对它不在乎。它不是在判断你的论文是在判断你的论文看起来像不像一篇好论文。学生说了一句很重的话OpRaise不止做了定量研究还组织了9个焦点小组25名师生参与讨论。一个曼彻斯特城市大学的学生说了这句话「如果学生和老师都在用AI那谁在学习我们在这里到底在做什么」焦点小组中反复出现一个词「被看见」。学生需要被教师看见和重视教师需要通过评分看见学生。一位教师说「如果你把它交给AI……它不考虑任何关系、任何对话、任何学生与你分享的思想。这一切都没有了。」报告把这叫做评分中的「社会契约」评分不只是分配数字而是师生之间关于尊重、学习目标和公平的共同预期。学生抗拒的不是AI这个工具本身而是「没有人看见我」的虚无感。焦点小组中有人担心缺失了人际连接学生会不来上课教师会离职。评语的情况更微妙。AI生成的评语是人类的3到8倍压缩到同等长度后师生竟然分不清人机。但揭晓来源后认可度骤降。甚至有人建议不要叫AI评分改叫「专门为心理学论文开发的高可靠性评分工具」可能更容易被接受。换一个说法信任就回来了但这恰恰说明真正的问题不在工具的性能而在人们对AI评分这个概念本身的抵触。「35%」不是准确率太低是一个签名很多人会说35%那是因为模型还不够好等GPT-6出来就好了。但报告已经用了当前非常强的三个模型提供了完整评分标准优化了prompt做了综合打分。偏差仍然存在而且报告明确说集成方法无法纠正。因为这不是单纯的精度问题。高压低、低拔高这是中心倾向偏差。所有输出被拉向训练数据的平均水平因为大语言模型没有自己的视角只有训练分布的加权平均。三个模型犯同样的错——这是共振。共享同一技术路径产生相同的偏差模式。AI之间高度一致但与人类分歧巨大这不是可靠是「没有理解的一致」。当然35%也可能仅仅因为当前模型在捕捉人类评估的复杂判断时还不够好一个更低调的解释。但如果这个偏差在不同模型和不同聚合方式下都稳定存在OpRaise观察到的正是这一点并且与「输出被拉向训练分布平均水平」的机制解释相符那么称之为当前技术路径的「系统性签名」是合理的。这不是某种神秘本质的证明而是说沿着这条技术路径评分偏差具有可预测的模式且这种模式与「没有视角的系统做统计匹配」的特征一致。35%不是准确率太低。它是当前大语言模型评分机制的系统性签名——一种可预测的、与「没有视角的系统做统计匹配」特征一致的偏差模式。大学的选择不少高校正在考虑让AI承担评分职责。教师阅卷负担沉重这完全可以理解。但报告提出了两个清醒的提醒第一性能不跨校泛化。同样一套AI在剑桥能做到63%的等级一致率到了曼彻斯特城市大学只剩35%。你的论文在哪个学校、面对哪个评分标准会直接影响AI给你的分数。每个机构必须用自身材料做本地验证。第二一旦转向AI评分可能难以回归人类评分——即使你想。因为人员已经调整投资已经转移。AI可以标记异常、检查一致性、生成初稿评语。但报告说得清楚最终评分权必须属于人类。顾问委员会一致同意。不是因为人比AI更准而是因为评分的本质不是打分是一个人读懂另一个人的思考然后给出回应。参考来源Talmi, D. et al.OpRaise: AI in University Assessment: Evaluating the Opportunities and Risks of Automated Marking(2026). 官网http://www.emotional-cognition.psychol.cam.ac.uk/opraise

相关新闻

HR必备:实时录音转文字工具提升招聘效率

HR必备:实时录音转文字工具提升招聘效率

1. 为什么HR需要实时录音转文字工具?在招聘旺季,HR每天可能要面试十几位候选人。传统的手写记录方式不仅效率低下,还容易遗漏关键信息。我曾经见过一位资深HR在面试结束后,面对密密麻麻的笔记却想不起候选人具体说了什么。更糟糕的…

2026/8/25 6:58:07 阅读更多 →
Toplify 自动化部署与运维实战指南

Toplify 自动化部署与运维实战指南

在团队协作开发前端项目时,最让人头疼的往往不是编写业务代码,而是那些重复、繁琐且容易出错的构建与发布环节。想象一下,每次合并代码都要手动执行打包命令,小心翼翼地上传文件到服务器,还要担心不同环境配置混淆导致…

2026/8/25 6:58:07 阅读更多 →
链表已死?从缓存局部性、动态数组与工程实践看数据结构选择

链表已死?从缓存局部性、动态数组与工程实践看数据结构选择

为什么有人说链表已死?这个说法乍一听很吓人,仿佛我们大学数据结构课上学的基础知识,一夜之间就成了技术古董。但如果你真的信了,可能就错过了一个理解现代软件工程底层逻辑的关键视角。链表真的“死”了吗?从技术原理…

2026/8/25 6:57:06 阅读更多 →

最新新闻

数据中心基础设施运维体系:从风险管控到智能运维的实战指南

数据中心基础设施运维体系:从风险管控到智能运维的实战指南

1. 项目概述:从“救火队”到“体系化”的运维跃迁干了十几年数据中心运维,从当年拎着螺丝刀在机房里“跑断腿”,到现在坐在监控大屏前“运筹帷幄”,我最大的感触就是:运维的本质不是修设备,而是管风险。今天…

2026/8/25 7:38:26 阅读更多 →
Python爬虫实战:高效获取英雄联盟战绩数据的技术解析

Python爬虫实战:高效获取英雄联盟战绩数据的技术解析

1. 从需求到实现:为什么选择爬虫获取LOL战绩数据?作为一名游戏数据爱好者,我经常想分析自己和朋友的《英雄联盟》对局表现。官方客户端和第三方App提供的数据虽然直观,但往往不够深入,或者无法满足批量分析、长期追踪的…

2026/8/25 7:38:26 阅读更多 →
主流登录鉴权框架深度解析:Spring Security、Shiro、JWT与OAuth2选型指南

主流登录鉴权框架深度解析:Spring Security、Shiro、JWT与OAuth2选型指南

1. 项目概述:为什么我们需要盘点登录与鉴权框架?在任何一个需要区分用户身份、控制资源访问的应用里,登录和鉴权都是绕不开的基石。简单来说,登录解决“你是谁”的问题,而鉴权则回答“你能做什么”。我见过太多项目&am…

2026/8/25 7:38:26 阅读更多 →
特征缩放:消除数据尺度差异,加速模型收敛与提升性能

特征缩放:消除数据尺度差异,加速模型收敛与提升性能

1. 项目概述:为什么你的模型总在“闹脾气”?你有没有遇到过这种情况?辛辛苦苦收集了数据,满怀信心地训练了一个机器学习模型,结果它的表现却像过山车一样不稳定,时好时坏,或者干脆就“学不会”&…

2026/8/25 7:38:26 阅读更多 →
Windows 7系统下经典迅雷版本选择、安全获取与配置优化全指南

Windows 7系统下经典迅雷版本选择、安全获取与配置优化全指南

1. 项目缘起:为什么今天还需要Windows 7的迅雷?如果你点开了这篇文章,大概率是在为一台老旧的电脑、一个特定的测试环境,或者某个必须运行在Windows 7上的专业软件寻找一个可靠的下载工具。是的,在主流操作系统早已迭代…

2026/8/25 7:38:26 阅读更多 →
AI招聘系统中的公平性保障与可解释性实践

AI招聘系统中的公平性保障与可解释性实践

1. 招聘筛选Agent的行业痛点与核心挑战最近两年,AI招聘工具在HR科技领域呈现爆发式增长。根据Gartner的调研数据,到2025年将有超过60%的企业在招聘流程中使用某种形式的AI辅助工具。但与此同时,关于算法歧视的诉讼案件也在同步增长——2023年…

2026/8/25 7:37:26 阅读更多 →

日新闻

洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表

洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表

【题目来源】 https://www.luogu.com.cn/problem/P7912 【题目描述】 小熊的水果店里摆放着一排 n 个水果。每个水果只可能是苹果或桔子,从左到右依次用正整数 1,2,…,n 编号。连续排在一起的同一种水果称为一个“块”。小熊要把这一排水果挑到若干个果篮里&#x…

2026/8/25 0:00:34 阅读更多 →
Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG

Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG

Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG 【免费下载链接】transformers.js State-of-the-art Machine Learning for the web. Run 🤗 Transformers directly in your browser, with no need for a server! 项目地址: https:/…

2026/8/25 0:00:34 阅读更多 →
数学建模竞赛论文写作指南:从模型构建到学术表达的核心技能

数学建模竞赛论文写作指南:从模型构建到学术表达的核心技能

1. 项目概述:从“会做”到“会写”的竞赛核心跃迁“全国大学生数学建模竞赛”,这个名字对理工科学生来说,分量极重。每年,无数团队在三天三夜的时间里,为一个开放性问题绞尽脑汁,从建立模型、求解算法到编程…

2026/8/25 0:00:34 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/25 3:38:12 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/25 3:38:18 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/25 3:38:23 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/24 20:22:44 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/23 12:10:44 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/24 11:20:22 阅读更多 →