AI监考远程考试失控,5.8万学生被迫重考

AI监考远程考试失控,5.8万学生被迫重考

据美国科技媒体 Ars Technica 报道,一场由人工智能负责监考的远程考试近日遭遇“滑铁卢”:因为考试成绩严重异常,某大学不得不宣布成绩作废,并安排多达 5.8 万名学生重新参加考试。而引发这场风波的直接信号,是考试中“顶级高分”人数比往年激增了整整 5 倍。

在校方看来,如此离谱的数据几乎不可能靠“学生发挥变好”解释。更合理的推测是——大量考生通过某种方式绕过了 AI 监考,或利用生成式 AI 工具在考试中作答。调查人员调阅了 AI 监考系统记录后惊讶地发现,系统在考试过程中并未标记出任何可疑行为。这意味着,这套看起来很聪明的监考软件,实际上成了摆设。

AI 监考系统为何失效?

现代远程监考工具通常整合了摄像头行为识别、屏幕录制、环境音频检测、浏览器锁定等多种技术手段。理想状态下,AI 能实时捕捉到考生的眼神闪烁、嘴部动作、键盘输入异常等“作弊信号”。然而,现实远比理想复杂。如果考生使用外接设备或提前准备好的 AI 聊天窗口,摄像头无法捕捉;如果 AI 生成答案的文本风格与考生平时的写作习惯差异不大,算法也无法识别。

更深层的问题在于 AI 模型的已知缺陷:误报和漏报。比如,某些学生由于紧张或生理原因,频繁看摄像头或摸鼻子,会被误判为作弊;而那些真正利用外部 AI 工具的学生,只要保持端正坐姿、自然表情,就能轻松骗过算法。用高维打低维,AI 监考在作弊技术面前显得格外脆弱。

技术尺度与教育公平

此次事件并非孤例。近年来,Proctorio、Honorlock、ExamSoft 等 AI 监考产品迅速占领在线教育市场,但围绕它们的争议一直没有停歇。2020 年,曾有学生发起投诉,认为 AI 监考系统在肤色较深的学生身上出现更高频的人脸识别错误;也有学者指出,AI 监考的“行为分析”本质上带有偏见,可能对焦虑人群、神经多样性人群不友好。

更值得担忧的是,AI 监考背后的“信任缺失”正在重塑考试文化。当学生被默认成潜在的作弊者,紧张感与不信任感会削弱学习动机。事实上,一次成功的考试不应当依赖“抓作弊”,而应当设计出作弊成本高、能力反映真实的评估方式。例如,开放性问题、项目管理式考核、口头答辩等,都比单选和多选更能抵御 AI 作弊。

5.8 万人重考,暴露了什么?

虽然此次重考安排的细节尚未公布,但组织 5.8 万人重考显然是一场浩大的工程。对于学校而言,这意味着额外的场地、设备和人力成本;对于学生而言,这意味着备考压力翻倍,甚至可能影响正常学习计划。有专家批评道:“用 AI 节省监考成本,最终却让所有人为一次失控的技术测试买单,实在讽刺。”

更广泛地看,远程考试并没有偏离高等教育的轨道,只是我们还没有准备好如何与 AI 共处。随着大模型能力快速提升,未来的考试必然要面对“人人都有 AI 助手”的新常态。与其试图堵住所有的作弊漏洞,不如重新思考:我们究竟想通过一场考试衡量什么?是记忆能力,还是理解与应用能力?

编者按:这是个典型的“技术万能论”陷阱。AI 监考的初衷本是用效率取代人力,但当这把尺子本身都不准的时候,它带来的不是公平,而是更大的不公。5.8 万人被迫重考,就是一次昂贵的试错。我们当然应该鼓励 AI 在教育领域的创新,但前提是,技术必须经得起现实检验。在 AI 全面渗透生活的时代,谨慎不是保守,而是对教育底线的尊重。

本文编译自 Ars Technica。