> 新闻 > 国内新闻 > 正文

天气预报

卡迪夫大学新研究:AI 尚无法像人类教师一样可靠地批改作业_我的网站

杀破狼

A |     

据@人民日报体育确认,国家体育总局社体中心发布通知,拟于2022年下半年举办首届中国飞盘联赛。赛事名称为2022-2023年中国飞盘联赛,时间拟于2022年8月至2023年2月在全国多地举行。在本次通知中,一个值得关注的点是——飞盘比赛将于十一人制足球场进行,将场地切分为两块。

B |      8 月 24 日消息,据外媒 Phys.org 今天(24 日)报道,卡迪夫大学和墨尔本大学的一项新研究发现,生成式人工智能(GenAI)目前还无法像人类教师一样可靠地评判学生的书面作业。研究人员使用 ChatGPT 的两个版本,对 50 篇生物科学专业本科生论文进行评分,以测试大模型评估学生作业的能力。ChatGPT 需要按照 7 项标准批改这些论文,研究人员还采用了 4 种不同的提示方式,随后将大模型与人工评分的平均分和分数波动情况进行比较。图源:Pexels卡迪夫大学生物科学学院威廉 · 凯博士指出:“研究结果显示,模型给出的分数波动很大,无法准确预测人工评分。近期在网上,关于足球和飞盘争夺场地的讨论也愈演愈烈。生成式 AI 与人类批改同一批论文时存在明显差异。对于飞盘和足球的场地之争,国足门将王大雷就表示,“足球场没人踢,人家花钱租场地玩飞盘,爱玩什么玩什么,这你能管得了人家嘛。” “人家花钱了消费了想干嘛干嘛,建了球场又没人踢球,还不让别人玩别的。

C | 只看论文总分,两者给出的结果相对接近;一旦具体到每项评分标准和每一篇论文,大模型与人工评分之间的差距就相当明显。老说些道貌岸然的,没品。” 北京市体育局局长赵文也在接受媒体采访时聊到过这个问题。“青少年更需要滑板U型槽、飞盘场地等。所以在今后北京新建的体育场地设施建设上,我们也会更多考虑青少年个性体育需求,提供多元化的场地设施。”除一种情况外,AI 模型给出的平均分普遍高于人工评分。”

。平均分方面,AI 模型与人工评分的最大差距达到 16.1 分;具体到单篇论文,最大差距达到 40 分。获悉,威廉 · 凯还发现,AI 往往会压低高分论文的成绩,又把低分作业的成绩抬高,最终使分数系统性地向中间集中。研究结果说明,至少现阶段,即使经过大量训练,AI 仍无法可靠地对主观性较强的书面作业给出与人类相当的分数。“我们测试的大模型目前并不适合取代教师,为学生预测作业成绩。”研究人员指出,高等教育领域确实很关注大模型能否利用模式识别能力,让学生作业评分更加客观,同时提高批改效率、减轻教职人员压力。

D | 但这项研究表明,目前并不适合这么做。此外,未经学生明确同意便把作业提交给 AI 工具,本身还涉及伦理问题;大模型也不能、也不应该被依赖来给学生的长篇书面作业评分。“随着大模型继续发展,未来模仿人类判断的能力可能会提高。但从这项研究来看,要让 AI 给出的分数与人工评分真正保持一致,恐怕并不容易。

Current article:http://boe60y.liawucunsainantaonao.sbs/news/20260826_3968522.html

Published on:02:18:40