吐槽大会原创文学网 - 纯净的绿色文学家园 !

吐槽大会(全文在线阅读>

吐槽大会

卡迪夫大学新研究:AI 尚无法像人类教师一样可靠地批改作业_我的网站

神雕侠侣

A |      8 月 24 日消息,据外媒 Phys.org 今天(24 日)报道,卡迪夫大学和墨尔本大学的一项新研究发现,生成式人工智能(GenAI)目前还无法像人类教师一样可靠地评判学生的书面作业。

B |       8月21日电 国务院新闻办公室8月21日举行“开局起步‘十五五’”系列主题新闻发布会。研究人员使用 ChatGPT 的两个版本,对 50 篇生物科学专业本科生论文进行评分,以测试大模型评估学生作业的能力。财政部副部长廖岷介绍,按照7月30日召开的中共中央政治局会议部署,结合前期政策执行情况和调研中各方意见,已对财政金融协同促内需政策作了优化完善,从今年8月1日起开始实施。ChatGPT 需要按照 7 项标准批改这些论文,研究人员还采用了 4 种不同的提示方式,随后将大模型与人工评分的平均分和分数波动情况进行比较。图源:Pexels卡迪夫大学生物科学学院威廉 · 凯博士指出:“研究结果显示,模型给出的分数波动很大,无法准确预测人工评分。生成式 AI 与人类批改同一批论文时存在明显差异。具体来讲,主要是有三个新的举措:  一是拓宽贴息范围。充分考虑企业的实际需要,在先前固定资产贷款的基础之上,将新发放的流动资金贷款也纳入了中小微企业贷款贴息的政策范围;更好贴近大众消费习惯,将包括购车、装修在内的新发生的各类信用卡分期消费都纳入到政策支持范围,按此,消费者只要是用信用卡分期方式进行消费,都可以享受贴息优惠。

C | 只看论文总分,两者给出的结果相对接近;一旦具体到每项评分标准和每一篇论文,大模型与人工评分之间的差距就相当明显。”除一种情况外,AI 模型给出的平均分普遍高于人工评分。  二是增加了经办机构。平均分方面,AI 模型与人工评分的最大差距达到 16.1 分;具体到单篇论文,最大差距达到 40 分。获悉,威廉 · 凯还发现,AI 往往会压低高分论文的成绩,又把低分作业的成绩抬高,最终使分数系统性地向中间集中。进一步扩大中小微企业贷款贴息、服务业经营主体贷款贴息经办机构范围,从先前约100家增加到了约400家,包括21家全国性银行和金融监管评级3A及以上的城商行、农村合作金融机构、民营银行、外资银行,广泛覆盖城乡经营主体,把服务窗口进一步开到群众家的门口。

D | 研究结果说明,至少现阶段,即使经过大量训练,AI 仍无法可靠地对主观性较强的书面作业给出与人类相当的分数。

E | “我们测试的大模型目前并不适合取代教师,为学生预测作业成绩。  三是进一步提高额度上限。将享受贴息政策的中小微企业贷款规模上限由5000万元提高到7500万元,将享受贴息政策的服务业经营主体的贷款规模上限由1000万元提高到2000万元;将享受政策的个人消费贷款的贴息上限由以前的3000元提高到了5000元,以更好满足经营主体投资和消费需求。”研究人员指出,高等教育领域确实很关注大模型能否利用模式识别能力,让学生作业评分更加客观,同时提高批改效率、减轻教职人员压力。但这项研究表明,目前并不适合这么做。此外,未经学生明确同意便把作业提交给 AI 工具,本身还涉及伦理问题;大模型也不能、也不应该被依赖来给学生的长篇书面作业评分。“随着大模型继续发展,未来模仿人类判断的能力可能会提高。但从这项研究来看,要让 AI 给出的分数与人工评分真正保持一致,恐怕并不容易。  廖岷表示,结合经济发展需要,正在继续研究制订财政金融协同的新政策和新举措,并于今年下半年推出。同时,强化统筹协调,将与央行等金融管理部门一道,推动财政金融联动常态化和长效化。期待这些政策能够进一步增加企业和居民的获得感。

Current article:http://svh3n0b.cousizhegaobaolengkuo.bond/news/20260826_1733716.html

Published on:18:39:03


顶一下
(0)
0%
踩一下
(0)
0%
------分隔线----------------------------