首个AI高考全卷评测结果:最高分303,数学全不及格

今日头条
Toutiao
最新回复:2024年6月20日 10点0分 PT
  返回列表
75683 阅读
15 评论
快科技

快科技6月19日消息,据媒体报道,上海人工智能实验室旗下司南评测体系OpenCompass选取了7个大模型进行高考“语数外”全卷能力测试。OpenCompass发布了首个大模型高考全卷评测结果。

在满分420分的三科测试中,阿里通义千问2-72B以303分的成绩拔得头筹,紧随其后的是OpenAI的GPT-4o,获得296分,而上海人工智能实验室的书生·浦语2.0位列第三。

这三大模型的得分率均超过了70%,展现了不俗的实力。相比之下,来自法国大模型初创公司的Mistral则排名末尾。

参与此次评测的模型来源广泛,包括阿里巴巴、零一万物、智谱AI、上海人工智能实验室、法国Mistral的开源模型,以及OpenAI的闭源模型GPT-4o。

为确保公平,实验室特别指出,由于无法确定闭源模型的更新时间,评测中仅将GPT-4o作为参考,并未纳入商用闭源模型。同时,所有参与评测的模型均在高考前(2024年4月-6月)开源,有效避免了“刷题风险”。

从评测结果来看,大模型在语文和英语方面的表现普遍较好,但在数学方面则普遍不及格。最高分仅为75分,由书生·浦语2.0获得,紧随其后的是GPT-4o的73分。语文方面,通义千问表现出色,而英语则由GPT-4o领跑。

数学成绩的不理想凸显出大模型在复杂推理能力方面的不足。这一能力是金融、工业等要求可靠场景落地所需的关键能力,也是大模型未来发展的重要方向。

l
liush000
1 楼
只要是第一次见到了,就开始瞎瘠薄拼接了。
s
slimane
2 楼
強國用OpenAI是不是違法行為?
加拿大临期食品
3 楼
这里面多数不是多模态,能测个毛数学。Mixtral 中文支持像粑粑一样,语文还有21分笑死我。
刁太大
4 楼
山寨版,怪不得这么水。
铗归来
5 楼
书生·浦语2.0 不道德 超过了GPT-4o 不道德。
阳痿男
6 楼
这些大模型都是通过文章训练出来的,当然只能搞搞语文。英语也是英国美国的语文。
c
carlos067
7 楼
第一个蒸汽机车比马车跑的慢。。。
p
potatohead
8 楼
这应该被举报了吧。
鹿
鹿特丹丹
9 楼
有意思。有没有具体答卷?
支持意大利
10 楼
还是train的不够,人家open ai没事研究中国高考干嘛😭
c
cxy1223
11 楼
在没有准确答案的时候,比较擅长忽悠人类。让它们做点实事就漏洞百出。
狼王2
12 楼
扯淡,我大学理工试卷全是gpt 做的,比教授做得还好。
o
oldoldcandy
13 楼
哈..哈..期望愈大,失望愈大...
夜来风雨
14 楼
你出生时不是没屁眼的吗?
鹿
鹿特丹丹
15 楼
真的?贴一个上来看看。