首个AI高考全卷评测结果:最高分303,数学全不及格 - 2024年6月20日 / 头条新闻

快科技

大约一年前

快科技6月19日消息，据媒体报道，上海人工智能实验室旗下司南评测体系OpenCompass选取了7个大模型进行高考“语数外”全卷能力测试。OpenCompass发布了首个大模型高考全卷评测结果。

在满分420分的三科测试中，阿里通义千问2-72B以303分的成绩拔得头筹，紧随其后的是OpenAI的GPT-4o，获得296分，而上海人工智能实验室的书生·浦语2.0位列第三。

这三大模型的得分率均超过了70%，展现了不俗的实力。相比之下，来自法国大模型初创公司的Mistral则排名末尾。

参与此次评测的模型来源广泛，包括阿里巴巴、零一万物、智谱AI、上海人工智能实验室、法国Mistral的开源模型，以及OpenAI的闭源模型GPT-4o。

为确保公平，实验室特别指出，由于无法确定闭源模型的更新时间，评测中仅将GPT-4o作为参考，并未纳入商用闭源模型。同时，所有参与评测的模型均在高考前（2024年4月-6月）开源，有效避免了“刷题风险”。

从评测结果来看，大模型在语文和英语方面的表现普遍较好，但在数学方面则普遍不及格。最高分仅为75分，由书生·浦语2.0获得，紧随其后的是GPT-4o的73分。语文方面，通义千问表现出色，而英语则由GPT-4o领跑。

数学成绩的不理想凸显出大模型在复杂推理能力方面的不足。这一能力是金融、工业等要求可靠场景落地所需的关键能力，也是大模型未来发展的重要方向。

liush000

大约一年

1 楼

只要是第一次见到了，就开始瞎瘠薄拼接了。

slimane

大约一年

2 楼

強國用OpenAI是不是違法行為？

加

加拿大临期食品

大约一年

3 楼

这里面多数不是多模态，能测个毛数学。Mixtral 中文支持像粑粑一样，语文还有21分笑死我。

刁

刁太大

大约一年

4 楼

山寨版，怪不得这么水。

铗

铗归来

大约一年

5 楼

书生·浦语2.0 不道德超过了GPT-4o 不道德。

阳

阳痿男

大约一年

6 楼

这些大模型都是通过文章训练出来的，当然只能搞搞语文。英语也是英国美国的语文。

carlos067

大约一年

7 楼

第一个蒸汽机车比马车跑的慢。。。

potatohead

大约一年

8 楼

这应该被举报了吧。

鹿

鹿特丹丹

大约一年

9 楼

有意思。有没有具体答卷？

支

支持意大利

大约一年

10 楼

还是train的不够，人家open ai没事研究中国高考干嘛😭

cxy1223

大约一年

11 楼

在没有准确答案的时候，比较擅长忽悠人类。让它们做点实事就漏洞百出。

狼

狼王2

大约一年

12 楼

扯淡，我大学理工试卷全是gpt 做的，比教授做得还好。

oldoldcandy

大约一年

13 楼

哈..哈..期望愈大，失望愈大...

夜

夜来风雨

大约一年

14 楼

你出生时不是没屁眼的吗？

鹿

鹿特丹丹

大约一年

15 楼

真的？贴一个上来看看。