让AI做2024新高考1卷数学最后一题:AI智商横向对比!

2024-06-11 01:04

本文主要是介绍让AI做2024新高考1卷数学最后一题:AI智商横向对比!,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

大家好,我是木易,一个持续关注AI领域的互联网技术产品经理,国内Top2本科,美国Top10 CS研究生,MBA。我坚信AI是普通人变强的“外挂”,所以创建了“AI信息Gap”这个公众号,专注于分享AI全维度知识,包括但不限于AI科普AI工具测评AI效率提升AI行业洞察。关注我,AI之路不迷路,2024我们一起变强。

一些结论

即使是当下最先进的AI模型,在面对高难度数学推理题时,仍有很大的提升空间。

模型名称题目理解解答过程总体评价
GPT-4o完全正确输出大量内容,但大部分不正确,仅成功给出一组答案题目理解强,但解答过程不准确
GPT-4 turbo理解与题目要求不符解答与题目无关,推理和计算不准确题目理解和解答均存在较大问题
Kimi Chat理解较为准确解答中出现AI幻觉,第一小问解答不正确题目理解较好,但解答过程出现错误
通义千问初步理解正确,但未详细解释题目思路正确,但详细解答过程中出现错误初步理解正确,详细解答不够准确

牵动着无数家长和学子们的一年一度的高考刚刚落下帷幕,那么,今年的高考数学难吗?有考生吐槽:一出考场就哭了。

之前我曾经用高考语文作文横向对比过部分AI模型/工具的创意写作能力,并且做了后续的AI互评,让AI来评价AI写的文章。感兴趣的小伙伴可以翻看这里:

  1. 让AI写高考作文:GPT-4、Kimi、通义千问“创意写作”能力横向测评!

  2. AI文章互评:得分最高的竟然不是GPT-4!

今天,让我们继续。今天我将以2024年新高考数学一卷的最后一题为基准,来测试各大AI模型/工具的表现。

2024年新高考数学一卷最后一题

这道题目是一道数列大题,对于AI来说应该算是很难的级别了,因为这并不是考察AI的知识积累,而是单纯的考察AI的推理能力,包括对题目的理解,知识点的定位,以及解答方法的分析推理。

其次,由于是数学题目,包括很多数学公式,所以我只能以图片的方式来发送给AI模型,这对于AI的多模态支持也是一个挑战,能够看出AI对图片的解析是否正确。

提示词:中文详细解释这道题目,然后写出详细完整的解答计算过程。

题目

答案

下面测评开始。

GPT-4o模型

回答速度极快,大概几秒钟就开始响应我的问题。题目理解完全正确,但后面的解答过程中,虽然洋洋洒洒输出了一大堆,但基本都不正确,即使是第一小问。第一小问中,答案应该是三组:(1,2),(1,6),(5,6),GPT-4o成功给出了一组。

GPT-4 turbo模型

GPT-4o不同,GPT-4 turbo模型在题目的理解上就出现了很大的问题,基本上牛头不对马嘴,更不用提后续的解答过程了。

这样的测试结果和OpenAI官方发布的GPT-4oGPT-4 turbo的对比测评结果是相符的。

Kimi Chat

Kimi的表现可圈可点,可以说对题目的理解方面,是明显强于GPT-4 turbo模型的。虽然这可能与提示词/题目都是中文的有关系,Kimi这种中文大模型会天然有一定的优势,但足以说明,Kimi在图片内容识别和题目的理解上是不错的。

但同样的,在后续的问题解析部分,Kimi也出现了AI幻觉,从第1问开始就不是很正确。我后续又追问了几个问题,让Kimi来写出具体的第1小问的解答,均未得到正确的结果。

通义千问

通义千问并没有遵循我在提示词里说的先详细解释题目,而是简单地写了一段初步理解。但从通义千问的简述来看,它对这道题目的理解是基本正确的。但同样在后续的解答中出现了幻觉,只能说是有思路,但没有做对。

结语

让AI做高考数学题目,离回答正确还有不小的距离。


精选推荐

  1. 使用GPT-4o模型的5种方法,总有一种适合你!

  2. 关于最新模型GPT-4o的14条总结,都在这里!

  3. 免费的GPT4终于要来了!OpenAI直播发布会详细解读!

  4. 春日暖阳,何不来看一场OpenAI的发布会


都读到这里了,点个赞鼓励一下吧,小手一赞,年薪百万!😊👍👍👍。关注我,AI之路不迷路,原创技术文章第一时间推送🤖。

这篇关于让AI做2024新高考1卷数学最后一题:AI智商横向对比!的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1049773

相关文章

Ilya-AI分享的他在OpenAI学习到的15个提示工程技巧

Ilya(不是本人,claude AI)在社交媒体上分享了他在OpenAI学习到的15个Prompt撰写技巧。 以下是详细的内容: 提示精确化:在编写提示时,力求表达清晰准确。清楚地阐述任务需求和概念定义至关重要。例:不用"分析文本",而用"判断这段话的情感倾向:积极、消极还是中性"。 快速迭代:善于快速连续调整提示。熟练的提示工程师能够灵活地进行多轮优化。例:从"总结文章"到"用

AI绘图怎么变现?想做点副业的小白必看!

在科技飞速发展的今天,AI绘图作为一种新兴技术,不仅改变了艺术创作的方式,也为创作者提供了多种变现途径。本文将详细探讨几种常见的AI绘图变现方式,帮助创作者更好地利用这一技术实现经济收益。 更多实操教程和AI绘画工具,可以扫描下方,免费获取 定制服务:个性化的创意商机 个性化定制 AI绘图技术能够根据用户需求生成个性化的头像、壁纸、插画等作品。例如,姓氏头像在电商平台上非常受欢迎,

从去中心化到智能化:Web3如何与AI共同塑造数字生态

在数字时代的演进中,Web3和人工智能(AI)正成为塑造未来互联网的两大核心力量。Web3的去中心化理念与AI的智能化技术,正相互交织,共同推动数字生态的变革。本文将探讨Web3与AI的融合如何改变数字世界,并展望这一新兴组合如何重塑我们的在线体验。 Web3的去中心化愿景 Web3代表了互联网的第三代发展,它基于去中心化的区块链技术,旨在创建一个开放、透明且用户主导的数字生态。不同于传统

AI一键生成 PPT

AI一键生成 PPT 操作步骤 作为一名打工人,是不是经常需要制作各种PPT来分享我的生活和想法。但是,你们知道,有时候灵感来了,时间却不够用了!😩直到我发现了Kimi AI——一个能够自动生成PPT的神奇助手!🌟 什么是Kimi? 一款月之暗面科技有限公司开发的AI办公工具,帮助用户快速生成高质量的演示文稿。 无论你是职场人士、学生还是教师,Kimi都能够为你的办公文

Andrej Karpathy最新采访:认知核心模型10亿参数就够了,AI会打破教育不公的僵局

夕小瑶科技说 原创  作者 | 海野 AI圈子的红人,AI大神Andrej Karpathy,曾是OpenAI联合创始人之一,特斯拉AI总监。上一次的动态是官宣创办一家名为 Eureka Labs 的人工智能+教育公司 ,宣布将长期致力于AI原生教育。 近日,Andrej Karpathy接受了No Priors(投资博客)的采访,与硅谷知名投资人 Sara Guo 和 Elad G

2024年流动式起重机司机证模拟考试题库及流动式起重机司机理论考试试题

题库来源:安全生产模拟考试一点通公众号小程序 2024年流动式起重机司机证模拟考试题库及流动式起重机司机理论考试试题是由安全生产模拟考试一点通提供,流动式起重机司机证模拟考试题库是根据流动式起重机司机最新版教材,流动式起重机司机大纲整理而成(含2024年流动式起重机司机证模拟考试题库及流动式起重机司机理论考试试题参考答案和部分工种参考解析),掌握本资料和学校方法,考试容易。流动式起重机司机考试技

【专题】2024飞行汽车技术全景报告合集PDF分享(附原数据表)

原文链接: https://tecdat.cn/?p=37628 6月16日,小鹏汇天旅航者X2在北京大兴国际机场临空经济区完成首飞,这也是小鹏汇天的产品在京津冀地区进行的首次飞行。小鹏汇天方面还表示,公司准备量产,并计划今年四季度开启预售小鹏汇天分体式飞行汽车,探索分体式飞行汽车城际通勤。阅读原文,获取专题报告合集全文,解锁文末271份飞行汽车相关行业研究报告。 据悉,业内人士对飞行汽车行业

高效录音转文字:2024年四大工具精选!

在快节奏的工作生活中,能够快速将录音转换成文字是一项非常实用的能力。特别是在需要记录会议纪要、讲座内容或者是采访素材的时候,一款优秀的在线录音转文字工具能派上大用场。以下推荐几个好用的录音转文字工具! 365在线转文字 直达链接:https://www.pdf365.cn/ 365在线转文字是一款提供在线录音转文字服务的工具,它以其高效、便捷的特点受到用户的青睐。用户无需下载安装任何软件,只

uva 10014 Simple calculations(数学推导)

直接按照题意来推导最后的结果就行了。 开始的时候只做到了第一个推导,第二次没有继续下去。 代码: #include<stdio.h>int main(){int T, n, i;double a, aa, sum, temp, ans;scanf("%d", &T);while(T--){scanf("%d", &n);scanf("%lf", &first);scanf

uva 10025 The ? 1 ? 2 ? ... ? n = k problem(数学)

题意是    ?  1  ?  2  ?  ...  ?  n = k 式子中给k,? 处可以填 + 也可以填 - ,问最小满足条件的n。 e.g k = 12  - 1 + 2 + 3 + 4 + 5 + 6 - 7 = 12 with n = 7。 先给证明,令 S(n) = 1 + 2 + 3 + 4 + 5 + .... + n 暴搜n,搜出当 S(n) >=