苹果研究团队曾测试20款先进AI模型 在有干扰项下简单算术题表现甚至不如小学生

花花2024-11-02热点分享123

  IT之家 11 月 2 日消息,《洛杉矶时报》昨日(11 月 1 日)发布博文,报道称苹果研究团队测试了 20 个最先进的 AI 模型,发现在有干扰项存在的情况下,它们处理简单的算术问题时表现不佳,甚至不如小学生。

  苹果公司用以下这道简单的算术题测试 20 多个最先进的 AI 模型,IT之家附上题目如下:

苹果研究团队曾测试20款先进AI模型 在有干扰项下简单算术题表现甚至不如小学生

  Oliver 在星期五采摘了 44 个猕猴桃、然后他在星期六采摘了 58 个猕猴桃,星期日采摘的数量是星期五的两倍,不过其中有 5 个猕猴桃的块头要比平均值要小,请问 Oliver 这三天共摘了多少个猕猴桃?

  正确答案是 190 个,计算公式为 44(星期五)+58(星期六)+88(44*2,星期日)。

  不过测试的 20 多个最先进 AI 模型无法排除干扰项,通常不理解猕猴桃的大小和数量无关,大部分的结果是 185 个。

  苹果团队发现,当问题包含看似相关但实际上无关的信息时,AI 模型的表现急剧下降。对此研究认为,AI 模型主要依赖于训练数据中的语言模式,而非真正理解数学概念。

  苹果的研究表明,目前的 AI 模型“无法进行真正的逻辑推理”。这一发现提醒我们,尽管 AI 在某些任务上表现出色,但其智能并不如表面看起来那样可靠。

  苹果团队指出,简单地扩展数据或计算能力并不能根本解决这个问题,苹果的论文并非旨在削弱对 AI 能力的热情,而是提供一种理性的认知。

相关文章

美国9月非农就业增长远超预期,美联储或放缓降息步伐

美国9月非农就业增长远超预期,美联储或放缓降息步伐

  美国劳工部周五发布的报告显示,9月非农就业人数增加25.4万人,远超市场预计的15万人左右。失业率为4.1%,比上月略降0.1个百分点。就业人数增加的同时,...

何六艺:老年人精神健康面临严峻挑战,国内高达19%老年人处于轻度抑郁状态

何六艺:老年人精神健康面临严峻挑战,国内高达19%老年人处于轻度抑郁状态

专题:2024中国企业竞争力年会暨《中国经营报》创刊40周年论坛...

产品年利率超2% 银行密集发售大额存单

产品年利率超2% 银行密集发售大额存单

  临近年末,银行揽储大战开启,为加大获客力度,大额存单产品迎来密集上新。12月10日,北京商报记者注意到,近日,多家中小银行、农信社推出了大额存单产品,多款产...

拉尼娜现象可能对巴西2024/25年度作物生长产生积极影响

拉尼娜现象可能对巴西2024/25年度作物生长产生积极影响

  作物专家迈克尔·科尔多涅博士称,目前全球天气正在从厄尔尼诺向拉尼娜过渡,但是拉尼娜现象可能不会很快出现,因此不会对2024年美国农作物产生太大影响,但是却可能对巴西202...

南京证券:第三季度营业收入和净利润分别同比增长44.42%和34.05%

南京证券:第三季度营业收入和净利润分别同比增长44.42%和34.05%

南京证券 2024年第三季度报告显示,公司业绩表现亮眼。营业收入和归属于上市公司股东的净利润分别同比增长44.42%和34.05%,主要得益于证券投资业务收入的增加。截至...