人工智能“迎战”奥数难题
创始人
2024-08-05 12:00:44
0

IMO中的问题涵盖了多个数学领域。但大多数IMO问题都是用英语编写的,需要翻译成AI能理解和验证的编程语言,才能让AI进行机器学习。

图片来源:《自然》网站

【今日视点】

继击败人类围棋大师和战略棋盘游戏顶尖高手之后,谷歌“深度思维”公司人工智能(AI)系统在英国巴斯举行的2024年国际数学奥林匹克竞赛(IMO)上,仅以1分之差与金牌失之交臂,获得了银牌。这是AI选手首次登上IMO领奖台。

英国《自然》杂志网站在7月27日的报道中指出,“深度思维”正与其他公司竞相解决数学领域的疑难问题。近年来,IMO被广泛认为是对机器学习的一个挑战,也是衡量AI系统高级数学推理能力的理想基准。AI系统在今年IMO中的精彩表现,标志着其即将再下一城:在解决数学难题方面击败世界顶尖学生。

首登领奖台

“深度思维”公司训练了一个专门用于解答数学奥赛考题的AI系统,成功解答了6道竞赛题中的4道,获得28分(满分42分),达到本次比赛银牌获得者的水平。

该系统包括解答数学推理问题的模型AlphaProof和解答几何问题的模型AlphaGeometry的升级版AlphaGeometry 2。其中,AlphaGeometry 2解决了一个几何问题,而AlphaProof则解答了两个代数问题和一个数论问题。

今年1月份,AlphaGeometry在解决欧几里得几何问题上,就已表现出奖牌级选手的水平。在今年的IMO比赛前,AlphaGeometry 2已经能够解决过去25年里83%的IMO几何问题,而其“前身”仅能解决53%。

“深度思维”公司AI科学副总裁普什米特·科利指出,这是AI系统首次达到获IMO奖牌级别的性能。IMO主席格雷戈尔·多利纳尔也表示,AI最终将能比人类更好地解决大多数数学问题,其进步速度令人惊叹。

几乎同一时间,软件公司Numina的科学家使用语言模型,赢得了AI数学奥林匹克奖(AIMO)的首个“进步奖”。

但Numina团队在获奖后表示,要解决更难的数学问题,仅靠语言模型可能还不够。

与自己对抗

AlphaProof是一个自学习系统,其核心创新在于结合预训练语言模型与AlphaZero强化学习算法的策略。强化学习是机器学习领域一种重要的学习范式,系统可通过多次尝试找到自己的解题方法。

这种方法需要用AI能理解和验证的语言编写大量问题,而大多数IMO问题都是用英语编写的。为解决这个问题,“深度思维”团队托马斯·赫伯特及其同事使用谷歌的大语言模型Gemini,将这些问题翻译成一种名为Lean的编程语言,以供AI进行学习。

AlphaProof使用经过微调的Gemini模型,自动将数学问题转换为Lean语言,从而创建了一个涵盖不同难度级别的大型问题库。在强化学习阶段,系统每验证一个证明,就用它来强化AlphaProof的语言模型,提高其解决后续更具挑战性问题的能力。

赫伯特表示,在挑战围棋游戏时,他们也采用了类似的方法:AI通过与自己对抗,来学习如何更好地玩游戏。结果显示,在某些情况下,AlphaProof能够在无限多的可能性中迈出正确的一步,展现出“灵光一闪”的能力。

仍有改进空间

尽管AlphaProof的表现令人印象深刻,但其速度相对较慢,解决3个问题耗费了3天时间,而人类参赛者仅需4个半小时。此外,它也未能回答两个与组合数学有关的问题。

英国数学家约瑟夫·迈尔斯审查了AI在本次IMO比赛中给出的答案。他指出,AlphaProof采取的这些技术能否予以完善还有待观察。

英国伦敦数学科学研究所何杨辉称,AlphaProof这样的系统对于帮助数学家证明问题很有用,但它无法帮助研究人员确定需要解决和研究的问题。

“深度思维”团队表示,他们正继续探索多种用于推进数学推理的AI方法。未来,数学研究者将与AI合作验证假说,尝试新方法来解决长期未解决的数学难题。他们也希望AlphaProof能够通过减少错误响应,帮助改进谷歌的大型语言模型。(记者 刘 霞)

相关内容

热门资讯

“打飞的”即将成为现实,低空载... 据报道,上海推出“打飞的”低空运输服务。9月23日,上海浦东到上海金山到浙江海宁的双向低空载客航线,...
上海量子城域网可支持百万级用户... 9月24日,第24届中国国际工业博览会在国家会展中心(上海)开幕。开幕式前,相关领导参观了中国电信展...
布局XR新赛道!西安市出台实施... XR技术将打开我们生活的新“视”界。西安市政府近日出台了《西安市培育打造XR产业链工作实施方案》,发...
聚焦科技视角下的城市更新 上海... 新民晚报讯(记者 马亚宁)一年一度的上海科技界规模最大的多学科、综合性、开放性的学术交流平台——上海...
华为艾优、未野、有色迷你min... 日常为维护面部清洁及良好的个人形象,广大男性同胞更偏向于使用操作便捷的迷你剃须刀来刮剃胡须,不过受结...
谨慎下载使用!这13款移动Ap... 据国家计算机病毒应急处理中心网站消息,国家计算机病毒应急处理中心近期通过互联网监测发现13款移动Ap...
原创 水... 说到水晶这种大名鼎鼎的晶体,大多数人都不陌生,因为晶莹剔透的质感十分美丽,无论是在珠宝市场上还是在博...
小辊径6辊轧机:硅钢轧机的高效... 在能源转型与低碳经济的浪潮中,硅钢作为电力传输与转换的关键材料,其重要性日益凸显。硅钢以其优异的磁性...
原创 苹... 苹果iOS17.7为什么如此火爆呢?很多iPhone用户认为此版本或将是iOS17最后的版本,另外这...
“科技引领,自主可控”国泰君安... 来源:市场资讯 近日,“科技引领,自主可控”国泰君安2024科技策略研讨会在上海举办。本次研讨会...
第二十四届工博会开幕 巨轮智能... 9月24日,以“工业聚能 新质领航”为主题的第二十四届中国国际工业博览会在上海开幕。本届工博会共设置...
原创 漂... 虽然这段时间手机圈的热度都被华为和苹果给霸占了,但不少厂商依然选择在此时间段发布新机,比如昨天发布的...
华为新款Wi-Fi 7路由器B...  随着智能家居设备的广泛普及,家庭网络的重要性愈发凸显。无论是流畅的在线游戏体验、高清视频会议,还是...
环境部:我国保持良好核安全记录... 9月25日,国务院新闻办公室举行“推动高质量发展”系列主题新闻发布会。 生态环境部副部长、国家核安...
贵州电网公司有了“小王同事”智... “小王同事,06021DY*015如何装表?” “答案不言而喻,你问的06021DY*015,红岩2...
突破主体互动难关!豆包发布视频... 字节跳动正式宣告进军AI视频生成。9月24日,字节跳动旗下火山引擎在深圳举办AI创新巡展,一举发布了...
声网发布aPaaS灵动会议 鞭牛士 9月24日消息,声网今日正式发布了aPaaS“灵动会议”,该产品通过领先的RTE技术,融合生...
中国联通:以数智之力守护黄河安... 黄河之水天上来,奔流到海不复回。 黄河安澜是中华儿女的千年期盼,黄河流域的生态保护和高质量发展,是事...
AI+机器人 中控技术发布Pl... 近期,中控技术正式发布了Plantbot机器人解决方案。Plantbot机器人解决方案,是中控技术基...
湖南移动实现娄邵高铁5G信号全... 华声在线9月24日讯(通讯员 赵琨)近日,湖南移动网络建设者经过连续40多天的奋战,顺利完成了娄邵高...