AI成为数学家得力助手还要多久

5个月前 来源:新华网 观看:81

从计算机科学到医学再到国家安全,数学是众多关键应用的基石,但数学领域的进步可能需要数年时间才能实现。y0f即热新闻——关注每天科技社会生活新变化gihot.com

几百年来,数学家使用的工具依然简朴:一张纸、一支笔。他们凭借逻辑与灵感,在符号的迷宫中寻找通往真理的路径。y0f即热新闻——关注每天科技社会生活新变化gihot.com

为了打破这一局面,美国国防高级研究计划局今年4月启动了“指数性数学”计划,旨在开发一种能极大提升数学研究效率的人工智能(AI)“合著者”系统。y0f即热新闻——关注每天科技社会生活新变化gihot.com

几十年来,数学家借助计算机进行辅助计算或验证命题,如今的AI或许能更上层楼,挑战那些人类长年未解的难题。不过,从能解高中题的AI,到能协助攻克前沿数学难关的AI,中间仍隔着一道鸿沟。y0f即热新闻——关注每天科技社会生活新变化gihot.com

解决重大难题仍力不从心y0f即热新闻——关注每天科技社会生活新变化gihot.com

大型语言模型(LLM)并不擅长数学。它们常常出现“幻觉”,甚至可能被误导相信2+2=5。但新一代大型推理模型,如OpenAI的o3、Anthropic的Claude 4 Thinking等,展现出的进步令数学家眼前一亮。y0f即热新闻——关注每天科技社会生活新变化gihot.com

今年,这些模型在美国数学邀请赛中的表现接近优秀高中生水平。不同于过去“一锤定音”式的输出,这些模型开始尝试模拟数学家逐步推理的思考过程。y0f即热新闻——关注每天科技社会生活新变化gihot.com

同时,一些将LLM与某种事实核查系统相结合的新型混合模型也取得了突破。例如,谷歌“深度思维”的AlphaProof系统将语言模型与棋类AI——AlphaZero结合,成为首个取得与国际数学奥林匹克竞赛银牌得主成绩相当的系统。今年5月,谷歌的AlphaEvolve模型更进一步,在多个长期未解的数学与计算难题上找到优于人类现有方案的解法。y0f即热新闻——关注每天科技社会生活新变化gihot.com

美国《麻省理工科技评论》指出,尽管这些AI成绩亮眼,但专家们普遍认为,它们仍不具备真正的协助科研的能力。竞赛题虽难,却更像是智力游戏,有一定“套路”。真正的数学研究则更开放、更复杂。面对“P vs NP”“黎曼猜想”等重大难题时,AI仍力不从心。y0f即热新闻——关注每天科技社会生活新变化gihot.com

为了更准确地评估AI的能力,初创公司Epoch AI去年推出了FrontierMath测试,联合60多位数学家设计出全新高难度题目,避开模型已见过的训练数据,结果LLM几乎集体“交白卷”。y0f即热新闻——关注每天科技社会生活新变化gihot.com

这些测试表明,AI在数学道路上虽已迈步,但离“合著者”角色仍有很长一段路要走。y0f即热新闻——关注每天科技社会生活新变化gihot.com

需攻克“超长推理链”y0f即热新闻——关注每天科技社会生活新变化gihot.com

仔细观察数学问题会发现,它们在某些方面类似:解决问题需完成一系列连续步骤,关键在于找到这些步骤。y0f即热新闻——关注每天科技社会生活新变化gihot.com

美国加州理工学院谢尔盖·古科夫指出,困难的差异往往体现在路径的长度上。高中数学可能只需10到40步,而像黎曼猜想这样的难题,路径可能长达百万步。y0f即热新闻——关注每天科技社会生活新变化gihot.com

这类“超长路径”极难处理。就像下围棋时寻找一条制胜序列,AI必须在指数级增长的可能路径中找到正确解法。而在数学中,这个复杂度要远超棋类游戏。y0f即热新闻——关注每天科技社会生活新变化gihot.com

据物理学家组织网今年2月报道,为应对这一挑战,古科夫团队开发了一种方法,将多个步骤打包成“超级步骤”,相当于穿上“巨人靴”跨越大段路程。他们设计了一个系统,其中强化学习模型负责提出超级步骤,另一个模型负责验证其合理性。y0f即热新闻——关注每天科技社会生活新变化gihot.com

该策略在经典未解难题——安德鲁斯-柯蒂斯猜想上取得了突破。虽然尚未证明或推翻该猜想,但借助AI,科学家推翻了一个40年来被广泛引用的“反例”。这曾被视为证明该猜想错误的关键依据。y0f即热新闻——关注每天科技社会生活新变化gihot.com

牛津大学数学家马丁·布里森对此表示肯定:“排除错误路径,是科研中非常有价值的一步。”y0f即热新闻——关注每天科技社会生活新变化gihot.com

古科夫相信,这种“压缩路径”的思路适用于所有需要推理链条的领域。他希望,这种方法不仅能推动AI跳出固有模式,也为数学研究带来新突破。y0f即热新闻——关注每天科技社会生活新变化gihot.com

真正的创新和突破仍属人类y0f即热新闻——关注每天科技社会生活新变化gihot.com

跳出思维定式,正是数学家攻克难题的关键。数学常被看作机械推理,而高等数学则更像是一场实验,充满一波三折的试错与灵光乍现的顿悟。y0f即热新闻——关注每天科技社会生活新变化gihot.com

这正是AlphaEvolve等AI工具的优势所在。它通过LLM不断生成并改进解题代码,配合第二个模型评估每一轮结果,最终提出比人类更优的解法。这种方法不仅能独立探索,也支持人类随时介入,提供灵感和指令。y0f即热新闻——关注每天科技社会生活新变化gihot.com

澳大利亚悉尼大学数学家乔迪·威廉姆森强调,探索性思维是数学的核心。据英国《新科学家》网站报道,他与Meta合作开发了PatternBoost AI系统,可根据一个数学想法生成相似概念,帮助激发灵感。他说:“这就像是这里有一堆有趣的东西,我不知道是怎么回事,但你能再生成一些类似的东西吗?”y0f即热新闻——关注每天科技社会生活新变化gihot.com

这种头脑风暴在数学中至关重要,它是新想法产生的源泉。以二十面体为例——古希腊人通过纯粹推理发现了它,其形状并不存在于自然界中,却深刻影响了数学的发展。威廉姆森希望,AI未来也能协助发现类似的“新数学对象”。y0f即热新闻——关注每天科技社会生活新变化gihot.com

不过,目前AI仍缺乏真正的创造力。让AI赢棋是一回事,让它发明围棋游戏则是另一回事。像AlphaEvolve和PatternBoost这样的工具或许能作为人类直觉的“侦察兵”,帮助人们发现路径、避开死路,但专家普遍认为,真正的创新与突破,仍然属于人类。y0f即热新闻——关注每天科技社会生活新变化gihot.com

从计算机科学到医学再到国家安全,数学是众多关键应用的基石,但数学领域的进步可能需要数年时间才能实现。y0f即热新闻——关注每天科技社会生活新变化gihot.com

几百年来,数学家使用的工具依然简朴:一张纸、一支笔。他们凭借逻辑与灵感,在符号的迷宫中寻找通往真理的路径。y0f即热新闻——关注每天科技社会生活新变化gihot.com

为了打破这一局面,美国国防高级研究计划局今年4月启动了“指数性数学”计划,旨在开发一种能极大提升数学研究效率的人工智能(AI)“合著者”系统。y0f即热新闻——关注每天科技社会生活新变化gihot.com

几十年来,数学家借助计算机进行辅助计算或验证命题,如今的AI或许能更上层楼,挑战那些人类长年未解的难题。不过,从能解高中题的AI,到能协助攻克前沿数学难关的AI,中间仍隔着一道鸿沟。y0f即热新闻——关注每天科技社会生活新变化gihot.com

解决重大难题仍力不从心y0f即热新闻——关注每天科技社会生活新变化gihot.com

大型语言模型(LLM)并不擅长数学。它们常常出现“幻觉”,甚至可能被误导相信2+2=5。但新一代大型推理模型,如OpenAI的o3、Anthropic的Claude 4 Thinking等,展现出的进步令数学家眼前一亮。y0f即热新闻——关注每天科技社会生活新变化gihot.com

今年,这些模型在美国数学邀请赛中的表现接近优秀高中生水平。不同于过去“一锤定音”式的输出,这些模型开始尝试模拟数学家逐步推理的思考过程。y0f即热新闻——关注每天科技社会生活新变化gihot.com

同时,一些将LLM与某种事实核查系统相结合的新型混合模型也取得了突破。例如,谷歌“深度思维”的AlphaProof系统将语言模型与棋类AI——AlphaZero结合,成为首个取得与国际数学奥林匹克竞赛银牌得主成绩相当的系统。今年5月,谷歌的AlphaEvolve模型更进一步,在多个长期未解的数学与计算难题上找到优于人类现有方案的解法。y0f即热新闻——关注每天科技社会生活新变化gihot.com

美国《麻省理工科技评论》指出,尽管这些AI成绩亮眼,但专家们普遍认为,它们仍不具备真正的协助科研的能力。竞赛题虽难,却更像是智力游戏,有一定“套路”。真正的数学研究则更开放、更复杂。面对“P vs NP”“黎曼猜想”等重大难题时,AI仍力不从心。y0f即热新闻——关注每天科技社会生活新变化gihot.com

为了更准确地评估AI的能力,初创公司Epoch AI去年推出了FrontierMath测试,联合60多位数学家设计出全新高难度题目,避开模型已见过的训练数据,结果LLM几乎集体“交白卷”。y0f即热新闻——关注每天科技社会生活新变化gihot.com

这些测试表明,AI在数学道路上虽已迈步,但离“合著者”角色仍有很长一段路要走。y0f即热新闻——关注每天科技社会生活新变化gihot.com

需攻克“超长推理链”y0f即热新闻——关注每天科技社会生活新变化gihot.com

仔细观察数学问题会发现,它们在某些方面类似:解决问题需完成一系列连续步骤,关键在于找到这些步骤。y0f即热新闻——关注每天科技社会生活新变化gihot.com

美国加州理工学院谢尔盖·古科夫指出,困难的差异往往体现在路径的长度上。高中数学可能只需10到40步,而像黎曼猜想这样的难题,路径可能长达百万步。y0f即热新闻——关注每天科技社会生活新变化gihot.com

这类“超长路径”极难处理。就像下围棋时寻找一条制胜序列,AI必须在指数级增长的可能路径中找到正确解法。而在数学中,这个复杂度要远超棋类游戏。y0f即热新闻——关注每天科技社会生活新变化gihot.com

据物理学家组织网今年2月报道,为应对这一挑战,古科夫团队开发了一种方法,将多个步骤打包成“超级步骤”,相当于穿上“巨人靴”跨越大段路程。他们设计了一个系统,其中强化学习模型负责提出超级步骤,另一个模型负责验证其合理性。y0f即热新闻——关注每天科技社会生活新变化gihot.com

该策略在经典未解难题——安德鲁斯-柯蒂斯猜想上取得了突破。虽然尚未证明或推翻该猜想,但借助AI,科学家推翻了一个40年来被广泛引用的“反例”。这曾被视为证明该猜想错误的关键依据。y0f即热新闻——关注每天科技社会生活新变化gihot.com

牛津大学数学家马丁·布里森对此表示肯定:“排除错误路径,是科研中非常有价值的一步。”y0f即热新闻——关注每天科技社会生活新变化gihot.com

古科夫相信,这种“压缩路径”的思路适用于所有需要推理链条的领域。他希望,这种方法不仅能推动AI跳出固有模式,也为数学研究带来新突破。y0f即热新闻——关注每天科技社会生活新变化gihot.com

真正的创新和突破仍属人类y0f即热新闻——关注每天科技社会生活新变化gihot.com

跳出思维定式,正是数学家攻克难题的关键。数学常被看作机械推理,而高等数学则更像是一场实验,充满一波三折的试错与灵光乍现的顿悟。y0f即热新闻——关注每天科技社会生活新变化gihot.com

这正是AlphaEvolve等AI工具的优势所在。它通过LLM不断生成并改进解题代码,配合第二个模型评估每一轮结果,最终提出比人类更优的解法。这种方法不仅能独立探索,也支持人类随时介入,提供灵感和指令。y0f即热新闻——关注每天科技社会生活新变化gihot.com

澳大利亚悉尼大学数学家乔迪·威廉姆森强调,探索性思维是数学的核心。据英国《新科学家》网站报道,他与Meta合作开发了PatternBoost AI系统,可根据一个数学想法生成相似概念,帮助激发灵感。他说:“这就像是这里有一堆有趣的东西,我不知道是怎么回事,但你能再生成一些类似的东西吗?”y0f即热新闻——关注每天科技社会生活新变化gihot.com

这种头脑风暴在数学中至关重要,它是新想法产生的源泉。以二十面体为例——古希腊人通过纯粹推理发现了它,其形状并不存在于自然界中,却深刻影响了数学的发展。威廉姆森希望,AI未来也能协助发现类似的“新数学对象”。y0f即热新闻——关注每天科技社会生活新变化gihot.com

不过,目前AI仍缺乏真正的创造力。让AI赢棋是一回事,让它发明围棋游戏则是另一回事。像AlphaEvolve和PatternBoost这样的工具或许能作为人类直觉的“侦察兵”,帮助人们发现路径、避开死路,但专家普遍认为,真正的创新与突破,仍然属于人类。y0f即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-2-2620-0.htmlAI成为数学家得力助手还要多久

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:我国成功组织实施梦舟载人飞船零高度逃逸飞行试验

下一篇:从开源看“智能向善”——人工智能热的冷思考

为你推荐
央视网消息:近日,中央社会工作部等8部门联合出台措施,指导加强快递员、网约配送员服务管理,推动构建和谐劳动关系,切实维护各方合法权益。措施提出,推进...
01-21
记者1月9日获悉,世界最高350米高水头冲击试验台近日在哈电集团哈尔滨电机厂有限责任公司(以下简称“哈电电机”)正式投入使用。该试验台是国内首座具...
01-24
  这几天,我国大部地区迎来寒潮天气。从26日上午开始,辽宁迎来今冬以来范围最广、强度最大的一场降雪。...
01-29
  近日,我省多个在建高速公路项目陆续启动复工。高速路建设加速度,离不开近年来我省聚焦“交通强省”建...
02-17
新闻记者 兰莎通讯员 陈强 吴佳倩2025年1月20日,备受瞩目的《手机、平板、智能手表(手环)购新补贴实施方案》手机国家补贴政策正式落地,不少湖北市民走进当地通信运营商营业厅挑...
01-21
  国家医保局:我国医保基金安全可持续  中新网1月17日电 国家医保局1月17日召开的新闻发布会上介绍,2024年我国医保基金收支平衡、略有结余,医保基金安全可持续。医保基金...
01-21
1 月 22 日消息,据特斯拉官方微博,特斯拉现已在其Tesla App官方商城中上架椒盐瓶套组 / 蛇年双肩背包 / 高尔夫伞等配件,整理具体商品如下:特斯拉椒盐瓶套组定价:239元官...
01-23
  21世纪经济报记者巩兆恩广州报道  “未来5年,锂电产业市场将迎来井喷期,快速进入到TWh时代...
01-23
近期,《树下有片红房子》备受关注,播出后引起了巨大的热度。在社交平台上,这部剧的相关资讯和剧情分析也十分丰富。为了让大家更全面深入地了解这部剧,以下整理...
02-21
《重症外伤中心》一经播出便迅速登上各大平台的热门榜单,吸引了众多观众的关注。这部电视剧中,白江赫医生在医疗事故后遭受误解与危机的故事引起了广泛讨论。...
02-22
  中国疾病预防控制中心病毒病预防控制所研究员王大燕1月17日表示,近期的流感高发属于正常的季节性流行,每年冬春季基本都会出现。最新一周监测数据显示,北方大部分省...
01-21
  本报北京1月13日电 (记者孙秀艳)为进一步加大对创新药的支持力度,国家医保局将研究出台一系列更有力度的政策举措。  国家医保局近日召开支持创新药发展企业座谈...
01-21
  1月16日,在得知37656.7元义卖捐款将送到西藏灾区后,西安航天基地富力城黄河小学的师生家长深感欣慰。  近日,西藏日喀则市定日县地震牵动着每个人的心。在听闻受灾地区...
01-21
2025年1月辽宁省普通高中学业水平合格性考试报名工作已于2024年11月24日结束。为满足考生需求,结合工作...
01-21
  摘要  临近春节,聚酯产业链进入交货“扫尾期”,也出现了一些新情况。  炒股第一步,先开个...
01-21
  临近春节,多家理财公司纷纷上线“春节档”理财产品,产品主要以中短期固收类为主,风险等级多为R...
01-28
射手座的男生天性热情开朗,喜欢自由自在地生活。他们追求刺激和冒险,对于感情也是如此。...
01-22
天秤男是十二星座中最具有浪漫气质的一位,他们善于表达情感,对待爱情充满了热情和渴望。...
01-22
童装搭配技巧? 童装搭配文案?一、童装搭配技巧?童装怎么样搭配!1,首先是看儿童的肤色选择深浅,2,儿童的胖瘦选择衣服,3,儿童的喜爱选择,4颜色深浅错开搭配,5舒适宽松二、童装搭配文案?1....
02-07
给女孩子的饰品店起名:好听又吸引顾客的秘诀在为女孩子的饰品店起名时,我们希望这个名字能够既好听又具有吸引力。一个好的店名不仅能够让顾客一眼记住,还能传达出品牌的气质和...
02-12
2月7日消息,百胜中国披露2024年第四季度及全年财务业绩。2024年第四季度,百胜中国总收入同比增长4%至26亿美元;经营利润同比增长36%至1.51亿美元;经营利润率为5.8%,同比增长140个...
02-07
2月10日消息,天眼查显示,2月8日,与辉同行(北京)科技有限公司发生工商变更,原全资股东董宇辉退出股东行列,新增子三省(北京)科技有限公司为股东并全资持股,董宇辉由直接持股变更为间接...
02-11
ZARA、H&M一度引领国内时尚风潮,被誉为“白领衣柜的时尚宠儿”,但如今光环不再。国内本土服装品牌的崛起,让ZARA、H&M等国际快时尚品...
02-18
2月22日消息,以“办好‘关键小事’ 托举幸福晚年”为主题的创新发展老年助餐服务座谈会近日在北京举行,饿了么总裁方永新在活动分享中表示,饿了么将在政策指引下,进一步深耕老年...
02-23
2024年末,一位科技创业者火了。作者 | 王思琪来源 | 投资家(ID:touzijias)2024年末,一位科技创业者火了。2025年初,这位创业者再度爆火。近日,中国科技行业因一位85后年轻人现身《...
01-24
近日,华力创科学宣布完成数千万元A+轮融资,本轮融资由金属3D打印领域头部上市公司铂力特独家投资。据披露,本轮融资所募集的资金将专注于深挖高性能光学多模态感知技术,结合金属...
01-24
著名的主机大战时代如今失去了悬念,索尼PlayStation在本世代多个方面都拔得头筹,这并不令人意外。然而,多年来,这两大巨头在硬件销售上竟出现如此巨大的差距,着实出...
02-10
韩国生活模拟游戏《inZOI》将于3月开放抢先体验版。游戏引入了独特元素,即角色死亡后可以作为幽灵出现,这一设定与《模拟人生4》市民死后世界相似。 近日inZOI...
02-13
据新华社报道,美国总统特朗普2月1日签署行政令,对进口自中国的商品加征10%的关税。美国的这一最新贸易保护措施在国际社会和美国国内遭到广泛反对。 商务部回应美对华加征关税...
02-02
要说今年春节档电影,不得不提的就是《哪吒之魔童闹海》。从大年初一上映以来,这部电影的票房一路高歌猛进。北京时间昨天(6日)中午,该影片以突破57.76亿元的成绩超过了2021年的电...
02-07
SQL Error: select * from ***_ecms_news1 where id in(197,32,247,,47,159,223,205) limit 8
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮