AI成为数学家得力助手还要多久

11个月前 来源:新华网 观看:127

从计算机科学到医学再到国家安全,数学是众多关键应用的基石,但数学领域的进步可能需要数年时间才能实现。GZi即热新闻——关注每天科技社会生活新变化gihot.com

几百年来,数学家使用的工具依然简朴:一张纸、一支笔。他们凭借逻辑与灵感,在符号的迷宫中寻找通往真理的路径。GZi即热新闻——关注每天科技社会生活新变化gihot.com

为了打破这一局面,美国国防高级研究计划局今年4月启动了“指数性数学”计划,旨在开发一种能极大提升数学研究效率的人工智能(AI)“合著者”系统。GZi即热新闻——关注每天科技社会生活新变化gihot.com

几十年来,数学家借助计算机进行辅助计算或验证命题,如今的AI或许能更上层楼,挑战那些人类长年未解的难题。不过,从能解高中题的AI,到能协助攻克前沿数学难关的AI,中间仍隔着一道鸿沟。GZi即热新闻——关注每天科技社会生活新变化gihot.com

解决重大难题仍力不从心GZi即热新闻——关注每天科技社会生活新变化gihot.com

大型语言模型(LLM)并不擅长数学。它们常常出现“幻觉”,甚至可能被误导相信2+2=5。但新一代大型推理模型,如OpenAI的o3、Anthropic的Claude 4 Thinking等,展现出的进步令数学家眼前一亮。GZi即热新闻——关注每天科技社会生活新变化gihot.com

今年,这些模型在美国数学邀请赛中的表现接近优秀高中生水平。不同于过去“一锤定音”式的输出,这些模型开始尝试模拟数学家逐步推理的思考过程。GZi即热新闻——关注每天科技社会生活新变化gihot.com

同时,一些将LLM与某种事实核查系统相结合的新型混合模型也取得了突破。例如,谷歌“深度思维”的AlphaProof系统将语言模型与棋类AI——AlphaZero结合,成为首个取得与国际数学奥林匹克竞赛银牌得主成绩相当的系统。今年5月,谷歌的AlphaEvolve模型更进一步,在多个长期未解的数学与计算难题上找到优于人类现有方案的解法。GZi即热新闻——关注每天科技社会生活新变化gihot.com

美国《麻省理工科技评论》指出,尽管这些AI成绩亮眼,但专家们普遍认为,它们仍不具备真正的协助科研的能力。竞赛题虽难,却更像是智力游戏,有一定“套路”。真正的数学研究则更开放、更复杂。面对“P vs NP”“黎曼猜想”等重大难题时,AI仍力不从心。GZi即热新闻——关注每天科技社会生活新变化gihot.com

为了更准确地评估AI的能力,初创公司Epoch AI去年推出了FrontierMath测试,联合60多位数学家设计出全新高难度题目,避开模型已见过的训练数据,结果LLM几乎集体“交白卷”。GZi即热新闻——关注每天科技社会生活新变化gihot.com

这些测试表明,AI在数学道路上虽已迈步,但离“合著者”角色仍有很长一段路要走。GZi即热新闻——关注每天科技社会生活新变化gihot.com

需攻克“超长推理链”GZi即热新闻——关注每天科技社会生活新变化gihot.com

仔细观察数学问题会发现,它们在某些方面类似:解决问题需完成一系列连续步骤,关键在于找到这些步骤。GZi即热新闻——关注每天科技社会生活新变化gihot.com

美国加州理工学院谢尔盖·古科夫指出,困难的差异往往体现在路径的长度上。高中数学可能只需10到40步,而像黎曼猜想这样的难题,路径可能长达百万步。GZi即热新闻——关注每天科技社会生活新变化gihot.com

这类“超长路径”极难处理。就像下围棋时寻找一条制胜序列,AI必须在指数级增长的可能路径中找到正确解法。而在数学中,这个复杂度要远超棋类游戏。GZi即热新闻——关注每天科技社会生活新变化gihot.com

据物理学家组织网今年2月报道,为应对这一挑战,古科夫团队开发了一种方法,将多个步骤打包成“超级步骤”,相当于穿上“巨人靴”跨越大段路程。他们设计了一个系统,其中强化学习模型负责提出超级步骤,另一个模型负责验证其合理性。GZi即热新闻——关注每天科技社会生活新变化gihot.com

该策略在经典未解难题——安德鲁斯-柯蒂斯猜想上取得了突破。虽然尚未证明或推翻该猜想,但借助AI,科学家推翻了一个40年来被广泛引用的“反例”。这曾被视为证明该猜想错误的关键依据。GZi即热新闻——关注每天科技社会生活新变化gihot.com

牛津大学数学家马丁·布里森对此表示肯定:“排除错误路径,是科研中非常有价值的一步。”GZi即热新闻——关注每天科技社会生活新变化gihot.com

古科夫相信,这种“压缩路径”的思路适用于所有需要推理链条的领域。他希望,这种方法不仅能推动AI跳出固有模式,也为数学研究带来新突破。GZi即热新闻——关注每天科技社会生活新变化gihot.com

真正的创新和突破仍属人类GZi即热新闻——关注每天科技社会生活新变化gihot.com

跳出思维定式,正是数学家攻克难题的关键。数学常被看作机械推理,而高等数学则更像是一场实验,充满一波三折的试错与灵光乍现的顿悟。GZi即热新闻——关注每天科技社会生活新变化gihot.com

这正是AlphaEvolve等AI工具的优势所在。它通过LLM不断生成并改进解题代码,配合第二个模型评估每一轮结果,最终提出比人类更优的解法。这种方法不仅能独立探索,也支持人类随时介入,提供灵感和指令。GZi即热新闻——关注每天科技社会生活新变化gihot.com

澳大利亚悉尼大学数学家乔迪·威廉姆森强调,探索性思维是数学的核心。据英国《新科学家》网站报道,他与Meta合作开发了PatternBoost AI系统,可根据一个数学想法生成相似概念,帮助激发灵感。他说:“这就像是这里有一堆有趣的东西,我不知道是怎么回事,但你能再生成一些类似的东西吗?”GZi即热新闻——关注每天科技社会生活新变化gihot.com

这种头脑风暴在数学中至关重要,它是新想法产生的源泉。以二十面体为例——古希腊人通过纯粹推理发现了它,其形状并不存在于自然界中,却深刻影响了数学的发展。威廉姆森希望,AI未来也能协助发现类似的“新数学对象”。GZi即热新闻——关注每天科技社会生活新变化gihot.com

不过,目前AI仍缺乏真正的创造力。让AI赢棋是一回事,让它发明围棋游戏则是另一回事。像AlphaEvolve和PatternBoost这样的工具或许能作为人类直觉的“侦察兵”,帮助人们发现路径、避开死路,但专家普遍认为,真正的创新与突破,仍然属于人类。GZi即热新闻——关注每天科技社会生活新变化gihot.com

从计算机科学到医学再到国家安全,数学是众多关键应用的基石,但数学领域的进步可能需要数年时间才能实现。GZi即热新闻——关注每天科技社会生活新变化gihot.com

几百年来,数学家使用的工具依然简朴:一张纸、一支笔。他们凭借逻辑与灵感,在符号的迷宫中寻找通往真理的路径。GZi即热新闻——关注每天科技社会生活新变化gihot.com

为了打破这一局面,美国国防高级研究计划局今年4月启动了“指数性数学”计划,旨在开发一种能极大提升数学研究效率的人工智能(AI)“合著者”系统。GZi即热新闻——关注每天科技社会生活新变化gihot.com

几十年来,数学家借助计算机进行辅助计算或验证命题,如今的AI或许能更上层楼,挑战那些人类长年未解的难题。不过,从能解高中题的AI,到能协助攻克前沿数学难关的AI,中间仍隔着一道鸿沟。GZi即热新闻——关注每天科技社会生活新变化gihot.com

解决重大难题仍力不从心GZi即热新闻——关注每天科技社会生活新变化gihot.com

大型语言模型(LLM)并不擅长数学。它们常常出现“幻觉”,甚至可能被误导相信2+2=5。但新一代大型推理模型,如OpenAI的o3、Anthropic的Claude 4 Thinking等,展现出的进步令数学家眼前一亮。GZi即热新闻——关注每天科技社会生活新变化gihot.com

今年,这些模型在美国数学邀请赛中的表现接近优秀高中生水平。不同于过去“一锤定音”式的输出,这些模型开始尝试模拟数学家逐步推理的思考过程。GZi即热新闻——关注每天科技社会生活新变化gihot.com

同时,一些将LLM与某种事实核查系统相结合的新型混合模型也取得了突破。例如,谷歌“深度思维”的AlphaProof系统将语言模型与棋类AI——AlphaZero结合,成为首个取得与国际数学奥林匹克竞赛银牌得主成绩相当的系统。今年5月,谷歌的AlphaEvolve模型更进一步,在多个长期未解的数学与计算难题上找到优于人类现有方案的解法。GZi即热新闻——关注每天科技社会生活新变化gihot.com

美国《麻省理工科技评论》指出,尽管这些AI成绩亮眼,但专家们普遍认为,它们仍不具备真正的协助科研的能力。竞赛题虽难,却更像是智力游戏,有一定“套路”。真正的数学研究则更开放、更复杂。面对“P vs NP”“黎曼猜想”等重大难题时,AI仍力不从心。GZi即热新闻——关注每天科技社会生活新变化gihot.com

为了更准确地评估AI的能力,初创公司Epoch AI去年推出了FrontierMath测试,联合60多位数学家设计出全新高难度题目,避开模型已见过的训练数据,结果LLM几乎集体“交白卷”。GZi即热新闻——关注每天科技社会生活新变化gihot.com

这些测试表明,AI在数学道路上虽已迈步,但离“合著者”角色仍有很长一段路要走。GZi即热新闻——关注每天科技社会生活新变化gihot.com

需攻克“超长推理链”GZi即热新闻——关注每天科技社会生活新变化gihot.com

仔细观察数学问题会发现,它们在某些方面类似:解决问题需完成一系列连续步骤,关键在于找到这些步骤。GZi即热新闻——关注每天科技社会生活新变化gihot.com

美国加州理工学院谢尔盖·古科夫指出,困难的差异往往体现在路径的长度上。高中数学可能只需10到40步,而像黎曼猜想这样的难题,路径可能长达百万步。GZi即热新闻——关注每天科技社会生活新变化gihot.com

这类“超长路径”极难处理。就像下围棋时寻找一条制胜序列,AI必须在指数级增长的可能路径中找到正确解法。而在数学中,这个复杂度要远超棋类游戏。GZi即热新闻——关注每天科技社会生活新变化gihot.com

据物理学家组织网今年2月报道,为应对这一挑战,古科夫团队开发了一种方法,将多个步骤打包成“超级步骤”,相当于穿上“巨人靴”跨越大段路程。他们设计了一个系统,其中强化学习模型负责提出超级步骤,另一个模型负责验证其合理性。GZi即热新闻——关注每天科技社会生活新变化gihot.com

该策略在经典未解难题——安德鲁斯-柯蒂斯猜想上取得了突破。虽然尚未证明或推翻该猜想,但借助AI,科学家推翻了一个40年来被广泛引用的“反例”。这曾被视为证明该猜想错误的关键依据。GZi即热新闻——关注每天科技社会生活新变化gihot.com

牛津大学数学家马丁·布里森对此表示肯定:“排除错误路径,是科研中非常有价值的一步。”GZi即热新闻——关注每天科技社会生活新变化gihot.com

古科夫相信,这种“压缩路径”的思路适用于所有需要推理链条的领域。他希望,这种方法不仅能推动AI跳出固有模式,也为数学研究带来新突破。GZi即热新闻——关注每天科技社会生活新变化gihot.com

真正的创新和突破仍属人类GZi即热新闻——关注每天科技社会生活新变化gihot.com

跳出思维定式,正是数学家攻克难题的关键。数学常被看作机械推理,而高等数学则更像是一场实验,充满一波三折的试错与灵光乍现的顿悟。GZi即热新闻——关注每天科技社会生活新变化gihot.com

这正是AlphaEvolve等AI工具的优势所在。它通过LLM不断生成并改进解题代码,配合第二个模型评估每一轮结果,最终提出比人类更优的解法。这种方法不仅能独立探索,也支持人类随时介入,提供灵感和指令。GZi即热新闻——关注每天科技社会生活新变化gihot.com

澳大利亚悉尼大学数学家乔迪·威廉姆森强调,探索性思维是数学的核心。据英国《新科学家》网站报道,他与Meta合作开发了PatternBoost AI系统,可根据一个数学想法生成相似概念,帮助激发灵感。他说:“这就像是这里有一堆有趣的东西,我不知道是怎么回事,但你能再生成一些类似的东西吗?”GZi即热新闻——关注每天科技社会生活新变化gihot.com

这种头脑风暴在数学中至关重要,它是新想法产生的源泉。以二十面体为例——古希腊人通过纯粹推理发现了它,其形状并不存在于自然界中,却深刻影响了数学的发展。威廉姆森希望,AI未来也能协助发现类似的“新数学对象”。GZi即热新闻——关注每天科技社会生活新变化gihot.com

不过,目前AI仍缺乏真正的创造力。让AI赢棋是一回事,让它发明围棋游戏则是另一回事。像AlphaEvolve和PatternBoost这样的工具或许能作为人类直觉的“侦察兵”,帮助人们发现路径、避开死路,但专家普遍认为,真正的创新与突破,仍然属于人类。GZi即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-2-2620-0.htmlAI成为数学家得力助手还要多久

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:我国成功组织实施梦舟载人飞船零高度逃逸飞行试验

下一篇:从开源看“智能向善”——人工智能热的冷思考

为你推荐
1月14日,记者从中国科学院合肥物质科学研究院等离子体物理研究所(以下简称“等离子体所”)获悉,由该所建设运行的国家重大科技基础设施“聚变堆主机关...
01-21
据最新一期《IEEE微波与无线元件快报》报道,欧洲空间局(ESA)研发了一个比草莓种子还要小巧的信号放大器(也被称为“种子”信号放大器),旨在弥补当前的技...
01-22
辽宁省气象台1月25日16时发布寒潮黄色预警  预计,26~29日全省气温自西向东陆续下降,大部地区累计降温幅...
01-27
昨天4时至今天17时辽宁大部地区出现大雪到暴雪其中丹东地区局部出现大暴雪降雪总量实况  全省275个气...
01-28
  中新经纬1月18日电 格力回应“董明珠被停职审查”传闻,称是恶意中伤。  18日,珠海格力电器股份有限公司文化传媒中心微博“格力文传”发布声明称,注意到微博用户“许韬de...
01-21
  开年A股第一宗并购!紫金矿业137亿元入主藏格矿业  1月16日,备受市场瞩目的2025年A股并购第一单落锤。  1月16日晚间,藏格矿业(000408.SZ)公告,紫金矿业(601899.SH)同步...
01-21
1 月 21 日消息,smart 精灵#5 SUV 将推出插电式混合动力版本,以应对全球部分市场对纯电动车型需求的变化。这一决定标志着由吉利和梅赛德斯-奔驰共同拥有的 smart 品...
01-22
1 月 24 日消息,小鹏汽车 MONA 产品负责人@XP-杨光 今日分享视频介绍了 MONA 车型的第五次大规模 OTA。他称“工程团队在原计划的基础上,全力做了压缩,终于赶在了春节...
01-25
  1、《爱你》电视剧原著小说叫《爱你,是我做过最好的事》,小说由笙离所著。  2、原著小说讲的是一个温暖的爱情故事,改编后的电视剧由张凌赫跟徐若晗领衔主演,即将上星江...
02-20
  1、《难哄》钟思乔一开始喜欢的人是向朗,后来喜欢上了苏浩安,和苏浩安走到了一起。  2、钟思乔和向朗、温以凡是青梅竹马,在不知道向朗喜欢温以凡之前,钟思乔一直暗恋向...
02-22
  图①:1月1日凌晨,吉林大学白求恩第一医院妇产中心产科,助产士在为新生儿印脚印。  新华社记者 张 楠摄  图②:贵州黔西市文峰街道文峰社区珠海蓝逸贝贝托育园,孩...
01-21
21世纪经济报道记者李佳英 广州报道对多数患者来说,福斯曼的倒闭消息如晴天霹雳,突如其来。“广州齐遇口腔门诊部(福斯曼)总部出现经营困难,拖...
02-15
  大众网记者 杨涛报道  9月22日,2024金砖国家职业技能大赛增材制造赛项全国选拔赛暨国内总决赛传来消息,青岛港湾职业技术学院参赛学生冯洋(指导老师曾显波)获得一等奖,...
01-21
2025年辽宁省普通高等学校招生艺术类专业省统考考生须知  1.凡报考美术与设计类、书法类、音乐类、舞...
01-22
  近日,由元保集团(以下简称“元保”)和清华大学五道口金融学院中国保险与养老金融研究中心联合...
01-22
  中国经济网北京2月7日讯 国家金融监督管理总局网站日前发布的上海监管局行政处罚信息公开表...
02-08
双鱼座的男生通常是非常敏感和浪漫的,他们对待自己喜欢的人也有着独特的方式。当双鱼男...
01-22
狮子座男孩通常自信、勇敢,喜欢成为众人焦点。然而,有时候我们可能想开个玩笑或者捉弄一...
01-22
男生穿搭显高推荐? 男生怎么穿搭显瘦显高?一、男生穿搭显高推荐?九分裤是现在很流行的一款裤子,设计非常的时尚,而且很好搭配,最重要的是它能够很好的修饰身材比例,让腿看起来更长,...
02-17
时尚与争议:女明星穿着暴露背后的故事在这个信息泛滥的时代,女明星的穿着往往成为我们热议的话题。她们在红毯上的一袭礼服或是出街时的休闲装,常常引发广泛讨论,尤其是那些选择...
02-17
2月9日消息,天猫近日发布一则内测文档,宣布“天猫旗舰店会员活动现在可以直投微信私域”,即允许品牌直接将微信私域流量引导至天猫旗舰店,实现会员招募、购买转化及销量回流。目...
02-09
2月18日消息,中经汇达实业有限公司(以下简称:中经汇达)董事长邱云飞一行近日到访涂多多。国联股份高级副总裁、涂多多CEO刘斋,涂多多高级副总裁、跨境产发部总经理邵春生代表公司...
02-18
据红星新闻报道,2月5日,现货黄金再创新纪录,摸高至2859美元/盎司。COMEX黄金也在盘中创下历史新高,最高涨至2886美元/盎司。国内黄金...
02-07
2月12日消息,去哪儿大数据显示,2月12日元宵节“灯会”搜索热度环比前一日猛增一倍,灯会主题景区门票量同比去年增两成。四川自贡,广东广州、深圳,湖北武汉,福建泉州,浙江杭州,江苏苏...
02-13
【#小鹏汽车在新疆成立销售服务公司# 注册资本1000万】天眼查App显示,近日,乌鲁木齐小鹏汽车销售服务有限公司成立,法定代表人为赵大武,注册资本1000万人民币,经营范围含新能源汽...
01-21
“产品主要成分都是草本植物和干酪乳杆菌,怎么吃了反复拉肚子?”近日,消费者张女士在抖音购买到宣称有助于快速排便的kingscom清清片,服用后腹部剧烈绞痛,连续多日地冒虚汗、跑厕...
01-21
近日,万代南梦宫为《深渊传说》注册了新商标,申请日期2025年为1月16日,公开日期为2025年1月24日。此前,在《传说》系列30周年纪念期间,万代南梦宫曾表示过除了《圣...
01-28
曾为《上古卷轴》系列献声的资深游戏配音演员韦斯·约翰逊突发重病入院,其家人已在GoFundMe平台发起医疗费募捐。截至发稿时,该活动已筹得超5.2万美元(最初目标5...
01-31
问:美国东部时间2月1日,美方宣布对中国输美产品加征10%关税。中方对此有何评论?答:美方以芬太尼问题为由,对中国输美产品加征10%关税,中方对此强烈不满,坚决反对,将采取必要反制措施...
02-02
春节期间,国产动画电影《哪吒之魔童闹海》(简称《哪吒2》)持续走红。猫眼专业版数据显示,截至2月5日中午11时52分,票房突破50亿元,观影人次达到1亿,成为中国影史第6部观影人次破1亿...
02-05
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮