推理模型:“慢思考”让决策更周全

3个月前 来源:科技日报 观看:36

2025年,“推理模型”成为人工智能行业的热词。从科大讯飞发布首个使用全国产算力训练的深度推理大模型——讯飞星火X1,到深度求索公司上线DeepSeek-R1推理模型,都将“推理模型”推到聚光灯下。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

多数大语言模型具备一定推理能力,但推理模型具有更强大的推理、逻辑分析和决策能力。推理模型会运用各种推理技巧,如演绎推理、归纳推理、类比推理等,来模拟人类的思考方式。多位业内人士接受科技日报记者采访时说,在人工智能大模型不断迭代升级的浪潮中,推理模型以创新的技术为行业发展注入新活力,也让人们对人工智能未来发展有了更大想象空间。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

推理模仿人类“慢思考”1Tk即热新闻——关注每天科技社会生活新变化gihot.com

在复旦大学计算机科学技术学院教授、上海市数据科学重点实验室主任肖仰华看来,过去,大模型的生成能力主要由语料决定。但专家级的推理能力并非“题海战术”可以实现,而是需要大模型具备强大的思维能力。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

心理学家认为,人类存在两种思维模式。一种是主要用来对日常生活中的简单问题进行判断、决策的“快思考”;另一种则是用于对一些特定问题进行深入分析、研判的“慢思考”。“快思考”是人类基于大量日常经验、常识等,对简单问题作出的快速反应,往往在人们无意识之间完成,是一种更加接近“本能”的思考方式。与之相对,“慢思考”则需要调动大脑更多资源,遵循特定思维逻辑,对问题进行抽丝剥茧式分析研究,进而作出更加理性周全的决策。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

作为人工智能的典型应用,大模型如今也有了“快”“慢”之别。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

传统大语言通用模型的思维方式更像是“快思考”,其主要依靠算力对海量数据进行学习,实现对后续空白内容的快速预测,回答人类提出的各类问题,本质上是基于概率模型对可能的答案进行“猜测”。相比之下,推理大模型更有意识和逻辑,会在回答之前进行一段时间“慢思考”,依据特定思维链条,提供更全面解答。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

科大讯飞研究院副院长殷兵举例说,讯飞星火X1在解答高考数学题等复杂题目时,会先将题目化繁为简,给出解题思路和步骤,呈现出全面的思考、分析和推理过程,进而给出准确的题目答案。殷兵说,推理模型更接近人类的“慢思考”方式。相较于通用大模型,推理模型在数学、医学、代码等领域,会产生更好的效果和意想不到的应用场景。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

强化学习实现反思纠错1Tk即热新闻——关注每天科技社会生活新变化gihot.com

人类可以对复杂问题进行深入思考、理性分析的一大原因在于,大脑能够反思。通过对过去错误结果和正确经验的反馈学习,人类得以不断提升对复杂问题判断的正确率。推理模型中普遍应用的强化学习技术,在一定程度上模仿了人类的反思、纠错能力。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

强化学习是一种机器学习方法,它允许智能体在与环境的交互中通过试错来学习最优策略。智能体在环境中执行相应行动,并根据行动的结果接收反馈,这些反馈信号则指导智能体调整下一步策略,循环往复,不断接近最优策略。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

例如,DeepSeek-R1在训练推理模型时采用了一条此前鲜有人使用的完全依赖强化学习的训练路径,即仅根据模型输出答案的优劣等简单信息,对模型进行奖惩。这相当于在不施加任何指引的情况下,让一个刚出生不久的幼儿完全自主探索世界,并根据探索结果给予反馈,从而让幼儿在反复试错和成功中快速成长。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

殷兵介绍,讯飞星火X1可以进行自我探索和反思验证,并基于答案正确与否的反馈信息进行强化训练。其中,自我评价迭代的评语模型能指出大模型存在的幻觉问题,大模型在得到评语模型的评价后可实现自我完善提升。同时,评语模型也通过强化训练进一步提升自身发现幻觉问题的能力。整个过程无需人员参与标注,而是依靠两个模型相互博弈、共同进化。多路径和反思迭代的强化学习技术使讯飞星火X1中能化繁为简,把复杂问题拆解成多个步骤进行思考推理,并进行自我反思探索。例如,它在解答高考数学题目时,不仅会实时呈现分步骤解题过程,还能对解题过程进行实时验算,反思纠正过程中的遗漏和问题,直至给出正确答案。而整个推理过程中形成的数据也可以被用于后续的强化学习。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

可靠算力仍是关键因素1Tk即热新闻——关注每天科技社会生活新变化gihot.com

无论是模型训练还是推理,都需要算力平台作为硬件基础。虽然在特定领域,推理模型能够在实现同等效果的情况下消耗更少算力,但算力平台的可靠性、稳定性仍然是决定推理模型发展的重要因素。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

此前,科大讯飞已联合华为打造出首个国产算力万卡平台“飞星一号”,并基于此完成了讯飞星火大模型多个版本的迭代训练。但推理模型的训练是一条全新的技术路线。目前,国产算力在单卡、集群、生态等方面距国际领先水平有一定差距,全面基于国产算力平台开展模型训练,面临着不少挑战。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

“讯飞星火X1的训练推理涉及多个模型的强交互,需要跨任务传输数据及权重,训练任务类型也由在线实时响应变为离线高吞吐。这需要克服国产显卡带宽不足的短板。”殷兵说,在这种复杂的训练模式下,影响效率的因素非常多,后训练所需的算力甚至提升了一个数量级。最终,通过与华为进行联合攻关,团队自研出训练框架并进行效率优化,实现了模型算法在国产算力上的成功适配,端到端效率大幅提升。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

2025年,“推理模型”成为人工智能行业的热词。从科大讯飞发布首个使用全国产算力训练的深度推理大模型——讯飞星火X1,到深度求索公司上线DeepSeek-R1推理模型,都将“推理模型”推到聚光灯下。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

多数大语言模型具备一定推理能力,但推理模型具有更强大的推理、逻辑分析和决策能力。推理模型会运用各种推理技巧,如演绎推理、归纳推理、类比推理等,来模拟人类的思考方式。多位业内人士接受科技日报记者采访时说,在人工智能大模型不断迭代升级的浪潮中,推理模型以创新的技术为行业发展注入新活力,也让人们对人工智能未来发展有了更大想象空间。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

推理模仿人类“慢思考”1Tk即热新闻——关注每天科技社会生活新变化gihot.com

在复旦大学计算机科学技术学院教授、上海市数据科学重点实验室主任肖仰华看来,过去,大模型的生成能力主要由语料决定。但专家级的推理能力并非“题海战术”可以实现,而是需要大模型具备强大的思维能力。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

心理学家认为,人类存在两种思维模式。一种是主要用来对日常生活中的简单问题进行判断、决策的“快思考”;另一种则是用于对一些特定问题进行深入分析、研判的“慢思考”。“快思考”是人类基于大量日常经验、常识等,对简单问题作出的快速反应,往往在人们无意识之间完成,是一种更加接近“本能”的思考方式。与之相对,“慢思考”则需要调动大脑更多资源,遵循特定思维逻辑,对问题进行抽丝剥茧式分析研究,进而作出更加理性周全的决策。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

作为人工智能的典型应用,大模型如今也有了“快”“慢”之别。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

传统大语言通用模型的思维方式更像是“快思考”,其主要依靠算力对海量数据进行学习,实现对后续空白内容的快速预测,回答人类提出的各类问题,本质上是基于概率模型对可能的答案进行“猜测”。相比之下,推理大模型更有意识和逻辑,会在回答之前进行一段时间“慢思考”,依据特定思维链条,提供更全面解答。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

科大讯飞研究院副院长殷兵举例说,讯飞星火X1在解答高考数学题等复杂题目时,会先将题目化繁为简,给出解题思路和步骤,呈现出全面的思考、分析和推理过程,进而给出准确的题目答案。殷兵说,推理模型更接近人类的“慢思考”方式。相较于通用大模型,推理模型在数学、医学、代码等领域,会产生更好的效果和意想不到的应用场景。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

强化学习实现反思纠错1Tk即热新闻——关注每天科技社会生活新变化gihot.com

人类可以对复杂问题进行深入思考、理性分析的一大原因在于,大脑能够反思。通过对过去错误结果和正确经验的反馈学习,人类得以不断提升对复杂问题判断的正确率。推理模型中普遍应用的强化学习技术,在一定程度上模仿了人类的反思、纠错能力。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

强化学习是一种机器学习方法,它允许智能体在与环境的交互中通过试错来学习最优策略。智能体在环境中执行相应行动,并根据行动的结果接收反馈,这些反馈信号则指导智能体调整下一步策略,循环往复,不断接近最优策略。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

例如,DeepSeek-R1在训练推理模型时采用了一条此前鲜有人使用的完全依赖强化学习的训练路径,即仅根据模型输出答案的优劣等简单信息,对模型进行奖惩。这相当于在不施加任何指引的情况下,让一个刚出生不久的幼儿完全自主探索世界,并根据探索结果给予反馈,从而让幼儿在反复试错和成功中快速成长。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

殷兵介绍,讯飞星火X1可以进行自我探索和反思验证,并基于答案正确与否的反馈信息进行强化训练。其中,自我评价迭代的评语模型能指出大模型存在的幻觉问题,大模型在得到评语模型的评价后可实现自我完善提升。同时,评语模型也通过强化训练进一步提升自身发现幻觉问题的能力。整个过程无需人员参与标注,而是依靠两个模型相互博弈、共同进化。多路径和反思迭代的强化学习技术使讯飞星火X1中能化繁为简,把复杂问题拆解成多个步骤进行思考推理,并进行自我反思探索。例如,它在解答高考数学题目时,不仅会实时呈现分步骤解题过程,还能对解题过程进行实时验算,反思纠正过程中的遗漏和问题,直至给出正确答案。而整个推理过程中形成的数据也可以被用于后续的强化学习。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

可靠算力仍是关键因素1Tk即热新闻——关注每天科技社会生活新变化gihot.com

无论是模型训练还是推理,都需要算力平台作为硬件基础。虽然在特定领域,推理模型能够在实现同等效果的情况下消耗更少算力,但算力平台的可靠性、稳定性仍然是决定推理模型发展的重要因素。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

此前,科大讯飞已联合华为打造出首个国产算力万卡平台“飞星一号”,并基于此完成了讯飞星火大模型多个版本的迭代训练。但推理模型的训练是一条全新的技术路线。目前,国产算力在单卡、集群、生态等方面距国际领先水平有一定差距,全面基于国产算力平台开展模型训练,面临着不少挑战。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

“讯飞星火X1的训练推理涉及多个模型的强交互,需要跨任务传输数据及权重,训练任务类型也由在线实时响应变为离线高吞吐。这需要克服国产显卡带宽不足的短板。”殷兵说,在这种复杂的训练模式下,影响效率的因素非常多,后训练所需的算力甚至提升了一个数量级。最终,通过与华为进行联合攻关,团队自研出训练框架并进行效率优化,实现了模型算法在国产算力上的成功适配,端到端效率大幅提升。1Tk即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-2-562-0.html推理模型:“慢思考”让决策更周全

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:新疆哈密上线 “满血版”DeepSeek-R1云服务

下一篇:新装置解决石油产业抽油杆防锈难题 油田小站捧回国际大奖

为你推荐
新华社合肥1月20日电(记者徐海涛、陈诺)“998、999、1000……”大屏幕上的数字最终定格在1066,原本安静的控制大厅一片欢呼。1月20日,我国...
01-21
随着操作人员在地面发出遥控指令,大载重无人机将除冰机器人准确放置于距离地面120米的架空地线上,并让机器人沿着架空地线行走。在机器人前端震动锤...
01-24
辽宁省汽车快速客运站发布停班通知  因高速口封闭,今日我站除桃仙机场外所有线路暂时停运,给您带来不便...
01-31
  新华社太原2月4日电(记者王飞航)立春过后,随着气温回升,位于山西吉县和陕西宜川县交界的黄河壶...
02-06
  近年来,短小精悍、剧情跌宕的短剧,发展成网络影视的一种新业态,短剧出海也成为我国文化产业的一个新风向。  截至2024年8月,头部海外短剧App的地区数据中,美国的收入达1...
01-22
  1月20日,中国有“人造太阳”之称的全超导托卡马克核聚变实验装置(EAST)在安徽合肥创造新的世界纪录,首次实现1亿摄氏度1066秒的高约束模等离子体运行,标志我国聚变能源研...
01-22
没有一个春天不会到来,无论经历过怎样的寒冬。风云变幻的汽车行业,有迅猛地崛起,有突然地倒下,也有在艰难中坚定前行……2024年底,北京现代迎来新的转机,双方股东再次增资10.95亿...
01-21
1 月 21 日消息,据晚点 Auto 报道,华为与江淮汽车合作的高端品牌尊界首款车型 S800 在销售渠道布局方面取得新进展。据悉,尊界门店销售专项招聘已于 1 月中旬启动,尊界 ...
01-22
最近几天,几部新剧陆续播出,其中备受期待的《复明计划A》终于上线。该剧播出后热度不减,频繁登上各大社交平台热搜。接下来聊聊这部剧的剧情。主演为朱彦恺和...
02-20
《余烬之上》最大反派是谁?最大的内鬼是谁?在《余烬之上》中,很难绝对地界定谁是最大反派,但戚美华和纳威都有较大嫌疑被认为是最大反派。戚美华策划灭门惨案:从...
02-21
21世纪经济报道记者 韩利明 上海报道1月20日,国家医保局发函指出,关于近期上海市“两会”期间,有政协委员、医学专家反映某些集采药品可能存...
01-21
  近日,中国疾控中心最新数据显示流感病毒阳性率持续上升且以甲流为主。奥司他韦和玛巴洛沙韦...
01-21
2025年1月16日天文系系主任换届,通过民主推荐和考察,经学校研究决定,清华大...
01-21
  大众网记者 杨涛报道  12月10日,山东港口第二届青年志愿服务项目大赛决赛在潍坊市渤海湾航运举行,青岛港湾职业技术学院“德传巷陌 艺润万家”文化惠民志愿服务项目...
01-21
  近年来,随着个人消费贷款需求不断增长,不法贷款中介、电信诈骗不法人员盯上了这块“蛋糕”。...
01-24
  2024年,钢铁行业寒冬仍在持续,供需失衡未见改善,行业盈利水平呈下滑态势,这从上市公司业绩预告...
02-11
天蝎座的男生通常都有着敏感而复杂的内心世界,他们对待感情非常认真,一旦陷入爱情,就会全...
01-22
天蝎座的男性通常给人一种神秘而深沉的感觉,他们内心充满了激情和热情。当一个天蝎男开...
01-22
引领潮流的冰冰个性服饰:时尚与个性的完美结合每当我走在街头,总会被一些独特的服饰所吸引。今天,想和大家聊聊一个我最近非常喜欢的品牌――冰冰个性潮流服饰。它不仅仅是一种...
02-07
揭晓那些令人惊艳的女明星,她们的魅力如何征服了观众说到女明星,很多人心中都会浮现出那些荧幕上的闪耀瞬间。她们不仅有着令人羡慕的外貌,更是集智慧与才华于一身。今天,我想和...
02-12
2月5日消息,微信团队发布2025春节数据报告《微信里的赛博年味儿》,展示基于除夕至初五的多项数据。春节期间,微信里共诞生了1亿+款用户自己创作的红包封面,约有3.9亿人收到含有...
02-07
1月23日消息,山东齐鲁漆业有限公司(以下简称:齐鲁漆业)总经理孙亮亮一行近日到访涂多多。涂多多副总裁、跨境产业总经理邵春生,涂多多副总裁、粉体产业链链主郑德莲代表公司与来...
02-07
2月6日消息,交通部门预计,今年春运期间,自驾出行预计达到72亿人次,约占全社会跨区域人员流动量的八成,高速公路车流量单日峰值或创历史新高。全球自驾游平台租租车数据显示,春节期...
02-07
2月9日消息,文化和旅游部近日公布2024年全国智慧旅游十佳解决方案和2024年全国智慧旅游优秀解决方案名单。“携程入境游景区融合服务平台解决方案”脱颖而出,荣获十佳解决方案...
02-09
岁聿云暮,一元复始。过去一年里,金融机构始终聚焦主业,践行社会担当,服务国家战略,发挥“金融+慈善”合力,让温暖得到传递。2025年1月13日至1月16日,由中国银河证券主办的“星善之...
01-23
全球性金融券商集团英国EBC Group平台始终致力于以领先生态,与全球交易者共塑交易的未来。 自第一届交易大赛起,为赤忱的热爱和卓越的才华提供舞台,在全球内寻找交易好手以赋能...
01-24
根据《怪物猎人:荒野》日文官推透露,《怪物猎人:荒野》正式版仍然会像《怪物猎人:世界》一样,对玩家重新编辑角色外观进行收费。 在游戏发售时,官方会为为所有玩家免...
02-11
根据 Culture Crave 报道,流媒体平台迪士尼+上出现了最近热门的团队英雄动作射击游戏《漫威争锋》的独立分区。 该分区以“出现在《漫威争锋》的角色为特色”,...
02-11
新华社布宜诺斯艾利斯2月5日电(记者张铎)阿根廷政府5日宣布,阿总统米莱已决定该国退出世界卫生组织。阿根廷总统府发言人阿多尔尼当天在新闻发布会上说,阿根廷不允许任何国际组...
02-06
记者今天(8日)从最高人民检察院获悉,十四届全国政协人口资源环境委员会原副主任李微微涉嫌受贿一案,由国家监察委员会调查终结,移送检察机关审查起诉。日前,最高人民检察院依法以...
02-08
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮