推理模型:“慢思考”让决策更周全

2个月前 来源:科技日报 观看:16

2025年,“推理模型”成为人工智能行业的热词。从科大讯飞发布首个使用全国产算力训练的深度推理大模型——讯飞星火X1,到深度求索公司上线DeepSeek-R1推理模型,都将“推理模型”推到聚光灯下。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

多数大语言模型具备一定推理能力,但推理模型具有更强大的推理、逻辑分析和决策能力。推理模型会运用各种推理技巧,如演绎推理、归纳推理、类比推理等,来模拟人类的思考方式。多位业内人士接受科技日报记者采访时说,在人工智能大模型不断迭代升级的浪潮中,推理模型以创新的技术为行业发展注入新活力,也让人们对人工智能未来发展有了更大想象空间。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

推理模仿人类“慢思考”SbJ即热新闻——关注每天科技社会生活新变化gihot.com

在复旦大学计算机科学技术学院教授、上海市数据科学重点实验室主任肖仰华看来,过去,大模型的生成能力主要由语料决定。但专家级的推理能力并非“题海战术”可以实现,而是需要大模型具备强大的思维能力。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

心理学家认为,人类存在两种思维模式。一种是主要用来对日常生活中的简单问题进行判断、决策的“快思考”;另一种则是用于对一些特定问题进行深入分析、研判的“慢思考”。“快思考”是人类基于大量日常经验、常识等,对简单问题作出的快速反应,往往在人们无意识之间完成,是一种更加接近“本能”的思考方式。与之相对,“慢思考”则需要调动大脑更多资源,遵循特定思维逻辑,对问题进行抽丝剥茧式分析研究,进而作出更加理性周全的决策。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

作为人工智能的典型应用,大模型如今也有了“快”“慢”之别。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

传统大语言通用模型的思维方式更像是“快思考”,其主要依靠算力对海量数据进行学习,实现对后续空白内容的快速预测,回答人类提出的各类问题,本质上是基于概率模型对可能的答案进行“猜测”。相比之下,推理大模型更有意识和逻辑,会在回答之前进行一段时间“慢思考”,依据特定思维链条,提供更全面解答。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

科大讯飞研究院副院长殷兵举例说,讯飞星火X1在解答高考数学题等复杂题目时,会先将题目化繁为简,给出解题思路和步骤,呈现出全面的思考、分析和推理过程,进而给出准确的题目答案。殷兵说,推理模型更接近人类的“慢思考”方式。相较于通用大模型,推理模型在数学、医学、代码等领域,会产生更好的效果和意想不到的应用场景。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

强化学习实现反思纠错SbJ即热新闻——关注每天科技社会生活新变化gihot.com

人类可以对复杂问题进行深入思考、理性分析的一大原因在于,大脑能够反思。通过对过去错误结果和正确经验的反馈学习,人类得以不断提升对复杂问题判断的正确率。推理模型中普遍应用的强化学习技术,在一定程度上模仿了人类的反思、纠错能力。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

强化学习是一种机器学习方法,它允许智能体在与环境的交互中通过试错来学习最优策略。智能体在环境中执行相应行动,并根据行动的结果接收反馈,这些反馈信号则指导智能体调整下一步策略,循环往复,不断接近最优策略。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

例如,DeepSeek-R1在训练推理模型时采用了一条此前鲜有人使用的完全依赖强化学习的训练路径,即仅根据模型输出答案的优劣等简单信息,对模型进行奖惩。这相当于在不施加任何指引的情况下,让一个刚出生不久的幼儿完全自主探索世界,并根据探索结果给予反馈,从而让幼儿在反复试错和成功中快速成长。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

殷兵介绍,讯飞星火X1可以进行自我探索和反思验证,并基于答案正确与否的反馈信息进行强化训练。其中,自我评价迭代的评语模型能指出大模型存在的幻觉问题,大模型在得到评语模型的评价后可实现自我完善提升。同时,评语模型也通过强化训练进一步提升自身发现幻觉问题的能力。整个过程无需人员参与标注,而是依靠两个模型相互博弈、共同进化。多路径和反思迭代的强化学习技术使讯飞星火X1中能化繁为简,把复杂问题拆解成多个步骤进行思考推理,并进行自我反思探索。例如,它在解答高考数学题目时,不仅会实时呈现分步骤解题过程,还能对解题过程进行实时验算,反思纠正过程中的遗漏和问题,直至给出正确答案。而整个推理过程中形成的数据也可以被用于后续的强化学习。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

可靠算力仍是关键因素SbJ即热新闻——关注每天科技社会生活新变化gihot.com

无论是模型训练还是推理,都需要算力平台作为硬件基础。虽然在特定领域,推理模型能够在实现同等效果的情况下消耗更少算力,但算力平台的可靠性、稳定性仍然是决定推理模型发展的重要因素。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

此前,科大讯飞已联合华为打造出首个国产算力万卡平台“飞星一号”,并基于此完成了讯飞星火大模型多个版本的迭代训练。但推理模型的训练是一条全新的技术路线。目前,国产算力在单卡、集群、生态等方面距国际领先水平有一定差距,全面基于国产算力平台开展模型训练,面临着不少挑战。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

“讯飞星火X1的训练推理涉及多个模型的强交互,需要跨任务传输数据及权重,训练任务类型也由在线实时响应变为离线高吞吐。这需要克服国产显卡带宽不足的短板。”殷兵说,在这种复杂的训练模式下,影响效率的因素非常多,后训练所需的算力甚至提升了一个数量级。最终,通过与华为进行联合攻关,团队自研出训练框架并进行效率优化,实现了模型算法在国产算力上的成功适配,端到端效率大幅提升。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

2025年,“推理模型”成为人工智能行业的热词。从科大讯飞发布首个使用全国产算力训练的深度推理大模型——讯飞星火X1,到深度求索公司上线DeepSeek-R1推理模型,都将“推理模型”推到聚光灯下。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

多数大语言模型具备一定推理能力,但推理模型具有更强大的推理、逻辑分析和决策能力。推理模型会运用各种推理技巧,如演绎推理、归纳推理、类比推理等,来模拟人类的思考方式。多位业内人士接受科技日报记者采访时说,在人工智能大模型不断迭代升级的浪潮中,推理模型以创新的技术为行业发展注入新活力,也让人们对人工智能未来发展有了更大想象空间。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

推理模仿人类“慢思考”SbJ即热新闻——关注每天科技社会生活新变化gihot.com

在复旦大学计算机科学技术学院教授、上海市数据科学重点实验室主任肖仰华看来,过去,大模型的生成能力主要由语料决定。但专家级的推理能力并非“题海战术”可以实现,而是需要大模型具备强大的思维能力。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

心理学家认为,人类存在两种思维模式。一种是主要用来对日常生活中的简单问题进行判断、决策的“快思考”;另一种则是用于对一些特定问题进行深入分析、研判的“慢思考”。“快思考”是人类基于大量日常经验、常识等,对简单问题作出的快速反应,往往在人们无意识之间完成,是一种更加接近“本能”的思考方式。与之相对,“慢思考”则需要调动大脑更多资源,遵循特定思维逻辑,对问题进行抽丝剥茧式分析研究,进而作出更加理性周全的决策。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

作为人工智能的典型应用,大模型如今也有了“快”“慢”之别。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

传统大语言通用模型的思维方式更像是“快思考”,其主要依靠算力对海量数据进行学习,实现对后续空白内容的快速预测,回答人类提出的各类问题,本质上是基于概率模型对可能的答案进行“猜测”。相比之下,推理大模型更有意识和逻辑,会在回答之前进行一段时间“慢思考”,依据特定思维链条,提供更全面解答。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

科大讯飞研究院副院长殷兵举例说,讯飞星火X1在解答高考数学题等复杂题目时,会先将题目化繁为简,给出解题思路和步骤,呈现出全面的思考、分析和推理过程,进而给出准确的题目答案。殷兵说,推理模型更接近人类的“慢思考”方式。相较于通用大模型,推理模型在数学、医学、代码等领域,会产生更好的效果和意想不到的应用场景。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

强化学习实现反思纠错SbJ即热新闻——关注每天科技社会生活新变化gihot.com

人类可以对复杂问题进行深入思考、理性分析的一大原因在于,大脑能够反思。通过对过去错误结果和正确经验的反馈学习,人类得以不断提升对复杂问题判断的正确率。推理模型中普遍应用的强化学习技术,在一定程度上模仿了人类的反思、纠错能力。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

强化学习是一种机器学习方法,它允许智能体在与环境的交互中通过试错来学习最优策略。智能体在环境中执行相应行动,并根据行动的结果接收反馈,这些反馈信号则指导智能体调整下一步策略,循环往复,不断接近最优策略。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

例如,DeepSeek-R1在训练推理模型时采用了一条此前鲜有人使用的完全依赖强化学习的训练路径,即仅根据模型输出答案的优劣等简单信息,对模型进行奖惩。这相当于在不施加任何指引的情况下,让一个刚出生不久的幼儿完全自主探索世界,并根据探索结果给予反馈,从而让幼儿在反复试错和成功中快速成长。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

殷兵介绍,讯飞星火X1可以进行自我探索和反思验证,并基于答案正确与否的反馈信息进行强化训练。其中,自我评价迭代的评语模型能指出大模型存在的幻觉问题,大模型在得到评语模型的评价后可实现自我完善提升。同时,评语模型也通过强化训练进一步提升自身发现幻觉问题的能力。整个过程无需人员参与标注,而是依靠两个模型相互博弈、共同进化。多路径和反思迭代的强化学习技术使讯飞星火X1中能化繁为简,把复杂问题拆解成多个步骤进行思考推理,并进行自我反思探索。例如,它在解答高考数学题目时,不仅会实时呈现分步骤解题过程,还能对解题过程进行实时验算,反思纠正过程中的遗漏和问题,直至给出正确答案。而整个推理过程中形成的数据也可以被用于后续的强化学习。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

可靠算力仍是关键因素SbJ即热新闻——关注每天科技社会生活新变化gihot.com

无论是模型训练还是推理,都需要算力平台作为硬件基础。虽然在特定领域,推理模型能够在实现同等效果的情况下消耗更少算力,但算力平台的可靠性、稳定性仍然是决定推理模型发展的重要因素。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

此前,科大讯飞已联合华为打造出首个国产算力万卡平台“飞星一号”,并基于此完成了讯飞星火大模型多个版本的迭代训练。但推理模型的训练是一条全新的技术路线。目前,国产算力在单卡、集群、生态等方面距国际领先水平有一定差距,全面基于国产算力平台开展模型训练,面临着不少挑战。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

“讯飞星火X1的训练推理涉及多个模型的强交互,需要跨任务传输数据及权重,训练任务类型也由在线实时响应变为离线高吞吐。这需要克服国产显卡带宽不足的短板。”殷兵说,在这种复杂的训练模式下,影响效率的因素非常多,后训练所需的算力甚至提升了一个数量级。最终,通过与华为进行联合攻关,团队自研出训练框架并进行效率优化,实现了模型算法在国产算力上的成功适配,端到端效率大幅提升。SbJ即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-2-562-0.html推理模型:“慢思考”让决策更周全

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:新疆哈密上线 “满血版”DeepSeek-R1云服务

下一篇:新装置解决石油产业抽油杆防锈难题 油田小站捧回国际大奖

为你推荐
  科技日报记者 宗诗涵  持续跳动的“心脏”、有代谢功能的“肝脏”、会呼吸的“肺”……在...
01-21
1月13日,科技日报记者来到河北省唐山市220千伏君瑞变电站设备间,看到一只智能巡检“机器狗”正在一台变电设备前执行任务,不时伸出背上的伸缩臂探视设...
01-22
  记者15日从国网辽宁省电力有限公司获悉,2024年,辽宁省绿电交易电量达127.83亿千瓦时,同比增长179.9%。...
01-21
  近日,《辽宁省加大存量商品房收购力度 进一步提升住房保障能力的若干措施》(以下简称《若干措施》)正...
02-07
新闻记者 潘锡珩通讯员陈默 龙慧芳近日,武汉市武昌区黄鹤楼街道读书社区的居民代表,为武钢江南燃气公司送上了一面锦旗,上面写着“踏实为民办实事,情暖人心暖寒冬”,以此表达对江...
01-22
  中新经纬1月20日电 国家发改委网站20日消息,国家发展改革委、国家数据局近日发布《关于建立公共数据资源授权运营价格形成机制的通知》(下称通知)。  通知明确定价范围...
01-21
1 月 22 日消息,据特斯拉官方微博,特斯拉现已在其Tesla App官方商城中上架椒盐瓶套组 / 蛇年双肩背包 / 高尔夫伞等配件,整理具体商品如下:特斯拉椒盐瓶套组定价:239元官...
01-23
1 月 30 日消息,日本汽车媒体 Mag-X 昨日(1 月 29 日)发布博文,报道称由于 LS 轿车 2024 在日本销量不足 1500 辆,雷克萨斯考虑调整 LS 系列,替代推出三排七座混合动力 SU...
01-31
  1、《难哄》温以凡梦游哭了是在第8集中,这是她第一次当着桑延的面梦游,桑延以为她只是太累了。  2、温以凡梦游的时候拥抱了桑延,还在他怀里哭了,第二天她醒来后完全不记...
02-22
在璀璨的娱乐圈里,何炅不仅以其出色的主持技巧和温文尔雅的形象深受观众喜爱,更因其卓越的自律精神和健康的身体状态成为了众人谈论的焦点。近日,这位知名主持人凭借惊人的八块...
02-22
21世纪经济报道记者 季媛媛 李佳英 上海 广州报道1月22日,国家卫生健康委、国家中医药局联合发布《流行性感冒诊疗方案(2025年版)》(以下简称...
01-24
  记者昨日从国家医保局获悉,国家医保服务平台APP“医保药品耗材追溯信息查询”功能于近日正式上线,购药者通过扫描药盒上的药品追溯码,即可获取详细的药品销售信息,了...
02-11
  大众网记者 张明明 报道  8月26日至30日,第七届全国高校青年教师教学竞赛决赛在上海交通大学举行。山东第一医科大学附属省立医院青年教师李毅荣获医科组二等奖,在31...
01-21
韩启德,病理生理学家,中国科学院院士、发展中国家科学院院士,中国科学技术协会名誉主席,曾任第十和十一届全...
01-23
  中国证监会1月22日消息,近日,中央金融办等六部门联合印发的《关于推动中长期资金入市工作的实...
01-24
  2月5日晚间,宁波银行正式发布2024年度业绩快报,公司2024全年实现营业收入666.32亿元,较上年同...
02-06
天秤男是十二星座中最具魅力的一种类型,他们温文尔雅、风度翩翩,总能吸引众多女性的目光...
01-22
天蝎男是一个神秘而深沉的星座,他们对爱情有着极高的要求和期待。在选择伴侣时,天蝎男会...
01-22
饰品创业计划书模板:轻松开启你的创业之旅在当今的市场环境中,饰品行业因其产品多样性和高利润率吸引了众多创业者的关注。如果你也想要在这个领域展开自己的创业冒险,撰写一份...
02-07
邹开云:打破常规的模特之路,反串时尚引发关注在时尚界,常常会出现一些颠覆传统的现象,今天你是否听说过邹开云?他是一位反串模特,以非凡的才华和独特的风格走入了大众视野。通过反...
02-17
2月7日消息,中国商业联合会今日发布2月份中国零售业景气指数(CRPI)。2月份,中国零售业景气指数(CRPI)为50.1%,环比下降1.0个百分点。分析认为,今年春节的大宗年货消费集中在1月份,CRP...
02-07
张一鸣:做不好就别做,要做就必须做到非常好。红果免费短剧月活飙升至1.58亿近一两年,除了AI,短剧可谓是另一个炙手可热的赛道。一时之间,资本争相涌入,就连周鸿祎也亲自下场做短剧...
02-19
在中国制造的广阔市场里,许多传统工厂正经历着一场前所未有的转型。而其中的“厂二代”,成为这股变革的核心力量。“98年女老板” ...
02-11
2月18日消息,从众信旅游集团了解到,节后错峰游市场展现新活力。由于2025年春节假期较早,因此春节过后至3月中旬形成了小的价格低谷。从众信旅游呼叫中心数据显示,近期错峰游咨询...
02-19
近日,美克生能源完成数亿元D+轮融资。本轮融资由北京市绿色能源和低碳产业投资基金(简称“北京绿色能源基金”)领投,北京未来科学城先进能源和智能制...
02-07
春节假期刚刚结束,各行各业的企业已经紧锣密鼓进入新年开工季。俗话说“兵马未动,粮草先行”,各类物资的及时就位是企业顺利开工的重要保障。为了更好地助力企业顺利开工,京...
02-09
在今天的 Xbox Developer_Direct 中,Bethesda Softworks 和 id Software 一同宣布,《DOOM™: The Dark Ages》将于 5 月 15 日登陆 Game Pass、Xbox Series X|S...
01-25
根据外媒Xbox Era的消息称,《使命召唤:现代战争2》(2009)即将于今年3月或4月加入XGP,随后外媒Insider Gaming发文称,他们的消息人士也证实了这一点。《使命召唤:现代...
02-13
据央视新闻报道,当地时间2月1日,美国联邦选举委员会年底的备案文件显示,埃隆·马斯克在2024年美国大选中的花费超过了2.9亿美元。马斯克 资料图(来源:环球网)文件表明,马斯克在年末...
02-02
营造清朗涉军网络舆论环境——解读《互联网军事信息传播管理办法》的四大特点《互联网军事信息传播管理办法》(以下简称《办法》),以习近平新时代中国特色社会主义思想为指导,全...
02-10
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮