推理模型:“慢思考”让决策更周全

1年前 来源:科技日报 观看:116

2025年,“推理模型”成为人工智能行业的热词。从科大讯飞发布首个使用全国产算力训练的深度推理大模型——讯飞星火X1,到深度求索公司上线DeepSeek-R1推理模型,都将“推理模型”推到聚光灯下。Csq即热新闻——关注每天科技社会生活新变化gihot.com

多数大语言模型具备一定推理能力,但推理模型具有更强大的推理、逻辑分析和决策能力。推理模型会运用各种推理技巧,如演绎推理、归纳推理、类比推理等,来模拟人类的思考方式。多位业内人士接受科技日报记者采访时说,在人工智能大模型不断迭代升级的浪潮中,推理模型以创新的技术为行业发展注入新活力,也让人们对人工智能未来发展有了更大想象空间。Csq即热新闻——关注每天科技社会生活新变化gihot.com

推理模仿人类“慢思考”Csq即热新闻——关注每天科技社会生活新变化gihot.com

在复旦大学计算机科学技术学院教授、上海市数据科学重点实验室主任肖仰华看来,过去,大模型的生成能力主要由语料决定。但专家级的推理能力并非“题海战术”可以实现,而是需要大模型具备强大的思维能力。Csq即热新闻——关注每天科技社会生活新变化gihot.com

心理学家认为,人类存在两种思维模式。一种是主要用来对日常生活中的简单问题进行判断、决策的“快思考”;另一种则是用于对一些特定问题进行深入分析、研判的“慢思考”。“快思考”是人类基于大量日常经验、常识等,对简单问题作出的快速反应,往往在人们无意识之间完成,是一种更加接近“本能”的思考方式。与之相对,“慢思考”则需要调动大脑更多资源,遵循特定思维逻辑,对问题进行抽丝剥茧式分析研究,进而作出更加理性周全的决策。Csq即热新闻——关注每天科技社会生活新变化gihot.com

作为人工智能的典型应用,大模型如今也有了“快”“慢”之别。Csq即热新闻——关注每天科技社会生活新变化gihot.com

传统大语言通用模型的思维方式更像是“快思考”,其主要依靠算力对海量数据进行学习,实现对后续空白内容的快速预测,回答人类提出的各类问题,本质上是基于概率模型对可能的答案进行“猜测”。相比之下,推理大模型更有意识和逻辑,会在回答之前进行一段时间“慢思考”,依据特定思维链条,提供更全面解答。Csq即热新闻——关注每天科技社会生活新变化gihot.com

科大讯飞研究院副院长殷兵举例说,讯飞星火X1在解答高考数学题等复杂题目时,会先将题目化繁为简,给出解题思路和步骤,呈现出全面的思考、分析和推理过程,进而给出准确的题目答案。殷兵说,推理模型更接近人类的“慢思考”方式。相较于通用大模型,推理模型在数学、医学、代码等领域,会产生更好的效果和意想不到的应用场景。Csq即热新闻——关注每天科技社会生活新变化gihot.com

强化学习实现反思纠错Csq即热新闻——关注每天科技社会生活新变化gihot.com

人类可以对复杂问题进行深入思考、理性分析的一大原因在于,大脑能够反思。通过对过去错误结果和正确经验的反馈学习,人类得以不断提升对复杂问题判断的正确率。推理模型中普遍应用的强化学习技术,在一定程度上模仿了人类的反思、纠错能力。Csq即热新闻——关注每天科技社会生活新变化gihot.com

强化学习是一种机器学习方法,它允许智能体在与环境的交互中通过试错来学习最优策略。智能体在环境中执行相应行动,并根据行动的结果接收反馈,这些反馈信号则指导智能体调整下一步策略,循环往复,不断接近最优策略。Csq即热新闻——关注每天科技社会生活新变化gihot.com

例如,DeepSeek-R1在训练推理模型时采用了一条此前鲜有人使用的完全依赖强化学习的训练路径,即仅根据模型输出答案的优劣等简单信息,对模型进行奖惩。这相当于在不施加任何指引的情况下,让一个刚出生不久的幼儿完全自主探索世界,并根据探索结果给予反馈,从而让幼儿在反复试错和成功中快速成长。Csq即热新闻——关注每天科技社会生活新变化gihot.com

殷兵介绍,讯飞星火X1可以进行自我探索和反思验证,并基于答案正确与否的反馈信息进行强化训练。其中,自我评价迭代的评语模型能指出大模型存在的幻觉问题,大模型在得到评语模型的评价后可实现自我完善提升。同时,评语模型也通过强化训练进一步提升自身发现幻觉问题的能力。整个过程无需人员参与标注,而是依靠两个模型相互博弈、共同进化。多路径和反思迭代的强化学习技术使讯飞星火X1中能化繁为简,把复杂问题拆解成多个步骤进行思考推理,并进行自我反思探索。例如,它在解答高考数学题目时,不仅会实时呈现分步骤解题过程,还能对解题过程进行实时验算,反思纠正过程中的遗漏和问题,直至给出正确答案。而整个推理过程中形成的数据也可以被用于后续的强化学习。Csq即热新闻——关注每天科技社会生活新变化gihot.com

可靠算力仍是关键因素Csq即热新闻——关注每天科技社会生活新变化gihot.com

无论是模型训练还是推理,都需要算力平台作为硬件基础。虽然在特定领域,推理模型能够在实现同等效果的情况下消耗更少算力,但算力平台的可靠性、稳定性仍然是决定推理模型发展的重要因素。Csq即热新闻——关注每天科技社会生活新变化gihot.com

此前,科大讯飞已联合华为打造出首个国产算力万卡平台“飞星一号”,并基于此完成了讯飞星火大模型多个版本的迭代训练。但推理模型的训练是一条全新的技术路线。目前,国产算力在单卡、集群、生态等方面距国际领先水平有一定差距,全面基于国产算力平台开展模型训练,面临着不少挑战。Csq即热新闻——关注每天科技社会生活新变化gihot.com

“讯飞星火X1的训练推理涉及多个模型的强交互,需要跨任务传输数据及权重,训练任务类型也由在线实时响应变为离线高吞吐。这需要克服国产显卡带宽不足的短板。”殷兵说,在这种复杂的训练模式下,影响效率的因素非常多,后训练所需的算力甚至提升了一个数量级。最终,通过与华为进行联合攻关,团队自研出训练框架并进行效率优化,实现了模型算法在国产算力上的成功适配,端到端效率大幅提升。Csq即热新闻——关注每天科技社会生活新变化gihot.com

2025年,“推理模型”成为人工智能行业的热词。从科大讯飞发布首个使用全国产算力训练的深度推理大模型——讯飞星火X1,到深度求索公司上线DeepSeek-R1推理模型,都将“推理模型”推到聚光灯下。Csq即热新闻——关注每天科技社会生活新变化gihot.com

多数大语言模型具备一定推理能力,但推理模型具有更强大的推理、逻辑分析和决策能力。推理模型会运用各种推理技巧,如演绎推理、归纳推理、类比推理等,来模拟人类的思考方式。多位业内人士接受科技日报记者采访时说,在人工智能大模型不断迭代升级的浪潮中,推理模型以创新的技术为行业发展注入新活力,也让人们对人工智能未来发展有了更大想象空间。Csq即热新闻——关注每天科技社会生活新变化gihot.com

推理模仿人类“慢思考”Csq即热新闻——关注每天科技社会生活新变化gihot.com

在复旦大学计算机科学技术学院教授、上海市数据科学重点实验室主任肖仰华看来,过去,大模型的生成能力主要由语料决定。但专家级的推理能力并非“题海战术”可以实现,而是需要大模型具备强大的思维能力。Csq即热新闻——关注每天科技社会生活新变化gihot.com

心理学家认为,人类存在两种思维模式。一种是主要用来对日常生活中的简单问题进行判断、决策的“快思考”;另一种则是用于对一些特定问题进行深入分析、研判的“慢思考”。“快思考”是人类基于大量日常经验、常识等,对简单问题作出的快速反应,往往在人们无意识之间完成,是一种更加接近“本能”的思考方式。与之相对,“慢思考”则需要调动大脑更多资源,遵循特定思维逻辑,对问题进行抽丝剥茧式分析研究,进而作出更加理性周全的决策。Csq即热新闻——关注每天科技社会生活新变化gihot.com

作为人工智能的典型应用,大模型如今也有了“快”“慢”之别。Csq即热新闻——关注每天科技社会生活新变化gihot.com

传统大语言通用模型的思维方式更像是“快思考”,其主要依靠算力对海量数据进行学习,实现对后续空白内容的快速预测,回答人类提出的各类问题,本质上是基于概率模型对可能的答案进行“猜测”。相比之下,推理大模型更有意识和逻辑,会在回答之前进行一段时间“慢思考”,依据特定思维链条,提供更全面解答。Csq即热新闻——关注每天科技社会生活新变化gihot.com

科大讯飞研究院副院长殷兵举例说,讯飞星火X1在解答高考数学题等复杂题目时,会先将题目化繁为简,给出解题思路和步骤,呈现出全面的思考、分析和推理过程,进而给出准确的题目答案。殷兵说,推理模型更接近人类的“慢思考”方式。相较于通用大模型,推理模型在数学、医学、代码等领域,会产生更好的效果和意想不到的应用场景。Csq即热新闻——关注每天科技社会生活新变化gihot.com

强化学习实现反思纠错Csq即热新闻——关注每天科技社会生活新变化gihot.com

人类可以对复杂问题进行深入思考、理性分析的一大原因在于,大脑能够反思。通过对过去错误结果和正确经验的反馈学习,人类得以不断提升对复杂问题判断的正确率。推理模型中普遍应用的强化学习技术,在一定程度上模仿了人类的反思、纠错能力。Csq即热新闻——关注每天科技社会生活新变化gihot.com

强化学习是一种机器学习方法,它允许智能体在与环境的交互中通过试错来学习最优策略。智能体在环境中执行相应行动,并根据行动的结果接收反馈,这些反馈信号则指导智能体调整下一步策略,循环往复,不断接近最优策略。Csq即热新闻——关注每天科技社会生活新变化gihot.com

例如,DeepSeek-R1在训练推理模型时采用了一条此前鲜有人使用的完全依赖强化学习的训练路径,即仅根据模型输出答案的优劣等简单信息,对模型进行奖惩。这相当于在不施加任何指引的情况下,让一个刚出生不久的幼儿完全自主探索世界,并根据探索结果给予反馈,从而让幼儿在反复试错和成功中快速成长。Csq即热新闻——关注每天科技社会生活新变化gihot.com

殷兵介绍,讯飞星火X1可以进行自我探索和反思验证,并基于答案正确与否的反馈信息进行强化训练。其中,自我评价迭代的评语模型能指出大模型存在的幻觉问题,大模型在得到评语模型的评价后可实现自我完善提升。同时,评语模型也通过强化训练进一步提升自身发现幻觉问题的能力。整个过程无需人员参与标注,而是依靠两个模型相互博弈、共同进化。多路径和反思迭代的强化学习技术使讯飞星火X1中能化繁为简,把复杂问题拆解成多个步骤进行思考推理,并进行自我反思探索。例如,它在解答高考数学题目时,不仅会实时呈现分步骤解题过程,还能对解题过程进行实时验算,反思纠正过程中的遗漏和问题,直至给出正确答案。而整个推理过程中形成的数据也可以被用于后续的强化学习。Csq即热新闻——关注每天科技社会生活新变化gihot.com

可靠算力仍是关键因素Csq即热新闻——关注每天科技社会生活新变化gihot.com

无论是模型训练还是推理,都需要算力平台作为硬件基础。虽然在特定领域,推理模型能够在实现同等效果的情况下消耗更少算力,但算力平台的可靠性、稳定性仍然是决定推理模型发展的重要因素。Csq即热新闻——关注每天科技社会生活新变化gihot.com

此前,科大讯飞已联合华为打造出首个国产算力万卡平台“飞星一号”,并基于此完成了讯飞星火大模型多个版本的迭代训练。但推理模型的训练是一条全新的技术路线。目前,国产算力在单卡、集群、生态等方面距国际领先水平有一定差距,全面基于国产算力平台开展模型训练,面临着不少挑战。Csq即热新闻——关注每天科技社会生活新变化gihot.com

“讯飞星火X1的训练推理涉及多个模型的强交互,需要跨任务传输数据及权重,训练任务类型也由在线实时响应变为离线高吞吐。这需要克服国产显卡带宽不足的短板。”殷兵说,在这种复杂的训练模式下,影响效率的因素非常多,后训练所需的算力甚至提升了一个数量级。最终,通过与华为进行联合攻关,团队自研出训练框架并进行效率优化,实现了模型算法在国产算力上的成功适配,端到端效率大幅提升。Csq即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-2-562-0.html推理模型:“慢思考”让决策更周全

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:新疆哈密上线 “满血版”DeepSeek-R1云服务

下一篇:新装置解决石油产业抽油杆防锈难题 油田小站捧回国际大奖

为你推荐
基于天关卫星的观测数据,中国科学院国家天文台等单位的科研人员,发现1例来自宇宙早期的伽马射线暴。这一爆发事件的发现,标志着人类首次探测到来自宇...
01-24
人形机器人产业作为发展新质生产力的代表领域之一,正在进入发展上升期,成为科技竞争的新高地、未来产业的新赛道、经济发展的新引擎,发展潜力大、应用...
01-27
  想办“商转公”贷款的小伙伴儿  沈阳公积金  最新政策调整来了  想提取公积金还房贷的小伙伴...
01-21
  1月21日下午3点,在辽宁省营口市鲅鱼圈区的辽港集团营口港47号泊位,“信风安庆”轮在进行粮食装船作业...
01-24
  红星资本局1月19日消息,近日,新世界发展(00017.HK)总裁黄少媚自掏腰包买入公司豪宅,花费5488万港元,引发关注。  黄少媚上任不足两个月,月薪约为98.5万港元。她接棒新世界...
01-21
  中国疾病预防控制中心发布的2025年1月健康风险提示显示,近期需要关注的急性呼吸道传染病还有人偏肺病毒、鼻病毒、腺病毒、肺炎支原体等病原体感染引起的传染病。其中...
01-21
开年见喜,吉利银河E5推出新春大礼包,立享至高价值1.5万元,包含新春保险大礼、新春保养大礼、新春贴膜大礼、新春焕新大礼,四重好礼惠及消费者,一站式福利待领取,省钱又省心。凡2月...
02-05
2 月 7 日消息,在福特 2024 年财报电话会议上,首席执行官吉姆・法利向媒体坦言,全尺寸电动或增程电动汽车并不是拖车的理想选择。他说:“它并不完美。如果你需要拖车,这...
02-07
  1、《难哄》温以凡在大伯家不仅要忍受大伯母的冷眼和挤兑,还差点被大伯母的弟弟侵犯了。  2、大伯母对温以凡并不好,经常对她说很多刻薄的话,温以凡只能察言观色,小心翼...
02-22
在某知名品牌的活动现场,林心如面对媒体镜头,坦诚地分享了自己对好友陈妍希离婚一事的看法。林心如透露,她是通过公开报道得知陈妍希与陈晓的婚姻走到了尽头。她感慨地说:“这样...
02-22
21世纪经济报道记者季媛媛 上海报道 2月6日,阿斯利康公布了全年财报业绩。数据显示,2024年,阿斯利康业绩表现亮眼,总营收实现21%增长,达到541...
02-07
这里是《21健讯Daily》,欢迎与21世纪经济报道新健康团队共同关注医药健康行业最新事件!政策动向国家药监局药审中心发布《地中海贫血基因治...
02-10
  大众网记者 隋宜笑 报道  12月26日,山东政法学院党委委员、副校长胡晓清,山东政法学院传媒学院党总支书记徐永青,山东政法学院传媒学院副院长常洪卫等一行5人到访山东...
01-21
  大众网记者 王一刚 报道  冬日风雅,大雪知寒。一年岁暮风雪始,寒冬用最纯洁的底色酝酿世间最精彩的颂歌。  一、童言话大雪  孩子们对即将到来的“大雪”节气充...
01-21
  近日,由元保集团(以下简称“元保”)和清华大学五道口金融学院中国保险与养老金融研究中心联合...
01-22
   当地时间1月24日(周五),美股三大指数收跌,道指跌0.32%,标普500指数跌0.29%,纳指跌0.5%。美国1月...
01-27
狮子座男生通常是阳光、自信和热情的代表,当他们喜欢上一个人时,会展现出一系列明显的行...
01-22
每个人都有自己心目中理想的伴侣类型,而对于狮子座的男生他们通常希望找到一位能够与他...
01-22
chanel包包面料? chanel包包贵吗?chanel包包面料?一种很耐磨又挺刮的合成面料chanel包包贵吗?贵,正品的香奈儿包包非常美,仿的目前完全不能比,所以值这个价。大多都是两三万。正品...
02-07
邹开云:打破常规的模特之路,反串时尚引发关注在时尚界,常常会出现一些颠覆传统的现象,今天你是否听说过邹开云?他是一位反串模特,以非凡的才华和独特的风格走入了大众视野。通过反...
02-17
2月16日消息,春风送暖,甘蔗种植迎来关键时刻。中农网依托产业链优势,推动旗下广西易农通深入甘蔗种植环节,在南宁市武鸣区罗波镇板欧蔗区率先启动2025年5万亩甘蔗种植计划,通过数...
02-17
京东、美团宣布为外卖骑手缴纳五险一金自从“百团大战”胜出以来,美团稳稳守住了外卖行业的“一哥”之位,几乎没有碰到几个“打得过”的对手。然而,外卖行业的战争似乎与美团王...
02-20
2月17日消息,先买后付解决方案提供商Tabby近日宣布完成1.6亿美元E轮融资,由Blue Pool Capital和Hassana Investment Company联合领投,STV和Wellington Management参投。随着E轮...
02-18
1.京东外卖上线大额补贴这次京东入局外卖市场,真是拿出了破釜沉舟的拼劲。这不,继全额承担外卖骑手五险一金所有成本后,京东又给外卖消费者送上了大额补贴福利。2月27日,京东外...
03-01
“产品主要成分都是草本植物和干酪乳杆菌,怎么吃了反复拉肚子?”近日,消费者张女士在抖音购买到宣称有助于快速排便的kingscom清清片,服用后腹部剧烈绞痛,连续多日地冒虚汗、跑厕...
01-21
2024年末,一位科技创业者火了。作者 | 王思琪来源 | 投资家(ID:touzijias)2024年末,一位科技创业者火了。2025年初,这位创业者再度爆火。近日,中国科技行业因一位85后年轻人现身《...
02-09
在《绝地潜兵》初代中,玩家实际上可以前往母星超级地球,进行保卫战。根据最新的泄露看来,《绝地潜兵2》的保卫站也已在制作当中,并且这场入侵我们将无法阻止。 数...
01-25
前几天,经典科幻作品《攻壳机动队》官方突然发布倒计时,今天谜底揭晓,官方将举行系列全部动画作品展,届时还会包括2026年的全新作品等等,敬请期待后续详细消息。 ...
02-05
▲资料图:飞行安全无小事。图/新华社飞机上捡到鞭炮?据荔枝新闻报道,有网友反映自己1月31日乘坐山东航空SC2270由桂林飞厦门的航班时,疑似在座位下方捡到一小截儿鞭炮。对此,2月1...
02-02
央视记者获悉,当地时间2月5日,美国一名法官黛博拉·博德曼在马里兰州格林贝尔特举行庭审后发布了初步禁令,阻止特朗普旨在终止“出生公民权”的行政令的实施。美国总统特朗普1...
02-06
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮