推理模型:“慢思考”让决策更周全

1年前 来源:科技日报 观看:142

2025年,“推理模型”成为人工智能行业的热词。从科大讯飞发布首个使用全国产算力训练的深度推理大模型——讯飞星火X1,到深度求索公司上线DeepSeek-R1推理模型,都将“推理模型”推到聚光灯下。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

多数大语言模型具备一定推理能力,但推理模型具有更强大的推理、逻辑分析和决策能力。推理模型会运用各种推理技巧,如演绎推理、归纳推理、类比推理等,来模拟人类的思考方式。多位业内人士接受科技日报记者采访时说,在人工智能大模型不断迭代升级的浪潮中,推理模型以创新的技术为行业发展注入新活力,也让人们对人工智能未来发展有了更大想象空间。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

推理模仿人类“慢思考”FdZ即热新闻——关注每天科技社会生活新变化gihot.com

在复旦大学计算机科学技术学院教授、上海市数据科学重点实验室主任肖仰华看来,过去,大模型的生成能力主要由语料决定。但专家级的推理能力并非“题海战术”可以实现,而是需要大模型具备强大的思维能力。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

心理学家认为,人类存在两种思维模式。一种是主要用来对日常生活中的简单问题进行判断、决策的“快思考”;另一种则是用于对一些特定问题进行深入分析、研判的“慢思考”。“快思考”是人类基于大量日常经验、常识等,对简单问题作出的快速反应,往往在人们无意识之间完成,是一种更加接近“本能”的思考方式。与之相对,“慢思考”则需要调动大脑更多资源,遵循特定思维逻辑,对问题进行抽丝剥茧式分析研究,进而作出更加理性周全的决策。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

作为人工智能的典型应用,大模型如今也有了“快”“慢”之别。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

传统大语言通用模型的思维方式更像是“快思考”,其主要依靠算力对海量数据进行学习,实现对后续空白内容的快速预测,回答人类提出的各类问题,本质上是基于概率模型对可能的答案进行“猜测”。相比之下,推理大模型更有意识和逻辑,会在回答之前进行一段时间“慢思考”,依据特定思维链条,提供更全面解答。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

科大讯飞研究院副院长殷兵举例说,讯飞星火X1在解答高考数学题等复杂题目时,会先将题目化繁为简,给出解题思路和步骤,呈现出全面的思考、分析和推理过程,进而给出准确的题目答案。殷兵说,推理模型更接近人类的“慢思考”方式。相较于通用大模型,推理模型在数学、医学、代码等领域,会产生更好的效果和意想不到的应用场景。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

强化学习实现反思纠错FdZ即热新闻——关注每天科技社会生活新变化gihot.com

人类可以对复杂问题进行深入思考、理性分析的一大原因在于,大脑能够反思。通过对过去错误结果和正确经验的反馈学习,人类得以不断提升对复杂问题判断的正确率。推理模型中普遍应用的强化学习技术,在一定程度上模仿了人类的反思、纠错能力。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

强化学习是一种机器学习方法,它允许智能体在与环境的交互中通过试错来学习最优策略。智能体在环境中执行相应行动,并根据行动的结果接收反馈,这些反馈信号则指导智能体调整下一步策略,循环往复,不断接近最优策略。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

例如,DeepSeek-R1在训练推理模型时采用了一条此前鲜有人使用的完全依赖强化学习的训练路径,即仅根据模型输出答案的优劣等简单信息,对模型进行奖惩。这相当于在不施加任何指引的情况下,让一个刚出生不久的幼儿完全自主探索世界,并根据探索结果给予反馈,从而让幼儿在反复试错和成功中快速成长。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

殷兵介绍,讯飞星火X1可以进行自我探索和反思验证,并基于答案正确与否的反馈信息进行强化训练。其中,自我评价迭代的评语模型能指出大模型存在的幻觉问题,大模型在得到评语模型的评价后可实现自我完善提升。同时,评语模型也通过强化训练进一步提升自身发现幻觉问题的能力。整个过程无需人员参与标注,而是依靠两个模型相互博弈、共同进化。多路径和反思迭代的强化学习技术使讯飞星火X1中能化繁为简,把复杂问题拆解成多个步骤进行思考推理,并进行自我反思探索。例如,它在解答高考数学题目时,不仅会实时呈现分步骤解题过程,还能对解题过程进行实时验算,反思纠正过程中的遗漏和问题,直至给出正确答案。而整个推理过程中形成的数据也可以被用于后续的强化学习。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

可靠算力仍是关键因素FdZ即热新闻——关注每天科技社会生活新变化gihot.com

无论是模型训练还是推理,都需要算力平台作为硬件基础。虽然在特定领域,推理模型能够在实现同等效果的情况下消耗更少算力,但算力平台的可靠性、稳定性仍然是决定推理模型发展的重要因素。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

此前,科大讯飞已联合华为打造出首个国产算力万卡平台“飞星一号”,并基于此完成了讯飞星火大模型多个版本的迭代训练。但推理模型的训练是一条全新的技术路线。目前,国产算力在单卡、集群、生态等方面距国际领先水平有一定差距,全面基于国产算力平台开展模型训练,面临着不少挑战。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

“讯飞星火X1的训练推理涉及多个模型的强交互,需要跨任务传输数据及权重,训练任务类型也由在线实时响应变为离线高吞吐。这需要克服国产显卡带宽不足的短板。”殷兵说,在这种复杂的训练模式下,影响效率的因素非常多,后训练所需的算力甚至提升了一个数量级。最终,通过与华为进行联合攻关,团队自研出训练框架并进行效率优化,实现了模型算法在国产算力上的成功适配,端到端效率大幅提升。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

2025年,“推理模型”成为人工智能行业的热词。从科大讯飞发布首个使用全国产算力训练的深度推理大模型——讯飞星火X1,到深度求索公司上线DeepSeek-R1推理模型,都将“推理模型”推到聚光灯下。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

多数大语言模型具备一定推理能力,但推理模型具有更强大的推理、逻辑分析和决策能力。推理模型会运用各种推理技巧,如演绎推理、归纳推理、类比推理等,来模拟人类的思考方式。多位业内人士接受科技日报记者采访时说,在人工智能大模型不断迭代升级的浪潮中,推理模型以创新的技术为行业发展注入新活力,也让人们对人工智能未来发展有了更大想象空间。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

推理模仿人类“慢思考”FdZ即热新闻——关注每天科技社会生活新变化gihot.com

在复旦大学计算机科学技术学院教授、上海市数据科学重点实验室主任肖仰华看来,过去,大模型的生成能力主要由语料决定。但专家级的推理能力并非“题海战术”可以实现,而是需要大模型具备强大的思维能力。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

心理学家认为,人类存在两种思维模式。一种是主要用来对日常生活中的简单问题进行判断、决策的“快思考”;另一种则是用于对一些特定问题进行深入分析、研判的“慢思考”。“快思考”是人类基于大量日常经验、常识等,对简单问题作出的快速反应,往往在人们无意识之间完成,是一种更加接近“本能”的思考方式。与之相对,“慢思考”则需要调动大脑更多资源,遵循特定思维逻辑,对问题进行抽丝剥茧式分析研究,进而作出更加理性周全的决策。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

作为人工智能的典型应用,大模型如今也有了“快”“慢”之别。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

传统大语言通用模型的思维方式更像是“快思考”,其主要依靠算力对海量数据进行学习,实现对后续空白内容的快速预测,回答人类提出的各类问题,本质上是基于概率模型对可能的答案进行“猜测”。相比之下,推理大模型更有意识和逻辑,会在回答之前进行一段时间“慢思考”,依据特定思维链条,提供更全面解答。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

科大讯飞研究院副院长殷兵举例说,讯飞星火X1在解答高考数学题等复杂题目时,会先将题目化繁为简,给出解题思路和步骤,呈现出全面的思考、分析和推理过程,进而给出准确的题目答案。殷兵说,推理模型更接近人类的“慢思考”方式。相较于通用大模型,推理模型在数学、医学、代码等领域,会产生更好的效果和意想不到的应用场景。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

强化学习实现反思纠错FdZ即热新闻——关注每天科技社会生活新变化gihot.com

人类可以对复杂问题进行深入思考、理性分析的一大原因在于,大脑能够反思。通过对过去错误结果和正确经验的反馈学习,人类得以不断提升对复杂问题判断的正确率。推理模型中普遍应用的强化学习技术,在一定程度上模仿了人类的反思、纠错能力。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

强化学习是一种机器学习方法,它允许智能体在与环境的交互中通过试错来学习最优策略。智能体在环境中执行相应行动,并根据行动的结果接收反馈,这些反馈信号则指导智能体调整下一步策略,循环往复,不断接近最优策略。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

例如,DeepSeek-R1在训练推理模型时采用了一条此前鲜有人使用的完全依赖强化学习的训练路径,即仅根据模型输出答案的优劣等简单信息,对模型进行奖惩。这相当于在不施加任何指引的情况下,让一个刚出生不久的幼儿完全自主探索世界,并根据探索结果给予反馈,从而让幼儿在反复试错和成功中快速成长。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

殷兵介绍,讯飞星火X1可以进行自我探索和反思验证,并基于答案正确与否的反馈信息进行强化训练。其中,自我评价迭代的评语模型能指出大模型存在的幻觉问题,大模型在得到评语模型的评价后可实现自我完善提升。同时,评语模型也通过强化训练进一步提升自身发现幻觉问题的能力。整个过程无需人员参与标注,而是依靠两个模型相互博弈、共同进化。多路径和反思迭代的强化学习技术使讯飞星火X1中能化繁为简,把复杂问题拆解成多个步骤进行思考推理,并进行自我反思探索。例如,它在解答高考数学题目时,不仅会实时呈现分步骤解题过程,还能对解题过程进行实时验算,反思纠正过程中的遗漏和问题,直至给出正确答案。而整个推理过程中形成的数据也可以被用于后续的强化学习。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

可靠算力仍是关键因素FdZ即热新闻——关注每天科技社会生活新变化gihot.com

无论是模型训练还是推理,都需要算力平台作为硬件基础。虽然在特定领域,推理模型能够在实现同等效果的情况下消耗更少算力,但算力平台的可靠性、稳定性仍然是决定推理模型发展的重要因素。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

此前,科大讯飞已联合华为打造出首个国产算力万卡平台“飞星一号”,并基于此完成了讯飞星火大模型多个版本的迭代训练。但推理模型的训练是一条全新的技术路线。目前,国产算力在单卡、集群、生态等方面距国际领先水平有一定差距,全面基于国产算力平台开展模型训练,面临着不少挑战。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

“讯飞星火X1的训练推理涉及多个模型的强交互,需要跨任务传输数据及权重,训练任务类型也由在线实时响应变为离线高吞吐。这需要克服国产显卡带宽不足的短板。”殷兵说,在这种复杂的训练模式下,影响效率的因素非常多,后训练所需的算力甚至提升了一个数量级。最终,通过与华为进行联合攻关,团队自研出训练框架并进行效率优化,实现了模型算法在国产算力上的成功适配,端到端效率大幅提升。FdZ即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-2-562-0.html推理模型:“慢思考”让决策更周全

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:新疆哈密上线 “满血版”DeepSeek-R1云服务

下一篇:新装置解决石油产业抽油杆防锈难题 油田小站捧回国际大奖

为你推荐
  近日,记者从江西省司法厅获悉:《数据资源公证登记规范》和《数据资产质押公证登记规范》两个...
01-21
  从西安市区出发,驱车一个多小时便可来到位于秦岭脚下的鄠邑区栗峪口村。在社交平台上,栗峪口...
02-05
  预计今天(2月14日)开始,西南地区东部、江南、江淮、华南等地又将迎来一次明显降水过程,局地或现...
02-14
  随着城市化加速和人民群众对居住品质要求的提升,房子的定义正从满足基本居住功能转向追求高...
01-21
  “索要千万逼死丈夫”案的翟欣欣因涉嫌犯敲诈勒索罪,案件将于今日开庭。  苏享茂的哥哥苏享龙此前也曾对外发布消息,说已接法院通知,翟欣欣涉嫌敲诈勒索一案,定于2025...
01-21
为了呈现安全可靠的驾驶乐趣,全新BMW X3“炼狱式”测试有多猛?据悉,在全新BMW X3实际路试中,全球共运行了500余辆测试车,测试总里程达200万公里,相当于绕行赤道50圈。纯粹驾驶乐趣...
01-21
2 月 5 日消息,新春伊始,绿地集团宣布成立新能源汽车出口公司,号称“打造百亿级新能源汽车出口平台”。同时,平台首个出口订单成功签约,将以全球热门车型为主,销往西亚、...
02-06
  1、在温以凡高考填报志愿期间,大伯母的弟弟车兴德骚扰温以凡,还差点猥亵了她。  2、这是温以凡寄居在大伯父家发生的事,大伯父为了面子不让她报警,改嫁的母亲也不关心她,...
02-20
在娱乐圈这片星光璀璨的天空下,何炅以其非凡的主持才能与温文尔雅的气质,长久以来赢得了无数观众的喜爱与尊敬。而近日,这位已年过半百的主持人,再度以惊人的健康体魄成为了舆论...
02-22
  到医院看病,迎面而来的可能是智能机器人;检查结果出来,人工智能迅速给出诊断意见……随着AI技术飞速提升,诊...
01-21
  科技日报北京2月5日电(记者张梦然)一种无药物、微创的新型干预方法,可逆转脊髓性肌萎缩症(SMA)的...
02-06
  1月16日,在得知37656.7元义卖捐款将送到西藏灾区后,西安航天基地富力城黄河小学的师生家长深感欣慰。  近日,西藏日喀则市定日县地震牵动着每个人的心。在听闻受灾地区...
01-21
2025年是贯彻全国教育大会精神、落实教育强国建设规划纲要的关键之年,也是“十四五”收官和“十五五”谋...
01-21
  中央经济工作会议提出,要稳妥处置地方中小金融机构风险。近期金融监管总局召开的年度监管工...
01-23
    2024年,工业硅供应持续增长,多晶硅需求疲弱,在高供应、高库存的情况下,工业硅价格承压下跌...
02-11
星座学说认为,巨蟹座和双鱼座是十分相配的星座组合。巨蟹男通常会被双鱼女所吸引,这是因...
01-22
天蝎座男生是十二星座中最神秘、复杂的一个,他们深藏不露的内心世界常常让人难以捉摸。...
01-22
国内休闲服饰品牌有那些?1 美特斯邦威上海美特斯邦威服饰股份有限公司成立于1995年。公司主要研发、采购和营销自主创立的Meters/bonwe和ME&CITY两大品牌时尚休闲服饰。通过...
02-12
姜黄哈伦裤怎么搭? 50岁女阔腿裤搭什么上衣哈伦裤?一、姜黄哈伦裤怎么搭?场景一:和姐妹出去耍姜黄色裤子+薄荷绿衬衫超级显白的薄荷绿,和春天的气息一样,清新自然。不管是拍照还是...
02-17
2月9日消息,苏宁易购日前与海信召开2025战略启动会,双方明确2025年百亿目标,聚焦换新消费趋势,将深化产品共创、场景升级、本地化经营、破圈营销,提升全品类经营效率。开工抢先机...
02-09
2月18日消息,华盛昌与北京京东数智工业科技有限公司(以下简称“京东工业”)近日在京东集团上海总部举行战略合作协议签约仪式。华盛昌董事长袁剑敏与京东工业副总裁郭晓博作为...
02-19
图片来源:图虫创意 乳企仍在经历原奶下行周期的阵痛。2月1...
02-21
3月7日消息,在“三八妇女节”来临之际,智联招聘撰写并发布《2025中国女性职场现状调查报告》。调研数据显示,当前女性平均月薪为8978元,较去年略有上涨,女性在各个行业中的努力和...
03-09
2024年11月25日,上海富勒信息科技有限公司(简称“富勒科技”)宣布完成超过3亿元人民币融资,本轮融资由经纬创投领投,高成投资、高瓴创投(GL Ventures)跟...
02-07
作者:三才真人(阴磊)在人类思想的漫长演进中,“道”一直是哲学家、思想家们不断探寻的核心。从老子的“道可道,非常道”到庄子的“道通为一”,道的内涵超越了语言的简单界定...
02-09
《最终幻想7:重生》PC版即将于北京时间1月23日晚上10点解锁,该作PC版媒体评分现已解禁,M站目前共收到29个评论,均分90,其中22个好评、1个中评,6个暂未给出评分。另外...
01-24
春节想打麻将,但又无力招架亲戚们在牌桌上的花式八卦盘问?那就来试试这款主打单人PVE的“i人麻将”吧! 点数无上限、构筑无下限,一起来花式赢积分。在这个春节,i...
01-27
极目新闻通讯员 李展鹏春运过半,东航武汉以高效运行和暖心服务交出一份亮眼答卷,截至2月1日,累计执行航班3200余班,运输旅客超44万人次,较2024年同期分别增长6.59%、10.42%;平均客...
02-03
极目新闻记者 谢茂 邓波2月8日,四川宜宾市筠连县沐爱镇金坪村发生山体滑坡,导致10户民房、1户生产用房被掩埋,目前有1人遇难,28人失联。一方有难,八方支援。受灾区域周边村镇的热...
02-09
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮