推理模型:“慢思考”让决策更周全

1年前 来源:科技日报 观看:112

2025年,“推理模型”成为人工智能行业的热词。从科大讯飞发布首个使用全国产算力训练的深度推理大模型——讯飞星火X1,到深度求索公司上线DeepSeek-R1推理模型,都将“推理模型”推到聚光灯下。KQi即热新闻——关注每天科技社会生活新变化gihot.com

多数大语言模型具备一定推理能力,但推理模型具有更强大的推理、逻辑分析和决策能力。推理模型会运用各种推理技巧,如演绎推理、归纳推理、类比推理等,来模拟人类的思考方式。多位业内人士接受科技日报记者采访时说,在人工智能大模型不断迭代升级的浪潮中,推理模型以创新的技术为行业发展注入新活力,也让人们对人工智能未来发展有了更大想象空间。KQi即热新闻——关注每天科技社会生活新变化gihot.com

推理模仿人类“慢思考”KQi即热新闻——关注每天科技社会生活新变化gihot.com

在复旦大学计算机科学技术学院教授、上海市数据科学重点实验室主任肖仰华看来,过去,大模型的生成能力主要由语料决定。但专家级的推理能力并非“题海战术”可以实现,而是需要大模型具备强大的思维能力。KQi即热新闻——关注每天科技社会生活新变化gihot.com

心理学家认为,人类存在两种思维模式。一种是主要用来对日常生活中的简单问题进行判断、决策的“快思考”;另一种则是用于对一些特定问题进行深入分析、研判的“慢思考”。“快思考”是人类基于大量日常经验、常识等,对简单问题作出的快速反应,往往在人们无意识之间完成,是一种更加接近“本能”的思考方式。与之相对,“慢思考”则需要调动大脑更多资源,遵循特定思维逻辑,对问题进行抽丝剥茧式分析研究,进而作出更加理性周全的决策。KQi即热新闻——关注每天科技社会生活新变化gihot.com

作为人工智能的典型应用,大模型如今也有了“快”“慢”之别。KQi即热新闻——关注每天科技社会生活新变化gihot.com

传统大语言通用模型的思维方式更像是“快思考”,其主要依靠算力对海量数据进行学习,实现对后续空白内容的快速预测,回答人类提出的各类问题,本质上是基于概率模型对可能的答案进行“猜测”。相比之下,推理大模型更有意识和逻辑,会在回答之前进行一段时间“慢思考”,依据特定思维链条,提供更全面解答。KQi即热新闻——关注每天科技社会生活新变化gihot.com

科大讯飞研究院副院长殷兵举例说,讯飞星火X1在解答高考数学题等复杂题目时,会先将题目化繁为简,给出解题思路和步骤,呈现出全面的思考、分析和推理过程,进而给出准确的题目答案。殷兵说,推理模型更接近人类的“慢思考”方式。相较于通用大模型,推理模型在数学、医学、代码等领域,会产生更好的效果和意想不到的应用场景。KQi即热新闻——关注每天科技社会生活新变化gihot.com

强化学习实现反思纠错KQi即热新闻——关注每天科技社会生活新变化gihot.com

人类可以对复杂问题进行深入思考、理性分析的一大原因在于,大脑能够反思。通过对过去错误结果和正确经验的反馈学习,人类得以不断提升对复杂问题判断的正确率。推理模型中普遍应用的强化学习技术,在一定程度上模仿了人类的反思、纠错能力。KQi即热新闻——关注每天科技社会生活新变化gihot.com

强化学习是一种机器学习方法,它允许智能体在与环境的交互中通过试错来学习最优策略。智能体在环境中执行相应行动,并根据行动的结果接收反馈,这些反馈信号则指导智能体调整下一步策略,循环往复,不断接近最优策略。KQi即热新闻——关注每天科技社会生活新变化gihot.com

例如,DeepSeek-R1在训练推理模型时采用了一条此前鲜有人使用的完全依赖强化学习的训练路径,即仅根据模型输出答案的优劣等简单信息,对模型进行奖惩。这相当于在不施加任何指引的情况下,让一个刚出生不久的幼儿完全自主探索世界,并根据探索结果给予反馈,从而让幼儿在反复试错和成功中快速成长。KQi即热新闻——关注每天科技社会生活新变化gihot.com

殷兵介绍,讯飞星火X1可以进行自我探索和反思验证,并基于答案正确与否的反馈信息进行强化训练。其中,自我评价迭代的评语模型能指出大模型存在的幻觉问题,大模型在得到评语模型的评价后可实现自我完善提升。同时,评语模型也通过强化训练进一步提升自身发现幻觉问题的能力。整个过程无需人员参与标注,而是依靠两个模型相互博弈、共同进化。多路径和反思迭代的强化学习技术使讯飞星火X1中能化繁为简,把复杂问题拆解成多个步骤进行思考推理,并进行自我反思探索。例如,它在解答高考数学题目时,不仅会实时呈现分步骤解题过程,还能对解题过程进行实时验算,反思纠正过程中的遗漏和问题,直至给出正确答案。而整个推理过程中形成的数据也可以被用于后续的强化学习。KQi即热新闻——关注每天科技社会生活新变化gihot.com

可靠算力仍是关键因素KQi即热新闻——关注每天科技社会生活新变化gihot.com

无论是模型训练还是推理,都需要算力平台作为硬件基础。虽然在特定领域,推理模型能够在实现同等效果的情况下消耗更少算力,但算力平台的可靠性、稳定性仍然是决定推理模型发展的重要因素。KQi即热新闻——关注每天科技社会生活新变化gihot.com

此前,科大讯飞已联合华为打造出首个国产算力万卡平台“飞星一号”,并基于此完成了讯飞星火大模型多个版本的迭代训练。但推理模型的训练是一条全新的技术路线。目前,国产算力在单卡、集群、生态等方面距国际领先水平有一定差距,全面基于国产算力平台开展模型训练,面临着不少挑战。KQi即热新闻——关注每天科技社会生活新变化gihot.com

“讯飞星火X1的训练推理涉及多个模型的强交互,需要跨任务传输数据及权重,训练任务类型也由在线实时响应变为离线高吞吐。这需要克服国产显卡带宽不足的短板。”殷兵说,在这种复杂的训练模式下,影响效率的因素非常多,后训练所需的算力甚至提升了一个数量级。最终,通过与华为进行联合攻关,团队自研出训练框架并进行效率优化,实现了模型算法在国产算力上的成功适配,端到端效率大幅提升。KQi即热新闻——关注每天科技社会生活新变化gihot.com

2025年,“推理模型”成为人工智能行业的热词。从科大讯飞发布首个使用全国产算力训练的深度推理大模型——讯飞星火X1,到深度求索公司上线DeepSeek-R1推理模型,都将“推理模型”推到聚光灯下。KQi即热新闻——关注每天科技社会生活新变化gihot.com

多数大语言模型具备一定推理能力,但推理模型具有更强大的推理、逻辑分析和决策能力。推理模型会运用各种推理技巧,如演绎推理、归纳推理、类比推理等,来模拟人类的思考方式。多位业内人士接受科技日报记者采访时说,在人工智能大模型不断迭代升级的浪潮中,推理模型以创新的技术为行业发展注入新活力,也让人们对人工智能未来发展有了更大想象空间。KQi即热新闻——关注每天科技社会生活新变化gihot.com

推理模仿人类“慢思考”KQi即热新闻——关注每天科技社会生活新变化gihot.com

在复旦大学计算机科学技术学院教授、上海市数据科学重点实验室主任肖仰华看来,过去,大模型的生成能力主要由语料决定。但专家级的推理能力并非“题海战术”可以实现,而是需要大模型具备强大的思维能力。KQi即热新闻——关注每天科技社会生活新变化gihot.com

心理学家认为,人类存在两种思维模式。一种是主要用来对日常生活中的简单问题进行判断、决策的“快思考”;另一种则是用于对一些特定问题进行深入分析、研判的“慢思考”。“快思考”是人类基于大量日常经验、常识等,对简单问题作出的快速反应,往往在人们无意识之间完成,是一种更加接近“本能”的思考方式。与之相对,“慢思考”则需要调动大脑更多资源,遵循特定思维逻辑,对问题进行抽丝剥茧式分析研究,进而作出更加理性周全的决策。KQi即热新闻——关注每天科技社会生活新变化gihot.com

作为人工智能的典型应用,大模型如今也有了“快”“慢”之别。KQi即热新闻——关注每天科技社会生活新变化gihot.com

传统大语言通用模型的思维方式更像是“快思考”,其主要依靠算力对海量数据进行学习,实现对后续空白内容的快速预测,回答人类提出的各类问题,本质上是基于概率模型对可能的答案进行“猜测”。相比之下,推理大模型更有意识和逻辑,会在回答之前进行一段时间“慢思考”,依据特定思维链条,提供更全面解答。KQi即热新闻——关注每天科技社会生活新变化gihot.com

科大讯飞研究院副院长殷兵举例说,讯飞星火X1在解答高考数学题等复杂题目时,会先将题目化繁为简,给出解题思路和步骤,呈现出全面的思考、分析和推理过程,进而给出准确的题目答案。殷兵说,推理模型更接近人类的“慢思考”方式。相较于通用大模型,推理模型在数学、医学、代码等领域,会产生更好的效果和意想不到的应用场景。KQi即热新闻——关注每天科技社会生活新变化gihot.com

强化学习实现反思纠错KQi即热新闻——关注每天科技社会生活新变化gihot.com

人类可以对复杂问题进行深入思考、理性分析的一大原因在于,大脑能够反思。通过对过去错误结果和正确经验的反馈学习,人类得以不断提升对复杂问题判断的正确率。推理模型中普遍应用的强化学习技术,在一定程度上模仿了人类的反思、纠错能力。KQi即热新闻——关注每天科技社会生活新变化gihot.com

强化学习是一种机器学习方法,它允许智能体在与环境的交互中通过试错来学习最优策略。智能体在环境中执行相应行动,并根据行动的结果接收反馈,这些反馈信号则指导智能体调整下一步策略,循环往复,不断接近最优策略。KQi即热新闻——关注每天科技社会生活新变化gihot.com

例如,DeepSeek-R1在训练推理模型时采用了一条此前鲜有人使用的完全依赖强化学习的训练路径,即仅根据模型输出答案的优劣等简单信息,对模型进行奖惩。这相当于在不施加任何指引的情况下,让一个刚出生不久的幼儿完全自主探索世界,并根据探索结果给予反馈,从而让幼儿在反复试错和成功中快速成长。KQi即热新闻——关注每天科技社会生活新变化gihot.com

殷兵介绍,讯飞星火X1可以进行自我探索和反思验证,并基于答案正确与否的反馈信息进行强化训练。其中,自我评价迭代的评语模型能指出大模型存在的幻觉问题,大模型在得到评语模型的评价后可实现自我完善提升。同时,评语模型也通过强化训练进一步提升自身发现幻觉问题的能力。整个过程无需人员参与标注,而是依靠两个模型相互博弈、共同进化。多路径和反思迭代的强化学习技术使讯飞星火X1中能化繁为简,把复杂问题拆解成多个步骤进行思考推理,并进行自我反思探索。例如,它在解答高考数学题目时,不仅会实时呈现分步骤解题过程,还能对解题过程进行实时验算,反思纠正过程中的遗漏和问题,直至给出正确答案。而整个推理过程中形成的数据也可以被用于后续的强化学习。KQi即热新闻——关注每天科技社会生活新变化gihot.com

可靠算力仍是关键因素KQi即热新闻——关注每天科技社会生活新变化gihot.com

无论是模型训练还是推理,都需要算力平台作为硬件基础。虽然在特定领域,推理模型能够在实现同等效果的情况下消耗更少算力,但算力平台的可靠性、稳定性仍然是决定推理模型发展的重要因素。KQi即热新闻——关注每天科技社会生活新变化gihot.com

此前,科大讯飞已联合华为打造出首个国产算力万卡平台“飞星一号”,并基于此完成了讯飞星火大模型多个版本的迭代训练。但推理模型的训练是一条全新的技术路线。目前,国产算力在单卡、集群、生态等方面距国际领先水平有一定差距,全面基于国产算力平台开展模型训练,面临着不少挑战。KQi即热新闻——关注每天科技社会生活新变化gihot.com

“讯飞星火X1的训练推理涉及多个模型的强交互,需要跨任务传输数据及权重,训练任务类型也由在线实时响应变为离线高吞吐。这需要克服国产显卡带宽不足的短板。”殷兵说,在这种复杂的训练模式下,影响效率的因素非常多,后训练所需的算力甚至提升了一个数量级。最终,通过与华为进行联合攻关,团队自研出训练框架并进行效率优化,实现了模型算法在国产算力上的成功适配,端到端效率大幅提升。KQi即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-2-562-0.html推理模型:“慢思考”让决策更周全

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:新疆哈密上线 “满血版”DeepSeek-R1云服务

下一篇:新装置解决石油产业抽油杆防锈难题 油田小站捧回国际大奖

为你推荐
你胖吗?一份最新报告或许会改变你现在的答案。1月15日,《柳叶刀·糖尿病与内分泌学》发布重大报告。该报告由全球75个医疗组织支持,参与撰写的5...
01-21
1月20日,中国有“人造太阳”之称的全超导托卡马克核聚变实验装置(EAST)在安徽合肥创造新的世界纪录,首次实现1亿摄氏度1066秒的高约束模等离子体运行,标...
01-23
  中央气象台1月27日18时继续发布暴雪黄色预警:  预计,1月27日20时至1月28日20时,辽宁中东部、吉林南...
01-28
    消费升腾跳动,城市脉搏跃动,新春的广州一片火热。  刚过去的蛇年春节假期,广州各大商圈...
02-06
  中新网北京1月21日电(中新财经记者 宋宇晟)2024年被认为是“低空经济元年”。步入2025年,中国低空经济将如何发展?中国低空经济联盟执行理事长罗军20日接受采访时呼吁,...
01-21
  断骨增高术是肢体延长术的俗称,是一项有创伤的疾病治疗技术,自2006年,我国卫生部门规定,严禁用于美容项目,但事实上,这种手术依然有人用于美容,在网络上有不少人声称可以做...
01-21
1 月 27 日消息,鸿蒙智行官方今日公布了旗下车型新年 OTA 升级详情,新版本将支持eAES 增强型自动紧急转向、新年主题 ADS App 等功能。附鸿蒙智行新年 OTA 升级详情如...
01-28
2 月 2 日消息,比亚迪宣布旗下海豹05 DM-i汽车将于2月10日正式上市,该车已于1月7日开启预售,预售价为 8.98-10.98万元。据从工信部申报信息获悉,海豹 05 DM-i 将配备与...
02-02
  1、《树下有片红房子》景栖迟的妈妈叫林一繁,在剧中是由荣蓉扮演的角色。  2、景栖迟的妈妈和陈欢尔的妈妈是老同学,因为两家以前就认识,陈欢尔和妈妈才搬到了同一个家...
02-18
最新播出的《仙台有树》收获了观众的一致好评。薛冉冉在剧中的表白引起了大家的兴趣,以下是对这一情节的分析。《仙台有树》的故事扣人心弦,薛冉冉和苏易水之...
02-19
21世纪经济报道记者季媛媛 上海报道 2025年刚开始,诺华制药就完成了大笔收购案。2月11日,诺华宣布了对Anthos Therapeutics的收购计划。据...
02-12
  春节后第一个重要节日元宵节到来。除了看花灯、猜灯谜,品尝元宵(汤圆)也是千家万户过节的重要...
02-13
  大众网记者 司心鹏 通讯员 邱文风 王琴 报道  12月5日,山东商业职业技术学院云计算技术与应用产业学院党总支与浪潮软件股份有限公司党委开展了“党建引领聚合力,双...
01-21
近日,人民网辽宁频道、中央广播电视总台辽宁总站、光明日报辽宁记者站、中国日报辽宁记者站、中新社辽宁...
01-21
  经济日报记者 杨然  监管评级结果是衡量保险公司风险程度的主要依据。国家金融监督管理总...
01-28
  经济日报记者 武亚东  近年来,我国董责险市场呈现出快速增长的趋势。董责险是董事、监事及...
02-07
每个人都有自己的星座,而星座之间的相互作用常常引起人们的好奇。其中,巨蟹男是一个温柔...
01-22
星座一直以来都是人们津津乐道的话题,尤其是在爱情方面。每个星座都有自己独特的性格特...
01-22
掌握潮流:男士服饰搭配的5个必备技巧在这个追求个性的时代,男士服饰搭配越来越受到关注。作为一名对时尚有追求的男士,我经常会思考如何在众多潮流中找到适合自己的搭配方法。...
02-12
如何在T台上定制完美造型:男女模特走秀秘笈作为一名爱好时尚的我,在T台走秀这种既华丽又充满挑战的场合中,造型的重要性不容忽视。无论是男女模特,如何在短时间内制定出令人惊艳...
02-12
2月5日消息,盒马发布《2025盒区房春节消费报告》(以下简称“报告”)。《报告》显示,盒马年菜销售同比增长了42%,下单购买年菜的18-35岁的年轻消费者占比达56%,不同于老一辈,这届年...
02-07
2月5日消息,微信团队发布2025春节数据报告《微信里的赛博年味儿》,展示基于除夕至初五的多项数据。春节期间,微信里共诞生了1亿+款用户自己创作的红包封面,约有3.9亿人收到含有...
02-07
2月16日消息,爱彼迎发布2024年第四季度及全年财务业绩。四季度,爱彼迎收入约25亿美元,同比增长12%;净利润约4.61亿美元,同比扭亏为盈,净利润率达19%;经调整EBITDA(息税折旧及摊销前...
02-17
3月7日消息,在“三八妇女节”来临之际,智联招聘撰写并发布《2025中国女性职场现状调查报告》。调研数据显示,当前女性平均月薪为8978元,较去年略有上涨,女性在各个行业中的努力和...
03-09
【#交银投资等在陕西成立航空航天股权基金# 出资额10亿】天眼查App显示,近日,陕西财金交汇航空航天新动能股权投资产业基金合伙企业(有限合伙)成立,执行事务合伙人为陕西空天宏远...
01-21
近日,美克生能源完成数亿元D+轮融资。本轮融资由北京市绿色能源和低碳产业投资基金(简称“北京绿色能源基金”)领投,北京未来科学城先进能源和智能制...
02-07
《绝地潜兵2》的开发商箭头游戏工作室在过去一年里,因其由游戏策划主导的剧情而备受关注。为纪念《绝地潜兵2》发布一周年,极为神秘的游戏策划J.O.E.L.首次在一...
02-10
开发了《英雄连》和《战争40K:战争黎明》等游戏的开发商 RelicEntertainment 去年 5 月与世嘉分道扬镳。公司日前概述了其作为独立工作室的未来计划。 Relic ...
02-12
据央视新闻报道,当地时间2月1日,美国联邦选举委员会年底的备案文件显示,埃隆·马斯克在2024年美国大选中的花费超过了2.9亿美元。马斯克 资料图(来源:环球网)文件表明,马斯克在年末...
02-02
极目新闻记者 潘锡珩4日,极目新闻记者从武汉地铁了解到,为保障铁路夜间到达乘客出行需求,今日(2月4日),武汉轨道交通2号线汉口火车站往佛祖岭方向末班车延时至24:00,4号线武汉火车站...
02-04
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮