推理模型:“慢思考”让决策更周全

1年前 来源:科技日报 观看:146

2025年,“推理模型”成为人工智能行业的热词。从科大讯飞发布首个使用全国产算力训练的深度推理大模型——讯飞星火X1,到深度求索公司上线DeepSeek-R1推理模型,都将“推理模型”推到聚光灯下。oD5即热新闻——关注每天科技社会生活新变化gihot.com

多数大语言模型具备一定推理能力,但推理模型具有更强大的推理、逻辑分析和决策能力。推理模型会运用各种推理技巧,如演绎推理、归纳推理、类比推理等,来模拟人类的思考方式。多位业内人士接受科技日报记者采访时说,在人工智能大模型不断迭代升级的浪潮中,推理模型以创新的技术为行业发展注入新活力,也让人们对人工智能未来发展有了更大想象空间。oD5即热新闻——关注每天科技社会生活新变化gihot.com

推理模仿人类“慢思考”oD5即热新闻——关注每天科技社会生活新变化gihot.com

在复旦大学计算机科学技术学院教授、上海市数据科学重点实验室主任肖仰华看来,过去,大模型的生成能力主要由语料决定。但专家级的推理能力并非“题海战术”可以实现,而是需要大模型具备强大的思维能力。oD5即热新闻——关注每天科技社会生活新变化gihot.com

心理学家认为,人类存在两种思维模式。一种是主要用来对日常生活中的简单问题进行判断、决策的“快思考”;另一种则是用于对一些特定问题进行深入分析、研判的“慢思考”。“快思考”是人类基于大量日常经验、常识等,对简单问题作出的快速反应,往往在人们无意识之间完成,是一种更加接近“本能”的思考方式。与之相对,“慢思考”则需要调动大脑更多资源,遵循特定思维逻辑,对问题进行抽丝剥茧式分析研究,进而作出更加理性周全的决策。oD5即热新闻——关注每天科技社会生活新变化gihot.com

作为人工智能的典型应用,大模型如今也有了“快”“慢”之别。oD5即热新闻——关注每天科技社会生活新变化gihot.com

传统大语言通用模型的思维方式更像是“快思考”,其主要依靠算力对海量数据进行学习,实现对后续空白内容的快速预测,回答人类提出的各类问题,本质上是基于概率模型对可能的答案进行“猜测”。相比之下,推理大模型更有意识和逻辑,会在回答之前进行一段时间“慢思考”,依据特定思维链条,提供更全面解答。oD5即热新闻——关注每天科技社会生活新变化gihot.com

科大讯飞研究院副院长殷兵举例说,讯飞星火X1在解答高考数学题等复杂题目时,会先将题目化繁为简,给出解题思路和步骤,呈现出全面的思考、分析和推理过程,进而给出准确的题目答案。殷兵说,推理模型更接近人类的“慢思考”方式。相较于通用大模型,推理模型在数学、医学、代码等领域,会产生更好的效果和意想不到的应用场景。oD5即热新闻——关注每天科技社会生活新变化gihot.com

强化学习实现反思纠错oD5即热新闻——关注每天科技社会生活新变化gihot.com

人类可以对复杂问题进行深入思考、理性分析的一大原因在于,大脑能够反思。通过对过去错误结果和正确经验的反馈学习,人类得以不断提升对复杂问题判断的正确率。推理模型中普遍应用的强化学习技术,在一定程度上模仿了人类的反思、纠错能力。oD5即热新闻——关注每天科技社会生活新变化gihot.com

强化学习是一种机器学习方法,它允许智能体在与环境的交互中通过试错来学习最优策略。智能体在环境中执行相应行动,并根据行动的结果接收反馈,这些反馈信号则指导智能体调整下一步策略,循环往复,不断接近最优策略。oD5即热新闻——关注每天科技社会生活新变化gihot.com

例如,DeepSeek-R1在训练推理模型时采用了一条此前鲜有人使用的完全依赖强化学习的训练路径,即仅根据模型输出答案的优劣等简单信息,对模型进行奖惩。这相当于在不施加任何指引的情况下,让一个刚出生不久的幼儿完全自主探索世界,并根据探索结果给予反馈,从而让幼儿在反复试错和成功中快速成长。oD5即热新闻——关注每天科技社会生活新变化gihot.com

殷兵介绍,讯飞星火X1可以进行自我探索和反思验证,并基于答案正确与否的反馈信息进行强化训练。其中,自我评价迭代的评语模型能指出大模型存在的幻觉问题,大模型在得到评语模型的评价后可实现自我完善提升。同时,评语模型也通过强化训练进一步提升自身发现幻觉问题的能力。整个过程无需人员参与标注,而是依靠两个模型相互博弈、共同进化。多路径和反思迭代的强化学习技术使讯飞星火X1中能化繁为简,把复杂问题拆解成多个步骤进行思考推理,并进行自我反思探索。例如,它在解答高考数学题目时,不仅会实时呈现分步骤解题过程,还能对解题过程进行实时验算,反思纠正过程中的遗漏和问题,直至给出正确答案。而整个推理过程中形成的数据也可以被用于后续的强化学习。oD5即热新闻——关注每天科技社会生活新变化gihot.com

可靠算力仍是关键因素oD5即热新闻——关注每天科技社会生活新变化gihot.com

无论是模型训练还是推理,都需要算力平台作为硬件基础。虽然在特定领域,推理模型能够在实现同等效果的情况下消耗更少算力,但算力平台的可靠性、稳定性仍然是决定推理模型发展的重要因素。oD5即热新闻——关注每天科技社会生活新变化gihot.com

此前,科大讯飞已联合华为打造出首个国产算力万卡平台“飞星一号”,并基于此完成了讯飞星火大模型多个版本的迭代训练。但推理模型的训练是一条全新的技术路线。目前,国产算力在单卡、集群、生态等方面距国际领先水平有一定差距,全面基于国产算力平台开展模型训练,面临着不少挑战。oD5即热新闻——关注每天科技社会生活新变化gihot.com

“讯飞星火X1的训练推理涉及多个模型的强交互,需要跨任务传输数据及权重,训练任务类型也由在线实时响应变为离线高吞吐。这需要克服国产显卡带宽不足的短板。”殷兵说,在这种复杂的训练模式下,影响效率的因素非常多,后训练所需的算力甚至提升了一个数量级。最终,通过与华为进行联合攻关,团队自研出训练框架并进行效率优化,实现了模型算法在国产算力上的成功适配,端到端效率大幅提升。oD5即热新闻——关注每天科技社会生活新变化gihot.com

2025年,“推理模型”成为人工智能行业的热词。从科大讯飞发布首个使用全国产算力训练的深度推理大模型——讯飞星火X1,到深度求索公司上线DeepSeek-R1推理模型,都将“推理模型”推到聚光灯下。oD5即热新闻——关注每天科技社会生活新变化gihot.com

多数大语言模型具备一定推理能力,但推理模型具有更强大的推理、逻辑分析和决策能力。推理模型会运用各种推理技巧,如演绎推理、归纳推理、类比推理等,来模拟人类的思考方式。多位业内人士接受科技日报记者采访时说,在人工智能大模型不断迭代升级的浪潮中,推理模型以创新的技术为行业发展注入新活力,也让人们对人工智能未来发展有了更大想象空间。oD5即热新闻——关注每天科技社会生活新变化gihot.com

推理模仿人类“慢思考”oD5即热新闻——关注每天科技社会生活新变化gihot.com

在复旦大学计算机科学技术学院教授、上海市数据科学重点实验室主任肖仰华看来,过去,大模型的生成能力主要由语料决定。但专家级的推理能力并非“题海战术”可以实现,而是需要大模型具备强大的思维能力。oD5即热新闻——关注每天科技社会生活新变化gihot.com

心理学家认为,人类存在两种思维模式。一种是主要用来对日常生活中的简单问题进行判断、决策的“快思考”;另一种则是用于对一些特定问题进行深入分析、研判的“慢思考”。“快思考”是人类基于大量日常经验、常识等,对简单问题作出的快速反应,往往在人们无意识之间完成,是一种更加接近“本能”的思考方式。与之相对,“慢思考”则需要调动大脑更多资源,遵循特定思维逻辑,对问题进行抽丝剥茧式分析研究,进而作出更加理性周全的决策。oD5即热新闻——关注每天科技社会生活新变化gihot.com

作为人工智能的典型应用,大模型如今也有了“快”“慢”之别。oD5即热新闻——关注每天科技社会生活新变化gihot.com

传统大语言通用模型的思维方式更像是“快思考”,其主要依靠算力对海量数据进行学习,实现对后续空白内容的快速预测,回答人类提出的各类问题,本质上是基于概率模型对可能的答案进行“猜测”。相比之下,推理大模型更有意识和逻辑,会在回答之前进行一段时间“慢思考”,依据特定思维链条,提供更全面解答。oD5即热新闻——关注每天科技社会生活新变化gihot.com

科大讯飞研究院副院长殷兵举例说,讯飞星火X1在解答高考数学题等复杂题目时,会先将题目化繁为简,给出解题思路和步骤,呈现出全面的思考、分析和推理过程,进而给出准确的题目答案。殷兵说,推理模型更接近人类的“慢思考”方式。相较于通用大模型,推理模型在数学、医学、代码等领域,会产生更好的效果和意想不到的应用场景。oD5即热新闻——关注每天科技社会生活新变化gihot.com

强化学习实现反思纠错oD5即热新闻——关注每天科技社会生活新变化gihot.com

人类可以对复杂问题进行深入思考、理性分析的一大原因在于,大脑能够反思。通过对过去错误结果和正确经验的反馈学习,人类得以不断提升对复杂问题判断的正确率。推理模型中普遍应用的强化学习技术,在一定程度上模仿了人类的反思、纠错能力。oD5即热新闻——关注每天科技社会生活新变化gihot.com

强化学习是一种机器学习方法,它允许智能体在与环境的交互中通过试错来学习最优策略。智能体在环境中执行相应行动,并根据行动的结果接收反馈,这些反馈信号则指导智能体调整下一步策略,循环往复,不断接近最优策略。oD5即热新闻——关注每天科技社会生活新变化gihot.com

例如,DeepSeek-R1在训练推理模型时采用了一条此前鲜有人使用的完全依赖强化学习的训练路径,即仅根据模型输出答案的优劣等简单信息,对模型进行奖惩。这相当于在不施加任何指引的情况下,让一个刚出生不久的幼儿完全自主探索世界,并根据探索结果给予反馈,从而让幼儿在反复试错和成功中快速成长。oD5即热新闻——关注每天科技社会生活新变化gihot.com

殷兵介绍,讯飞星火X1可以进行自我探索和反思验证,并基于答案正确与否的反馈信息进行强化训练。其中,自我评价迭代的评语模型能指出大模型存在的幻觉问题,大模型在得到评语模型的评价后可实现自我完善提升。同时,评语模型也通过强化训练进一步提升自身发现幻觉问题的能力。整个过程无需人员参与标注,而是依靠两个模型相互博弈、共同进化。多路径和反思迭代的强化学习技术使讯飞星火X1中能化繁为简,把复杂问题拆解成多个步骤进行思考推理,并进行自我反思探索。例如,它在解答高考数学题目时,不仅会实时呈现分步骤解题过程,还能对解题过程进行实时验算,反思纠正过程中的遗漏和问题,直至给出正确答案。而整个推理过程中形成的数据也可以被用于后续的强化学习。oD5即热新闻——关注每天科技社会生活新变化gihot.com

可靠算力仍是关键因素oD5即热新闻——关注每天科技社会生活新变化gihot.com

无论是模型训练还是推理,都需要算力平台作为硬件基础。虽然在特定领域,推理模型能够在实现同等效果的情况下消耗更少算力,但算力平台的可靠性、稳定性仍然是决定推理模型发展的重要因素。oD5即热新闻——关注每天科技社会生活新变化gihot.com

此前,科大讯飞已联合华为打造出首个国产算力万卡平台“飞星一号”,并基于此完成了讯飞星火大模型多个版本的迭代训练。但推理模型的训练是一条全新的技术路线。目前,国产算力在单卡、集群、生态等方面距国际领先水平有一定差距,全面基于国产算力平台开展模型训练,面临着不少挑战。oD5即热新闻——关注每天科技社会生活新变化gihot.com

“讯飞星火X1的训练推理涉及多个模型的强交互,需要跨任务传输数据及权重,训练任务类型也由在线实时响应变为离线高吞吐。这需要克服国产显卡带宽不足的短板。”殷兵说,在这种复杂的训练模式下,影响效率的因素非常多,后训练所需的算力甚至提升了一个数量级。最终,通过与华为进行联合攻关,团队自研出训练框架并进行效率优化,实现了模型算法在国产算力上的成功适配,端到端效率大幅提升。oD5即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-2-562-0.html推理模型:“慢思考”让决策更周全

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:新疆哈密上线 “满血版”DeepSeek-R1云服务

下一篇:新装置解决石油产业抽油杆防锈难题 油田小站捧回国际大奖

为你推荐
图源:Pixabay 寒武纪(688256.SH)的股价还在震荡,股民心情“过...
01-21
1月20日,我国首款起飞重量5.25吨、最大载重1.9吨的大型无人机鸿雁(HY100)在新疆石河子市天域航通石河子生产基地成功实现量产下线,其中3架顺利向客户完...
01-21
  中国自然资源部北海区海洋预报台6日发布的监测数据显示,受近期中国东北地区大风和降温影响,未来3天,预...
02-07
  近日,工业和信息化部公布了2024年实数融合典型案例名单,我省5家企业上榜,分别为大连亚明汽车部件股份...
02-17
  近日,衡阳90后小伙夏汪辉从深圳步行回家过年,目前已走了11天。他一边赶路一边分享视频,引发大量关注。很多网友点赞他的毅力,也有人表示关心,问他是不是没买到车票,想顺道...
01-21
  史上最快!春节档爆了,这部电影强势领跑   中国基金报记者 安曼  顶级IP“神仙打架”,2025年春节档时间未到,但是票房已经爆了!  据灯塔专业版显示,2025年春节档今日开启...
01-21
没有一个春天不会到来,无论经历过怎样的寒冬。风云变幻的汽车行业,有迅猛地崛起,有突然地倒下,也有在艰难中坚定前行……2024年底,北京现代迎来新的转机,双方股东再次增资10.95亿...
01-21
2 月 3 日消息,博主@孙少军09 今日发文分享了一张截图,其中提到了吉利银河 L6 EM-i 汽车相关销售信息,重点内容如下:L6 EM-i 已陆续到店,可以按照 8.98 万起的先享提车价...
02-04
《余烬之上》男主是谁啊?余烬之上背后的boss是谁?‌《余烬之上》的男主角是王子奇和孙阳。‌王子奇饰演的廖思远是一个天才破案少年,因童年创伤患上“解离性人...
02-21
人气演员王鹤棣近日现身上海,参与了一场备受瞩目的品牌盛事,现场发布的未经修饰的照片和视频迅速在网络上走红,引起了广泛热议。 活动中,王鹤棣以一袭粉色衬衫惊艳亮相,帅气形象...
02-22
据国家卫生健康委消息,1月22日,国家卫生健康委办公厅、国家中医药局综合司发布流行性感冒诊疗方案(2025年版)。国家卫生健康委表示,为进一步提...
01-23
21世纪经济报道记者 韩利明 上海报道2024年,对于中国生物医药企业而言,似乎尚未走出“资本寒冬”。医药魔方数据显示,中国医疗健康领域一级市...
02-06
日前,教育部召开2024年全国教育数字化工作总结会,会上宣布国家终身教育智慧教育平台正式上线。平台网址为...
01-21
2025年辽宁省普通高等学校艺术类专业招生简章  一、艺术类考生高考报名  艺术类考生高考报名工作按...
01-21
  银行业理财登记托管中心近日发布《中国银行业理财市场年度报告(2024年)》(简称《报告》)。《报...
01-22
  摘要  【黄金价格再攀新高足金首饰价格冲破830元/克】COMEX黄金价格报2762美元/盎司,创近...
01-24
射手座的男生通常被认为是热情开朗、喜欢自由的人。他们对待感情也有一套独特的方式,其...
01-22
每个人都有自己的审美观和喜好,摩羯男也不例外。他们对女生的打扮有着独特的偏好,下面就...
01-22
关于穿搭的爆火文案? t恤的多种穿搭方法?一、关于穿搭的爆火文案?我的衣服并不能改变世界,但是它可以改变我的心情。你的穿搭风格决定了你的气质,让自己看起来更自信更迷人。不要...
02-12
探索艾琳潮流服饰:时尚风格与个性表达的完美结合在如今这个人人追求个性和时尚的时代,艾琳潮流服饰无疑成为了许多年轻人心目中的时尚标杆。我早已深陷于这个品牌所展现的独特...
02-17
2月9日消息,为满足消费者对品质家居好物的需求,京东“潮品家”频道升级上线,汇聚百大国际、原创家具品牌,精选时下流行的家具精品、宝藏店铺、风格趋势及热门榜单,为消费者打造一...
02-09
2月9日消息,苏宁易购日前与海信召开2025战略启动会,双方明确2025年百亿目标,聚焦换新消费趋势,将深化产品共创、场景升级、本地化经营、破圈营销,提升全品类经营效率。开工抢先机...
02-09
新春佳节,许多爱美的小伙伴会去美甲店或是在家做个美甲,让指甲换上新装。然而,美甲行业受欢迎的背后,其隐藏的安全问题也不容忽视。近...
02-11
2月27日消息,智能支付网络平台Thunes宣布将其直连的全球网络(Thunes’ Direct Global Network)扩展至台湾市场,新举措将Thunes的Pay-to-Banks银行支付功能引入该地区,进一步提升...
03-01
2024年末,一位科技创业者火了。作者 | 王思琪来源 | 投资家(ID:touzijias)2024年末,一位科技创业者火了。2025年初,这位创业者再度爆火。近日,中国科技行业因一位85后年轻人现身《...
01-24
自去年底开始,黄金多头优势逐渐退却,国际现货黄金价格经历几次大跌后一度跌下2700关口,多空进入漫长的震荡周期,多头始终无法找到再度冲高的时机。  北京时间1月21日,国际现货...
02-09
今日(1月23日),后末世主题的城市建造游戏《终落之城》Steam页面上线,游戏支持简体中文,年内发售,感兴趣的玩家可以点击此处进入商店页面。 游戏介绍: 这是一款后末世...
01-24
由Dark Panda打造的第三人称射击生存动作冒险游戏《奇异地平线(Strange Horizons)》,现已上线Steam平台。 本作 是一款生存冒险游戏,在游戏中,一个通往另一个维度...
02-06
@上海地铁shmetro截图2月8日7时13分,@上海地铁shmetro发布运营信息:目前,浦江线因线路设备故障,三鲁公路至沈杜公路区段停止运营,汇臻路至三鲁公路单一交路运行。目前,故障区段已...
02-08
“买短乘长”致使列车超载,今年春运又出现了。据媒体报道,近期有列车经过河南信阳时,因一些旅客未在票面到达站下车造成超员,导致部分正常购票旅客没能上车。经过铁路部门协调安...
02-10
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮