昆仑万维开源R1V视觉思维链推理模型,开启多模态思考新时代

5个月前 来源:财经网 观看:86

3月18日,昆仑万维正式开源首款工业界多模态思维链推理模型Skywork R1V,即日起开源模型权重和技术报告。OUN即热新闻——关注每天科技社会生活新变化gihot.com

1OUN即热新闻——关注每天科技社会生活新变化gihot.com

开启多模态思考新时代OUN即热新闻——关注每天科技社会生活新变化gihot.com

继OpenAI o1和DeepSeek-R1在全球掀起长思考模型热潮后,大模型进入新技术范式。昆仑万维秉持实现 AGI 的初心,积极贡献开源社区,正式开源Skywork R1V多模态视觉推理模型,成为中国第一个开源「多模态推理模型」的企业。OUN即热新闻——关注每天科技社会生活新变化gihot.com

什么是视觉推理模型?OUN即热新闻——关注每天科技社会生活新变化gihot.com

视觉推理模型是一类能够解决需要思维链(Chain-of-Thought)的视觉任务的模型,通过对视觉信息进行多步逻辑推理与分析,逐步推导出最终结果。这种模型不仅关注图像内容的识别与理解,更强调通过层层递进的推理路径,实现复杂视觉问题的精准求解,例如视觉逻辑推理、视觉数学问题、图像中的科学现象分析、医学影像的诊断推理等,从而有效拓展了视觉大模型的应用边界。OUN即热新闻——关注每天科技社会生活新变化gihot.com

无论是日常繁琐的工作任务、复杂的数据分析、难以解答的学术问题,还是前所未见的陌生场景,都可以交给Skywork R1V进行高效处理。OUN即热新闻——关注每天科技社会生活新变化gihot.com

快速体验下来,R1V的视觉理解和推理能力双双在线。这样的模型能力是如何炼成的呢?OUN即热新闻——关注每天科技社会生活新变化gihot.com

强大推理能力,刷新跨模态任务新高度OUN即热新闻——关注每天科技社会生活新变化gihot.com

在Reasoning推理能力方面,Skywork R1V实现了模型的顶尖逻辑推理与数学分析能力。在权威的MATH500和AIME基准测试中,Skywork R1V分别取得了94.0和72.0的高分,明显领先于行业内众多主流模型。Skywork R1V在纯文本复杂推理任务中展现出卓越性能,使其在逻辑推理和数学问题求解领域展现出人类专家级别的水准。OUN即热新闻——关注每天科技社会生活新变化gihot.com

在Vision视觉理解能力方面,Skywork R1V成功地将其强大的文本推理与思维链推导能力高效迁移到视觉任务中。凭借创新的跨模态迁移技术与推理优化框架,Skywork R1V能够高效解决需要多步视觉推理的问题,在MMMU与MathVista等视觉推理基准中分别取得了69和67.5的优异成绩。这些结果不仅明显超越了多个近似大小的开源竞争模型,更达到与规模更大的闭源模型媲美的水准,充分证实了Skywork R1V在需要视觉思维链推理的跨模态任务中的领先优势。OUN即热新闻——关注每天科技社会生活新变化gihot.com

Skywork R1V通过视觉与文本能力的深度融合和视觉思维链推理能力的突破,推动了多模态推理模型的进一步发展,标志着人工智能领域的又一重大进步。OUN即热新闻——关注每天科技社会生活新变化gihot.com

目前,Skywork R1V已全面开源,期望助力全球范围内更多视觉推理任务的学术研究与产业应用探索。OUN即热新闻——关注每天科技社会生活新变化gihot.com

和开源同规模或更大规模模型的对比,Skywork R1V 38B体现出行业显著优异的推理能力,以及领先的多模态视觉理解能力。如下图,与开源同规模或更大规模模型的对比:OUN即热新闻——关注每天科技社会生活新变化gihot.com

2OUN即热新闻——关注每天科技社会生活新变化gihot.com

与闭源头部模型性能对比,R1V 38B模型性能媲美甚至超越更大开源模型以及主流闭源模型。如下图,与开源大尺寸模型与闭源专有模型的对比:OUN即热新闻——关注每天科技社会生活新变化gihot.com

3OUN即热新闻——关注每天科技社会生活新变化gihot.com

三大核心技术创新,引领视觉推理新突破OUN即热新闻——关注每天科技社会生活新变化gihot.com

Skywork R1V能够达到当前的性能高度,依赖于以下三项关键技术创新:OUN即热新闻——关注每天科技社会生活新变化gihot.com

1、文本推理能力的多模态高效迁移OUN即热新闻——关注每天科技社会生活新变化gihot.com

昆仑万维团队首次提出利用Skywork-VL的视觉投影器,无需重新训练语言模型和视觉编码器,即可实现文本推理能力的高效迁移到视觉任务,同时保留了优秀的原本推理文本能力(AIME 72.0,MATH500 94.0)。OUN即热新闻——关注每天科技社会生活新变化gihot.com

2、多模态混合式训练(IterativeSFT+GRPO)OUN即热新闻——关注每天科技社会生活新变化gihot.com

通过结合迭代监督微调(Iterative SFT)和GRPO强化学习,分阶段对齐视觉-文本表征,实现跨模态任务的高效融合,极大提升跨模态任务的表现。推动模型在MMMU基准达到69分的能力,同时在MathVista达到67.5分,与更大规模的闭源模型基本持平。通过反复迭代地利用高质量数据与高难度数据的组合,实现模型持续的知识巩固与错误纠正,显著提升了多模态推理的精度与泛化性能。OUN即热新闻——关注每天科技社会生活新变化gihot.com

图丨多模态混合式训练(来源:Skywork R1V技术报告)OUN即热新闻——关注每天科技社会生活新变化gihot.com

图丨多模态混合式训练(来源:Skywork R1V技术报告)OUN即热新闻——关注每天科技社会生活新变化gihot.com

3、自适应长度思维链蒸馏OUN即热新闻——关注每天科技社会生活新变化gihot.com

团队提出了一种基于视觉-文本复杂度的自适应推理链长度控制机制,动态优化模型推理过程,避免模型“过度思考”,提升推理效率。结合多阶段自蒸馏策略,进一步提升了数据生成与推理过程的质量,促进了模型在复杂多模态任务中的表现。OUN即热新闻——关注每天科技社会生活新变化gihot.com

图丨自适应长度思维链蒸馏(来源:Skywork R1V技术报告)OUN即热新闻——关注每天科技社会生活新变化gihot.com

图丨自适应长度思维链蒸馏(来源:Skywork R1V技术报告)OUN即热新闻——关注每天科技社会生活新变化gihot.com

Skywork R1V在训练过程中创新性地采用了三阶段方法,使得文本端强大的推理能力得以高效迁移至视觉任务上,具体训练流程如下:OUN即热新闻——关注每天科技社会生活新变化gihot.com

1、STEP1 视觉语言表征的初始对齐OUN即热新闻——关注每天科技社会生活新变化gihot.com

训练时首先使用轻量级的视觉适配器(MLP)连接视觉编码器(ViT)与语言模型,在已有的200万条常规多模态数据上进行训练,使得MLP初步学习如何将图像特征映射至语言空间。这一阶段仅训练MLP适配器,视觉编码器和语言模型参数保持冻结不变,快速、高效地实现视觉与语言表征的初步对齐。OUN即热新闻——关注每天科技社会生活新变化gihot.com

2、STEP2 推理能力迁移OUN即热新闻——关注每天科技社会生活新变化gihot.com

利用第一阶段训练好的MLP适配器,直接将视觉编码器与原始的强推理语言模型(R1-distilled-Qwen-32B)连接,形成Skywork-R1V视觉推理模型。虽然此时语言模型的参数发生了改变,但得益于语言模型架构的高度相似性和MLP的泛化能力,重新组装后的模型已能表现出一定的视觉推理能力,初始性能即达到业内同等规模的先进水平。OUN即热新闻——关注每天科技社会生活新变化gihot.com

3、STEP3 视觉与文本模态精准对齐OUN即热新闻——关注每天科技社会生活新变化gihot.com

最后,采用创新的“混合优化框架”,进一步精准对齐视觉和语言模态的表征。这一阶段分为两大步骤:迭代监督微调(Iterative SFT)和群组相对策略优化(GRPO)强化学习。在整个训练过程中,Skywork-R1V还创新性地引入了“自适应长度思维链蒸馏技术”,动态优化推理链长度,防止模型过度思考,从而提升了推理效率和质量。OUN即热新闻——关注每天科技社会生活新变化gihot.com

通过以上的训练策略,Skywork R1V在视觉推理任务上取得突破性进展,并在多个公开评测基准中达到或超过了现有领先模型的性能。OUN即热新闻——关注每天科技社会生活新变化gihot.com

此外,Skywork团队多模态理解模型也在进行"全面贯通"的进化,将视觉多模态扩展为全模态模型,引入语音理解能力。当前,全模态模型往往受限于特定领域不仅需要独立训练多个专业模型,更面临跨模态协同的算力挑战。OUN即热新闻——关注每天科技社会生活新变化gihot.com

基于R1V模型,Skywork团队设计了一种灵活在R1V中扩展语音理解模态的方式,从而实现一个全模态思考大模型,该在单个模型中同时实现图像、视频、语音的全模态理解能力,并在语音和视觉理解评测中斩获多项SOTA成绩。我们将陆续公布测评成绩、开源全模态思考大模型。OUN即热新闻——关注每天科技社会生活新变化gihot.com

持续开源回馈社区,坚定迈向AGIOUN即热新闻——关注每天科技社会生活新变化gihot.com

2023年10月以来,昆仑万维陆续开源了百亿级大语言模型「天工」Skywork-13B系列、数字智能体全流程研发工具包AgentStudio、4000亿参数MoE超级模型、2千亿稀疏大模型Skywork-MoE、推理模型Skywork-o1-Open等。2025年2月18日,昆仑万维同时将SOTA级别的SkyReels-V1和SkyReels-A1进行开源。OUN即热新闻——关注每天科技社会生活新变化gihot.com

在语言生成模型、AI Agent、推理模型、视频生成模型等相继开源、多点开花之后,我们正式开源Skywork R1V多模态推理模型,在文本-视觉多模态推理方向再下一城,成为中国第一家开源多模态思考模型的企业。OUN即热新闻——关注每天科技社会生活新变化gihot.com

中国企业过去一年在AI领域的开源贡献,让全世界AI从业者和开发者享受到了技术共享带来的普惠发展。DeepSeek的开源为AI行业提供了新的发展范本,多项开源成果显著降低了AI技术的应用门槛、促进全球AI技术的民主化。昆仑万维作为中国AI领军企业,我们将持续开源优秀的模型、数据集等,共建开发者生态、加速技术创新、降低应用门槛、推动技术平权和AI行业发展。OUN即热新闻——关注每天科技社会生活新变化gihot.com

此文内容为企业供稿,仅供参考。OUN即热新闻——关注每天科技社会生活新变化gihot.com


OUN即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-14-7857-0.html昆仑万维开源R1V视觉思维链推理模型,开启多模态思考新时代

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:甜啦啦获评2025年度特色茶饮十大品牌

下一篇:百利好:国际金价持续大涨后续走势会怎样?

为你推荐
著名复古掌机改装大佬 Hairo Satoh 最近成功的将一部 DS 掌机塞进了原版 Game Boy 掌机的外壳当中。 他展示了主机,它不仅能读取正版卡带,而且还有一个藏在主机...
01-28
近日Sprecher啤酒公司宣布与育碧合作,推出一款限量版的啤酒以庆祝《刺客信条:影》的发行,并将在游戏内提供免费的奖励。 视频欣赏: 据悉,玩家购买这款特别版啤酒...
02-15
极目新闻记者 张秀娟 2月5日上午9时10分许,武汉市民之家企业开办综合办事窗口,工作人员将崭新的营业执照交至武汉国有资本投资运营集团有限公司办事人员彭艳丽的手中。这是武...
02-05
2月7日,鸟瞰武汉光谷重点民生项目生物城公共停车场。2月7日,鸟瞰武汉光谷重点民生项目生物城公共停车场,这座智能化停车场近期已投入使用,地下一楼的充电站内许多新能源车正在充...
02-08
  在“返乡潮”带动下,众多中小城市的“老家游”持续升温。面对春节返乡旅游热,地方文旅也不断...
01-27
  中新网西安2月8日电(记者阿琳娜)记者8日从西北大学文化遗产学院获悉,通过对唐高祖李渊侄子、...
02-11
  继“City不City”之后,“周五下班去中国”成为海外游客新潮流,韩国年轻人日渐兴起了“去中国过周末”的citywalk。  免签政策开放以来,越来越多的外国游客亲身体验、...
01-21
新闻通讯员 木子春运承载着亿万游子对家乡的眷恋与期盼,春节的脚步近了,归心似箭的人们纷纷踏上返乡之路。据交通运输等部门预计,今年春运全社会跨区域人员流动量将达到90亿人...
01-22
2 月 1 日消息,东风风行宣布旗下星海S7中大型轿车新增“555 鸿运版”上市,指导价为 10.99 万元,该版本车型定位入门,整理目前东风风行星海S7 具体车型定价如下:555鸿运版...
02-02
2 月 3 日消息,法拉第未来今日发文官宣,公司计划于 2025 年 3 月 10 日正式更换纳斯达克股票代码为“FFAI”,并在 3 月 17 日举行“FF 开放 AI 日”公布公司 AI 战略的...
02-04
  1、《难哄》桑延的工作是程序员,不过他还有副业,他有个酒吧,自己也是酒吧老板。  2、桑延在一个温暖有爱的家庭中长大,性格看似毒舌傲娇,实际上三观很正,有情有义。  3、...
02-15
《余烬之上》美华姐是什么身份?美华姐背景是什么?‌戚美华在《余烬之上》中是廖思远的养母,经营着一家药铺‌。她性格豪放,喜欢享受生活,交际广泛,对廖思远有着深...
02-21
21世纪经济报道记者季媛媛 上海报道 新一代药王“K药”刚刚宣布拿下294.82亿美元销售额后,“网红”司美格鲁肽随即高调宣称,2024年销售额为2...
02-06
21世纪经济报道记者朱艺艺 李佳英 闫硕 杭州、广州、北京报道“天津老百姓大药房可以订购华为WATCH D2,2988元,医保账号走个人账户”“上海...
02-14
山东科技大学: 山东省人民政府决定,任命: 陈绍杰为山东科技大学副校长(试用期...
01-21
  大众网记者 王一刚 报道  进入大班后,孩子们对探索自己身体秘密的情感越来越强烈。在一次手掌拓印活动中,孩子们对手上的指纹产生了浓厚的兴趣,在好奇心的推动下,孩子...
01-21
  今年以来,银行、理财子公司布局“理财夜市”热度持续。多家银行、理财子公司发布关于理财夜...
01-22
  2月9日,国家统计局发布数据显示,1月份国内金饰品价格环比上涨3%,同比上涨30.0%。受春节假期因...
02-11
巨蟹座的男生通常是非常敏感和细腻的,他们对待暗恋他们的女生会有一些独特的方式。 1....
01-22
天蝎座的男生通常深沉、神秘,他们不会轻易表露自己的感情。然而,当一个天蝎男爱上你时,他...
01-22
打造成功饰品品牌:你的创业项目计划书指南你是否曾经梦想过创建一个属于自己的饰品品牌?想象一下,自己设计的独特项链、耳环或者手链被人们喜爱和追捧,这种感觉无疑是令人激动的...
02-07
瘦小的男人适合穿什么品牌?一、瘦小的男人适合穿什么品牌?没有特定的品牌适合瘦小的男人,关键是要选择适合自己身材和风格的衣服。因为每个人的身材和个性都不同,选择品牌只是其...
02-17
势不可挡,未来可期。1、霞湖世家爆火,登顶视频号不得不说,老板亲自下场直播带货,还是有点用的。这不,视频号上一个名为“霞湖世家”的男装品牌,在老板郭长棋的带领下火了,销售额可...
02-14
阿里将与苹果强强联手。在阿联酋迪拜举办的World Governments Summit 2025峰会上,阿里巴巴联合创始人、董事局主席蔡崇信回应阿里与苹果合作传闻,他表示,“苹果在中国需要一个...
02-14
2月14日消息,情人节到来,饿了么联合战略咨询公司OC&C共同发布的《情人节即时零售礼赠趋势与品类机遇洞察》显示,过去三年情人节当天,重点礼赠品类的外卖单量较12日环比增长超过3...
02-15
图片来源:图虫创意 乳企仍在经历原奶下行周期的阵痛。2月1...
02-21
全球性金融券商集团英国EBC Group平台始终致力于以领先生态,与全球交易者共塑交易的未来。 自第一届交易大赛起,为赤忱的热爱和卓越的才华提供舞台,在全球内寻找交易好手以赋能...
01-24
近日,柔性钙钛矿电池研发制造企业湖南炎和科技有限责任公司(简称“炎和科技”)完成千万级天使+轮融资,由朝希资本独家投资。炎和科技是一家专注于钙钛...
02-07
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮