昆仑万维开源R1V视觉思维链推理模型,开启多模态思考新时代

2个月前 来源:财经网 观看:11

3月18日,昆仑万维正式开源首款工业界多模态思维链推理模型Skywork R1V,即日起开源模型权重和技术报告。D7N即热新闻——关注每天科技社会生活新变化gihot.com

1D7N即热新闻——关注每天科技社会生活新变化gihot.com

开启多模态思考新时代D7N即热新闻——关注每天科技社会生活新变化gihot.com

继OpenAI o1和DeepSeek-R1在全球掀起长思考模型热潮后,大模型进入新技术范式。昆仑万维秉持实现 AGI 的初心,积极贡献开源社区,正式开源Skywork R1V多模态视觉推理模型,成为中国第一个开源「多模态推理模型」的企业。D7N即热新闻——关注每天科技社会生活新变化gihot.com

什么是视觉推理模型?D7N即热新闻——关注每天科技社会生活新变化gihot.com

视觉推理模型是一类能够解决需要思维链(Chain-of-Thought)的视觉任务的模型,通过对视觉信息进行多步逻辑推理与分析,逐步推导出最终结果。这种模型不仅关注图像内容的识别与理解,更强调通过层层递进的推理路径,实现复杂视觉问题的精准求解,例如视觉逻辑推理、视觉数学问题、图像中的科学现象分析、医学影像的诊断推理等,从而有效拓展了视觉大模型的应用边界。D7N即热新闻——关注每天科技社会生活新变化gihot.com

无论是日常繁琐的工作任务、复杂的数据分析、难以解答的学术问题,还是前所未见的陌生场景,都可以交给Skywork R1V进行高效处理。D7N即热新闻——关注每天科技社会生活新变化gihot.com

快速体验下来,R1V的视觉理解和推理能力双双在线。这样的模型能力是如何炼成的呢?D7N即热新闻——关注每天科技社会生活新变化gihot.com

强大推理能力,刷新跨模态任务新高度D7N即热新闻——关注每天科技社会生活新变化gihot.com

在Reasoning推理能力方面,Skywork R1V实现了模型的顶尖逻辑推理与数学分析能力。在权威的MATH500和AIME基准测试中,Skywork R1V分别取得了94.0和72.0的高分,明显领先于行业内众多主流模型。Skywork R1V在纯文本复杂推理任务中展现出卓越性能,使其在逻辑推理和数学问题求解领域展现出人类专家级别的水准。D7N即热新闻——关注每天科技社会生活新变化gihot.com

在Vision视觉理解能力方面,Skywork R1V成功地将其强大的文本推理与思维链推导能力高效迁移到视觉任务中。凭借创新的跨模态迁移技术与推理优化框架,Skywork R1V能够高效解决需要多步视觉推理的问题,在MMMU与MathVista等视觉推理基准中分别取得了69和67.5的优异成绩。这些结果不仅明显超越了多个近似大小的开源竞争模型,更达到与规模更大的闭源模型媲美的水准,充分证实了Skywork R1V在需要视觉思维链推理的跨模态任务中的领先优势。D7N即热新闻——关注每天科技社会生活新变化gihot.com

Skywork R1V通过视觉与文本能力的深度融合和视觉思维链推理能力的突破,推动了多模态推理模型的进一步发展,标志着人工智能领域的又一重大进步。D7N即热新闻——关注每天科技社会生活新变化gihot.com

目前,Skywork R1V已全面开源,期望助力全球范围内更多视觉推理任务的学术研究与产业应用探索。D7N即热新闻——关注每天科技社会生活新变化gihot.com

和开源同规模或更大规模模型的对比,Skywork R1V 38B体现出行业显著优异的推理能力,以及领先的多模态视觉理解能力。如下图,与开源同规模或更大规模模型的对比:D7N即热新闻——关注每天科技社会生活新变化gihot.com

2D7N即热新闻——关注每天科技社会生活新变化gihot.com

与闭源头部模型性能对比,R1V 38B模型性能媲美甚至超越更大开源模型以及主流闭源模型。如下图,与开源大尺寸模型与闭源专有模型的对比:D7N即热新闻——关注每天科技社会生活新变化gihot.com

3D7N即热新闻——关注每天科技社会生活新变化gihot.com

三大核心技术创新,引领视觉推理新突破D7N即热新闻——关注每天科技社会生活新变化gihot.com

Skywork R1V能够达到当前的性能高度,依赖于以下三项关键技术创新:D7N即热新闻——关注每天科技社会生活新变化gihot.com

1、文本推理能力的多模态高效迁移D7N即热新闻——关注每天科技社会生活新变化gihot.com

昆仑万维团队首次提出利用Skywork-VL的视觉投影器,无需重新训练语言模型和视觉编码器,即可实现文本推理能力的高效迁移到视觉任务,同时保留了优秀的原本推理文本能力(AIME 72.0,MATH500 94.0)。D7N即热新闻——关注每天科技社会生活新变化gihot.com

2、多模态混合式训练(IterativeSFT+GRPO)D7N即热新闻——关注每天科技社会生活新变化gihot.com

通过结合迭代监督微调(Iterative SFT)和GRPO强化学习,分阶段对齐视觉-文本表征,实现跨模态任务的高效融合,极大提升跨模态任务的表现。推动模型在MMMU基准达到69分的能力,同时在MathVista达到67.5分,与更大规模的闭源模型基本持平。通过反复迭代地利用高质量数据与高难度数据的组合,实现模型持续的知识巩固与错误纠正,显著提升了多模态推理的精度与泛化性能。D7N即热新闻——关注每天科技社会生活新变化gihot.com

图丨多模态混合式训练(来源:Skywork R1V技术报告)D7N即热新闻——关注每天科技社会生活新变化gihot.com

图丨多模态混合式训练(来源:Skywork R1V技术报告)D7N即热新闻——关注每天科技社会生活新变化gihot.com

3、自适应长度思维链蒸馏D7N即热新闻——关注每天科技社会生活新变化gihot.com

团队提出了一种基于视觉-文本复杂度的自适应推理链长度控制机制,动态优化模型推理过程,避免模型“过度思考”,提升推理效率。结合多阶段自蒸馏策略,进一步提升了数据生成与推理过程的质量,促进了模型在复杂多模态任务中的表现。D7N即热新闻——关注每天科技社会生活新变化gihot.com

图丨自适应长度思维链蒸馏(来源:Skywork R1V技术报告)D7N即热新闻——关注每天科技社会生活新变化gihot.com

图丨自适应长度思维链蒸馏(来源:Skywork R1V技术报告)D7N即热新闻——关注每天科技社会生活新变化gihot.com

Skywork R1V在训练过程中创新性地采用了三阶段方法,使得文本端强大的推理能力得以高效迁移至视觉任务上,具体训练流程如下:D7N即热新闻——关注每天科技社会生活新变化gihot.com

1、STEP1 视觉语言表征的初始对齐D7N即热新闻——关注每天科技社会生活新变化gihot.com

训练时首先使用轻量级的视觉适配器(MLP)连接视觉编码器(ViT)与语言模型,在已有的200万条常规多模态数据上进行训练,使得MLP初步学习如何将图像特征映射至语言空间。这一阶段仅训练MLP适配器,视觉编码器和语言模型参数保持冻结不变,快速、高效地实现视觉与语言表征的初步对齐。D7N即热新闻——关注每天科技社会生活新变化gihot.com

2、STEP2 推理能力迁移D7N即热新闻——关注每天科技社会生活新变化gihot.com

利用第一阶段训练好的MLP适配器,直接将视觉编码器与原始的强推理语言模型(R1-distilled-Qwen-32B)连接,形成Skywork-R1V视觉推理模型。虽然此时语言模型的参数发生了改变,但得益于语言模型架构的高度相似性和MLP的泛化能力,重新组装后的模型已能表现出一定的视觉推理能力,初始性能即达到业内同等规模的先进水平。D7N即热新闻——关注每天科技社会生活新变化gihot.com

3、STEP3 视觉与文本模态精准对齐D7N即热新闻——关注每天科技社会生活新变化gihot.com

最后,采用创新的“混合优化框架”,进一步精准对齐视觉和语言模态的表征。这一阶段分为两大步骤:迭代监督微调(Iterative SFT)和群组相对策略优化(GRPO)强化学习。在整个训练过程中,Skywork-R1V还创新性地引入了“自适应长度思维链蒸馏技术”,动态优化推理链长度,防止模型过度思考,从而提升了推理效率和质量。D7N即热新闻——关注每天科技社会生活新变化gihot.com

通过以上的训练策略,Skywork R1V在视觉推理任务上取得突破性进展,并在多个公开评测基准中达到或超过了现有领先模型的性能。D7N即热新闻——关注每天科技社会生活新变化gihot.com

此外,Skywork团队多模态理解模型也在进行"全面贯通"的进化,将视觉多模态扩展为全模态模型,引入语音理解能力。当前,全模态模型往往受限于特定领域不仅需要独立训练多个专业模型,更面临跨模态协同的算力挑战。D7N即热新闻——关注每天科技社会生活新变化gihot.com

基于R1V模型,Skywork团队设计了一种灵活在R1V中扩展语音理解模态的方式,从而实现一个全模态思考大模型,该在单个模型中同时实现图像、视频、语音的全模态理解能力,并在语音和视觉理解评测中斩获多项SOTA成绩。我们将陆续公布测评成绩、开源全模态思考大模型。D7N即热新闻——关注每天科技社会生活新变化gihot.com

持续开源回馈社区,坚定迈向AGID7N即热新闻——关注每天科技社会生活新变化gihot.com

2023年10月以来,昆仑万维陆续开源了百亿级大语言模型「天工」Skywork-13B系列、数字智能体全流程研发工具包AgentStudio、4000亿参数MoE超级模型、2千亿稀疏大模型Skywork-MoE、推理模型Skywork-o1-Open等。2025年2月18日,昆仑万维同时将SOTA级别的SkyReels-V1和SkyReels-A1进行开源。D7N即热新闻——关注每天科技社会生活新变化gihot.com

在语言生成模型、AI Agent、推理模型、视频生成模型等相继开源、多点开花之后,我们正式开源Skywork R1V多模态推理模型,在文本-视觉多模态推理方向再下一城,成为中国第一家开源多模态思考模型的企业。D7N即热新闻——关注每天科技社会生活新变化gihot.com

中国企业过去一年在AI领域的开源贡献,让全世界AI从业者和开发者享受到了技术共享带来的普惠发展。DeepSeek的开源为AI行业提供了新的发展范本,多项开源成果显著降低了AI技术的应用门槛、促进全球AI技术的民主化。昆仑万维作为中国AI领军企业,我们将持续开源优秀的模型、数据集等,共建开发者生态、加速技术创新、降低应用门槛、推动技术平权和AI行业发展。D7N即热新闻——关注每天科技社会生活新变化gihot.com

此文内容为企业供稿,仅供参考。D7N即热新闻——关注每天科技社会生活新变化gihot.com


D7N即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-14-7857-0.html昆仑万维开源R1V视觉思维链推理模型,开启多模态思考新时代

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:甜啦啦获评2025年度特色茶饮十大品牌

下一篇:百利好:国际金价持续大涨后续走势会怎样?

为你推荐
今日(1月27日),恐怖探索ADV《呪いの穢れ唄 鳴海龍也の回奇録》Steam页面开放,2025年4月发售,不支持中文,感兴趣的玩家可以点击此处进入商店页面。 游戏介绍: 失...
01-29
RTX 5090已于1月30日在全球开卖,但因为货源稀少,导致全球各地掀起抢购潮。 据媒体报道,日本东京秋叶原一家名为“电脑工房秋叶原零件馆”的店家限量发售10张RTX...
02-03
北京时间2月3日凌晨,单板滑雪世界杯阿斯本站男子坡面障碍技巧决赛,中国选手苏翊鸣状态回升,凭借稳健的表现以78.36分获得亚军,为中国选手拿下该项目首枚世界杯奖牌!冠军归属加拿...
02-03
极目新闻记者 柯称通讯员 吴江龙 吴柳青“大家好,我是土生土长的湖北人!”2月5日上午,武汉大学刘胜院士团队研发的“天问”人形机器人,这一开场白逗乐了现场观众。当天是蛇年新...
02-05
1月20日,国家能源局发布的“2024年全国油气勘探开发十大标志性成果”显示,2024年,国内油气产量当量首次超过4亿吨,连续8年保持千万吨级快速增长势头,“...
01-21
美国布朗大学物理学家在一项新研究中观察到一种名为“分数激子”的新型量子粒子,既不属于玻色子,也不属于费米子,而是介于两者之间的粒子类型。这一发...
01-24
   1月18日拍摄的横道河子镇保护建筑街区(无人机照片)。  时下正值冰雪旅游旺季,有着百年历史...
01-21
  “小寒大寒,冻成冰团。”时值大寒节气,冬天在季节版图上的霸主地位仍不可撼动。天气愈发寒冷,...
01-28
福建即将迎来一所新院校。 近日,据教育部网站消息,拟同意设置北京科技职业大学、淄博职业技术大学、酒泉职业技术大学等14所学校。...
01-21
  作为新春的“氛围担当”之一,年宵花深受人们的喜爱。春节将至,年味渐浓,各地不同品种、五彩斑斓的年宵花已大量上市,满足消费者需求。  在山东济宁兖州区兴隆庄街道一...
01-22
新春贺岁,宝马“以福相迎”。除了满屏福气,来自宝马的非遗好礼也已备好!跟随「贺岁拍档」高先生,一起蛇来运转「开心年」!...
01-24
1 月 23 日消息,2024 年 4 月 25 日,美国国家公路交通安全管理局(NHTSA)下属的缺陷调查办公室(ODI)对福特的 BlueCruise 自动驾驶系统展开了初步评估(PE24012),原因是该机构...
01-24
  胡建礼  近年来,国产系列电影如雨后春笋般涌现,如《熊出没》系列、《唐人街探案》系列、《...
01-22
《余烬之上》美华姐是干嘛的?美华姐的结局是什么?‌《余烬之上》中的美华姐,即戚美华,是廖思远的养母,经营着一家药铺‌。她性格豪放,喜欢享受生活,交际广泛,对廖思...
02-21
21世纪经济报道记者 闫硕 北京报道近日,上市连锁药店一心堂和健之佳发布了2024年业绩预告,净利润皆大幅下滑。根据公告,一心堂2024年归属于上...
01-21
  记者昨日从国家医保局获悉,国家医保服务平台APP“医保药品耗材追溯信息查询”功能于近日正式上线,购药者通过扫描药盒上的药品追溯码,即可获取详细的药品销售信息,了...
02-11
  大众网记者 秦瑾 通讯员 吴悦 报道  12月19日,2024年度山东省数据要素发展大会暨可信数据空间建设启动会在山东大厦举行。齐鲁师范学院人工智能教育研究院研发的“...
01-21
学院简介  西安海棠职业学院是在1996年创办的“陕西海棠中医美容培训学院”基础上发展而来,2004年经陕西省人民政府批准,国家教育部备案,纳入国家统一招生计划,并具有独立颁...
01-21
  保险公司拿到了黄金市场的“入场券”。  2月7日,金融监管总局发布《关于开展保险资金投资...
02-13
经济观察网 记者 胡群 2024年,全球家族办公室的资产配置出现了哪些新动向?近期发布的《瑞银2024年全球家族办公室报告》显示,与上一年度相比,2024年,全球家族办公室的投资策略出...
02-13
射手座的男生通常是开朗、乐观、自由奔放的,他们对待感情也是如此。然而,当他们真正爱上...
01-22
射手座男生是十二星座中的一员,他们有着独特的性格特点。那么,我们来看看射手座男生是否...
01-22
掀起潮流风暴:深入探讨潮流文化与服饰的融合潮流文化是一种与时尚密切相关的现象,它不仅影响着人们的穿着打扮,还渗透到生活的各个角落。在这个快速变化的时代,每一季的新趋势都...
02-12
时尚榜样:这些女明星是穿衣界的“风向标”在纷繁复杂的娱乐圈中,有些女明星不仅在荧幕上光彩夺目,私下里她们的穿衣风格也同样引人注目。无论是红毯礼服还是日常休闲装,她们总能...
02-17
2月6日消息,沃尔玛加拿大公司近日宣布,将投资65亿加元(约45亿美元)用于门店和供应链的布局与扩张。该计划包括开设数十家门店,其中首批五家超级购物中心将于2027年前在安大略省和...
02-07
2月18日消息,华盛昌与北京京东数智工业科技有限公司(以下简称“京东工业”)近日在京东集团上海总部举行战略合作协议签约仪式。华盛昌董事长袁剑敏与京东工业副总裁郭晓博作为...
02-19
2月10日,喜茶发布了主题为《不参与数字游戏与规模内卷,回归用户与品牌》的内部全员邮件,宣布2025年暂时停止接受事业合伙申请。喜茶...
02-11
2月24日消息,智联招聘发布第三期《2025年春招市场行情周报》,继续围绕38个重点城市,洞察春节后第三周招聘求职趋势,快速呈现春招市场最新动态。智联招聘数据显示,节后第三周,交通/...
02-25
全球性金融券商集团英国EBC Group平台始终致力于以领先生态,与全球交易者共塑交易的未来。 自第一届交易大赛起,为赤忱的热爱和卓越的才华提供舞台,在全球内寻找交易好手以赋能...
01-24
全球性金融券商集团英国EBC Group平台始终致力于以领先生态,与全球交易者共塑交易的未来。 自第一届交易大赛起,为赤忱的热爱和卓越的才华提供舞台,在全球内寻找交易好手以赋能...
01-24
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮