昆仑万维开源R1V视觉思维链推理模型,开启多模态思考新时代

11个月前 来源:财经网 观看:129

3月18日,昆仑万维正式开源首款工业界多模态思维链推理模型Skywork R1V,即日起开源模型权重和技术报告。LAp即热新闻——关注每天科技社会生活新变化gihot.com

1LAp即热新闻——关注每天科技社会生活新变化gihot.com

开启多模态思考新时代LAp即热新闻——关注每天科技社会生活新变化gihot.com

继OpenAI o1和DeepSeek-R1在全球掀起长思考模型热潮后,大模型进入新技术范式。昆仑万维秉持实现 AGI 的初心,积极贡献开源社区,正式开源Skywork R1V多模态视觉推理模型,成为中国第一个开源「多模态推理模型」的企业。LAp即热新闻——关注每天科技社会生活新变化gihot.com

什么是视觉推理模型?LAp即热新闻——关注每天科技社会生活新变化gihot.com

视觉推理模型是一类能够解决需要思维链(Chain-of-Thought)的视觉任务的模型,通过对视觉信息进行多步逻辑推理与分析,逐步推导出最终结果。这种模型不仅关注图像内容的识别与理解,更强调通过层层递进的推理路径,实现复杂视觉问题的精准求解,例如视觉逻辑推理、视觉数学问题、图像中的科学现象分析、医学影像的诊断推理等,从而有效拓展了视觉大模型的应用边界。LAp即热新闻——关注每天科技社会生活新变化gihot.com

无论是日常繁琐的工作任务、复杂的数据分析、难以解答的学术问题,还是前所未见的陌生场景,都可以交给Skywork R1V进行高效处理。LAp即热新闻——关注每天科技社会生活新变化gihot.com

快速体验下来,R1V的视觉理解和推理能力双双在线。这样的模型能力是如何炼成的呢?LAp即热新闻——关注每天科技社会生活新变化gihot.com

强大推理能力,刷新跨模态任务新高度LAp即热新闻——关注每天科技社会生活新变化gihot.com

在Reasoning推理能力方面,Skywork R1V实现了模型的顶尖逻辑推理与数学分析能力。在权威的MATH500和AIME基准测试中,Skywork R1V分别取得了94.0和72.0的高分,明显领先于行业内众多主流模型。Skywork R1V在纯文本复杂推理任务中展现出卓越性能,使其在逻辑推理和数学问题求解领域展现出人类专家级别的水准。LAp即热新闻——关注每天科技社会生活新变化gihot.com

在Vision视觉理解能力方面,Skywork R1V成功地将其强大的文本推理与思维链推导能力高效迁移到视觉任务中。凭借创新的跨模态迁移技术与推理优化框架,Skywork R1V能够高效解决需要多步视觉推理的问题,在MMMU与MathVista等视觉推理基准中分别取得了69和67.5的优异成绩。这些结果不仅明显超越了多个近似大小的开源竞争模型,更达到与规模更大的闭源模型媲美的水准,充分证实了Skywork R1V在需要视觉思维链推理的跨模态任务中的领先优势。LAp即热新闻——关注每天科技社会生活新变化gihot.com

Skywork R1V通过视觉与文本能力的深度融合和视觉思维链推理能力的突破,推动了多模态推理模型的进一步发展,标志着人工智能领域的又一重大进步。LAp即热新闻——关注每天科技社会生活新变化gihot.com

目前,Skywork R1V已全面开源,期望助力全球范围内更多视觉推理任务的学术研究与产业应用探索。LAp即热新闻——关注每天科技社会生活新变化gihot.com

和开源同规模或更大规模模型的对比,Skywork R1V 38B体现出行业显著优异的推理能力,以及领先的多模态视觉理解能力。如下图,与开源同规模或更大规模模型的对比:LAp即热新闻——关注每天科技社会生活新变化gihot.com

2LAp即热新闻——关注每天科技社会生活新变化gihot.com

与闭源头部模型性能对比,R1V 38B模型性能媲美甚至超越更大开源模型以及主流闭源模型。如下图,与开源大尺寸模型与闭源专有模型的对比:LAp即热新闻——关注每天科技社会生活新变化gihot.com

3LAp即热新闻——关注每天科技社会生活新变化gihot.com

三大核心技术创新,引领视觉推理新突破LAp即热新闻——关注每天科技社会生活新变化gihot.com

Skywork R1V能够达到当前的性能高度,依赖于以下三项关键技术创新:LAp即热新闻——关注每天科技社会生活新变化gihot.com

1、文本推理能力的多模态高效迁移LAp即热新闻——关注每天科技社会生活新变化gihot.com

昆仑万维团队首次提出利用Skywork-VL的视觉投影器,无需重新训练语言模型和视觉编码器,即可实现文本推理能力的高效迁移到视觉任务,同时保留了优秀的原本推理文本能力(AIME 72.0,MATH500 94.0)。LAp即热新闻——关注每天科技社会生活新变化gihot.com

2、多模态混合式训练(IterativeSFT+GRPO)LAp即热新闻——关注每天科技社会生活新变化gihot.com

通过结合迭代监督微调(Iterative SFT)和GRPO强化学习,分阶段对齐视觉-文本表征,实现跨模态任务的高效融合,极大提升跨模态任务的表现。推动模型在MMMU基准达到69分的能力,同时在MathVista达到67.5分,与更大规模的闭源模型基本持平。通过反复迭代地利用高质量数据与高难度数据的组合,实现模型持续的知识巩固与错误纠正,显著提升了多模态推理的精度与泛化性能。LAp即热新闻——关注每天科技社会生活新变化gihot.com

图丨多模态混合式训练(来源:Skywork R1V技术报告)LAp即热新闻——关注每天科技社会生活新变化gihot.com

图丨多模态混合式训练(来源:Skywork R1V技术报告)LAp即热新闻——关注每天科技社会生活新变化gihot.com

3、自适应长度思维链蒸馏LAp即热新闻——关注每天科技社会生活新变化gihot.com

团队提出了一种基于视觉-文本复杂度的自适应推理链长度控制机制,动态优化模型推理过程,避免模型“过度思考”,提升推理效率。结合多阶段自蒸馏策略,进一步提升了数据生成与推理过程的质量,促进了模型在复杂多模态任务中的表现。LAp即热新闻——关注每天科技社会生活新变化gihot.com

图丨自适应长度思维链蒸馏(来源:Skywork R1V技术报告)LAp即热新闻——关注每天科技社会生活新变化gihot.com

图丨自适应长度思维链蒸馏(来源:Skywork R1V技术报告)LAp即热新闻——关注每天科技社会生活新变化gihot.com

Skywork R1V在训练过程中创新性地采用了三阶段方法,使得文本端强大的推理能力得以高效迁移至视觉任务上,具体训练流程如下:LAp即热新闻——关注每天科技社会生活新变化gihot.com

1、STEP1 视觉语言表征的初始对齐LAp即热新闻——关注每天科技社会生活新变化gihot.com

训练时首先使用轻量级的视觉适配器(MLP)连接视觉编码器(ViT)与语言模型,在已有的200万条常规多模态数据上进行训练,使得MLP初步学习如何将图像特征映射至语言空间。这一阶段仅训练MLP适配器,视觉编码器和语言模型参数保持冻结不变,快速、高效地实现视觉与语言表征的初步对齐。LAp即热新闻——关注每天科技社会生活新变化gihot.com

2、STEP2 推理能力迁移LAp即热新闻——关注每天科技社会生活新变化gihot.com

利用第一阶段训练好的MLP适配器,直接将视觉编码器与原始的强推理语言模型(R1-distilled-Qwen-32B)连接,形成Skywork-R1V视觉推理模型。虽然此时语言模型的参数发生了改变,但得益于语言模型架构的高度相似性和MLP的泛化能力,重新组装后的模型已能表现出一定的视觉推理能力,初始性能即达到业内同等规模的先进水平。LAp即热新闻——关注每天科技社会生活新变化gihot.com

3、STEP3 视觉与文本模态精准对齐LAp即热新闻——关注每天科技社会生活新变化gihot.com

最后,采用创新的“混合优化框架”,进一步精准对齐视觉和语言模态的表征。这一阶段分为两大步骤:迭代监督微调(Iterative SFT)和群组相对策略优化(GRPO)强化学习。在整个训练过程中,Skywork-R1V还创新性地引入了“自适应长度思维链蒸馏技术”,动态优化推理链长度,防止模型过度思考,从而提升了推理效率和质量。LAp即热新闻——关注每天科技社会生活新变化gihot.com

通过以上的训练策略,Skywork R1V在视觉推理任务上取得突破性进展,并在多个公开评测基准中达到或超过了现有领先模型的性能。LAp即热新闻——关注每天科技社会生活新变化gihot.com

此外,Skywork团队多模态理解模型也在进行"全面贯通"的进化,将视觉多模态扩展为全模态模型,引入语音理解能力。当前,全模态模型往往受限于特定领域不仅需要独立训练多个专业模型,更面临跨模态协同的算力挑战。LAp即热新闻——关注每天科技社会生活新变化gihot.com

基于R1V模型,Skywork团队设计了一种灵活在R1V中扩展语音理解模态的方式,从而实现一个全模态思考大模型,该在单个模型中同时实现图像、视频、语音的全模态理解能力,并在语音和视觉理解评测中斩获多项SOTA成绩。我们将陆续公布测评成绩、开源全模态思考大模型。LAp即热新闻——关注每天科技社会生活新变化gihot.com

持续开源回馈社区,坚定迈向AGILAp即热新闻——关注每天科技社会生活新变化gihot.com

2023年10月以来,昆仑万维陆续开源了百亿级大语言模型「天工」Skywork-13B系列、数字智能体全流程研发工具包AgentStudio、4000亿参数MoE超级模型、2千亿稀疏大模型Skywork-MoE、推理模型Skywork-o1-Open等。2025年2月18日,昆仑万维同时将SOTA级别的SkyReels-V1和SkyReels-A1进行开源。LAp即热新闻——关注每天科技社会生活新变化gihot.com

在语言生成模型、AI Agent、推理模型、视频生成模型等相继开源、多点开花之后,我们正式开源Skywork R1V多模态推理模型,在文本-视觉多模态推理方向再下一城,成为中国第一家开源多模态思考模型的企业。LAp即热新闻——关注每天科技社会生活新变化gihot.com

中国企业过去一年在AI领域的开源贡献,让全世界AI从业者和开发者享受到了技术共享带来的普惠发展。DeepSeek的开源为AI行业提供了新的发展范本,多项开源成果显著降低了AI技术的应用门槛、促进全球AI技术的民主化。昆仑万维作为中国AI领军企业,我们将持续开源优秀的模型、数据集等,共建开发者生态、加速技术创新、降低应用门槛、推动技术平权和AI行业发展。LAp即热新闻——关注每天科技社会生活新变化gihot.com

此文内容为企业供稿,仅供参考。LAp即热新闻——关注每天科技社会生活新变化gihot.com


LAp即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-14-7857-0.html昆仑万维开源R1V视觉思维链推理模型,开启多模态思考新时代

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:甜啦啦获评2025年度特色茶饮十大品牌

下一篇:百利好:国际金价持续大涨后续走势会怎样?

为你推荐
《天国:拯救2》已正式发售,首发24小时销量就突破100万份。许多玩家对这款中世纪RPG表现出浓厚兴趣。游戏中有许多细节非常真实,比如玩家会因为偷窃被捕,越狱时被守...
02-06
2月8日,幻想冒险RPG游戏《二重螺旋》「狩夜测试」宣布定档2月20日,据悉,测试将于2月20日10:00开启,2月28日17:00结束。目前游戏的测试招募仍在进行中,预计2月10日23...
02-10
当地时间2月2日,美国国家运输安全委员会发表声明称,该机构目前已派遣工作人员抵达费城坠机事故的现场参与调查。截至2日下午,费城坠机事故的受伤人数已增至22人,5名伤者仍在住院...
02-03
据央视新闻报道,乌克兰总统泽连斯基2月1日在接受采访时称,乌克兰实际所获得的来自美国的支持远低于美方声称的数额,巨大的差额去哪儿了?他也不知道。据报道,泽连斯基在接受采访时...
02-04
最新一期《科学》杂志发表论文称,大约350万年前生活在南非的人类祖先——南方古猿,其实是“吃素的”。其饮食几乎完全由植物构成,鲜少或根...
01-23
近年来,AI客服的使用场景越来越丰富,多地却把人工客服岗位列入紧缺技能职业目录。记者采访了解到,人工客服从业者大多出身农村,岗位工作压力大、强度高...
01-27
  1月27日夜间,纷纷扬扬的大雪已下了一整天,白雪覆红灯让年味愈发浓厚。在沈阳街头,环卫工人们挥舞铁锹...
01-28
  2月4日,春节假期即将落下帷幕。在线旅游平台飞猪发布的《2025年春节假期出游快报》显示,“追着非遗过...
02-05
  价格周报|本周生猪周均价环比下跌,春节前或有阶段性反弹机会  澎湃新闻记者 彭艳秋  据农业农村部监测,1月17日,全国农产品批发市场猪肉平均价格为22.85元/公斤,与上周五...
01-21
1 月 21 日消息,据中国汽研今日消息,《智能网联汽车交通事故保险赔偿判定技术规范》团体标准启动会近日在北京召开。平安财险、太平洋财险、中国人寿财险等 20 余家保...
01-21
1 月 24 日消息,据“一汽红旗”官方公众号,一汽红旗宣布旗下天工系列全新电动中型车定名为天工 05,该车是红旗天工系列的首款轿车,官图称该车将于“新岁登场”,结合该车...
01-25
最近热播的《大梁第一女仵作》受到许多观众的喜爱,大家不仅追剧热情高涨,还对情节和人物充满好奇。为了让大家更全面地了解这部电视剧,这里整理了一些相关信息...
02-19
《180天重启计划》播出后受到了观众的喜爱和追捧。剧中第5集的剧情引起了广泛讨论,以下是该集的主要内容。吴俪梅叫醒顾云苏,让她好好打扮去见一个重要的人。...
02-21
  记者从国家医保局了解到,12月1日,全国医保正式上线慢性阻塞性肺疾病、类风湿关节炎、冠心病、病毒性肝炎、强直性脊柱炎等5种门...
01-21
21世纪经济报道记者 唐唯珂 广州报道社会办医的洗牌期仍在继续。2025年1月,新华医疗挂牌转让旗下山东新华昌国医院投资管理有限公司55%股权...
01-25
  大众网记者 杨涛报道  近日,在第十六届山东省大学生科技节——山东省大学生消防安全技能大赛中,青岛港湾职业技术学院应急管理学院23级建筑消防技术与应急救援技术专...
01-21
1月22日,香港科技大学上海中心在徐汇滨江成立,港科大将与上海合作打造人才...
01-23
  摘要  【氧化铝大涨又大跌后市怎么走?】氧化铝价格大跌后反弹,此前一月内现货报价下跌1400...
01-21
  摘要  【国际金价续创新高黄金板块业绩集体向好】近期,投资者的避险情绪升温,贵金属价格持...
02-06
天秤男和金牛女是十分有吸引力的组合。他们之间的关系充满了浪漫和温馨,但同时也存在一...
01-22
白羊男性格直爽、冲动,喜欢追求刺激和自由。如果你想要折磨一个白羊男,以下是一些方法可...
01-22
她是当今最美的女明星,你同意吗?在娱乐圈,讨论“谁是最美的女明星”一直是个热门话题。从银幕上闪耀的光芒到红毯上的璀璨,每位女明星都有她独特的魅力和风格。但在这其中,究竟谁...
02-07
姜黄哈伦裤怎么搭? 50岁女阔腿裤搭什么上衣哈伦裤?一、姜黄哈伦裤怎么搭?场景一:和姐妹出去耍姜黄色裤子+薄荷绿衬衫超级显白的薄荷绿,和春天的气息一样,清新自然。不管是拍照还是...
02-17
1月27日消息,“2024年中国产业互联网垂直细分行业TOP10企业”榜单近日发布。卓尔智联及旗下中农网、卓钢链、化塑汇、CIC、华纺链、海上鲜分别入选综合型、农业、钢铁、化工...
02-07
阿里苹果或将联手,为iPhone开发AI功能一则重磅消息,让阿里股价再创阶段新高。2月11日晚间,据The Information援引知情人士消息称,苹果为了应对在中国市场销售下滑的局势,正积极寻...
02-13
平台与骑手共赢,才是王道。1.美团将公布“取消骑手超时扣款”具体方案新的一年,美团要让骑手过得越来越好。2月11日晚,“美团Meituan”微信公众号公布了“取消骑手超时扣款”的...
02-13
史玉东有两重身份,他是全国人大代表,也是蒙牛集团全球研发创新中心研发总监。 来自乳业研发一线的身份,让他对行业有更深刻的了解。...
03-05
2024年末,一位科技创业者火了。作者 | 王思琪来源 | 投资家(ID:touzijias)2024年末,一位科技创业者火了。2025年初,这位创业者再度爆火。近日,中国科技行业因一位85后年轻人现身《...
01-24
根据一份流传到网上的内部公告,1月24日,完美世界开除了百万工作室四人,其违规行为包括在素材制作外包管理方面玩忽职守,构成严重失职;利用公司资源、谋取利益,涉及金额巨大;内外相...
02-09
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮