DeepSeek成功的底层逻辑及产业影响

9个月前 来源:新华网 观看:110

仿佛是一夜之间,DeepSeek迎来了“滔天的流量”。它不仅在全球引发了新一轮的AI应用热潮,而且给全球的算力资本市场带来了重大冲击。究其原因,DeepSeek不仅在训练成本及使用成本、模型训练及优化方式等领域实现了大量的工程创新,而且打破了AI领域许多的传统叙事逻辑。简而言之,DeepSeek正在改变游戏规则。UjF即热新闻——关注每天科技社会生活新变化gihot.com

DeepSeek最新推理模型R1的横空出世,带来了一个非常大的惊喜,仅用6天就发展了1亿用户。“用好奇心来揭开AGI的神秘面纱”这一愿景,更增添了神秘色彩。那么,DeepSeek在技术上究竟有哪些创新,成功的背后有哪些深层次的原因?这一切将对中美下一个十年的科技竞争产生哪些影响?UjF即热新闻——关注每天科技社会生活新变化gihot.com

工程创新UjF即热新闻——关注每天科技社会生活新变化gihot.com

成就与众不同UjF即热新闻——关注每天科技社会生活新变化gihot.com

DeepSeek不仅引发了全球新一轮的AI应用热潮,而且对全球的算力资本市场产生重大冲击。究其原因,DeepSeek在训练成本及使用成本、模型训练及优化方式方面均实现了大量工程创新。UjF即热新闻——关注每天科技社会生活新变化gihot.com

成本是最大的亮点。DeepSeek-R1的整体训练成本比OpenAI少了一个数量级以上。R1在整个训练过程中的工程优化和创新亮点非常多,包括“Multi-Head Latent Attention——多头隐形注意力机制”“Multi-token predication——多token预测”“有选择性地使用8个浮点数精度FP8来替代FP16甚至FP31”等。这些优化其实都不容易实现。每一个看似不显著的优化,在层级叠加效应下却产生了非常惊人的效果。UjF即热新闻——关注每天科技社会生活新变化gihot.com

DeepSeek其实一共发布了两个模型,分别是R1和R1-zero。DeepSeek基于V3这个基础模型聚焦强化学习获得了R1-zero。但是,R1-zero在回答一些问题的时候容易产生包括“多语言混杂”在内的诸多问题。Deep-Seek又对这个模型进行了SFT(监督微调优化),从而产生了R1。R1的强化学习功能可以实现自动化,是比较容易去scale的。这样一来,该模型未来的想象空间接近无限。UjF即热新闻——关注每天科技社会生活新变化gihot.com

颠覆性改变UjF即热新闻——关注每天科技社会生活新变化gihot.com

打破传统叙事逻辑UjF即热新闻——关注每天科技社会生活新变化gihot.com

DeepSeek之所以备受关注,本质在于打破了很多AI领域的传统叙事逻辑,例如OpenAI对于推理模型的算力堆叠霸权逻辑、AI应用圈的OpenAI寡头垄断格局逻辑、美国对中国的高制程芯片封锁逻辑以及AI大模型的开源闭源逻辑……UjF即热新闻——关注每天科技社会生活新变化gihot.com

首先,AI圈公认这种推理模型的实现难度是极大的。此前,比较好的推理模型只有OpenAI的GPT o1。Anthropic做不出来,Google“卡”了很久才推出表现一般的Germini 2.0。DeepSeek-R1至少是o1的平替,甚至部分能力还要强于o1。进一步来看,R1不仅免费还开源,训练成本和使用成本均实现了指数级下降。原先o1凭借领先性可以“收割”相当长一段时间的价值,但DeepSeek-R1的出现以及开源的举措,让绝大多数开发者以及聚焦应用的创业公司都能够以更低的门槛去做开发。更加便宜且更容易私有化部署的R1,击碎了华尔街对于所有大模型公司的估值逻辑。UjF即热新闻——关注每天科技社会生活新变化gihot.com

其次,DeepSeek的出现打破了AI应用圈原有的竞争枷锁。就算是美国的顶尖应用公司选择DeepSeek和ChatGPT时,答案也很清楚。Cursor、Perplexity这些AI领域的超级明星应用,都第一时间进行了DeepSeek模型的部署,而且设置了推荐第一优先级。此外,Google、Amazon、NV等平台也都部署了Deep-Seek模型。这些改变,同步影响了云服务的市场格局。国内大量从事应用开发的企业,在DeepSeek-R1出现之前不得不使用微软云(为了便捷使用GPT-4的API);现在,使用阿里云上部署的Deep-Seek成为可选项。UjF即热新闻——关注每天科技社会生活新变化gihot.com

再其次,DeepSeek带来了芯片封锁逻辑的崩塌。DeepSeek在辉达CUDA生态的更底层(例如PTX层),通过微调底层代码来优化性能,从而解决“连接通信能力和调度能力被阉割”的问题。专家普遍认为,目前中美AI大模型领域的技术差距约为4个月。从技术能力发展的趋势来看,这一差距继续缩小的概率大于扩大的概率。UjF即热新闻——关注每天科技社会生活新变化gihot.com

最后,开源让DeepSeek在舆论战中至少“不落下风”。在AGI的道路上做出最强大的模型并开源,应该是OpenAI最早的初心和使命。市场永远不会说谎,谁的模型能力强谁就能掌握最终的话语权。2024年12月DeepSeek V3发布的时候,国际主流媒体主要关注其“成本低廉”;当Deep-Seek-R1发布时,情况则截然不同,因为“滔天的流量”来了。作为一个开源模型,DeepSeek让所有用户在任何领域都增加了一个“顶尖专家”,免费且24小时随时在线。UjF即热新闻——关注每天科技社会生活新变化gihot.com

仿佛是一夜之间,DeepSeek迎来了“滔天的流量”。它不仅在全球引发了新一轮的AI应用热潮,而且给全球的算力资本市场带来了重大冲击。究其原因,DeepSeek不仅在训练成本及使用成本、模型训练及优化方式等领域实现了大量的工程创新,而且打破了AI领域许多的传统叙事逻辑。简而言之,DeepSeek正在改变游戏规则。UjF即热新闻——关注每天科技社会生活新变化gihot.com

DeepSeek最新推理模型R1的横空出世,带来了一个非常大的惊喜,仅用6天就发展了1亿用户。“用好奇心来揭开AGI的神秘面纱”这一愿景,更增添了神秘色彩。那么,DeepSeek在技术上究竟有哪些创新,成功的背后有哪些深层次的原因?这一切将对中美下一个十年的科技竞争产生哪些影响?UjF即热新闻——关注每天科技社会生活新变化gihot.com

工程创新UjF即热新闻——关注每天科技社会生活新变化gihot.com

成就与众不同UjF即热新闻——关注每天科技社会生活新变化gihot.com

DeepSeek不仅引发了全球新一轮的AI应用热潮,而且对全球的算力资本市场产生重大冲击。究其原因,DeepSeek在训练成本及使用成本、模型训练及优化方式方面均实现了大量工程创新。UjF即热新闻——关注每天科技社会生活新变化gihot.com

成本是最大的亮点。DeepSeek-R1的整体训练成本比OpenAI少了一个数量级以上。R1在整个训练过程中的工程优化和创新亮点非常多,包括“Multi-Head Latent Attention——多头隐形注意力机制”“Multi-token predication——多token预测”“有选择性地使用8个浮点数精度FP8来替代FP16甚至FP31”等。这些优化其实都不容易实现。每一个看似不显著的优化,在层级叠加效应下却产生了非常惊人的效果。UjF即热新闻——关注每天科技社会生活新变化gihot.com

DeepSeek其实一共发布了两个模型,分别是R1和R1-zero。DeepSeek基于V3这个基础模型聚焦强化学习获得了R1-zero。但是,R1-zero在回答一些问题的时候容易产生包括“多语言混杂”在内的诸多问题。Deep-Seek又对这个模型进行了SFT(监督微调优化),从而产生了R1。R1的强化学习功能可以实现自动化,是比较容易去scale的。这样一来,该模型未来的想象空间接近无限。UjF即热新闻——关注每天科技社会生活新变化gihot.com

颠覆性改变UjF即热新闻——关注每天科技社会生活新变化gihot.com

打破传统叙事逻辑UjF即热新闻——关注每天科技社会生活新变化gihot.com

DeepSeek之所以备受关注,本质在于打破了很多AI领域的传统叙事逻辑,例如OpenAI对于推理模型的算力堆叠霸权逻辑、AI应用圈的OpenAI寡头垄断格局逻辑、美国对中国的高制程芯片封锁逻辑以及AI大模型的开源闭源逻辑……UjF即热新闻——关注每天科技社会生活新变化gihot.com

首先,AI圈公认这种推理模型的实现难度是极大的。此前,比较好的推理模型只有OpenAI的GPT o1。Anthropic做不出来,Google“卡”了很久才推出表现一般的Germini 2.0。DeepSeek-R1至少是o1的平替,甚至部分能力还要强于o1。进一步来看,R1不仅免费还开源,训练成本和使用成本均实现了指数级下降。原先o1凭借领先性可以“收割”相当长一段时间的价值,但DeepSeek-R1的出现以及开源的举措,让绝大多数开发者以及聚焦应用的创业公司都能够以更低的门槛去做开发。更加便宜且更容易私有化部署的R1,击碎了华尔街对于所有大模型公司的估值逻辑。UjF即热新闻——关注每天科技社会生活新变化gihot.com

其次,DeepSeek的出现打破了AI应用圈原有的竞争枷锁。就算是美国的顶尖应用公司选择DeepSeek和ChatGPT时,答案也很清楚。Cursor、Perplexity这些AI领域的超级明星应用,都第一时间进行了DeepSeek模型的部署,而且设置了推荐第一优先级。此外,Google、Amazon、NV等平台也都部署了Deep-Seek模型。这些改变,同步影响了云服务的市场格局。国内大量从事应用开发的企业,在DeepSeek-R1出现之前不得不使用微软云(为了便捷使用GPT-4的API);现在,使用阿里云上部署的Deep-Seek成为可选项。UjF即热新闻——关注每天科技社会生活新变化gihot.com

再其次,DeepSeek带来了芯片封锁逻辑的崩塌。DeepSeek在辉达CUDA生态的更底层(例如PTX层),通过微调底层代码来优化性能,从而解决“连接通信能力和调度能力被阉割”的问题。专家普遍认为,目前中美AI大模型领域的技术差距约为4个月。从技术能力发展的趋势来看,这一差距继续缩小的概率大于扩大的概率。UjF即热新闻——关注每天科技社会生活新变化gihot.com

最后,开源让DeepSeek在舆论战中至少“不落下风”。在AGI的道路上做出最强大的模型并开源,应该是OpenAI最早的初心和使命。市场永远不会说谎,谁的模型能力强谁就能掌握最终的话语权。2024年12月DeepSeek V3发布的时候,国际主流媒体主要关注其“成本低廉”;当Deep-Seek-R1发布时,情况则截然不同,因为“滔天的流量”来了。作为一个开源模型,DeepSeek让所有用户在任何领域都增加了一个“顶尖专家”,免费且24小时随时在线。UjF即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-2-674-0.htmlDeepSeek成功的底层逻辑及产业影响

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:中央网信办部署推进2025年信息化重点工作

下一篇:小心AI伴侣背后的“温柔陷阱”

为你推荐
  IT之家1月15日消息,TheVerge今日报道,微软悄然撤下了其仿冒谷歌搜索的界面,该界面此前被用于让...
01-21
1月21日,美国总统唐纳德·特朗普宣布,美国开放人工智能研究中心(OpenAI)、软银和甲骨文公司将联合成立名为“星际之门”的新公司。未来4年,这3家...
01-24
  中新社太原1月16日电(记者胡健)“晋祠·唐刻华严石经陈列馆”16日在山西太原晋祠博物馆开馆...
01-22
  预计今天(2月14日)开始,西南地区东部、江南、江淮、华南等地又将迎来一次明显降水过程,局地或现...
02-14
新春临近,位于广州市荔湾区的岭南花卉市场一派热闹景象。在岭南地区,逛花市是春节必不可少的活动。作为全国大型花卉批发零售市场,岭南花卉市场本周迎来年花销售高峰期,逾千种花...
01-22
  国家医保局:我国医保基金安全可持续  中新网1月17日电 国家医保局1月17日召开的新闻发布会上介绍,2024年我国医保基金收支平衡、略有结余,医保基金安全可持续。医保基金...
01-21
新春贺岁,宝马“以福相迎”。除了满屏福气,来自宝马的非遗好礼也已备好!跟随「贺岁拍档」高先生,一起蛇来运转「开心年」!...
01-24
2 月 6 日消息,Jeep 昨日(2 月 5 日)发布公告,宣布推出 Wagoneer S Limited 版,配备了与 Launch Edition 相同的 400 伏、100 千瓦时电池组,支持在 20 分钟内通过 DC 快充...
02-06
  1、《爱你》电视剧定档于2025年2月25日上映,张凌赫和徐若晗领衔主演。  2、张凌赫饰演的何苏叶是个温柔坚韧的中医院肿瘤科医生,徐若晗演的沈惜凡有重度失眠,在看诊的时...
02-20
随着《相棒 第23季》的播出热度不断攀升,它有望成为近期最值得一看的作品,并成为大众话题的中心。最近讨论最多的是第17集的剧情。在这一集中,一具尸体在搬运...
02-21
  图①:1月1日凌晨,吉林大学白求恩第一医院妇产中心产科,助产士在为新生儿印脚印。  新华社记者 张 楠摄  图②:贵州黔西市文峰街道文峰社区珠海蓝逸贝贝托育园,孩...
01-21
21世纪经济报道记者季媛媛 上海报道 新一代药王“K药”刚刚宣布拿下294.82亿美元销售额后,“网红”司美格鲁肽随即高调宣称,2024年销售额为2...
02-06
  立足于学生生活,创造现实而又有意义的学习情境,突出语文的实用性是当前小学语文教学的一项主...
01-21
2023年12月11日,灞桥区洪庆街道“双减办”组织教育、安监等多部门,对洪庆地铁口“爱心托管”进行突击检查。  检查中发现,“爱心托管”在市场监管部门有备案,但机构内印有学...
01-21
  摘要  【棕榈油价格一季度将见顶?】春节假期期间,受美国关税政策以及马来西亚棕榈油产地供...
02-08
  险资在全国的收租版图有加速拓展的势头。近日,新华保险携手万科集团旗下住房租赁平台等,成立...
02-14
在爱情的世界里,有时候我们会遇到一些人,他们似乎对我们表现出了浓厚的兴趣,但却让我们感...
01-22
天蝎座的男生通常都有着强烈的个人魅力和吸引力,因此很容易吸引到一些暗恋他们的女生。...
01-22
探索欣昕潮流服饰:引领时尚的潮流之路在这个瞬息万变的时尚界,想要找对一件既能展现个性又不失品位的服饰,真的是一项挑战。然而,欣昕潮流服饰似乎打破了常规,以其独特的设计和多...
02-12
国内休闲服饰品牌有那些?1 美特斯邦威上海美特斯邦威服饰股份有限公司成立于1995年。公司主要研发、采购和营销自主创立的Meters/bonwe和ME&CITY两大品牌时尚休闲服饰。通过...
02-12
刘强东:无论京东做多大,都将会把最实惠的价格带给用户。1.京东上线竞价购物玩法刘强东认准一件事情,似乎无论发生什么,都会贯彻到底。自从2022年底京东零售内部大会上,刘强东明确...
02-13
黄铮:用户的需求就是我们的方向标。1、多多国际全面招募海淘商家拼多多对商家下手了。据亿邦动力获悉,近日,拼多多站内的多多国际正全面招募海淘商家入驻,其中针对生活或来往境...
02-18
近日界面新闻综合多个社交媒体平台搜索后发现,多个网友称开设于北京华贸中心的杰尼亚门店将在3月1日正式关闭。该店为杰尼亚的双层...
03-01
外卖后厨看得一清二楚,点餐的时候心里踏实多了。美团上线“明厨亮灶”专区有多少人一边点外卖,一边又担心外卖商家后厨的卫生状况?近年来,外卖后厨脏乱差的问题屡受诟病。布满油...
03-03
【#国家能源集团等在安徽成立新公司# 注册资本2.1亿】天眼查App显示,近日,国能(太湖)新能源有限责任公司成立,法定代表人为赵冠永,注册资本2.1亿人民币,经营范围含太阳能发电技术服...
01-21
近来,交易领域的流行语不外乎是“技术”和“创新”。 虽然许多业内人士都在强调尖端解决方案,但本质上真正的进步是远非这些营销炒作所能比的。 名副其实的创新是能为交易者提...
01-21
《天国:拯救2》已正式发售,首发24小时销量就突破100万份。许多玩家对这款中世纪RPG表现出浓厚兴趣。游戏中有许多细节非常真实,比如玩家会因为偷窃被捕,越狱时被守...
02-06
育碧发布了截至2024 年 12 月 31 日的九个月财务报告,这家法国开发商和发行商重点介绍了即将推出的《刺客信条》游戏以及正在进行的成本削减计划,该计划已经导致...
02-15
极目新闻通讯员 李璐“太感谢你们了!这么短的时间,就帮我找回了背包,为我解决了大麻烦!”1月31日上午,张先生来到湖北枣阳市公安局北城派出所领回自己失而复得的背包,紧紧握住民警...
02-02
2月8日,@抖音集团李亮 回应封禁张兰、汪小菲账号。简单说一下这个事件的处理过程:2月5日晚,账号“我是夏小健”发布所谓“包机”视频;6日,在逝者家属否认包机后(热点事件常有反转,...
02-08
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮