“喂”给人工智能的真实数据终将耗尽,合成数据能否让AI模型精确可靠?

3个月前 来源:中国科技网 观看:60

人工智能(AI)初创公司xAI创始人埃隆·马斯克近日表示:“在AI训练中,我们现在基本上耗尽了人类知识的累积总和。”之前研究也表明,人类生成的真实数据将在2到8年内消耗殆尽。鉴于真实数据日益稀缺,为满足AI的“胃口”,科技行业正转向使用合成数据。BCd即热新闻——关注每天科技社会生活新变化gihot.com

澳大利亚“对话”网站在本月稍早时间报道中指出,合成数据具有诸多优势,但过度依赖合成数据也可能削弱AI的精确性和可靠性。BCd即热新闻——关注每天科技社会生活新变化gihot.com

合成数据应运而生BCd即热新闻——关注每天科技社会生活新变化gihot.com

以往,科技公司主要依赖真实数据来构建、训练和改进AI模型。真实数据是指由人类创建的文本、视频和图像。它们通过调查、实验、观察或挖掘网站和社交媒体等途径被收集而来。BCd即热新闻——关注每天科技社会生活新变化gihot.com

真实数据因蕴含真实事件以及其场景和背景而极具价值,但其并非尽善尽美。它可能掺杂拼写错误、不一致或无关的内容,甚至潜藏严重偏见,导致生成式AI模型在某些情况下创建的图像仅展示男性或白人形象。BCd即热新闻——关注每天科技社会生活新变化gihot.com

但真实数据日益匮乏,因为人类生成数据的速度赶不上AI不断增长的需求。BCd即热新闻——关注每天科技社会生活新变化gihot.com

美国开放人工智能研究中心联合创始人伊利亚·苏茨克维尔在去年12月举行的机器学习会议上声称,AI行业已触及他所称的“数据峰值”,AI的训练数据如同化石燃料一样面临着耗尽的危机。此外,有研究预测,到2026年,ChatGPT等大型语言模型的训练将耗尽互联网上所有可用文本数据,届时将没有新的真实数据可供使用。BCd即热新闻——关注每天科技社会生活新变化gihot.com

为给AI提供充足的“养分”,一种由算法生成的、模仿真实世界情况的数据——合成数据应运而生。合成数据是在数字世界中创造的,而非从现实世界收集或测量而来。它可以作为真实世界数据的替代品,来训练、测试、验证AI模型。BCd即热新闻——关注每天科技社会生活新变化gihot.com

从理论上来说,合成数据为训练AI模型提供了一种经济高效且快捷的解决方案。它有效解决了AI训练使用真实数据时饱受诟病的隐私问题和道德问题,尤其是涉及个人健康数据等敏感信息时。更重要的是,与真实数据不同,合成数据在理论上可以无限供应。BCd即热新闻——关注每天科技社会生活新变化gihot.com

研究机构高德纳公司估计,2024年AI及分析项目使用的数据中,约60%是合成数据。到2030年,AI模型使用的绝大部分数据将是由AI生成的合成数据。BCd即热新闻——关注每天科技社会生活新变化gihot.com

科技公司来者不拒BCd即热新闻——关注每天科技社会生活新变化gihot.com

事实上,微软、元宇宙平台公司,以及Anthropic等众多科技头部企业和初创企业,已经开始广泛使用合成数据来训练其AI模型。BCd即热新闻——关注每天科技社会生活新变化gihot.com

例如,微软在1月8日开源的AI模型“Phi-4”,便是合成数据携手真实数据训练的;谷歌的“Gemma”模型也采用了类似方法。Anthropic公司也利用部分合成数据,开发出其性能最优异的AI系统之一“Claude 3.5 Sonnet”。苹果自研AI系统Apple Intelligence,在预训练阶段,也大量使用了合成数据。BCd即热新闻——关注每天科技社会生活新变化gihot.com

随着科技公司对合成数据的需求与日俱增,生产合成数据的工具也接踵而至。BCd即热新闻——关注每天科技社会生活新变化gihot.com

英伟达公司发布的3D仿真数据生成引擎Omniverse Replicator,能够生成合成数据,用于自动驾驶汽车和机器人训练。去年6月,英伟达开源了Nemotron-4340b系列模型,开发者可使用该模型生成合成数据,用于训练大型语言模型,以应用于医疗保健、金融、制造、零售等行业。在医疗、金融等专业领域,该模型能够根据特定需求生成高质量的合成数据,帮助构建更为精准的行业专属模型。微软推出的开源合成数据工具Synthetic Data Showcase则旨在通过生成合成数据和用户界面,实现隐私保护的数据共享和分析。亚马逊云科技推出的Amazon SageMaker Ground Truth也能为用户生成数十万张自动标记的合成图像。BCd即热新闻——关注每天科技社会生活新变化gihot.com

此外,去年12月,元宇宙平台公司推出开源大模型Llama 3.3,更是大幅降低了生成合成数据的成本。BCd即热新闻——关注每天科技社会生活新变化gihot.com

过度依赖风险难测BCd即热新闻——关注每天科技社会生活新变化gihot.com

尽管合成数据暂时解决了AI训练的燃眉之急,但它也并非尽善尽美。BCd即热新闻——关注每天科技社会生活新变化gihot.com

一个关键问题在于:当AI模型过于依赖合成数据时,它们可能会“崩溃”。它们会产生更多“幻觉”,编造看似合理可信但实际上并不存在的信息。而且,AI模型的质量和性能也会飞速下降,甚至无法使用。例如,某个AI模型生成的数据出现了一些拼写错误,利用这些充满了错误的数据训练其他模型,这些AI模型必定会“以讹传讹”,导致更大的错误。BCd即热新闻——关注每天科技社会生活新变化gihot.com

此外,合成数据也存在过于简单化的风险。它可能缺乏真实数据集蕴含的细节和多样性,这可能导致在其上训练的AI模型的输出也过于简单,缺乏实用性。BCd即热新闻——关注每天科技社会生活新变化gihot.com

为解决这些问题,国际标准化组织需要着手创建强大的系统,来跟踪和验证AI训练数据。此外,AI系统可以配备元数据追踪功能,让用户或系统能对合成数据进行溯源。人类也需要在AI模型的整个训练过程中对合成数据进行监督,以确保其高质量且符合道德标准。BCd即热新闻——关注每天科技社会生活新变化gihot.com

AI的未来在很大程度上取决于数据的质量,合成数据将在克服数据短缺方面发挥越来越重要的作用。对合成数据的使用,人们必须保持谨慎态度,尽量减少错误,确保其作为真实数据的可靠补充,从而保障AI系统的准确性和可信度。BCd即热新闻——关注每天科技社会生活新变化gihot.com

人工智能(AI)初创公司xAI创始人埃隆·马斯克近日表示:“在AI训练中,我们现在基本上耗尽了人类知识的累积总和。”之前研究也表明,人类生成的真实数据将在2到8年内消耗殆尽。鉴于真实数据日益稀缺,为满足AI的“胃口”,科技行业正转向使用合成数据。BCd即热新闻——关注每天科技社会生活新变化gihot.com

澳大利亚“对话”网站在本月稍早时间报道中指出,合成数据具有诸多优势,但过度依赖合成数据也可能削弱AI的精确性和可靠性。BCd即热新闻——关注每天科技社会生活新变化gihot.com

合成数据应运而生BCd即热新闻——关注每天科技社会生活新变化gihot.com

以往,科技公司主要依赖真实数据来构建、训练和改进AI模型。真实数据是指由人类创建的文本、视频和图像。它们通过调查、实验、观察或挖掘网站和社交媒体等途径被收集而来。BCd即热新闻——关注每天科技社会生活新变化gihot.com

真实数据因蕴含真实事件以及其场景和背景而极具价值,但其并非尽善尽美。它可能掺杂拼写错误、不一致或无关的内容,甚至潜藏严重偏见,导致生成式AI模型在某些情况下创建的图像仅展示男性或白人形象。BCd即热新闻——关注每天科技社会生活新变化gihot.com

但真实数据日益匮乏,因为人类生成数据的速度赶不上AI不断增长的需求。BCd即热新闻——关注每天科技社会生活新变化gihot.com

美国开放人工智能研究中心联合创始人伊利亚·苏茨克维尔在去年12月举行的机器学习会议上声称,AI行业已触及他所称的“数据峰值”,AI的训练数据如同化石燃料一样面临着耗尽的危机。此外,有研究预测,到2026年,ChatGPT等大型语言模型的训练将耗尽互联网上所有可用文本数据,届时将没有新的真实数据可供使用。BCd即热新闻——关注每天科技社会生活新变化gihot.com

为给AI提供充足的“养分”,一种由算法生成的、模仿真实世界情况的数据——合成数据应运而生。合成数据是在数字世界中创造的,而非从现实世界收集或测量而来。它可以作为真实世界数据的替代品,来训练、测试、验证AI模型。BCd即热新闻——关注每天科技社会生活新变化gihot.com

从理论上来说,合成数据为训练AI模型提供了一种经济高效且快捷的解决方案。它有效解决了AI训练使用真实数据时饱受诟病的隐私问题和道德问题,尤其是涉及个人健康数据等敏感信息时。更重要的是,与真实数据不同,合成数据在理论上可以无限供应。BCd即热新闻——关注每天科技社会生活新变化gihot.com

研究机构高德纳公司估计,2024年AI及分析项目使用的数据中,约60%是合成数据。到2030年,AI模型使用的绝大部分数据将是由AI生成的合成数据。BCd即热新闻——关注每天科技社会生活新变化gihot.com

科技公司来者不拒BCd即热新闻——关注每天科技社会生活新变化gihot.com

事实上,微软、元宇宙平台公司,以及Anthropic等众多科技头部企业和初创企业,已经开始广泛使用合成数据来训练其AI模型。BCd即热新闻——关注每天科技社会生活新变化gihot.com

例如,微软在1月8日开源的AI模型“Phi-4”,便是合成数据携手真实数据训练的;谷歌的“Gemma”模型也采用了类似方法。Anthropic公司也利用部分合成数据,开发出其性能最优异的AI系统之一“Claude 3.5 Sonnet”。苹果自研AI系统Apple Intelligence,在预训练阶段,也大量使用了合成数据。BCd即热新闻——关注每天科技社会生活新变化gihot.com

随着科技公司对合成数据的需求与日俱增,生产合成数据的工具也接踵而至。BCd即热新闻——关注每天科技社会生活新变化gihot.com

英伟达公司发布的3D仿真数据生成引擎Omniverse Replicator,能够生成合成数据,用于自动驾驶汽车和机器人训练。去年6月,英伟达开源了Nemotron-4340b系列模型,开发者可使用该模型生成合成数据,用于训练大型语言模型,以应用于医疗保健、金融、制造、零售等行业。在医疗、金融等专业领域,该模型能够根据特定需求生成高质量的合成数据,帮助构建更为精准的行业专属模型。微软推出的开源合成数据工具Synthetic Data Showcase则旨在通过生成合成数据和用户界面,实现隐私保护的数据共享和分析。亚马逊云科技推出的Amazon SageMaker Ground Truth也能为用户生成数十万张自动标记的合成图像。BCd即热新闻——关注每天科技社会生活新变化gihot.com

此外,去年12月,元宇宙平台公司推出开源大模型Llama 3.3,更是大幅降低了生成合成数据的成本。BCd即热新闻——关注每天科技社会生活新变化gihot.com

过度依赖风险难测BCd即热新闻——关注每天科技社会生活新变化gihot.com

尽管合成数据暂时解决了AI训练的燃眉之急,但它也并非尽善尽美。BCd即热新闻——关注每天科技社会生活新变化gihot.com

一个关键问题在于:当AI模型过于依赖合成数据时,它们可能会“崩溃”。它们会产生更多“幻觉”,编造看似合理可信但实际上并不存在的信息。而且,AI模型的质量和性能也会飞速下降,甚至无法使用。例如,某个AI模型生成的数据出现了一些拼写错误,利用这些充满了错误的数据训练其他模型,这些AI模型必定会“以讹传讹”,导致更大的错误。BCd即热新闻——关注每天科技社会生活新变化gihot.com

此外,合成数据也存在过于简单化的风险。它可能缺乏真实数据集蕴含的细节和多样性,这可能导致在其上训练的AI模型的输出也过于简单,缺乏实用性。BCd即热新闻——关注每天科技社会生活新变化gihot.com

为解决这些问题,国际标准化组织需要着手创建强大的系统,来跟踪和验证AI训练数据。此外,AI系统可以配备元数据追踪功能,让用户或系统能对合成数据进行溯源。人类也需要在AI模型的整个训练过程中对合成数据进行监督,以确保其高质量且符合道德标准。BCd即热新闻——关注每天科技社会生活新变化gihot.com

AI的未来在很大程度上取决于数据的质量,合成数据将在克服数据短缺方面发挥越来越重要的作用。对合成数据的使用,人们必须保持谨慎态度,尽量减少错误,确保其作为真实数据的可靠补充,从而保障AI系统的准确性和可信度。BCd即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-2-217-0.html“喂”给人工智能的真实数据终将耗尽,合成数据能否让AI模型精确可靠?

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:仿昆虫微型机器人飞行长达15分钟

下一篇:新型光学原子钟比铯钟精度高千倍

为你推荐
1月20日,国家能源局发布的“2024年全国油气勘探开发十大标志性成果”显示,2024年,国内油气产量当量首次超过4亿吨,连续8年保持千万吨级快速增长势头,“...
01-21
海军054B护卫舰首舰漯河舰1月22日上午在山东青岛某军港交接入列。10时许,入列授旗仪式开始,全场高唱中华人民共和国国歌,五星红旗冉冉升起。仪仗礼兵...
01-23
  中新社太原1月16日电(记者胡健)“晋祠·唐刻华严石经陈列馆”16日在山西太原晋祠博物馆开馆...
01-22
  今年春节,中国动画电影《哪吒之魔童闹海》登顶中国影史票房榜,魔童“哪吒”脚踏风火轮冲出国...
02-13
  2024年是房地产市场“政策大年”,也是历经3年左右调整后开始止跌企稳的一年。2024年9月26日,...
01-22
新华社联合国/日内瓦1月21日电(记者施春 陈俊侠)随着美国新任总统唐纳德·特朗普20日在就职当天签署一道道行政令,从纽约东河边的联合国总部,到瑞士日内瓦湖畔的万国宫,联合...
01-22
  2025年开年,中国汽车工业传捷报。  13日,中国汽车工业协会公布数据显示,2024年我国汽车产销...
01-21
1 月 26 日消息,据韩联社报道,比亚迪韩国公司 24 日透露,截至 23 日,旗下纯电 SUV 车型“ATTO 3”(元 PLUS)在韩预售量突破 1000 辆关口。这距离比亚迪本月 16 日在韩国市...
01-27
  1、《难哄》桑延是桑稚的亲哥,两人是年龄相差六岁的亲兄妹,从小打打闹闹,但兄妹感情很好。  2、桑延和桑稚生活在一个幸福有爱的家庭中,在《难哄》中白敬亭饰演桑延,桑稚...
02-14
电视剧《谁看见了孔雀在跳舞?》播出几天后热度持续上升,观众们在网上热烈讨论。特别是关于第5集的分集剧情介绍,成为了近期关注的焦点。在第5集中,拉面店店主染...
02-20
21世纪经济报道记者季媛媛 上海报道 继2023年出现上市以来首次亏损,科创板首家CRO(医药合同研发服务)企业美迪西(688202.SH)2024年的业绩继续...
01-22
编者按:一个人工智能(AI)机器人,在短短8天内独立完成了668项实验,合成了668种化合物,并成功研发出一种全新的化学催化剂。这一壮举令人赞叹。AI...
02-11
近日,人民网辽宁频道、中央广播电视总台辽宁总站、光明日报辽宁记者站、中国日报辽宁记者站、中新社辽宁...
01-21
为加强名班主任工作室成员的交流学习,提升班主任专业素养,近日,阜新市第一职专名班主任工作室开展了以《做...
01-23
  近期,保险资金频繁“扫货”上市公司股票。根据Wind统计,今年以来,包括平安人寿举牌邮储银行H股...
02-11
  2月10日,集运指数(欧线)期货主力合约2504收涨14.22%。期货日报记者注意到,集运指数(欧线)期货主力...
02-11
水瓶座是黄道十二宫中的第十一宫,出生于1月20日至2月18日之间。他们被认为是最具创造力...
01-22
天蝎男是一个神秘而深沉的星座,他们喜欢与人保持一定的距离感,不轻易展示自己的内心世界...
01-22
模特T台走秀效果大揭秘:音乐如何影响整个秀场氛围当我们在社交媒体上浏览顶级模特们在T台走秀的精彩瞬间时,或许会显得光鲜亮丽,难以想象,在这个过程中,还有一种不可见的力量同样...
02-07
瘦小的男人适合穿什么品牌?一、瘦小的男人适合穿什么品牌?没有特定的品牌适合瘦小的男人,关键是要选择适合自己身材和风格的衣服。因为每个人的身材和个性都不同,选择品牌只是其...
02-17
又一奢侈品电商巨头将撤出中国。奢侈品电商平台Net-a-Porter近日发布公告称,公司将于3月20日关闭包括天猫、微信小程序、小红书、抖音旗舰店、公司网站和App在内的所有中国线...
02-18
2月17日消息,1688温州选品中心落户温州大象城开工盛典仪式日前举行,标志着温州市电商发展迈入新篇章。图源:1688商人圈公众号活动现场,1688温州选品中心合作链主林景乐表示,1688 ...
02-18
2月5日消息,滴滴出行数据显示,春节假期期间,打车完单量同比去年上涨17%,其中异地打车(非常驻地打车)需求相比年前上涨60%。入境用户在国内使用滴滴的打车完单量同比去年上涨80%。...
02-07
2月9日消息,中国动画电影《哪吒2》总票房(含点映及预售)已突破70亿元。四川宜宾、江油等“含吒量”较高的旅游目的地,成为这波流量红利的受益者。同程旅行数据显示,自《哪吒2》电...
02-09
金陵华软科技股份有限公司(以下简称“华软科技”)于2025年1月18日发布了2024年度业绩预告。尽管公司预计2024年净利润仍为负值,但从整体情况来看,华软科技正在逐步摆脱困境,展现...
01-21
2024年末,一位科技创业者火了。作者 | 王思琪来源 | 投资家(ID:touzijias)2024年末,一位科技创业者火了。2025年初,这位创业者再度爆火。近日,中国科技行业因一位85后年轻人现身《...
01-24
在美国,PS5主机的销量走势领先于PS4,而Xbox Series主机的销量则落后于Xbox One。 这一信息来自Circana(前身为NPD集团)的执行董事兼电子游戏行业分析师马特·皮斯...
01-27
《绝地潜兵2》的开发商箭头游戏工作室在过去一年里,因其由游戏策划主导的剧情而备受关注。为纪念《绝地潜兵2》发布一周年,极为神秘的游戏策划J.O.E.L.首次在一...
02-10
极目新闻通讯员 龚轩 “我的车定速巡航功能失效了,刹车也踩不动,怎么办?”2月1日凌晨5时11分,湖北省公安厅高警总队六支队指挥中心民警石路接到群众报警求助。情况紧急,石路立即...
02-02
受加美关税战影响,2月2日外汇市场上,加元对美元汇率大幅下跌至1加元兑换0.6789美元。多伦多道明银行首席经济学家贝亚塔·卡兰西(Beata Caranci)和高级经济学家詹姆斯·奥兰多(Ja...
02-03
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮