“喂”给人工智能的真实数据终将耗尽,合成数据能否让AI模型精确可靠?

7个月前 来源:中国科技网 观看:300

人工智能(AI)初创公司xAI创始人埃隆·马斯克近日表示:“在AI训练中,我们现在基本上耗尽了人类知识的累积总和。”之前研究也表明,人类生成的真实数据将在2到8年内消耗殆尽。鉴于真实数据日益稀缺,为满足AI的“胃口”,科技行业正转向使用合成数据。dNk即热新闻——关注每天科技社会生活新变化gihot.com

澳大利亚“对话”网站在本月稍早时间报道中指出,合成数据具有诸多优势,但过度依赖合成数据也可能削弱AI的精确性和可靠性。dNk即热新闻——关注每天科技社会生活新变化gihot.com

合成数据应运而生dNk即热新闻——关注每天科技社会生活新变化gihot.com

以往,科技公司主要依赖真实数据来构建、训练和改进AI模型。真实数据是指由人类创建的文本、视频和图像。它们通过调查、实验、观察或挖掘网站和社交媒体等途径被收集而来。dNk即热新闻——关注每天科技社会生活新变化gihot.com

真实数据因蕴含真实事件以及其场景和背景而极具价值,但其并非尽善尽美。它可能掺杂拼写错误、不一致或无关的内容,甚至潜藏严重偏见,导致生成式AI模型在某些情况下创建的图像仅展示男性或白人形象。dNk即热新闻——关注每天科技社会生活新变化gihot.com

但真实数据日益匮乏,因为人类生成数据的速度赶不上AI不断增长的需求。dNk即热新闻——关注每天科技社会生活新变化gihot.com

美国开放人工智能研究中心联合创始人伊利亚·苏茨克维尔在去年12月举行的机器学习会议上声称,AI行业已触及他所称的“数据峰值”,AI的训练数据如同化石燃料一样面临着耗尽的危机。此外,有研究预测,到2026年,ChatGPT等大型语言模型的训练将耗尽互联网上所有可用文本数据,届时将没有新的真实数据可供使用。dNk即热新闻——关注每天科技社会生活新变化gihot.com

为给AI提供充足的“养分”,一种由算法生成的、模仿真实世界情况的数据——合成数据应运而生。合成数据是在数字世界中创造的,而非从现实世界收集或测量而来。它可以作为真实世界数据的替代品,来训练、测试、验证AI模型。dNk即热新闻——关注每天科技社会生活新变化gihot.com

从理论上来说,合成数据为训练AI模型提供了一种经济高效且快捷的解决方案。它有效解决了AI训练使用真实数据时饱受诟病的隐私问题和道德问题,尤其是涉及个人健康数据等敏感信息时。更重要的是,与真实数据不同,合成数据在理论上可以无限供应。dNk即热新闻——关注每天科技社会生活新变化gihot.com

研究机构高德纳公司估计,2024年AI及分析项目使用的数据中,约60%是合成数据。到2030年,AI模型使用的绝大部分数据将是由AI生成的合成数据。dNk即热新闻——关注每天科技社会生活新变化gihot.com

科技公司来者不拒dNk即热新闻——关注每天科技社会生活新变化gihot.com

事实上,微软、元宇宙平台公司,以及Anthropic等众多科技头部企业和初创企业,已经开始广泛使用合成数据来训练其AI模型。dNk即热新闻——关注每天科技社会生活新变化gihot.com

例如,微软在1月8日开源的AI模型“Phi-4”,便是合成数据携手真实数据训练的;谷歌的“Gemma”模型也采用了类似方法。Anthropic公司也利用部分合成数据,开发出其性能最优异的AI系统之一“Claude 3.5 Sonnet”。苹果自研AI系统Apple Intelligence,在预训练阶段,也大量使用了合成数据。dNk即热新闻——关注每天科技社会生活新变化gihot.com

随着科技公司对合成数据的需求与日俱增,生产合成数据的工具也接踵而至。dNk即热新闻——关注每天科技社会生活新变化gihot.com

英伟达公司发布的3D仿真数据生成引擎Omniverse Replicator,能够生成合成数据,用于自动驾驶汽车和机器人训练。去年6月,英伟达开源了Nemotron-4340b系列模型,开发者可使用该模型生成合成数据,用于训练大型语言模型,以应用于医疗保健、金融、制造、零售等行业。在医疗、金融等专业领域,该模型能够根据特定需求生成高质量的合成数据,帮助构建更为精准的行业专属模型。微软推出的开源合成数据工具Synthetic Data Showcase则旨在通过生成合成数据和用户界面,实现隐私保护的数据共享和分析。亚马逊云科技推出的Amazon SageMaker Ground Truth也能为用户生成数十万张自动标记的合成图像。dNk即热新闻——关注每天科技社会生活新变化gihot.com

此外,去年12月,元宇宙平台公司推出开源大模型Llama 3.3,更是大幅降低了生成合成数据的成本。dNk即热新闻——关注每天科技社会生活新变化gihot.com

过度依赖风险难测dNk即热新闻——关注每天科技社会生活新变化gihot.com

尽管合成数据暂时解决了AI训练的燃眉之急,但它也并非尽善尽美。dNk即热新闻——关注每天科技社会生活新变化gihot.com

一个关键问题在于:当AI模型过于依赖合成数据时,它们可能会“崩溃”。它们会产生更多“幻觉”,编造看似合理可信但实际上并不存在的信息。而且,AI模型的质量和性能也会飞速下降,甚至无法使用。例如,某个AI模型生成的数据出现了一些拼写错误,利用这些充满了错误的数据训练其他模型,这些AI模型必定会“以讹传讹”,导致更大的错误。dNk即热新闻——关注每天科技社会生活新变化gihot.com

此外,合成数据也存在过于简单化的风险。它可能缺乏真实数据集蕴含的细节和多样性,这可能导致在其上训练的AI模型的输出也过于简单,缺乏实用性。dNk即热新闻——关注每天科技社会生活新变化gihot.com

为解决这些问题,国际标准化组织需要着手创建强大的系统,来跟踪和验证AI训练数据。此外,AI系统可以配备元数据追踪功能,让用户或系统能对合成数据进行溯源。人类也需要在AI模型的整个训练过程中对合成数据进行监督,以确保其高质量且符合道德标准。dNk即热新闻——关注每天科技社会生活新变化gihot.com

AI的未来在很大程度上取决于数据的质量,合成数据将在克服数据短缺方面发挥越来越重要的作用。对合成数据的使用,人们必须保持谨慎态度,尽量减少错误,确保其作为真实数据的可靠补充,从而保障AI系统的准确性和可信度。dNk即热新闻——关注每天科技社会生活新变化gihot.com

人工智能(AI)初创公司xAI创始人埃隆·马斯克近日表示:“在AI训练中,我们现在基本上耗尽了人类知识的累积总和。”之前研究也表明,人类生成的真实数据将在2到8年内消耗殆尽。鉴于真实数据日益稀缺,为满足AI的“胃口”,科技行业正转向使用合成数据。dNk即热新闻——关注每天科技社会生活新变化gihot.com

澳大利亚“对话”网站在本月稍早时间报道中指出,合成数据具有诸多优势,但过度依赖合成数据也可能削弱AI的精确性和可靠性。dNk即热新闻——关注每天科技社会生活新变化gihot.com

合成数据应运而生dNk即热新闻——关注每天科技社会生活新变化gihot.com

以往,科技公司主要依赖真实数据来构建、训练和改进AI模型。真实数据是指由人类创建的文本、视频和图像。它们通过调查、实验、观察或挖掘网站和社交媒体等途径被收集而来。dNk即热新闻——关注每天科技社会生活新变化gihot.com

真实数据因蕴含真实事件以及其场景和背景而极具价值,但其并非尽善尽美。它可能掺杂拼写错误、不一致或无关的内容,甚至潜藏严重偏见,导致生成式AI模型在某些情况下创建的图像仅展示男性或白人形象。dNk即热新闻——关注每天科技社会生活新变化gihot.com

但真实数据日益匮乏,因为人类生成数据的速度赶不上AI不断增长的需求。dNk即热新闻——关注每天科技社会生活新变化gihot.com

美国开放人工智能研究中心联合创始人伊利亚·苏茨克维尔在去年12月举行的机器学习会议上声称,AI行业已触及他所称的“数据峰值”,AI的训练数据如同化石燃料一样面临着耗尽的危机。此外,有研究预测,到2026年,ChatGPT等大型语言模型的训练将耗尽互联网上所有可用文本数据,届时将没有新的真实数据可供使用。dNk即热新闻——关注每天科技社会生活新变化gihot.com

为给AI提供充足的“养分”,一种由算法生成的、模仿真实世界情况的数据——合成数据应运而生。合成数据是在数字世界中创造的,而非从现实世界收集或测量而来。它可以作为真实世界数据的替代品,来训练、测试、验证AI模型。dNk即热新闻——关注每天科技社会生活新变化gihot.com

从理论上来说,合成数据为训练AI模型提供了一种经济高效且快捷的解决方案。它有效解决了AI训练使用真实数据时饱受诟病的隐私问题和道德问题,尤其是涉及个人健康数据等敏感信息时。更重要的是,与真实数据不同,合成数据在理论上可以无限供应。dNk即热新闻——关注每天科技社会生活新变化gihot.com

研究机构高德纳公司估计,2024年AI及分析项目使用的数据中,约60%是合成数据。到2030年,AI模型使用的绝大部分数据将是由AI生成的合成数据。dNk即热新闻——关注每天科技社会生活新变化gihot.com

科技公司来者不拒dNk即热新闻——关注每天科技社会生活新变化gihot.com

事实上,微软、元宇宙平台公司,以及Anthropic等众多科技头部企业和初创企业,已经开始广泛使用合成数据来训练其AI模型。dNk即热新闻——关注每天科技社会生活新变化gihot.com

例如,微软在1月8日开源的AI模型“Phi-4”,便是合成数据携手真实数据训练的;谷歌的“Gemma”模型也采用了类似方法。Anthropic公司也利用部分合成数据,开发出其性能最优异的AI系统之一“Claude 3.5 Sonnet”。苹果自研AI系统Apple Intelligence,在预训练阶段,也大量使用了合成数据。dNk即热新闻——关注每天科技社会生活新变化gihot.com

随着科技公司对合成数据的需求与日俱增,生产合成数据的工具也接踵而至。dNk即热新闻——关注每天科技社会生活新变化gihot.com

英伟达公司发布的3D仿真数据生成引擎Omniverse Replicator,能够生成合成数据,用于自动驾驶汽车和机器人训练。去年6月,英伟达开源了Nemotron-4340b系列模型,开发者可使用该模型生成合成数据,用于训练大型语言模型,以应用于医疗保健、金融、制造、零售等行业。在医疗、金融等专业领域,该模型能够根据特定需求生成高质量的合成数据,帮助构建更为精准的行业专属模型。微软推出的开源合成数据工具Synthetic Data Showcase则旨在通过生成合成数据和用户界面,实现隐私保护的数据共享和分析。亚马逊云科技推出的Amazon SageMaker Ground Truth也能为用户生成数十万张自动标记的合成图像。dNk即热新闻——关注每天科技社会生活新变化gihot.com

此外,去年12月,元宇宙平台公司推出开源大模型Llama 3.3,更是大幅降低了生成合成数据的成本。dNk即热新闻——关注每天科技社会生活新变化gihot.com

过度依赖风险难测dNk即热新闻——关注每天科技社会生活新变化gihot.com

尽管合成数据暂时解决了AI训练的燃眉之急,但它也并非尽善尽美。dNk即热新闻——关注每天科技社会生活新变化gihot.com

一个关键问题在于:当AI模型过于依赖合成数据时,它们可能会“崩溃”。它们会产生更多“幻觉”,编造看似合理可信但实际上并不存在的信息。而且,AI模型的质量和性能也会飞速下降,甚至无法使用。例如,某个AI模型生成的数据出现了一些拼写错误,利用这些充满了错误的数据训练其他模型,这些AI模型必定会“以讹传讹”,导致更大的错误。dNk即热新闻——关注每天科技社会生活新变化gihot.com

此外,合成数据也存在过于简单化的风险。它可能缺乏真实数据集蕴含的细节和多样性,这可能导致在其上训练的AI模型的输出也过于简单,缺乏实用性。dNk即热新闻——关注每天科技社会生活新变化gihot.com

为解决这些问题,国际标准化组织需要着手创建强大的系统,来跟踪和验证AI训练数据。此外,AI系统可以配备元数据追踪功能,让用户或系统能对合成数据进行溯源。人类也需要在AI模型的整个训练过程中对合成数据进行监督,以确保其高质量且符合道德标准。dNk即热新闻——关注每天科技社会生活新变化gihot.com

AI的未来在很大程度上取决于数据的质量,合成数据将在克服数据短缺方面发挥越来越重要的作用。对合成数据的使用,人们必须保持谨慎态度,尽量减少错误,确保其作为真实数据的可靠补充,从而保障AI系统的准确性和可信度。dNk即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-2-217-0.html“喂”给人工智能的真实数据终将耗尽,合成数据能否让AI模型精确可靠?

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:仿昆虫微型机器人飞行长达15分钟

下一篇:新型光学原子钟比铯钟精度高千倍

为你推荐
1月19日,应用于沙戈荒地区的超大功率等级风电机组——“凌风号”在吉林中车松原基地成功下线,这是国内首个成功下线的12兆瓦级陆上风电机...
01-21
  中新社太原1月16日电(记者胡健)“晋祠·唐刻华严石经陈列馆”16日在山西太原晋祠博物馆开馆...
01-22
  中新网西安2月8日电(记者阿琳娜)记者8日从西北大学文化遗产学院获悉,通过对唐高祖李渊侄子、...
02-11
长三角的“千亿县”,又扩容了。 近日,合肥长丰县在作2024年政府工作报告时宣布,长丰晋级安徽省第二个“千亿县”。预计全年GDP增长10...
01-21
长三角的“千亿县”,又扩容了。 近日,合肥长丰县在作2024年政府工作报告时宣布,长丰晋级安徽省第二个“千亿县”。预计全年GDP增长10...
01-21
新春贺岁,宝马“以福相迎”。除了满屏福气,来自宝马的非遗好礼也已备好!跟随「贺岁拍档」高先生,一起蛇来运转「开心年」!...
01-24
2 月 4 日消息,恒大汽车昨日发布公告称,公司迄今未能成功找到能够帮助缓解集团流动资金问题并推进集团适当重组的战略投资者或买家。公告提到,由于现今中国大陆新能源...
02-05
  1、《树下有片红房子》陈欢尔和宋丛没有在一起,宋丛暗恋过陈欢尔,但陈欢尔的官配是景栖迟。  2、宋丛是品学兼优的学霸,高中时为陈欢尔补习过功课,是个心思细腻但比较内...
02-18
《余烬之上》河神新娘真相是什么?河神新娘大结局是什么?‌《余烬之上》中“河神新娘案”的真相是引入了民间传说的元素:寡妇身披红衣待嫁,而准新郎却是河神‌‌...
02-21
  大家都知道“吃头孢不能喝酒”  但许多人并不知道这背后的原理  也不知道除了头孢以外...
01-24
21世纪经济报道记者 唐唯珂 广州报道社会办医的洗牌期仍在继续。2025年1月,新华医疗挂牌转让旗下山东新华昌国医院投资管理有限公司55%股权...
01-25
  大众网记者 杨涛 王学涛 报道  12月24日,鲁藏青少年“手拉手”文体交流活动在济南艺术学校成功举行。活动由山东省教育厅、山东援藏干部中心管理组组织指导,济南市教...
01-21
新华社北京1月19日电 近日,中共中央、国务院印发了《教育强国建设规划纲要(2024—2035年)》(以下简称《纲...
01-21
  财中社1月20日电国信证券发布农林牧渔行业农产品研究跟踪系列报告。文中指出看好猪价2025年...
01-21
  摘要  【棕榈油价格一季度将见顶?】春节假期期间,受美国关税政策以及马来西亚棕榈油产地供...
02-08
水瓶座男人是一个独特而又复杂的星座,他们对于爱情有着自己独特的追求和标准。下面是一...
01-22
射手座男人是热情洋溢、乐观开朗的人,他们喜欢自由自在的生活方式。对于他们寻找一个能...
01-22
小皮皮,潮流服饰界的新宠儿在这个瞬息万变的时尚界,我们常常会被一些新兴品牌所吸引。就像一颗新星――小皮皮潮流服饰,它将个性、时尚与舒适完美结合,成为众多年轻人的心头好。...
02-07
脸宽的女明星:她们如何展现独特魅力在娱乐圈中,有些女明星以“脸宽”这一特征而闻名,常常引发公众的热议。有人认为这是缺点,而我却认为这是她们独特的魅力所在。从周迅到容祖儿...
02-17
1月26日消息,国联股份CNAUTO近日携手山港海外发展集团、日照银行,共同推出了“海外仓”产融新模式,此次合作是国联股份在跨境电商领域的又一次重大突破。CNAUTO是国联股份打造...
02-07
2月20日消息,闲鱼数据显示,过去一年中,平台上的循环订单量同比增长近50%,覆盖手机数码、家具家电、服饰、图书等品类。在线上,超1亿人在闲鱼挂出闲置物品,每天都有超400万件闲置物...
02-21
2月8日消息,据Tech星球消息,美团近期启动个人摄影师招募计划,现阶段招募的是人像摄影师,服务类型包含婚恋类、宴会类和景点跟拍类等,摄影师向平台交付2000元押金后,无需营业执照,即...
02-09
2月18日消息,据环球旅讯,携程集团近日宣布多名高层调整。截图图源:环球旅讯公众号任命公告具体为,陈刚出任集团首席产品官,将牵头集团AI相关产品的战略制订;谭煜东出任集团首席科...
02-19
12月3日消息,悦点科技宣布公司完成数千万人民币的天使轮融资。此次融资由云启资本独家投资,本轮融资将主要用于悦点科技在企业级GenAI应用平台的进...
02-07
2月5日,有投资者在投资者互动平台向东峰集团提问:公司公告预计亏损5亿元左右,感觉公司今年在洗澡。国资入主后是否会调整并购策略?未来准备如何提升公司经营业绩?东峰集团在投资...
02-09
近日,SE宣布《勇者斗恶龙11》将于2025年2月1日起在 Switch eShop 上暂时下架,重新上架时间待定。官方也解释了其暂时下架的原因,他们将对该作商店列表进行一些小...
02-02
今日(1月31日),真人互动电影《Trilogy of the Moon》Steam页面上线,游戏支持简繁体中文,预计于2025年第一季度发售,感兴趣的玩家可以点击此处进入商店页面。 ...
02-03
极目新闻记者 陈凌燕WTA官方社交平台截图2月6日,郑钦文抵达多哈。WTA1000多哈站是2025赛季首个1000级别赛事,郑钦文的亮相,引发大量球迷关注。眼尖的球迷更发现,郑钦文团队中添...
02-06
2月9日,哈尔滨亚冬会速度滑冰男子5000米决赛,中国队包揽金银铜牌。吴宇夺得金牌,刘瀚彬获得银牌,哈那哈提·木哈买提获得铜牌。...
02-09
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮