“喂”给人工智能的真实数据终将耗尽,合成数据能否让AI模型精确可靠?

1年前 来源:中国科技网 观看:376

人工智能(AI)初创公司xAI创始人埃隆·马斯克近日表示:“在AI训练中,我们现在基本上耗尽了人类知识的累积总和。”之前研究也表明,人类生成的真实数据将在2到8年内消耗殆尽。鉴于真实数据日益稀缺,为满足AI的“胃口”,科技行业正转向使用合成数据。bbg即热新闻——关注每天科技社会生活新变化gihot.com

澳大利亚“对话”网站在本月稍早时间报道中指出,合成数据具有诸多优势,但过度依赖合成数据也可能削弱AI的精确性和可靠性。bbg即热新闻——关注每天科技社会生活新变化gihot.com

合成数据应运而生bbg即热新闻——关注每天科技社会生活新变化gihot.com

以往,科技公司主要依赖真实数据来构建、训练和改进AI模型。真实数据是指由人类创建的文本、视频和图像。它们通过调查、实验、观察或挖掘网站和社交媒体等途径被收集而来。bbg即热新闻——关注每天科技社会生活新变化gihot.com

真实数据因蕴含真实事件以及其场景和背景而极具价值,但其并非尽善尽美。它可能掺杂拼写错误、不一致或无关的内容,甚至潜藏严重偏见,导致生成式AI模型在某些情况下创建的图像仅展示男性或白人形象。bbg即热新闻——关注每天科技社会生活新变化gihot.com

但真实数据日益匮乏,因为人类生成数据的速度赶不上AI不断增长的需求。bbg即热新闻——关注每天科技社会生活新变化gihot.com

美国开放人工智能研究中心联合创始人伊利亚·苏茨克维尔在去年12月举行的机器学习会议上声称,AI行业已触及他所称的“数据峰值”,AI的训练数据如同化石燃料一样面临着耗尽的危机。此外,有研究预测,到2026年,ChatGPT等大型语言模型的训练将耗尽互联网上所有可用文本数据,届时将没有新的真实数据可供使用。bbg即热新闻——关注每天科技社会生活新变化gihot.com

为给AI提供充足的“养分”,一种由算法生成的、模仿真实世界情况的数据——合成数据应运而生。合成数据是在数字世界中创造的,而非从现实世界收集或测量而来。它可以作为真实世界数据的替代品,来训练、测试、验证AI模型。bbg即热新闻——关注每天科技社会生活新变化gihot.com

从理论上来说,合成数据为训练AI模型提供了一种经济高效且快捷的解决方案。它有效解决了AI训练使用真实数据时饱受诟病的隐私问题和道德问题,尤其是涉及个人健康数据等敏感信息时。更重要的是,与真实数据不同,合成数据在理论上可以无限供应。bbg即热新闻——关注每天科技社会生活新变化gihot.com

研究机构高德纳公司估计,2024年AI及分析项目使用的数据中,约60%是合成数据。到2030年,AI模型使用的绝大部分数据将是由AI生成的合成数据。bbg即热新闻——关注每天科技社会生活新变化gihot.com

科技公司来者不拒bbg即热新闻——关注每天科技社会生活新变化gihot.com

事实上,微软、元宇宙平台公司,以及Anthropic等众多科技头部企业和初创企业,已经开始广泛使用合成数据来训练其AI模型。bbg即热新闻——关注每天科技社会生活新变化gihot.com

例如,微软在1月8日开源的AI模型“Phi-4”,便是合成数据携手真实数据训练的;谷歌的“Gemma”模型也采用了类似方法。Anthropic公司也利用部分合成数据,开发出其性能最优异的AI系统之一“Claude 3.5 Sonnet”。苹果自研AI系统Apple Intelligence,在预训练阶段,也大量使用了合成数据。bbg即热新闻——关注每天科技社会生活新变化gihot.com

随着科技公司对合成数据的需求与日俱增,生产合成数据的工具也接踵而至。bbg即热新闻——关注每天科技社会生活新变化gihot.com

英伟达公司发布的3D仿真数据生成引擎Omniverse Replicator,能够生成合成数据,用于自动驾驶汽车和机器人训练。去年6月,英伟达开源了Nemotron-4340b系列模型,开发者可使用该模型生成合成数据,用于训练大型语言模型,以应用于医疗保健、金融、制造、零售等行业。在医疗、金融等专业领域,该模型能够根据特定需求生成高质量的合成数据,帮助构建更为精准的行业专属模型。微软推出的开源合成数据工具Synthetic Data Showcase则旨在通过生成合成数据和用户界面,实现隐私保护的数据共享和分析。亚马逊云科技推出的Amazon SageMaker Ground Truth也能为用户生成数十万张自动标记的合成图像。bbg即热新闻——关注每天科技社会生活新变化gihot.com

此外,去年12月,元宇宙平台公司推出开源大模型Llama 3.3,更是大幅降低了生成合成数据的成本。bbg即热新闻——关注每天科技社会生活新变化gihot.com

过度依赖风险难测bbg即热新闻——关注每天科技社会生活新变化gihot.com

尽管合成数据暂时解决了AI训练的燃眉之急,但它也并非尽善尽美。bbg即热新闻——关注每天科技社会生活新变化gihot.com

一个关键问题在于:当AI模型过于依赖合成数据时,它们可能会“崩溃”。它们会产生更多“幻觉”,编造看似合理可信但实际上并不存在的信息。而且,AI模型的质量和性能也会飞速下降,甚至无法使用。例如,某个AI模型生成的数据出现了一些拼写错误,利用这些充满了错误的数据训练其他模型,这些AI模型必定会“以讹传讹”,导致更大的错误。bbg即热新闻——关注每天科技社会生活新变化gihot.com

此外,合成数据也存在过于简单化的风险。它可能缺乏真实数据集蕴含的细节和多样性,这可能导致在其上训练的AI模型的输出也过于简单,缺乏实用性。bbg即热新闻——关注每天科技社会生活新变化gihot.com

为解决这些问题,国际标准化组织需要着手创建强大的系统,来跟踪和验证AI训练数据。此外,AI系统可以配备元数据追踪功能,让用户或系统能对合成数据进行溯源。人类也需要在AI模型的整个训练过程中对合成数据进行监督,以确保其高质量且符合道德标准。bbg即热新闻——关注每天科技社会生活新变化gihot.com

AI的未来在很大程度上取决于数据的质量,合成数据将在克服数据短缺方面发挥越来越重要的作用。对合成数据的使用,人们必须保持谨慎态度,尽量减少错误,确保其作为真实数据的可靠补充,从而保障AI系统的准确性和可信度。bbg即热新闻——关注每天科技社会生活新变化gihot.com

人工智能(AI)初创公司xAI创始人埃隆·马斯克近日表示:“在AI训练中,我们现在基本上耗尽了人类知识的累积总和。”之前研究也表明,人类生成的真实数据将在2到8年内消耗殆尽。鉴于真实数据日益稀缺,为满足AI的“胃口”,科技行业正转向使用合成数据。bbg即热新闻——关注每天科技社会生活新变化gihot.com

澳大利亚“对话”网站在本月稍早时间报道中指出,合成数据具有诸多优势,但过度依赖合成数据也可能削弱AI的精确性和可靠性。bbg即热新闻——关注每天科技社会生活新变化gihot.com

合成数据应运而生bbg即热新闻——关注每天科技社会生活新变化gihot.com

以往,科技公司主要依赖真实数据来构建、训练和改进AI模型。真实数据是指由人类创建的文本、视频和图像。它们通过调查、实验、观察或挖掘网站和社交媒体等途径被收集而来。bbg即热新闻——关注每天科技社会生活新变化gihot.com

真实数据因蕴含真实事件以及其场景和背景而极具价值,但其并非尽善尽美。它可能掺杂拼写错误、不一致或无关的内容,甚至潜藏严重偏见,导致生成式AI模型在某些情况下创建的图像仅展示男性或白人形象。bbg即热新闻——关注每天科技社会生活新变化gihot.com

但真实数据日益匮乏,因为人类生成数据的速度赶不上AI不断增长的需求。bbg即热新闻——关注每天科技社会生活新变化gihot.com

美国开放人工智能研究中心联合创始人伊利亚·苏茨克维尔在去年12月举行的机器学习会议上声称,AI行业已触及他所称的“数据峰值”,AI的训练数据如同化石燃料一样面临着耗尽的危机。此外,有研究预测,到2026年,ChatGPT等大型语言模型的训练将耗尽互联网上所有可用文本数据,届时将没有新的真实数据可供使用。bbg即热新闻——关注每天科技社会生活新变化gihot.com

为给AI提供充足的“养分”,一种由算法生成的、模仿真实世界情况的数据——合成数据应运而生。合成数据是在数字世界中创造的,而非从现实世界收集或测量而来。它可以作为真实世界数据的替代品,来训练、测试、验证AI模型。bbg即热新闻——关注每天科技社会生活新变化gihot.com

从理论上来说,合成数据为训练AI模型提供了一种经济高效且快捷的解决方案。它有效解决了AI训练使用真实数据时饱受诟病的隐私问题和道德问题,尤其是涉及个人健康数据等敏感信息时。更重要的是,与真实数据不同,合成数据在理论上可以无限供应。bbg即热新闻——关注每天科技社会生活新变化gihot.com

研究机构高德纳公司估计,2024年AI及分析项目使用的数据中,约60%是合成数据。到2030年,AI模型使用的绝大部分数据将是由AI生成的合成数据。bbg即热新闻——关注每天科技社会生活新变化gihot.com

科技公司来者不拒bbg即热新闻——关注每天科技社会生活新变化gihot.com

事实上,微软、元宇宙平台公司,以及Anthropic等众多科技头部企业和初创企业,已经开始广泛使用合成数据来训练其AI模型。bbg即热新闻——关注每天科技社会生活新变化gihot.com

例如,微软在1月8日开源的AI模型“Phi-4”,便是合成数据携手真实数据训练的;谷歌的“Gemma”模型也采用了类似方法。Anthropic公司也利用部分合成数据,开发出其性能最优异的AI系统之一“Claude 3.5 Sonnet”。苹果自研AI系统Apple Intelligence,在预训练阶段,也大量使用了合成数据。bbg即热新闻——关注每天科技社会生活新变化gihot.com

随着科技公司对合成数据的需求与日俱增,生产合成数据的工具也接踵而至。bbg即热新闻——关注每天科技社会生活新变化gihot.com

英伟达公司发布的3D仿真数据生成引擎Omniverse Replicator,能够生成合成数据,用于自动驾驶汽车和机器人训练。去年6月,英伟达开源了Nemotron-4340b系列模型,开发者可使用该模型生成合成数据,用于训练大型语言模型,以应用于医疗保健、金融、制造、零售等行业。在医疗、金融等专业领域,该模型能够根据特定需求生成高质量的合成数据,帮助构建更为精准的行业专属模型。微软推出的开源合成数据工具Synthetic Data Showcase则旨在通过生成合成数据和用户界面,实现隐私保护的数据共享和分析。亚马逊云科技推出的Amazon SageMaker Ground Truth也能为用户生成数十万张自动标记的合成图像。bbg即热新闻——关注每天科技社会生活新变化gihot.com

此外,去年12月,元宇宙平台公司推出开源大模型Llama 3.3,更是大幅降低了生成合成数据的成本。bbg即热新闻——关注每天科技社会生活新变化gihot.com

过度依赖风险难测bbg即热新闻——关注每天科技社会生活新变化gihot.com

尽管合成数据暂时解决了AI训练的燃眉之急,但它也并非尽善尽美。bbg即热新闻——关注每天科技社会生活新变化gihot.com

一个关键问题在于:当AI模型过于依赖合成数据时,它们可能会“崩溃”。它们会产生更多“幻觉”,编造看似合理可信但实际上并不存在的信息。而且,AI模型的质量和性能也会飞速下降,甚至无法使用。例如,某个AI模型生成的数据出现了一些拼写错误,利用这些充满了错误的数据训练其他模型,这些AI模型必定会“以讹传讹”,导致更大的错误。bbg即热新闻——关注每天科技社会生活新变化gihot.com

此外,合成数据也存在过于简单化的风险。它可能缺乏真实数据集蕴含的细节和多样性,这可能导致在其上训练的AI模型的输出也过于简单,缺乏实用性。bbg即热新闻——关注每天科技社会生活新变化gihot.com

为解决这些问题,国际标准化组织需要着手创建强大的系统,来跟踪和验证AI训练数据。此外,AI系统可以配备元数据追踪功能,让用户或系统能对合成数据进行溯源。人类也需要在AI模型的整个训练过程中对合成数据进行监督,以确保其高质量且符合道德标准。bbg即热新闻——关注每天科技社会生活新变化gihot.com

AI的未来在很大程度上取决于数据的质量,合成数据将在克服数据短缺方面发挥越来越重要的作用。对合成数据的使用,人们必须保持谨慎态度,尽量减少错误,确保其作为真实数据的可靠补充,从而保障AI系统的准确性和可信度。bbg即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-2-217-0.html“喂”给人工智能的真实数据终将耗尽,合成数据能否让AI模型精确可靠?

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:仿昆虫微型机器人飞行长达15分钟

下一篇:新型光学原子钟比铯钟精度高千倍

为你推荐
2025年1月16日,华为车BU业务“继承者”引望迎来了成立的第一周年。引望全名为深圳引望智能技术有限公司,成立于2024年1月16日,彼时为...
01-21
冰岛基因解码公司科学家完成了一项重要研究。他们绘制了一份人类基因组完整改组图谱,即详尽的人类DNA在生殖过程中混合方式的地图。这项研究深化了...
01-23
    2024年12月28日,韩国游客文鉉堣(左后)一家在上海外滩合影。他们在圣诞节来到上海并计划游...
01-21
已经立春了,天气啥时候变暖?在冷空气的频繁打压下沈阳最低气温已连续多日低于-20℃明天就是春节假期结束第...
02-05
>  近日,有网友在12306购票时发现,一些不是那么热门的行程出现了低价票。对此,12306科创中心负责人单杏花介绍,这是铁路在春运期间的一个惠民措施,一些客座率较低的车次票价...
01-21
  中新经纬1月20日电 国新办20日举行“中国经济高质量发展成效”系列新闻发布会,介绍“夯实‘三农’基本盘,扎实推进乡村全面振兴”有关情况。农业农村部副部长张兴旺在会上...
01-21
2 月 1 日消息,东风风行宣布旗下星海S7中大型轿车新增“555 鸿运版”上市,指导价为 10.99 万元,该版本车型定位入门,整理目前东风风行星海S7 具体车型定价如下:555鸿运版...
02-02
2 月 5 日消息,新春伊始,绿地集团宣布成立新能源汽车出口公司,号称“打造百亿级新能源汽车出口平台”。同时,平台首个出口订单成功签约,将以全球热门车型为主,销往西亚、...
02-06
在璀璨夺目的娱乐圈内,何炅凭借其出色的主持能力和温文尔雅的气质,早已赢得了众多粉丝的喜爱与尊敬。然而,近日,这位年过半百的知名主持人再度成为话题中心,原因竟是他那令人惊叹...
02-22
电视剧《六姊妹》近期以其深刻的情感表达触动了无数观众的心弦,剧中虽然聚焦于六位女性的命运波折,但不得不提的是,由奚美娟饰演的奶奶何文氏,这一角色虽未拥有全名,却以其坚韧不...
02-23
  本报北京1月16日电 (记者孙秀艳)为进一步优化医保基金结算政策,不断提升医保基金结算清算效率,近日,国家医保局印发《关于推进基本医保基金即时结算改革的通知》。按...
01-21
  乙巳新春佳节至,欢聚莫忘养生经。日前,国家中医药管理局举行新闻发布会,介绍春节期间中医药健康养生知识。  美食佳肴需有度  腊月里的民俗有道是:二十五,磨豆腐;二...
01-27
2025年寒假伊始,遍布沈阳市城乡社区的“中小学家访社区共享会客厅”再一次启动了。家访是学校与家庭沟通...
01-21
作者:王欢(西安交通大学党委副书记)国无防不立,民无防不安。国防教育是建设和巩固国防的基础,是增强民族凝聚...
01-22
  新华财经北京1月21日电(郭洲洋、吴郑思)国内商品期货市场1月21日涨跌互现,其中集运欧线主力合...
01-23
  本报记者 熊悦  在港股上市不久的宜宾市商业银行股份有限公司(以下简称“宜宾银行”)遭遇股...
02-07
双鱼座的男生通常是浪漫、敏感且富有想象力的人。他们渴望与一个特别的女生建立深厚的...
01-22
水瓶座的男生通常被认为是理性而冷漠的,他们在处理感情问题时往往表现得非常独立和坚定...
01-22
北京时尚潮胖子服饰:穿出个性与自信在北方的气候里,冬天的衣物需要保暖,夏天则需要清凉。而对于胖子们来说,选择一套合适的服饰不仅要考虑到舒适度,更要能够展现个人的魅力。作为...
02-07
给女孩子的饰品店起名:好听又吸引顾客的秘诀在为女孩子的饰品店起名时,我们希望这个名字能够既好听又具有吸引力。一个好的店名不仅能够让顾客一眼记住,还能传达出品牌的气质和...
02-12
1月27日消息,云汉芯城凭借卓越的线上分销能力和创新的数字化服务,获得WAGO万可颁发的“2024最佳线上分销渠道奖”。图源:云汉芯城公众号据介绍,WAGO万可于1951年成立于德国,是一...
02-07
阿里苹果或将联手,为iPhone开发AI功能一则重磅消息,让阿里股价再创阶段新高。2月11日晚间,据The Information援引知情人士消息称,苹果为了应对在中国市场销售下滑的局势,正积极寻...
02-13
骑手们终于能老有所养,病有所医,伤有所赔。1.京东为外卖骑手缴纳五险一金,美团回应千万骑手翘首以盼的这一天,终于来了。2月19日,京东黑板报官宣,自2025年3月1日起,京东将逐步为京...
02-20
春天,万物复苏,本该是肌肤最活跃的季节,却也是敏感、干燥等问题频发的时期。忽冷忽热的天气,加上花粉、柳絮等外界刺激,让肌肤状态变得...
02-25
金陵华软科技股份有限公司(以下简称“华软科技”)于2025年1月18日发布了2024年度业绩预告。尽管公司预计2024年净利润仍为负值,但从整体情况来看,华软科技正在逐步摆脱困境,展现...
01-21
2024年末,一位科技创业者火了。作者 | 王思琪来源 | 投资家(ID:touzijias)2024年末,一位科技创业者火了。2025年初,这位创业者再度爆火。近日,中国科技行业因一位85后年轻人现身《...
01-24
今日(1月21日),roguelike游戏《Ragnar》Steam页面上线,游戏支持简繁体中文,发售日待定,感兴趣的玩家可以点击此处进入商店页面。 游戏介绍: 在这款受北欧神话启发...
01-22
2月8日,幻想冒险RPG游戏《二重螺旋》「狩夜测试」宣布定档2月20日,据悉,测试将于2月20日10:00开启,2月28日17:00结束。目前游戏的测试招募仍在进行中,预计2月10日23...
02-10
亚冬会的成功举办,离不开哈尔滨各行各业的倾情参与和服务保障。其中,有一位小有名气的“的哥”,他叫徐峰,是一位“五星级驾驶员”。每年一到冰雪旅游旺季,他都会给乘客“整活”送...
02-05
在上海交通大学闵行校园的西区,旭华路是一条几乎贯穿南北的道路。开学时节,这几乎是全校最热闹的道路之一,沿旭华路一路穿行,会经过学生宿舍、体育场、用餐区、快递区、活动场馆...
02-08
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮