大模型既要“吃得饱”更要“吃得好”

8个月前 来源:科技日报 观看:80

前段时间,网络上流传着一些由大模型生成的“异次元篇章”。比如,有人让大模型续写《红楼梦》情节时,竟得出一幕“贾宝玉倒拔垂杨柳”的奇景,令人啼笑皆非。之所以会出现这种“混搭”和“幻觉”,是因为大模型不仅学习了原著,还“广纳博采”了不少错误信息。hHo即热新闻——关注每天科技社会生活新变化gihot.com

这些人工智能(AI)生成的“胡言乱语”虽是网友们茶余饭后的笑谈,但提醒我们要清醒认识到其背后折射出的问题:数据质量是大模型应用成败的关键。以个性化推荐AI系统为例,一些企业在开发过程中,虽然收集了大量的用户行为数据,但数据中充斥着错误的标注、重复的数据以及相互矛盾的信息,数据的量增加了,但系统推荐的准确性并没有显著提升。《自然》杂志(Nature)刊登的一篇有关大模型可靠性研究的文章指出,一个西班牙研究团队发现,包括OpenAI公司的GPT在内的几个大模型升级后,虽然参数量更大了,误答情况却更严重了。因此,大模型长得壮不壮,不仅取决于“食量”(即数据的数量),更在于食物的“质量”(即数据的质量)——吃得饱并不等同于吃得好。hHo即热新闻——关注每天科技社会生活新变化gihot.com

数据是大模型的基石,在数据质量不高、可靠性缺失的情况下,一味追求大模型参数量的增加,不仅无法提升模型性能,反而会放大偏差和谬误,产生更多不可信数据。如此一来,势必造成计算与存储资源的浪费,增加开发和维护成本,降低用户信任度。更为严重的是,这种“大模型幻觉”和“灾难性遗忘”现象如果发生在精确性要求极高的工业生产领域中,还可能引发不可预测的风险和隐患。以油气勘探为例,基于大模型给出的错误预测进行开采可能导致数亿元的资金损失,并对自然环境造成不可逆转的破坏。hHo即热新闻——关注每天科技社会生活新变化gihot.com

提升大模型性能,关键是处理好数据“质”和“量”的关系,构建大规模、高质量的数据集。应建立完善的数据收集、清洗、验证和存储机制,加强对数据质量的监控和评估,确保数据的准确性、完整性和一致性。此外,还应注重跨领域合作,引入数据科学家、AI算法工程师等多方力量,开展大模型算法合作、制定数据共享和隐私安全保密协议,推动大模型产学研用生态建设。hHo即热新闻——关注每天科技社会生活新变化gihot.com

如今,大模型的发展已迈入多模态融合阶段。通过加强数据治理,优化人工智能学习、训练和验证的“基础食材”,端上大规模、高质量、多模态数据集的“丰盛大餐”,必将助力大模型能力的提升,让人工智能更好地赋能千行百业、造福人类社会。hHo即热新闻——关注每天科技社会生活新变化gihot.com

前段时间,网络上流传着一些由大模型生成的“异次元篇章”。比如,有人让大模型续写《红楼梦》情节时,竟得出一幕“贾宝玉倒拔垂杨柳”的奇景,令人啼笑皆非。之所以会出现这种“混搭”和“幻觉”,是因为大模型不仅学习了原著,还“广纳博采”了不少错误信息。hHo即热新闻——关注每天科技社会生活新变化gihot.com

这些人工智能(AI)生成的“胡言乱语”虽是网友们茶余饭后的笑谈,但提醒我们要清醒认识到其背后折射出的问题:数据质量是大模型应用成败的关键。以个性化推荐AI系统为例,一些企业在开发过程中,虽然收集了大量的用户行为数据,但数据中充斥着错误的标注、重复的数据以及相互矛盾的信息,数据的量增加了,但系统推荐的准确性并没有显著提升。《自然》杂志(Nature)刊登的一篇有关大模型可靠性研究的文章指出,一个西班牙研究团队发现,包括OpenAI公司的GPT在内的几个大模型升级后,虽然参数量更大了,误答情况却更严重了。因此,大模型长得壮不壮,不仅取决于“食量”(即数据的数量),更在于食物的“质量”(即数据的质量)——吃得饱并不等同于吃得好。hHo即热新闻——关注每天科技社会生活新变化gihot.com

数据是大模型的基石,在数据质量不高、可靠性缺失的情况下,一味追求大模型参数量的增加,不仅无法提升模型性能,反而会放大偏差和谬误,产生更多不可信数据。如此一来,势必造成计算与存储资源的浪费,增加开发和维护成本,降低用户信任度。更为严重的是,这种“大模型幻觉”和“灾难性遗忘”现象如果发生在精确性要求极高的工业生产领域中,还可能引发不可预测的风险和隐患。以油气勘探为例,基于大模型给出的错误预测进行开采可能导致数亿元的资金损失,并对自然环境造成不可逆转的破坏。hHo即热新闻——关注每天科技社会生活新变化gihot.com

提升大模型性能,关键是处理好数据“质”和“量”的关系,构建大规模、高质量的数据集。应建立完善的数据收集、清洗、验证和存储机制,加强对数据质量的监控和评估,确保数据的准确性、完整性和一致性。此外,还应注重跨领域合作,引入数据科学家、AI算法工程师等多方力量,开展大模型算法合作、制定数据共享和隐私安全保密协议,推动大模型产学研用生态建设。hHo即热新闻——关注每天科技社会生活新变化gihot.com

如今,大模型的发展已迈入多模态融合阶段。通过加强数据治理,优化人工智能学习、训练和验证的“基础食材”,端上大规模、高质量、多模态数据集的“丰盛大餐”,必将助力大模型能力的提升,让人工智能更好地赋能千行百业、造福人类社会。hHo即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-2-856-0.html大模型既要“吃得饱”更要“吃得好”

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:张成伟代表:把低空安全作为初心使命

下一篇:全国人大代表、万事利集团董事长屠红燕:连续三年呼吁AI应用,加快丝绸纺织业变革

为你推荐
1月14日,记者从中国科学院合肥物质科学研究院等离子体物理研究所(以下简称“等离子体所”)获悉,由该所建设运行的国家重大科技基础设施“聚变堆主机关...
01-21
荷兰特文特大学科学家开发出一种新工艺,能在室温下制造出晶体结构高度有序的半导体材料。他们表示,通过精准控制这种半导体材料的晶体结构,大幅降低了...
01-21
  蓝天白云、繁星闪烁,辽宁“好天儿”更多了。1月23日,记者从省生态环境厅了解到,2024年,我省环境空气质...
01-24
  近日,辽宁省防减救灾办与相关成员单位进行会商,对近期全省自然灾害风险形势开展了研判分析,结合实际对...
01-24
  断骨增高术是肢体延长术的俗称,是一项有创伤的疾病治疗技术,自2006年,我国卫生部门规定,严禁用于美容项目,但事实上,这种手术依然有人用于美容,在网络上有不少人声称可以做...
01-21
  史上最快!春节档爆了,这部电影强势领跑   中国基金报记者 安曼  顶级IP“神仙打架”,2025年春节档时间未到,但是票房已经爆了!  据灯塔专业版显示,2025年春节档今日开启...
01-21
1 月 22 日消息,奇瑞星途汽车营销中心总经理黄招根在微博透露,奇瑞星途星纪元ES 增程版已向首批内测车主交付,计划 3 月初上市。作为参考,当前在售的 2025 款星纪元ES ...
01-23
[本站 资讯] 日前,比亚迪官方宣布,2025款汉家族OTA升级内测,本次升级包含5项新增功能和6项优化体验。值得一提的是,本次OTA升级,涉及不同款型配置,以实际收到的OTA推送内容...
01-24
最近风靡的《和歌子酒 第八季》凭借演员们的颜值、演技以及剧情深深吸引了观众。这部剧集不仅情节吸引人,人物塑造也十分生动,还有许多精彩场景和细节,引发了...
02-21
《余烬之上》男主是谁的孩子?男主是谁扮演的?《余烬之上》有双男主,廖思远和廖知白是兄弟,他们是廖氏夫妇的孩子。剧中,一场十年前的大火让廖氏兄弟廖知白和廖思...
02-21
这里是《21健讯Daily》,欢迎与21世纪经济报道新健康团队共同关注医药健康行业最新事件!政策动向国家药监局药审中心回应个别品种数据重复,系...
01-27
  “当前,全国范围内呼吸道传染病流行情况已经下降,流感样病例占比有所下降,肺炎支原体等阳性率持续下降,新冠病毒等其他呼吸道疾病继续处于低流行水平。”在26日举行的...
01-28
  大众网记者 秦瑾 通讯员 张建东 报道  近日,由山东省教育厅主办、曲阜师范大学承办的山东省第五届高校体育教师基本功大赛圆满落幕。齐鲁师范学院体育学院教师们以...
01-21
  大众网记者 杨涛报道  近日,在第十六届山东省大学生科技节——山东省大学生消防安全技能大赛中,青岛港湾职业技术学院应急管理学院23级建筑消防技术与应急救援技术专...
01-21
  观点网讯:1月20日,汇贤产业信托宣布偿还贷款及其财务影响。  公告显示,于2025年1月20日,汇贤...
01-21
  图片来源:界面图库  界面新闻记者|邹文榕  信托业一纲领性文件出炉。  近日,国务院办公...
02-07
水瓶座是黄道十二宫中的第十一宫,出生于1月20日至2月18日之间。他们被认为是最具创造力...
01-22
巨蟹座的人通常被认为是温柔、体贴和善良的,他们对待感情非常认真。然而,有时候即使是最...
01-22
ysl是什么牌子的包包? lv包包和ysl包包哪个?ysl是什么牌子的包包?圣罗兰 股票代码ISYSl,不过目前已经退市。YSL(Yves Saint laurent)的简称,中文译名圣罗兰,是法国著名奢侈品牌,由193...
02-17
lv包包和ysl包包哪个? ysl包包真假鉴定?lv包包和ysl包包哪个?看你买那种了,钱包很一般的两折的大概三千多,大点的自然就会贵很多,平时出门背的包我们国内买的最便宜的是五千多,经典...
02-17
2月4日消息,百果园日前发布2024年业绩预警公告,相较2023年财政年度的拥有人应占利润约3.62亿元,预期2024年财政年度公司拥有人应占亏损3.5亿元-4亿元。同时,公司预期于2024年财...
02-07
2月20日消息,为帮助商家抓住微信电商增长机遇,微盟智慧零售与微商城解决方案已上线微盟小程序商城跳转微信小店能力,支持小程序“一键送礼”,实现流量高效转化。该功能旨在帮助...
02-21
2月15日消息,星图金融旗下苏宁支付近日与北京力众华援技术服务有限公司(下称“力众华援”)达成综合支付业务合作。苏宁支付所提供的综合支付方案成效显著,对于力众华援而言,该方...
02-15
2月22日消息,第十四届公益节暨2024ESG影响力年会奖项评选结果近日正式公布,享道出行申报的“请帮我回家”项目摘得“2024年度公益项目奖”。“请帮我回家”是享道出行聚焦儿童...
02-23
近日,华力创科学宣布完成数千万元A+轮融资,本轮融资由金属3D打印领域头部上市公司铂力特独家投资。据披露,本轮融资所募集的资金将专注于深挖高性能光学多模态感知技术,结合金属...
01-24
近日,华力创科学宣布完成数千万元A+轮融资,本轮融资由金属3D打印领域头部上市公司铂力特独家投资。据披露,本轮融资所募集的资金将专注于深挖高性能光学多模态感知技术,结合金属...
01-24
今日(1月24日),明末生存题材文字冒险游戏《哀鸿:城破十日记》Steam页面上线,游戏支持简繁体中文,预计于2025年第四季度发售,感兴趣的玩家可以点击此处进入商店页面。 ...
01-25
1月27日消息,RTX 50系列即将上市开卖,RTX 5090/5090D的评测已经出炉,但奇怪的是,这次全球媒体评测的样卡,没有一块和FE公版价格相同的标准版,也就是俗称的“丐版”。...
01-29
2月9日,哈尔滨亚冬会速度滑冰男子5000米决赛,中国队包揽金银铜牌。吴宇夺得金牌,刘瀚彬获得银牌,哈那哈提·木哈买提获得铜牌。...
02-09
2月9日是哈尔滨亚冬会开幕后的第二个比赛日,中国代表团以15金15银14铜继续领跑奖牌榜。在滑雪登山女子短距离、滑雪登山男子短距离、越野滑雪女子5公里(自由技术)、自由式滑雪...
02-10
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮