AI医疗进入精准化“深水区” :OpenAI医疗评估基准落地、大模型加速变革|AI医疗浪潮㉑

4个月前 来源: 观看:165

21世纪经济报道记者 闫硕 北京报道tX8即热新闻——关注每天科技社会生活新变化gihot.com

近日,OpenAI推出HealthBench开源基准测试,用于衡量大语言模型在医疗健康领域的性能表现与安全可靠性,引发业内广泛讨论。tX8即热新闻——关注每天科技社会生活新变化gihot.com

根据官方信息,HealthBench由262位来自60个国家/地区执业的医生共同参与构建,整合了5000段真实的医疗对话数据。与以前的狭窄基准不同,HealthBench通过48562个独特的医生编写的评分标准进行有意义的开放式评估,涵盖多个健康背景和行为维度。tX8即热新闻——关注每天科技社会生活新变化gihot.com

有研报分析指出,随着OpenAI推出HealthBench等医疗大模型评估基准的建立和完善,AI医疗模型的性能评估将更加科学、全面,有助于加速AI技术在医疗领域的落地应用,为医疗行业的智能化升级提供有力支持,相关企业有望迎来新的发展机遇。tX8即热新闻——关注每天科技社会生活新变化gihot.com

另一方面,大模型本身也在加速变革。事实上,随着大模型竞争的白热化,竞争的焦点也已进入全新阶段:从早先粗放的参数体量堆砌竞赛,转变为模型效率优化与单位算力下的性能提升。tX8即热新闻——关注每天科技社会生活新变化gihot.com

IQVIA艾昆纬战略规划副总监Barrett Li向21世纪经济报道记者表示,随着大模型的不断进化,以及模型优化方法的不断提升,已经为AI在要求更特殊的专业场景中的更广泛应用拓展了可能性,尤其是对于医药行业的AI应用来说,已显现三大趋势:模型即产品、本地与端侧部署、研发端AI应用的快速拓展。tX8即热新闻——关注每天科技社会生活新变化gihot.com

新的评估测试集

改善人类健康将成为通用人工智能(AGI)的决定性影响之一。如果能够得到有效开发和部署,大语言模型有望拓展健康信息的获取渠道,支持临床医生提供高质量医疗服务,并帮助人们维护自身健康。而评估对于理解模型在医疗场景中的表现至关重要。tX8即热新闻——关注每天科技社会生活新变化gihot.com

OpenAI认为,现有评估仍然存在一些问题,首先,未反映真实场景,脱离了实际医疗互动的复杂性,如仅采用标准化测试或有限临床问题。其次,缺乏专家医学验证,评分标准未经过医疗专家严格审核,难以体现专业医疗判断。此外,也并未预留改进空间,最先进模型已接近“天花板”得分,无法激励持续优化。tX8即热新闻——关注每天科技社会生活新变化gihot.com

也因此,在过去的一年里,OpenAI与60个国家的262名医生合作构建了HealthBench,包括5000个真实的医疗对话数据。HealthBench 的测试样本被分为7个主题和5个评估维度。其中,7个主题包括紧急转诊、专业沟通定制、健康数据任务等方面,5个评估纬度则包含准确性、沟通质量、情境理解等方面。tX8即热新闻——关注每天科技社会生活新变化gihot.com

在HealthBench的基础上,OpenAI还推出了两个特别版本:HealthBench Consensus(共识版)和HealthBench Hard(困难版)。前者包含34个经医生共识验证的、对模型行为表现尤为关键的评估维度;后者则设置了更高难度的评估场景,目前最高得分仅为o3模型的32%,主要被用于挑战模型在复杂医疗情境中的极限表现。tX8即热新闻——关注每天科技社会生活新变化gihot.com

对于HealthBench的可信度,OpenAI开展了HealthBench Consensus(共识版)的元评估,即将模型的打分结果与医生人工打分进行对比。结果表明,7个评估领域中的6个领域,模型打分结果与医生评分的中位数水平高度一致。tX8即热新闻——关注每天科技社会生活新变化gihot.com

有券商分析师向21世纪经济报道记者表示,在医疗等垂直领域,准确性和实际场景的相关性比“流畅对话”更为关键,HealthBench不同于过去大多关注通用大语言模型表现的基准,而是聚焦医疗垂直领域,为医疗领域的AI应用提供更为专业的评估工具,同时也将推动大模型领域建立专业的AI评估标准。tX8即热新闻——关注每天科技社会生活新变化gihot.com

值得一提的是,在HealthBench的测评中可以发现,大模型在医疗领域的应用正迅速发展。比如,2023年推出的GPT-3.5Turbo得分为16%,而2024年5月推出的GPT-4o得分已达到32%,2024年12月推出的o3模型得分更是达到60%。另外,较小规模的模型尤其进步显著,GPT-4.1 nano的表现超过GPT-4o,且成本仅为GPT-4o的1/25。tX8即热新闻——关注每天科技社会生活新变化gihot.com

大模型持续优化

根据世界经济论坛发布的《人工智能驱动健康的未来:引领潮流》报告,人工智能是医疗保健的主要变革力量,预计2024年—2032年,AI医疗市场将以每年43%的速度增长,市场规模有望达到4910亿美元。tX8即热新闻——关注每天科技社会生活新变化gihot.com

其中,AI在医疗服务中的应用前景广阔。中信建投证券分析指出,AI可以扩展医疗服务可及性,可应用于诊断前、诊治及诊断后阶段,解决当前医院系统医疗人员短缺和缺乏有效分流等问题,以少量资源实现高效率。此外,AI辅助医生诊疗未来有望降低误诊率的同时,在部分疑难杂症诊疗方面也有望发挥协同作用。tX8即热新闻——关注每天科技社会生活新变化gihot.com

也因此,不仅评估工具在发生变革,大模型本身也在持续优化。当前,AI在医疗领域的应用历经了从规则驱动到数据驱动、从单一任务优化到多模态协同的演变,已进入到多模态融合阶段。tX8即热新闻——关注每天科技社会生活新变化gihot.com

浙商证券分析指出,大模型的多模态能力解决了早期AI医疗存在的信息割裂和数据孤岛等问题,大模型通过“预训练+微调”架构,用统一参数体系处理多模态医疗数据。在临床应用中,借助多模态技术,AI可以实现跨模态数据的理解和动态时序建模,使得AI诊疗与医生的诊疗水平更加接近。tX8即热新闻——关注每天科技社会生活新变化gihot.com

需要指出的是,由于万亿级参数模型高昂的训练成本与当下较低的投资回报比,叠加通用参数的堆砌对专业场景下的模型效率提升遇到了瓶颈,大模型竞争的焦点已从早先粗放的参数体量堆砌竞赛,转向模型效率优化与单位算力下的性能提升。tX8即热新闻——关注每天科技社会生活新变化gihot.com

在应用方面,Barrett Li向记者总结道,随着大模型的不断进化,目前对于医药行业的AI应用来说,几大趋势已经显现:tX8即热新闻——关注每天科技社会生活新变化gihot.com

首先,模型即产品。相比通用大模型在其他行业中相对较低的应用门槛,医药行业高度专业性的场景,对于模型的适配性有着更高的要求。而随着模型训练与针对特定知识库优化的技术与应用逐渐推广,大模型厂商未来预计会逐步关闭对外的API接口,转而将专业化后的模型本身作为产品直接提供给企业用户使用,颠覆现有的套壳应用层。而现有的专业AI软件,也必须逐步增强其底层模型训练的能力以应对这一挑战。在可见的未来,将会有更多直接针对医药行业训练的模型被广泛应用。tX8即热新闻——关注每天科技社会生活新变化gihot.com

其次,本地与端侧部署。针对特定场景而训练优化的专业模型,可以在满足性能要求的前提下,减少对硬件方面提出过高的要求。因此在成本可控性、分析可溯源、数据安全、反馈延迟等要求更高的场景下,专业中小模型的本地部署会提供极大的赋能。tX8即热新闻——关注每天科技社会生活新变化gihot.com

“此外,研发端AI应用也在快速拓展。出于高度专业性、数据安全、隐私合规等因素,相比通用大模型在商业化阶段的快速发展,医药行业企业尚未在研发阶段感受到AI所带来的巨大转变。而随着特定场景专业模型训练的普及,研发阶段AI应用的壁垒未来也有望被逐一消解。”Barrett Li说道。tX8即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-7-17974-0.htmlAI医疗进入精准化“深水区” :OpenAI医疗评估基准落地、大模型加速变革|AI医疗浪潮㉑

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:CXO企业一季报:5家营收破10亿元,8家亏损,国际化与创新赛道或成破局关键

下一篇:交易超10亿美金,石药这款首仿药何以抢滩全球市场?

为你推荐
  即将告别春节假期,你有没有不想上班、不想上学、不想起床?从“假期模式”切换到“工作模式”还不太适应?如何调整?指南请收好↓↓↓  01  什么是“节后综合征”? ...
02-07
这里是《21健讯Daily》,欢迎与21世纪经济报道新健康团队共同关注医药健康行业最新事件!政策动向国家医疗保障局召开2025年全国医疗保障系统...
02-11
2021年从清华大学博士毕业后加入华为,工作约三年半后,王成将进入上海交通大...
01-21
  大众网记者 杨涛报道  近日,2024年山东省“技能兴鲁”职业技能大赛暨第五届山东省汽车服务行业职业技能竞赛在青岛港湾职业技术学院成功举行。“技能兴鲁”职业技能...
01-21
春节临近,各地返乡客流与出游人群交织,北京、深圳等城市的地铁站里人潮涌动,成为人们出行的关键枢...
01-27
  昨日,菜粕走势强劲,2503合约一度触及涨停。截至下午收盘,菜粕2503合约上涨3.75%,菜粕2505合约上...
02-11
天蝎座男性在工作中往往是强势而有魅力的领导者,他们对待感情也同样充满了热情和决心。...
01-22
射手座的男生通常是开朗、乐观、自由奔放的,他们对待感情也是如此。然而,当他们真正爱上...
01-22
穿搭化妆风格? 菲律宾穿搭风格?一、穿搭化妆风格?每个人的气质不同,在穿搭上有很多种风格,所以,妆容方面也是有很多风格的。那么,接下来我们一起来看看妆容有哪些风格吧!感兴趣的朋...
02-07
石家庄时尚盛宴:揭秘模特T台走秀的光彩时刻当我走进石家庄的时尚中心,目光所及之处尽是华丽的灯光、绚烂的服饰,以及那些熠熠生辉的模特。在这个为期数天的T台走秀活动中,观众们...
02-12
2月15日消息,字节跳动日前举办新一期的All Hands全员会,字节CEO梁汝波、CFO高准、人力资源负责人华巍、电商业务负责人康泽宇、AI业务负责人朱文佳、TikTok CEO周受资与全体员...
02-15
张一鸣:做不好就别做,要做就必须做到非常好。红果免费短剧月活飙升至1.58亿近一两年,除了AI,短剧可谓是另一个炙手可热的赛道。一时之间,资本争相涌入,就连周鸿祎也亲自下场做短剧...
02-19
2025年家电购新补贴延续,对于家电圈而言可谓喜闻乐见。一方面,消费者能够用更优惠的价格添置高品质的新家电;另一方面,厂商能够专注绿...
02-07
依然是全程面带微笑、依然健步如飞,现年已74岁的全国政协委员、新希望集团董事长刘永好在2025年全国两会前的媒体沟通会中坐了近三...
03-01
自去年底开始,黄金多头优势逐渐退却,国际现货黄金价格经历几次大跌后一度跌下2700关口,多空进入漫长的震荡周期,多头始终无法找到再度冲高的时机。  北京时间1月21日,国际现货...
01-24
近日,华力创科学宣布完成数千万元A+轮融资,本轮融资由金属3D打印领域头部上市公司铂力特独家投资。据披露,本轮融资所募集的资金将专注于深挖高性能光学多模态感知技术,结合金属...
01-24
今日(1月31日),米哈游官方公布《崩坏:星穹铁道》阿格莱雅角色PV——「致命浪漫」,我们会重逢的,朋友。无论你行向何处,奥赫玛的大门始终为英雄敞开。 宣传片: 中文CV...
02-03
2月12日,发行商万代南梦宫和开发商Omega Force宣布,《海贼无双4》销量现已突破400万,游戏即将登陆新平台PS5和Xbox Series X|S,具体发售时间待定,这两个版本将包含...
02-13
当地时间2月2日,美国华盛顿消防部门表示,已确定两机相撞事故中55名遇难者的身份。当地时间1月29日,一架美国国内支线客机在罗纳德·里根华盛顿国家机场同一架美军直升机在半空...
02-03
2月5日傍晚,小米创始人雷军在社交媒体上发文:这是金的。转发的视频里有人介绍,小米SU7 Ultra车标变成了碳纤维+金色,兄弟们这个如何?来源:当事人社交账号今日上午,雷军又连发多条微...
02-06
从空间太阳能发电到破解大脑基因密码,再到由真菌制造的自我修复材料,《欧盟研究与创新》杂志盘点了2025年有望大放异彩的创新技术。这些成果拥有广阔...
01-21
德国联邦物理技术研究院团队成功开发出一系列先进的光学原子钟,其中包括单离子时钟和光晶格时钟。这些新型时钟展示了前所未有的精度,可比现有的定义...
01-22
  据网络平台数据  截至2月5日13时29分  2025年春节档上映新片(含春节档结束后)  总票房(...
02-06
  近日,我省多个在建高速公路项目陆续启动复工。高速路建设加速度,离不开近年来我省聚焦“交通强省”建...
02-17
  作为新春的“氛围担当”之一,年宵花深受人们的喜爱。春节将至,年味渐浓,各地不同品种、五彩斑斓的年宵花已大量上市,满足消费者需求。  在山东济宁兖州区兴隆庄街道一...
01-22
  TikTok 禁令执行了十四个小时。当地时间 1 月 19 日下午,TikTok 在美国正式恢复上线。  此前,临近 TikTok 禁令生效日,为寻找下一个互联网落脚点,1 月 13 日,语言学习软...
01-22
1 月 28 日消息,据 Teslarati 报道,一项由电动汽车咨询平台 Electrifying.com 开展的调查显示,特斯拉首席执行官埃隆・马斯克(Elon Musk)的言行正在影响英国消费者对特斯...
01-29
1 月 30 日消息,东风启辰现已发布了旗下2025款启辰大 V DD-i 超混动SUV官图,该车主要在外观及动力系统方面进行调整。作为比较,现款在售2023款启辰大 V DD-i车型定价为...
01-31
  1、《难哄》桑延和《偷偷藏不住》的桑延本质上是同一个人,但是剧里面是由不同的演员饰演的。  2、桑延在《偷偷藏不住》剧中由马伯骞饰演,在《难哄》里是白敬亭饰演的...
02-17
《余烬之上》廖知白是凶手吗?廖知白最后结局是什么?在《余烬之上》中,廖知白不能被简单认定为凶手。从主观动机与行为目的看:廖知白经历家庭惨变后,一心追求真相...
02-21
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮