AI医疗进入精准化“深水区” :OpenAI医疗评估基准落地、大模型加速变革|AI医疗浪潮㉑

7个月前 来源: 观看:212

21世纪经济报道记者 闫硕 北京报道Nd3即热新闻——关注每天科技社会生活新变化gihot.com

近日,OpenAI推出HealthBench开源基准测试,用于衡量大语言模型在医疗健康领域的性能表现与安全可靠性,引发业内广泛讨论。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

根据官方信息,HealthBench由262位来自60个国家/地区执业的医生共同参与构建,整合了5000段真实的医疗对话数据。与以前的狭窄基准不同,HealthBench通过48562个独特的医生编写的评分标准进行有意义的开放式评估,涵盖多个健康背景和行为维度。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

有研报分析指出,随着OpenAI推出HealthBench等医疗大模型评估基准的建立和完善,AI医疗模型的性能评估将更加科学、全面,有助于加速AI技术在医疗领域的落地应用,为医疗行业的智能化升级提供有力支持,相关企业有望迎来新的发展机遇。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

另一方面,大模型本身也在加速变革。事实上,随着大模型竞争的白热化,竞争的焦点也已进入全新阶段:从早先粗放的参数体量堆砌竞赛,转变为模型效率优化与单位算力下的性能提升。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

IQVIA艾昆纬战略规划副总监Barrett Li向21世纪经济报道记者表示,随着大模型的不断进化,以及模型优化方法的不断提升,已经为AI在要求更特殊的专业场景中的更广泛应用拓展了可能性,尤其是对于医药行业的AI应用来说,已显现三大趋势:模型即产品、本地与端侧部署、研发端AI应用的快速拓展。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

新的评估测试集

改善人类健康将成为通用人工智能(AGI)的决定性影响之一。如果能够得到有效开发和部署,大语言模型有望拓展健康信息的获取渠道,支持临床医生提供高质量医疗服务,并帮助人们维护自身健康。而评估对于理解模型在医疗场景中的表现至关重要。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

OpenAI认为,现有评估仍然存在一些问题,首先,未反映真实场景,脱离了实际医疗互动的复杂性,如仅采用标准化测试或有限临床问题。其次,缺乏专家医学验证,评分标准未经过医疗专家严格审核,难以体现专业医疗判断。此外,也并未预留改进空间,最先进模型已接近“天花板”得分,无法激励持续优化。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

也因此,在过去的一年里,OpenAI与60个国家的262名医生合作构建了HealthBench,包括5000个真实的医疗对话数据。HealthBench 的测试样本被分为7个主题和5个评估维度。其中,7个主题包括紧急转诊、专业沟通定制、健康数据任务等方面,5个评估纬度则包含准确性、沟通质量、情境理解等方面。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

在HealthBench的基础上,OpenAI还推出了两个特别版本:HealthBench Consensus(共识版)和HealthBench Hard(困难版)。前者包含34个经医生共识验证的、对模型行为表现尤为关键的评估维度;后者则设置了更高难度的评估场景,目前最高得分仅为o3模型的32%,主要被用于挑战模型在复杂医疗情境中的极限表现。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

对于HealthBench的可信度,OpenAI开展了HealthBench Consensus(共识版)的元评估,即将模型的打分结果与医生人工打分进行对比。结果表明,7个评估领域中的6个领域,模型打分结果与医生评分的中位数水平高度一致。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

有券商分析师向21世纪经济报道记者表示,在医疗等垂直领域,准确性和实际场景的相关性比“流畅对话”更为关键,HealthBench不同于过去大多关注通用大语言模型表现的基准,而是聚焦医疗垂直领域,为医疗领域的AI应用提供更为专业的评估工具,同时也将推动大模型领域建立专业的AI评估标准。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

值得一提的是,在HealthBench的测评中可以发现,大模型在医疗领域的应用正迅速发展。比如,2023年推出的GPT-3.5Turbo得分为16%,而2024年5月推出的GPT-4o得分已达到32%,2024年12月推出的o3模型得分更是达到60%。另外,较小规模的模型尤其进步显著,GPT-4.1 nano的表现超过GPT-4o,且成本仅为GPT-4o的1/25。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

大模型持续优化

根据世界经济论坛发布的《人工智能驱动健康的未来:引领潮流》报告,人工智能是医疗保健的主要变革力量,预计2024年—2032年,AI医疗市场将以每年43%的速度增长,市场规模有望达到4910亿美元。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

其中,AI在医疗服务中的应用前景广阔。中信建投证券分析指出,AI可以扩展医疗服务可及性,可应用于诊断前、诊治及诊断后阶段,解决当前医院系统医疗人员短缺和缺乏有效分流等问题,以少量资源实现高效率。此外,AI辅助医生诊疗未来有望降低误诊率的同时,在部分疑难杂症诊疗方面也有望发挥协同作用。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

也因此,不仅评估工具在发生变革,大模型本身也在持续优化。当前,AI在医疗领域的应用历经了从规则驱动到数据驱动、从单一任务优化到多模态协同的演变,已进入到多模态融合阶段。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

浙商证券分析指出,大模型的多模态能力解决了早期AI医疗存在的信息割裂和数据孤岛等问题,大模型通过“预训练+微调”架构,用统一参数体系处理多模态医疗数据。在临床应用中,借助多模态技术,AI可以实现跨模态数据的理解和动态时序建模,使得AI诊疗与医生的诊疗水平更加接近。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

需要指出的是,由于万亿级参数模型高昂的训练成本与当下较低的投资回报比,叠加通用参数的堆砌对专业场景下的模型效率提升遇到了瓶颈,大模型竞争的焦点已从早先粗放的参数体量堆砌竞赛,转向模型效率优化与单位算力下的性能提升。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

在应用方面,Barrett Li向记者总结道,随着大模型的不断进化,目前对于医药行业的AI应用来说,几大趋势已经显现:Nd3即热新闻——关注每天科技社会生活新变化gihot.com

首先,模型即产品。相比通用大模型在其他行业中相对较低的应用门槛,医药行业高度专业性的场景,对于模型的适配性有着更高的要求。而随着模型训练与针对特定知识库优化的技术与应用逐渐推广,大模型厂商未来预计会逐步关闭对外的API接口,转而将专业化后的模型本身作为产品直接提供给企业用户使用,颠覆现有的套壳应用层。而现有的专业AI软件,也必须逐步增强其底层模型训练的能力以应对这一挑战。在可见的未来,将会有更多直接针对医药行业训练的模型被广泛应用。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

其次,本地与端侧部署。针对特定场景而训练优化的专业模型,可以在满足性能要求的前提下,减少对硬件方面提出过高的要求。因此在成本可控性、分析可溯源、数据安全、反馈延迟等要求更高的场景下,专业中小模型的本地部署会提供极大的赋能。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

“此外,研发端AI应用也在快速拓展。出于高度专业性、数据安全、隐私合规等因素,相比通用大模型在商业化阶段的快速发展,医药行业企业尚未在研发阶段感受到AI所带来的巨大转变。而随着特定场景专业模型训练的普及,研发阶段AI应用的壁垒未来也有望被逐一消解。”Barrett Li说道。Nd3即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-7-17974-0.htmlAI医疗进入精准化“深水区” :OpenAI医疗评估基准落地、大模型加速变革|AI医疗浪潮㉑

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:CXO企业一季报:5家营收破10亿元,8家亏损,国际化与创新赛道或成破局关键

下一篇:交易超10亿美金,石药这款首仿药何以抢滩全球市场?

为你推荐
  近日,知名生物药企麦克斯科学(MaxScientific)宣布旗下衰老干预品牌瑞维拓“上新”,正式上线第五代瑞维拓(Revigorator G5)。  ...
01-21
21世纪经济报道记者 韩利明 上海报道春节前,王晨(化名)家中未满一岁的幼儿突发咳嗽、流涕等症状。尽管卫生院就在隔壁,王晨还是选择驱车前往县...
02-02
师生在街头义务为群众书写春联 贾敏杰 摄  当日,河北省石家庄新乐市东长寿学校举行“金蛇送福、柿柿如意”师生义务书写春联活动,师生为群众书写春联福字,传递新年祝福。 编...
01-21
为加强名班主任工作室成员的交流学习,提升班主任专业素养,近日,阜新市第一职专名班主任工作室开展了以《做...
01-23
  新年伊始,锂电行业迎来一波产能扩张热潮,包括宁德时代、亿纬锂能、瑞浦兰钧在内的多家头部电...
01-21
  或因禁止手工补息与非银同业存款利率自律管理倡议效果逐步显现,2024年多家银行出现存款规模...
01-24
水瓶男通常具有理性、独立和思想家的特质,他们喜欢追求自由和个人空间。他们对于感情较...
01-22
狮子座男生通常具有自信、热情和领导力,他们喜欢被关注和赞美。如果你想吸引一个狮子座...
01-22
从高个子女明星看时尚与魅力:她们的独特风采如果你留意一下娱乐圈,时常会发现那些高个子女明星总是有着特别的魅力,无论是在红毯上还是日常生活中,她们的形象都能成为众人瞩目的...
02-12
儿童口号大全?  1、宝贝向前冲,这里属于你。  2、精彩艺术,尽放未来。  3、宝贝可爱,我们相伴。  4、来鹿优优,做全能宝宝。  5、希望,由此开始;未来,由此腾飞。  6、关...
02-12
2月5日消息,盒马发布《2025盒区房春节消费报告》(以下简称“报告”)。《报告》显示,盒马年菜销售同比增长了42%,下单购买年菜的18-35岁的年轻消费者占比达56%,不同于老一辈,这届年...
02-07
阿里巴巴港股成交额突破440亿港元,创历史天量,盘中股价涨超15%。消息面上,阿里巴巴昨日发布2025财年第三财季业绩公告。财报显示,阿里巴巴第三财季收入2801.54亿元,同比增长8%;经...
02-22
时隔两月,网红袋泡茶品牌“CHALI茶里”再度陷入欠薪风波。据《消费者报道》此前报道,2024年11月13日晚间,针对当时多名自称茶里的员...
02-07
2月27日消息,京东外卖宣布推出“10元/20元餐补随机领”优惠活动,用户每晚8点即可随机领取“满15元减10元”“满40元减20元”两种大额餐补优惠券,首批覆盖通过京东认证的大学生...
03-01
近日,毅富能源科技(广东)有限公司(以下简称“毅富能源”)成功完成天使+轮融资。本轮融资由国内新能源行业产业投资平台仁发投资和国内知名早期风险投资...
02-07
【#哪吒汽车旗下电驱公司被强执1051万#】天眼查App显示,近日,浩智科技电驱(桐城)有限公司新增一条被执行人信息,执行标的1051万余元,执行法院为桐城市人民法院。该公司成立于2022...
02-09
由Dark Panda打造的第三人称射击生存动作冒险游戏《奇异地平线(Strange Horizons)》,现已上线Steam平台。 本作 是一款生存冒险游戏,在游戏中,一个通往另一个维度...
02-06
不知大家发现没有,我们在晚上做决定的时候,总会“大胆”很多,但第二天醒来不免会懊恼。这种到了晚上更易做出冲动决定的现象,在心理学上叫“深夜效应”。 白天大...
02-10
距离除夕只剩几天,“回家”成为大街小巷最热门的话题。窗前的红灯笼、热闹的年货市场、街头巷尾的新春歌曲……处处洋溢着喜庆的氛围。“我恭喜你发财,我恭喜你精彩,最好的请过...
02-02
极目新闻记者 张静娴在清晨六七点的随州农贸市场,卖菜卖肉的摊位前早已挤满了人,洋溢着浓厚的春节氛围。在年货市场上,最具代表性的特色年货莫过于炸三鲜了。从过年前几周一直...
02-04
美国宾夕法尼亚大学工程与应用学院研究团队开发出一种新型基因编辑平台——“最小通用遗传扰动技术(mvGPT)”。这一平台集成了基因精确编...
01-24
  中新网呼和浩特1月25日电(记者李爱平)内蒙古自治区文物考古研究院25日消息称,考古部门近期在...
01-27
  近日,工业和信息化部公布了2024年度绿色制造名单,来自辽宁的45家工厂荣获国家级绿色工厂,2家园区荣获...
02-17
SQL Error: select * from ***_ecms_news3 where id in(252,) limit 2
1 月 24 日消息,据“特斯拉”官方新闻稿,特斯拉宣布旗下首批V4超级充电站将于国内落地,相应充电站也将支持第三方汽车充电。▲ 特斯拉 V4 充电桩V4 超级充电桩号称特斯...
01-25
蛇舞新春,科技贺岁!万众期待的2025年央视蛇年春晚如期而至。在今年的春晚舞台上,780台问界M9带来划破夜空、直穿云霄的震撼灯光表演,问界M9化身为灵动的“光影舞者”,以闪耀变幻...
01-31
  胡建礼  系列电影的创作并非易事,绝非简单复制。续集既要保持与前作IP风格和元素的连贯性,...
02-18
温以凡桑延是什么小说?温以凡为什么叫温霜降?温以凡和桑延是小说《难哄》中的主要角色。‌这部小说由竹已创作,讲述了温以凡和桑延之间的爱情故事。温以凡回到...
02-19
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮