AI医疗进入精准化“深水区” :OpenAI医疗评估基准落地、大模型加速变革|AI医疗浪潮㉑

8个月前 来源: 观看:223

21世纪经济报道记者 闫硕 北京报道Dzt即热新闻——关注每天科技社会生活新变化gihot.com

近日,OpenAI推出HealthBench开源基准测试,用于衡量大语言模型在医疗健康领域的性能表现与安全可靠性,引发业内广泛讨论。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

根据官方信息,HealthBench由262位来自60个国家/地区执业的医生共同参与构建,整合了5000段真实的医疗对话数据。与以前的狭窄基准不同,HealthBench通过48562个独特的医生编写的评分标准进行有意义的开放式评估,涵盖多个健康背景和行为维度。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

有研报分析指出,随着OpenAI推出HealthBench等医疗大模型评估基准的建立和完善,AI医疗模型的性能评估将更加科学、全面,有助于加速AI技术在医疗领域的落地应用,为医疗行业的智能化升级提供有力支持,相关企业有望迎来新的发展机遇。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

另一方面,大模型本身也在加速变革。事实上,随着大模型竞争的白热化,竞争的焦点也已进入全新阶段:从早先粗放的参数体量堆砌竞赛,转变为模型效率优化与单位算力下的性能提升。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

IQVIA艾昆纬战略规划副总监Barrett Li向21世纪经济报道记者表示,随着大模型的不断进化,以及模型优化方法的不断提升,已经为AI在要求更特殊的专业场景中的更广泛应用拓展了可能性,尤其是对于医药行业的AI应用来说,已显现三大趋势:模型即产品、本地与端侧部署、研发端AI应用的快速拓展。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

新的评估测试集

改善人类健康将成为通用人工智能(AGI)的决定性影响之一。如果能够得到有效开发和部署,大语言模型有望拓展健康信息的获取渠道,支持临床医生提供高质量医疗服务,并帮助人们维护自身健康。而评估对于理解模型在医疗场景中的表现至关重要。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

OpenAI认为,现有评估仍然存在一些问题,首先,未反映真实场景,脱离了实际医疗互动的复杂性,如仅采用标准化测试或有限临床问题。其次,缺乏专家医学验证,评分标准未经过医疗专家严格审核,难以体现专业医疗判断。此外,也并未预留改进空间,最先进模型已接近“天花板”得分,无法激励持续优化。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

也因此,在过去的一年里,OpenAI与60个国家的262名医生合作构建了HealthBench,包括5000个真实的医疗对话数据。HealthBench 的测试样本被分为7个主题和5个评估维度。其中,7个主题包括紧急转诊、专业沟通定制、健康数据任务等方面,5个评估纬度则包含准确性、沟通质量、情境理解等方面。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

在HealthBench的基础上,OpenAI还推出了两个特别版本:HealthBench Consensus(共识版)和HealthBench Hard(困难版)。前者包含34个经医生共识验证的、对模型行为表现尤为关键的评估维度;后者则设置了更高难度的评估场景,目前最高得分仅为o3模型的32%,主要被用于挑战模型在复杂医疗情境中的极限表现。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

对于HealthBench的可信度,OpenAI开展了HealthBench Consensus(共识版)的元评估,即将模型的打分结果与医生人工打分进行对比。结果表明,7个评估领域中的6个领域,模型打分结果与医生评分的中位数水平高度一致。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

有券商分析师向21世纪经济报道记者表示,在医疗等垂直领域,准确性和实际场景的相关性比“流畅对话”更为关键,HealthBench不同于过去大多关注通用大语言模型表现的基准,而是聚焦医疗垂直领域,为医疗领域的AI应用提供更为专业的评估工具,同时也将推动大模型领域建立专业的AI评估标准。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

值得一提的是,在HealthBench的测评中可以发现,大模型在医疗领域的应用正迅速发展。比如,2023年推出的GPT-3.5Turbo得分为16%,而2024年5月推出的GPT-4o得分已达到32%,2024年12月推出的o3模型得分更是达到60%。另外,较小规模的模型尤其进步显著,GPT-4.1 nano的表现超过GPT-4o,且成本仅为GPT-4o的1/25。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

大模型持续优化

根据世界经济论坛发布的《人工智能驱动健康的未来:引领潮流》报告,人工智能是医疗保健的主要变革力量,预计2024年—2032年,AI医疗市场将以每年43%的速度增长,市场规模有望达到4910亿美元。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

其中,AI在医疗服务中的应用前景广阔。中信建投证券分析指出,AI可以扩展医疗服务可及性,可应用于诊断前、诊治及诊断后阶段,解决当前医院系统医疗人员短缺和缺乏有效分流等问题,以少量资源实现高效率。此外,AI辅助医生诊疗未来有望降低误诊率的同时,在部分疑难杂症诊疗方面也有望发挥协同作用。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

也因此,不仅评估工具在发生变革,大模型本身也在持续优化。当前,AI在医疗领域的应用历经了从规则驱动到数据驱动、从单一任务优化到多模态协同的演变,已进入到多模态融合阶段。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

浙商证券分析指出,大模型的多模态能力解决了早期AI医疗存在的信息割裂和数据孤岛等问题,大模型通过“预训练+微调”架构,用统一参数体系处理多模态医疗数据。在临床应用中,借助多模态技术,AI可以实现跨模态数据的理解和动态时序建模,使得AI诊疗与医生的诊疗水平更加接近。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

需要指出的是,由于万亿级参数模型高昂的训练成本与当下较低的投资回报比,叠加通用参数的堆砌对专业场景下的模型效率提升遇到了瓶颈,大模型竞争的焦点已从早先粗放的参数体量堆砌竞赛,转向模型效率优化与单位算力下的性能提升。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

在应用方面,Barrett Li向记者总结道,随着大模型的不断进化,目前对于医药行业的AI应用来说,几大趋势已经显现:Dzt即热新闻——关注每天科技社会生活新变化gihot.com

首先,模型即产品。相比通用大模型在其他行业中相对较低的应用门槛,医药行业高度专业性的场景,对于模型的适配性有着更高的要求。而随着模型训练与针对特定知识库优化的技术与应用逐渐推广,大模型厂商未来预计会逐步关闭对外的API接口,转而将专业化后的模型本身作为产品直接提供给企业用户使用,颠覆现有的套壳应用层。而现有的专业AI软件,也必须逐步增强其底层模型训练的能力以应对这一挑战。在可见的未来,将会有更多直接针对医药行业训练的模型被广泛应用。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

其次,本地与端侧部署。针对特定场景而训练优化的专业模型,可以在满足性能要求的前提下,减少对硬件方面提出过高的要求。因此在成本可控性、分析可溯源、数据安全、反馈延迟等要求更高的场景下,专业中小模型的本地部署会提供极大的赋能。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

“此外,研发端AI应用也在快速拓展。出于高度专业性、数据安全、隐私合规等因素,相比通用大模型在商业化阶段的快速发展,医药行业企业尚未在研发阶段感受到AI所带来的巨大转变。而随着特定场景专业模型训练的普及,研发阶段AI应用的壁垒未来也有望被逐一消解。”Barrett Li说道。Dzt即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-7-17974-0.htmlAI医疗进入精准化“深水区” :OpenAI医疗评估基准落地、大模型加速变革|AI医疗浪潮㉑

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:CXO企业一季报:5家营收破10亿元,8家亏损,国际化与创新赛道或成破局关键

下一篇:交易超10亿美金,石药这款首仿药何以抢滩全球市场?

为你推荐
  记者1日从国家卫生健康委获悉,2025年至2027年被确定为“儿科和精神卫生服务年”,同时,国家卫生健康委公布了2025年全系统为民服务的八件实事。  据介绍,在2025年至2...
01-21
这里是《21健讯Daily》,欢迎与21世纪经济报道新健康团队共同关注医药健康行业最新事件!政策动向2025年版流感诊疗方案发布1月22日,国家卫生健...
01-24
她师从图灵奖获得者 博士毕业于麻省理工学院 是国际知名企业的首席科学家 回...
01-21
  大众网记者 王一刚 报道  为进一步贯彻落实济南高新区教育文体部“三美”教师师德专题培训内容,加强师德师风建设,提升教师队伍素质,济南高新区玺悦幼教集团(玺悦园、...
01-21
  2025年伊始,山西银行迎来了业务扩张的新机遇。1月10日,山西银行汾阳支行正式揭牌运营,进一步拓...
01-22
  本报记者 刘琪  1月24日,国家金融监督管理总局(以下简称“国家金融监管总局”)发布消息,为进...
01-28
白羊座男生通常充满活力、冲动和自信。他们喜欢追求刺激和挑战,对于新鲜事物充满好奇心...
01-22
狮子座男生通常都是阳光、自信、热情洋溢的,当他们喜欢上一个人时,会展现出一系列特殊的...
01-22
关于男生穿搭的几个小窍门~?一、关于男生穿搭的几个小窍门~?1、颜色要基础男生衣服的颜色一定不要是花花绿绿的,要在自己的衣柜里多备一点黑色、白色、灰色这一类的打底,如果觉...
02-12
韩国女明星:穿衣风格的大胆创新与时尚潮流提到韩国女明星,你首先想到的是什么?是她们精致的面容、优雅的举止,还是那令人眼前一亮的穿衣风格?无论是哪一种,她们都以独特的个性和大...
02-17
2月4日消息,春节假期,京东联合联通数智智慧足迹,对全国31个城市的线下商圈客流量及消费数据进行了实时动态统计,反映消费者在春节线上线下各场景中的消费趋势。观察显示,西安、哈...
02-07
赚钱,无孔不入。1.大小品牌挤进爆火直播间一切生意的本质都是流量,在抖音尤是如此。不知道大家有没有发现,从去年开始,大小品牌开始挤进抖音爆火直播间,通过砸钱给主播送礼物,以此...
02-11
美国邮政局(USPS)当地时间2月5日上午在官网上宣布,将恢复接收来自中国内地和中国香港的所有国际入境邮件和包裹。就在前一天晚间,美国...
02-07
2月4日消息,途家民宿数据显示,截至2月4日,春节期间持非中国护照游客的民宿预订量同比增长3.7倍,有51个乡镇第一次迎来了外国人的订单。从平台民宿预订情况看,大理连续三年蝉联第...
02-07
2024年,年轻人的生活方式和消费行为发生了显著变化,需求的多元化和精细化,直接影响着品牌的营销策略和创新方向。从注重“质价比”的理性消费到对情绪价值的追求,从圈层文化的细...
01-23
2024年末,一位科技创业者火了。作者 | 王思琪来源 | 投资家(ID:touzijias)2024年末,一位科技创业者火了。2025年初,这位创业者再度爆火。近日,中国科技行业因一位85后年轻人现身《...
01-24
英伟达最新推出的RTX 50系列显卡,特别是RTX 5090,在全球范围内都是一卡难求,在中国台湾RTX 5090显卡同样也是供不应求。 据媒体报道,在这种供不应求的情况下,黄牛...
02-06
由infiniteloop开发,费虚拟桌面宠物游戏《桌面伴侣(Desktop Mate)》的新DLC雪未来发布,冰雪装初音登场,感兴趣的玩家可以关注下了。 Desktop Mate:Steam地址 Deskto...
02-10
极目新闻记者 付瞰是谁,在大年初五见到了肖战?哦,是我们武汉影迷啊。2月2日大年初五中午,电影《射雕英雄传:侠之大者》在武汉百丽宫影城举办惊喜见面会,数百位武汉影迷受邀与影片...
02-02
2月6日,外交部发言人郭嘉昆主持例行记者会。有记者提问,据报道,韩国的一些政府部门已经屏蔽对DeepSeek的访问,之前意大利、澳大利亚、印度、美国、日本等国家也传出禁止或限制使...
02-06
小环径比球形托卡马克(SMART)装置首次成功产生了托卡马克等离子体。这一进展使通过受控核聚变反应实现可持续、清洁且几乎无限的能源又近了一步。该...
01-23
  蛇年新春进入倒计时,年轻人的时尚消费热情也被浓郁的“年味”燃起。记者留意到,2025年伊始,新...
01-24
  央广网昆明2月5日消息(记者魏文青)今年是农历乙巳蛇年。蛇在中国传统文化中被赋予神秘、智慧...
02-08
  中国疾病预防控制中心发布的2025年1月健康风险提示显示,近期需要关注的急性呼吸道传染病还有人偏肺病毒、鼻病毒、腺病毒、肺炎支原体等病原体感染引起的传染病。其中...
01-21
新闻记者 康旭阳 通讯员 沈商轩实习生 何世银1月21日,全国手机、平板、智能手表(手环)购新补贴政策实施暨“年在荆楚 巳巳如意”湖北新春消费季启动仪式在武汉举行。新闻记者获...
01-22
[本站 资讯] 1月18日,海通国际发布研究报告“预测小米可能会收购蔚来,并使蔚来的换电技术得到更广泛的应用,甚至可能在专利保护下开放给其他汽车制造商使用,还预测小米、...
01-21
“若前方无路,我便踏出一条路;若天理不容,我便扭转这乾坤。”电影《哪吒2》开年“王炸”,让人看到了哪吒打破命运,勇敢做自己,最终活出自我的过程。新年刚过,国内车市异常“开卷”,...
02-06
最近热播的《大梁第一女仵作》受到许多观众的喜爱,大家不仅追剧热情高涨,还对情节和人物充满好奇。为了让大家更全面地了解这部电视剧,这里整理了一些相关信息...
02-19
近期热播的《香草的每天》因其强大的演员阵容和吸引人的剧情受到了广泛关注。这部剧不仅演员颜值高,演技也十分出色,尤其是第18集分集剧情引发了观众的热烈讨...
02-20
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮