中国“女娲”让基因组“暗物质”现原形

8个月前 来源:文汇报 观看:121

 9Bn即热新闻——关注每天科技社会生活新变化gihot.com

郭国骥(左一)在指导团队进行实验。(受访者供图)

  ?9Bn即热新闻——关注每天科技社会生活新变化gihot.com

人类基因组计划完成20多年来,超过九成的非编码序列仍是未破译的“天书”,是基因组的“暗物质”。近日,浙江大学医学院郭国骥、韩晓平教授团队在《细胞》发布最新成果,其自主研发的AI生物大模型“女娲CE”(简称NvwaCE),为破译非编码序列提供了全新的工具。

据悉,“女娲CE”大模型能从一级DNA序列出发,精准预测脊椎动物基因突变对细胞的表型影响,精度达单细胞级,准确率超90%。此外,它还成功预测并经实验验证了罕见病镰刀型贫血症的基因治疗位点,成为世界首例AI预测的人类疾病治疗性位点。

“通过深度学习,那些人类暂时无法理解的复杂语法,正在被AI学习、解析。”郭国骥就课题最新进展,接受了文汇报记者专访。

单细胞图谱,让AI大模型有了“精品教材”

人类几乎所有具体的生理机能都依靠蛋白质来完成。在人类基因组中,编码序列(对蛋白质进行编码,直接表达为蛋白质)仅占1%-2%,剩下的98%都是非编码序列(不会直接表达为蛋白质,包含调控序列)。

这98%的非编码序列,在很长一段时间内,无法被理解。近年来,随着AI和生物学研究的深入,科学家们发现,这些序列对基因的表达调控,有可能被解读。

“生命科学研究长期以‘还原论’为主,也就是科学家会将某个表型还原到某个基因,研究它的调控和功能。但进入调控序列,这种方法就行不通了。”郭国骥解释,非编码序列有一套复杂精密的“语法系统”,决定了哪个基因在何时、何地、以何种强度表达。每一个调控序列的碱基,都可能在不同时间、不同类型细胞中扮演不同角色。因此,用传统敲除验证的方法,就像盲人摸象。

2020年,郭国骥团队完成了小鼠和人类细胞图谱的一系列工作,他们开始思考,从生物的一级DNA序列寻找细胞图谱的编码模式。当时,传统学界并不理解。“凭什么一级DNA序列就会决定终极表型?”但郭国骥认为,生物的表观、表型等复杂现象的“因”,深植于DNA序列本身。从一级DNA序列出发,研究生物表型,远比直接研究生物表型特征之间的联系更能找到本质规律。

传统表型检测外貌、身高、指纹之类的宏观表型。郭国骥则将之精细到单细胞级别的分子表型。“单个细胞里面的分子是什么?我们测的是这种‘没有偏见’的分子表型。”

为此,团队在传统的ATAC测序技术上自主研发出超高灵敏度、超高通量的单细胞级测序技术UUATAC-seq,使测序灵敏度在理论上提升了4倍,通量提升了10到100倍,可以在单日内高效绘制一个物种所有类型细胞核中的染色质可及性图谱。以此为基础,团队科学家绘制出涵盖哺乳类、鸟类、两栖类、爬行类、水生类五大类脊椎动物的单细胞图谱数据集。

通过研究范式创新获得高质量的数据,是这个团队的核心科研优势所在。据介绍,国外许多顶尖的基因组AI模型,比如近日Deepmind团队预发表的AlphaGenome,都是基于ENCODE项目进行数据训练。由于该数据集年代久远、最长已超过20年,其涵盖的基本是“群体细胞”“器官细胞”或者在体外培养的“细胞系”数据,存在分辨率低、不同类型细胞混杂的问题。用这样的数据集训练AI,好比用一本内容模糊、混杂的教材教学生。

相较而言,女娲CE的训练集堪称“精品”,所有数据在同一技术标准下产生,精度达到单细胞级别,数据噪音更少,有高度的可比性与纯净性。

“可以说,我们为AI提供了迄今为止最适合学习基因调控语法的训练集。”郭国骥说。

更高精度带来惊人发现:“生命语法”比DNA序列本身更保守

与依赖大量数据、超长扫描窗口(读长)的生物深度学习算法不同,女娲CE采用多任务框架、超短扫描窗口,直接学习从一级DNA序列到生物体所有类型细胞表型的映射关系。“AI学到了一些我们人类暂时无法理解的复杂规则。”郭国骥说,通过这种规则,就能让基因组的“暗物质”开口说话,进而预测基因突变带来的后果。

借助女娲CE,以500碱基对(简称bp)的“短窗口”进行分段扫描,团队发现,在亿万年的演化长河中,脊椎动物的基因“调控语法”比其核苷酸序列本身更为保守。

“这意味着,在进化过程中,即使物种的某段调控序列和过去已完全不同,但它们最终行使的功能依然类似。”郭国骥说,这一发现对达尔文进化论中的“随机突变”提出了重要补充:脊椎动物的基因组突变并非完全随机,适者生存并非仅仅依靠环境筛选,还有一套深刻的内在调控语法约束着进化过程。“任何跳出这套语法的突变,可能胚胎都无法形成。它在接受自然选择前,就被生命底层的逻辑淘汰了。”

这一发现本身,也成为了女娲CE算法的重要组成部分,让它拥有超高泛化能力。女娲CE能够从基因组序列出发,预测未经训练物种的细胞染色质可及性蓝图,并一次性预测了包括人、猴、牛、猪、马、羊、熊猫七个物种的单细胞调控原件蓝图。

女娲CE的正式发表,也意味着中国科学家团队在AI基因组大模型研发的赛道上已先人一步。团队表示,相关数据和模型本身,将会全部开源。

世界首例AI预测基因位点成功,开拓基因治疗新路径

要知道,很多遗传性疾病、罕见病,都是因为细胞的表型异常。以往,当科学家们试图通过基因编辑手段治疗这些疾病,只能通过“神农尝百草”的方式,不断尝试,尝试几百、上千次都不算多的。但是,有了AI,就可以根据异常表型特征,让AI预测哪些基因位点最有可能让表型恢复正常。

针对镰状细胞病,女娲CE就预测出了治疗关键位点:胎儿血红蛋白基因HBG1-68:A>G。这是一个全新的、从未被记录过的位点。进一步实验显示,该位点在基因编辑后能够实现胎儿血红蛋白表达量的显著提升,这也是科学家首次在人类细胞中验证了基因组AI预测的功能性位点。

除了“女娲”,还有“华佗”“神农”……郭国骥坦言,他偏爱用中国传统神话为自己的算法命名,这既是对传统文化的致敬,也寄托了一种希望。“AI或许最终会超越人类,向着‘神性’发展,就像神话中的女娲抟土造人,帮我们理解乃至创造生命,解决人类的难题。”

郭国骥团队的下一步计划,是构建虚拟细胞,将调控元件模型与网络模型、蛋白质结构模型等模块整合,创造出“数字小鼠”乃至“数字人类”。有了这样的“数字生命”,科学家就可以高效进行虚拟实验,测试基因突变的影响或筛选疾病药物和治疗位点,从而大幅缩短研发周期、降低成本,并极大减少实验动物的使用,让未来的临床试验更安全、更精准。

业余时间,郭国骥还是一位歌者。他创作的歌曲《生命》中,有这样一句歌词:“宇宙浩瀚无穷尽,却不及她的珍贵……该如何解开基因的密锁,该如何理清神经的网络,千山万水寻寻觅觅,春去秋来上下求索。”

为生命求索,中国科学家从未停下前进的脚步。9Bn即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-8-6056-0.html中国“女娲”让基因组“暗物质”现原形

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:著名医学生物化学家、医学教育家杨同书逝世

下一篇:著名神经病学家、临床医学教育家饶明俐病逝

为你推荐
  大众网记者 司心鹏 报道  在12月13日至16日举办的第十七届山东省职业院校技能大赛(高职组)体育活动设计与实施赛项中,菏泽医学专科学校公共教学部体育教研室指导的参...
01-21
  大众网记者 秦瑾 通讯员 祁凯丽 报道  12月20日,章丘区大中小学思政课一体化协同创新联盟成立暨大中小学思政课教学展示活动在齐鲁师范学院附属中学(章丘中学)报告厅...
01-21
  本报记者 熊悦  当前正值“开门红”销售旺季,一批中小银行的大额存单产品陆续上新。  春...
02-08
  2月10日,集运指数(欧线)期货主力合约2504收涨14.22%。期货日报记者注意到,集运指数(欧线)期货主力...
02-11
天秤座的男人通常被认为是温和、理性、追求平衡的代表。他们对于爱情有着独特的追求和...
01-22
狮子座的男生通常都有一颗自信而强大的心,他们喜欢追求并征服那些吸引他们的人。当狮子...
01-22
揭晓那些令人惊艳的女明星,她们的魅力如何征服了观众说到女明星,很多人心中都会浮现出那些荧幕上的闪耀瞬间。她们不仅有着令人羡慕的外貌,更是集智慧与才华于一身。今天,我想和...
02-12
当衣橱成为画布:那些穿衣大胆的女明星在娱乐圈中,总有一些女明星以她们的穿衣风格而引人注目。她们不仅是在荧幕上出镜,更是在影响着时尚的潮流。选择挑战常规、突破传统的服装...
02-17
2月7日消息,震坤行宣布旗下AI产品:AI物料管家已接入DeepSeek V3模型,用户可以在处理海量物料数据清单时自主选择使用,至此将为企业在物料梳理相关工作环节带来更多改善。图源:震...
02-08
阿里巴巴港股成交额突破440亿港元,创历史天量,盘中股价涨超15%。消息面上,阿里巴巴昨日发布2025财年第三财季业绩公告。财报显示,阿里巴巴第三财季收入2801.54亿元,同比增长8%;经...
02-22
3月1日消息,曹操出行日前举办曹操智行自动驾驶平台上线仪式,宣布已成功构建国内首个“F立方”全域自研闭环智驾生态,同时在苏杭两地开启Robotaxi运营试点,并投放搭载吉利最新智...
03-01
3月3日消息,2025年第九届亚洲冬季运动会(以下简称“亚冬会”)近日在冰雪之城哈尔滨落下帷幕。在“亚冬会”举办期间,银联商务全力保障“亚冬会”现场和周边服务的支付便利,同时推...
03-04
国家统计局近日公布的2024年国民经济运行数据显示,2024年全国社会消费品零售总额48.7895万亿元,比上年增长3.5%;全国网上零售额15.5225万亿元,增长7.2%。过去一年,增量政策...
02-09
作者:三才真人(阴磊)在人类思想的漫长演进中,“道”一直是哲学家、思想家们不断探寻的核心。从老子的“道可道,非常道”到庄子的“道通为一”,道的内涵超越了语言的简单界定...
02-09
为纪念《消逝的光芒》问世十周年,开发商Techland宣布这款后启示录丧尸题材系列迎来重要里程碑:全平台累计玩家数突破4500万。该数据涵盖初代《消逝的光芒》与续...
01-31
前几天,经典科幻作品《攻壳机动队》官方突然发布倒计时,今天谜底揭晓,官方将举行系列全部动画作品展,届时还会包括2026年的全新作品等等,敬请期待后续详细消息。 ...
02-05
今天(2月3日)上午第九届亚洲冬季运动会火炬传递仪式在黑龙江哈尔滨启动火炬传递时间为1天传递总路线长约11公里火炬传递起点定在哈尔滨市道外区中华巴洛克街区这里是哈尔滨城...
02-03
过去一年,鹊桥二号绕月搭桥,助力嫦娥六号实现了人类首次月球背面采样返回。随着嫦娥六号任务的圆满完成,嫦娥七号任务也已经被提上日程。按照计划,我国将在2026年发射嫦娥七号月...
02-03
1月14日,记者从中国科学院合肥物质科学研究院等离子体物理研究所(以下简称“等离子体所”)获悉,由该所建设运行的国家重大科技基础设施“聚变堆主机关...
01-21
核电站是将核能转化为电能的场所但是你知道吗?核电站现在还能有个副业那就是,产珍珠!又大又白的珍珠就是我国海南昌江核电站培育出来的昌江核电站不仅...
01-22
在全面振兴新突破三年行动“首战告捷”的基础上,2024年,辽宁实现了“攻坚连胜”,地区生产总值(GDP)增速高于...
02-11
  近日,一列满载一汽商品车散件组装件的集装箱班列由长春兴隆山抵达大连铁路中心站,标志着一汽(大连)通商...
02-14
  证券时报记者吴家明  “即将到来的春节假期,我们店里每天都有同事值班,现在已经对店里挂盘...
01-21
新华社北京1月21日电(记者张辛欣、张晓洁)工业和信息化部副部长张云明在21日国新办举行的“中国经济高质量发展成效”系列新闻发布会上表示,我国已有570多家工业企业入围全球研...
01-22
1 月 21 日消息,长期以来,特斯拉一直是电动汽车领域的无可争议的霸主,其产量和销量远超竞争对手。然而,来自中国竞争对手的威胁正在逐渐显现,尤其是比亚迪正迅速追赶特斯...
01-22
蛇舞新春,科技贺岁!万众期待的2025年央视蛇年春晚如期而至。在今年的春晚舞台上,780台问界M9带来划破夜空、直穿云霄的震撼灯光表演,问界M9化身为灵动的“光影舞者”,以闪耀变幻...
01-31
最新播出的《仙台有树》收获了观众的一致好评。薛冉冉在剧中的表白引起了大家的兴趣,以下是对这一情节的分析。《仙台有树》的故事扣人心弦,薛冉冉和苏易水之...
02-19
电视剧《陌上又花开》以其高度的观赏价值吸引了众多观众,将人们带入了一个充满想象力和戏剧性的世界。制作团队和演员们的出色表现让这部剧更加光彩夺目。近...
02-21
21世纪经济报道记者 韩利明 上海报道1月20日,国家医保局发函指出,关于近期上海市“两会”期间,有政协委员、医学专家反映某些集采药品可能存...
01-21
  即将告别春节假期,你有没有不想上班、不想上学、不想起床?从“假期模式”切换到“工作模式”还不太适应?如何调整?指南请收好↓↓↓  01  什么是“节后综合征”? ...
02-07
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮