中国“女娲”让基因组“暗物质”现原形

2个月前 来源:文汇报 观看:72

 0on即热新闻——关注每天科技社会生活新变化gihot.com

郭国骥(左一)在指导团队进行实验。(受访者供图)

  ?0on即热新闻——关注每天科技社会生活新变化gihot.com

人类基因组计划完成20多年来,超过九成的非编码序列仍是未破译的“天书”,是基因组的“暗物质”。近日,浙江大学医学院郭国骥、韩晓平教授团队在《细胞》发布最新成果,其自主研发的AI生物大模型“女娲CE”(简称NvwaCE),为破译非编码序列提供了全新的工具。

据悉,“女娲CE”大模型能从一级DNA序列出发,精准预测脊椎动物基因突变对细胞的表型影响,精度达单细胞级,准确率超90%。此外,它还成功预测并经实验验证了罕见病镰刀型贫血症的基因治疗位点,成为世界首例AI预测的人类疾病治疗性位点。

“通过深度学习,那些人类暂时无法理解的复杂语法,正在被AI学习、解析。”郭国骥就课题最新进展,接受了文汇报记者专访。

单细胞图谱,让AI大模型有了“精品教材”

人类几乎所有具体的生理机能都依靠蛋白质来完成。在人类基因组中,编码序列(对蛋白质进行编码,直接表达为蛋白质)仅占1%-2%,剩下的98%都是非编码序列(不会直接表达为蛋白质,包含调控序列)。

这98%的非编码序列,在很长一段时间内,无法被理解。近年来,随着AI和生物学研究的深入,科学家们发现,这些序列对基因的表达调控,有可能被解读。

“生命科学研究长期以‘还原论’为主,也就是科学家会将某个表型还原到某个基因,研究它的调控和功能。但进入调控序列,这种方法就行不通了。”郭国骥解释,非编码序列有一套复杂精密的“语法系统”,决定了哪个基因在何时、何地、以何种强度表达。每一个调控序列的碱基,都可能在不同时间、不同类型细胞中扮演不同角色。因此,用传统敲除验证的方法,就像盲人摸象。

2020年,郭国骥团队完成了小鼠和人类细胞图谱的一系列工作,他们开始思考,从生物的一级DNA序列寻找细胞图谱的编码模式。当时,传统学界并不理解。“凭什么一级DNA序列就会决定终极表型?”但郭国骥认为,生物的表观、表型等复杂现象的“因”,深植于DNA序列本身。从一级DNA序列出发,研究生物表型,远比直接研究生物表型特征之间的联系更能找到本质规律。

传统表型检测外貌、身高、指纹之类的宏观表型。郭国骥则将之精细到单细胞级别的分子表型。“单个细胞里面的分子是什么?我们测的是这种‘没有偏见’的分子表型。”

为此,团队在传统的ATAC测序技术上自主研发出超高灵敏度、超高通量的单细胞级测序技术UUATAC-seq,使测序灵敏度在理论上提升了4倍,通量提升了10到100倍,可以在单日内高效绘制一个物种所有类型细胞核中的染色质可及性图谱。以此为基础,团队科学家绘制出涵盖哺乳类、鸟类、两栖类、爬行类、水生类五大类脊椎动物的单细胞图谱数据集。

通过研究范式创新获得高质量的数据,是这个团队的核心科研优势所在。据介绍,国外许多顶尖的基因组AI模型,比如近日Deepmind团队预发表的AlphaGenome,都是基于ENCODE项目进行数据训练。由于该数据集年代久远、最长已超过20年,其涵盖的基本是“群体细胞”“器官细胞”或者在体外培养的“细胞系”数据,存在分辨率低、不同类型细胞混杂的问题。用这样的数据集训练AI,好比用一本内容模糊、混杂的教材教学生。

相较而言,女娲CE的训练集堪称“精品”,所有数据在同一技术标准下产生,精度达到单细胞级别,数据噪音更少,有高度的可比性与纯净性。

“可以说,我们为AI提供了迄今为止最适合学习基因调控语法的训练集。”郭国骥说。

更高精度带来惊人发现:“生命语法”比DNA序列本身更保守

与依赖大量数据、超长扫描窗口(读长)的生物深度学习算法不同,女娲CE采用多任务框架、超短扫描窗口,直接学习从一级DNA序列到生物体所有类型细胞表型的映射关系。“AI学到了一些我们人类暂时无法理解的复杂规则。”郭国骥说,通过这种规则,就能让基因组的“暗物质”开口说话,进而预测基因突变带来的后果。

借助女娲CE,以500碱基对(简称bp)的“短窗口”进行分段扫描,团队发现,在亿万年的演化长河中,脊椎动物的基因“调控语法”比其核苷酸序列本身更为保守。

“这意味着,在进化过程中,即使物种的某段调控序列和过去已完全不同,但它们最终行使的功能依然类似。”郭国骥说,这一发现对达尔文进化论中的“随机突变”提出了重要补充:脊椎动物的基因组突变并非完全随机,适者生存并非仅仅依靠环境筛选,还有一套深刻的内在调控语法约束着进化过程。“任何跳出这套语法的突变,可能胚胎都无法形成。它在接受自然选择前,就被生命底层的逻辑淘汰了。”

这一发现本身,也成为了女娲CE算法的重要组成部分,让它拥有超高泛化能力。女娲CE能够从基因组序列出发,预测未经训练物种的细胞染色质可及性蓝图,并一次性预测了包括人、猴、牛、猪、马、羊、熊猫七个物种的单细胞调控原件蓝图。

女娲CE的正式发表,也意味着中国科学家团队在AI基因组大模型研发的赛道上已先人一步。团队表示,相关数据和模型本身,将会全部开源。

世界首例AI预测基因位点成功,开拓基因治疗新路径

要知道,很多遗传性疾病、罕见病,都是因为细胞的表型异常。以往,当科学家们试图通过基因编辑手段治疗这些疾病,只能通过“神农尝百草”的方式,不断尝试,尝试几百、上千次都不算多的。但是,有了AI,就可以根据异常表型特征,让AI预测哪些基因位点最有可能让表型恢复正常。

针对镰状细胞病,女娲CE就预测出了治疗关键位点:胎儿血红蛋白基因HBG1-68:A>G。这是一个全新的、从未被记录过的位点。进一步实验显示,该位点在基因编辑后能够实现胎儿血红蛋白表达量的显著提升,这也是科学家首次在人类细胞中验证了基因组AI预测的功能性位点。

除了“女娲”,还有“华佗”“神农”……郭国骥坦言,他偏爱用中国传统神话为自己的算法命名,这既是对传统文化的致敬,也寄托了一种希望。“AI或许最终会超越人类,向着‘神性’发展,就像神话中的女娲抟土造人,帮我们理解乃至创造生命,解决人类的难题。”

郭国骥团队的下一步计划,是构建虚拟细胞,将调控元件模型与网络模型、蛋白质结构模型等模块整合,创造出“数字小鼠”乃至“数字人类”。有了这样的“数字生命”,科学家就可以高效进行虚拟实验,测试基因突变的影响或筛选疾病药物和治疗位点,从而大幅缩短研发周期、降低成本,并极大减少实验动物的使用,让未来的临床试验更安全、更精准。

业余时间,郭国骥还是一位歌者。他创作的歌曲《生命》中,有这样一句歌词:“宇宙浩瀚无穷尽,却不及她的珍贵……该如何解开基因的密锁,该如何理清神经的网络,千山万水寻寻觅觅,春去秋来上下求索。”

为生命求索,中国科学家从未停下前进的脚步。0on即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-8-6056-0.html中国“女娲”让基因组“暗物质”现原形

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:著名医学生物化学家、医学教育家杨同书逝世

下一篇:著名神经病学家、临床医学教育家饶明俐病逝

为你推荐
  “如果不是郑皆连院士坚定的科学执言,‘世界第一拱’极有可能与我们擦肩而过。”这是广西大...
01-21
  大众网记者 王一刚 报道  1.暖·冬至  冬至,在我国农历的舞台上,它不仅是一个至关重要的节气,更是一场阖家团圆、传承民俗的文化盛宴。  为了在幼儿心底种下传统...
01-21
  摘要  【碳酸锂价格节后维持“震荡”业内人士:今年一季度或上演“躁动”行情】对于锂行业...
02-06
  近日,央行披露4家银行大额罚单,包括一家国有大行、三家股份行因涉及多项反洗钱领域违规被处罚...
02-06
射手座的男生通常被认为是自由奔放、热情洋溢的人,他们喜欢追求刺激和冒险,对于感情也是...
01-22
射手座的男生喜欢自由和冒险,他们热爱探索未知的领域,追求刺激和新鲜感。如果你想增进与...
01-22
关于穿搭的爆火文案? t恤的多种穿搭方法?一、关于穿搭的爆火文案?我的衣服并不能改变世界,但是它可以改变我的心情。你的穿搭风格决定了你的气质,让自己看起来更自信更迷人。不要...
02-12
女生短裙穿搭注意事项?一、女生短裙穿搭注意事项?1、穿裙子的时候最重要的就是看自己的比例,如果自己腿比较粗,就可以选择把裙子穿到腰部旁边一点,超过腰部一点,可以遮蔽一部分腿...
02-22
2月20日消息,苏宁易购与西门子家电将于2月21日起联合启动“德系精工智能·开年大赏”专属品牌节,通过新品首发、超级工厂直播、门店体验等系列活动,助力消费者解锁智慧生活新方...
02-21
1.阿里缓过来了开年两个月,阿里巴巴就展现出强劲的“复兴”势头,成为市场瞩目的焦点。近期,随着马云频繁亮相,公众对阿里的关注度显著提升。同时,阿里在AI领域的表现也备受瞩目。...
02-22
时隔两月,网红袋泡茶品牌“CHALI茶里”再度陷入欠薪风波。据《消费者报道》此前报道,2024年11月13日晚间,针对当时多名自称茶里的员...
02-07
图源:喜茶官网 喜茶的一封全员内部信,打响了2025年新茶饮行...
02-11
2024年国网全年电网投资首超6000亿元,预计达到6092亿元,相比2023年新增711亿元,13.2%的同比增速也为近年最高值。据国网1月15日发布的信息显示,2025年国网将进一步加大投资力度,...
01-22
2024国庆长假第一天,北京奥林匹克公园人头攒动,往来如织的人群中一道道“奇装异服”的身影吸引了游客注目,银发雪衣的雪女,斗笠披风的侠客,长尾兽耳的萌娘,子衿青青的儒生……原来...
01-23
《最终幻想7:重生》PC版即将于北京时间1月23日晚上10点解锁,该作PC版媒体评分现已解禁,M站目前共收到29个评论,均分90,其中22个好评、1个中评,6个暂未给出评分。另外...
01-24
近日武侠电影《笑傲江湖》角色海报发布。天下英雄各展身手,谁能最终问鼎武林?江湖恩怨诸多是非,还请诸君敬请期待! 《笑傲江湖》电影将于1月28日(除夕)在腾讯视频...
01-25
极目新闻记者 涂梦蝶非遗三节龙、傩仪舞蹈、广场烟花秀……走进湖北省云梦县祥云湾文旅度假区,仿佛参加一场战国游园会。近日,极目新闻记者了解到,春节期间,云梦县祥云湾文旅度...
02-04
极目新闻记者 李迎 近日,南京市红山森林动物园饲养员为一只离世河马手写讣告,回忆了河马最后阶段的点点滴滴,字里行间真诚动人。2月5日,红山动物园回应称,为离世动物写讣告为园方...
02-05
北京时间1月18日,执行中国第41次南极考察任务的“雪龙2”号极地科考破冰船到达阿蒙森海预定作业站位,开始为期约一个月的大洋考察。“雪龙2”号大洋...
01-21
据发表于1月13日《自然·通讯》杂志的一项研究,西班牙国家癌症研究中心领衔的团队发现一种由线粒体蛋白控制的脂肪消耗机制。该机制有助于科...
01-24
  一场降雪,光顾辽沈大地,“兆丰年”的同时,也为归乡人的安全畅行带来了些许麻烦。辽宁交投高速运营公司...
01-27
  2月6日,记者从省气象局获悉,1月全省平均降水量13.1毫米,比常年同期偏多2.2倍,为1961年以来历史同期第四...
02-07
新闻记者 张秀娟 实习生 赵子豪春节临近,牛羊肉作为年夜饭餐桌上的“硬菜”代表,其销售也迎来旺季。“用来滋补的牛尾,适合煨汤的瓦沟和炖煮入味的牛腩,近日销量都不错。”武汉...
01-21
  海报新闻记者 孙佃潇 北京报道  1月21日,海报新闻记者从交通运输部获悉,春运期间,河北聚焦新能源车出行增多等特点,全面开展充电能力倍增行动,加快充电基础设施建设,切实...
01-22
[本站 国内谍照] 1月18日,我们从相关渠道获取到了一组疑似吉利银河旗下全新轿车的路试谍照。从多处细节来看,该车或将归属星舰系列的全新插混车型,从而与星舰7 EM-i等车...
01-21
1 月 28 日消息,据日经亚洲报道,日本本田汽车公司计划最早于 2026 年在北美市场推出一款售价低于 3 万美元(备注:当前约 21.8 万元人民币)的小型电动汽车,以加快在纯电动...
01-29
《余烬之上》男主是谁的孩子?男主是谁扮演的?《余烬之上》有双男主,廖思远和廖知白是兄弟,他们是廖氏夫妇的孩子。剧中,一场十年前的大火让廖氏兄弟廖知白和廖思...
02-21
电视剧《难哄》中的钟思乔职业成为了近期热门话题。该剧开拍前就吸引了大量粉丝,随着剧集播出,更多观众加入粉丝群体,对剧情充满期待,并对钟思乔的职业感到好奇...
02-22
  近日公布的新版医保药品目录新增91种药品,目录内药品总数增至3159种,参保人的“药篮子”再次升级。医保目录是如何诞生...
01-21
美国时间1月13日至16日,一年一度的摩根大通医疗健康会议(J.P. Morgan Healthcare Conference,简称JPM大会)在加利福尼亚州旧金山成功举办。JPM...
01-21
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮