中国“女娲”让基因组“暗物质”现原形

7个月前 来源:文汇报 观看:114

 F3g即热新闻——关注每天科技社会生活新变化gihot.com

郭国骥(左一)在指导团队进行实验。(受访者供图)

  ?F3g即热新闻——关注每天科技社会生活新变化gihot.com

人类基因组计划完成20多年来,超过九成的非编码序列仍是未破译的“天书”,是基因组的“暗物质”。近日,浙江大学医学院郭国骥、韩晓平教授团队在《细胞》发布最新成果,其自主研发的AI生物大模型“女娲CE”(简称NvwaCE),为破译非编码序列提供了全新的工具。

据悉,“女娲CE”大模型能从一级DNA序列出发,精准预测脊椎动物基因突变对细胞的表型影响,精度达单细胞级,准确率超90%。此外,它还成功预测并经实验验证了罕见病镰刀型贫血症的基因治疗位点,成为世界首例AI预测的人类疾病治疗性位点。

“通过深度学习,那些人类暂时无法理解的复杂语法,正在被AI学习、解析。”郭国骥就课题最新进展,接受了文汇报记者专访。

单细胞图谱,让AI大模型有了“精品教材”

人类几乎所有具体的生理机能都依靠蛋白质来完成。在人类基因组中,编码序列(对蛋白质进行编码,直接表达为蛋白质)仅占1%-2%,剩下的98%都是非编码序列(不会直接表达为蛋白质,包含调控序列)。

这98%的非编码序列,在很长一段时间内,无法被理解。近年来,随着AI和生物学研究的深入,科学家们发现,这些序列对基因的表达调控,有可能被解读。

“生命科学研究长期以‘还原论’为主,也就是科学家会将某个表型还原到某个基因,研究它的调控和功能。但进入调控序列,这种方法就行不通了。”郭国骥解释,非编码序列有一套复杂精密的“语法系统”,决定了哪个基因在何时、何地、以何种强度表达。每一个调控序列的碱基,都可能在不同时间、不同类型细胞中扮演不同角色。因此,用传统敲除验证的方法,就像盲人摸象。

2020年,郭国骥团队完成了小鼠和人类细胞图谱的一系列工作,他们开始思考,从生物的一级DNA序列寻找细胞图谱的编码模式。当时,传统学界并不理解。“凭什么一级DNA序列就会决定终极表型?”但郭国骥认为,生物的表观、表型等复杂现象的“因”,深植于DNA序列本身。从一级DNA序列出发,研究生物表型,远比直接研究生物表型特征之间的联系更能找到本质规律。

传统表型检测外貌、身高、指纹之类的宏观表型。郭国骥则将之精细到单细胞级别的分子表型。“单个细胞里面的分子是什么?我们测的是这种‘没有偏见’的分子表型。”

为此,团队在传统的ATAC测序技术上自主研发出超高灵敏度、超高通量的单细胞级测序技术UUATAC-seq,使测序灵敏度在理论上提升了4倍,通量提升了10到100倍,可以在单日内高效绘制一个物种所有类型细胞核中的染色质可及性图谱。以此为基础,团队科学家绘制出涵盖哺乳类、鸟类、两栖类、爬行类、水生类五大类脊椎动物的单细胞图谱数据集。

通过研究范式创新获得高质量的数据,是这个团队的核心科研优势所在。据介绍,国外许多顶尖的基因组AI模型,比如近日Deepmind团队预发表的AlphaGenome,都是基于ENCODE项目进行数据训练。由于该数据集年代久远、最长已超过20年,其涵盖的基本是“群体细胞”“器官细胞”或者在体外培养的“细胞系”数据,存在分辨率低、不同类型细胞混杂的问题。用这样的数据集训练AI,好比用一本内容模糊、混杂的教材教学生。

相较而言,女娲CE的训练集堪称“精品”,所有数据在同一技术标准下产生,精度达到单细胞级别,数据噪音更少,有高度的可比性与纯净性。

“可以说,我们为AI提供了迄今为止最适合学习基因调控语法的训练集。”郭国骥说。

更高精度带来惊人发现:“生命语法”比DNA序列本身更保守

与依赖大量数据、超长扫描窗口(读长)的生物深度学习算法不同,女娲CE采用多任务框架、超短扫描窗口,直接学习从一级DNA序列到生物体所有类型细胞表型的映射关系。“AI学到了一些我们人类暂时无法理解的复杂规则。”郭国骥说,通过这种规则,就能让基因组的“暗物质”开口说话,进而预测基因突变带来的后果。

借助女娲CE,以500碱基对(简称bp)的“短窗口”进行分段扫描,团队发现,在亿万年的演化长河中,脊椎动物的基因“调控语法”比其核苷酸序列本身更为保守。

“这意味着,在进化过程中,即使物种的某段调控序列和过去已完全不同,但它们最终行使的功能依然类似。”郭国骥说,这一发现对达尔文进化论中的“随机突变”提出了重要补充:脊椎动物的基因组突变并非完全随机,适者生存并非仅仅依靠环境筛选,还有一套深刻的内在调控语法约束着进化过程。“任何跳出这套语法的突变,可能胚胎都无法形成。它在接受自然选择前,就被生命底层的逻辑淘汰了。”

这一发现本身,也成为了女娲CE算法的重要组成部分,让它拥有超高泛化能力。女娲CE能够从基因组序列出发,预测未经训练物种的细胞染色质可及性蓝图,并一次性预测了包括人、猴、牛、猪、马、羊、熊猫七个物种的单细胞调控原件蓝图。

女娲CE的正式发表,也意味着中国科学家团队在AI基因组大模型研发的赛道上已先人一步。团队表示,相关数据和模型本身,将会全部开源。

世界首例AI预测基因位点成功,开拓基因治疗新路径

要知道,很多遗传性疾病、罕见病,都是因为细胞的表型异常。以往,当科学家们试图通过基因编辑手段治疗这些疾病,只能通过“神农尝百草”的方式,不断尝试,尝试几百、上千次都不算多的。但是,有了AI,就可以根据异常表型特征,让AI预测哪些基因位点最有可能让表型恢复正常。

针对镰状细胞病,女娲CE就预测出了治疗关键位点:胎儿血红蛋白基因HBG1-68:A>G。这是一个全新的、从未被记录过的位点。进一步实验显示,该位点在基因编辑后能够实现胎儿血红蛋白表达量的显著提升,这也是科学家首次在人类细胞中验证了基因组AI预测的功能性位点。

除了“女娲”,还有“华佗”“神农”……郭国骥坦言,他偏爱用中国传统神话为自己的算法命名,这既是对传统文化的致敬,也寄托了一种希望。“AI或许最终会超越人类,向着‘神性’发展,就像神话中的女娲抟土造人,帮我们理解乃至创造生命,解决人类的难题。”

郭国骥团队的下一步计划,是构建虚拟细胞,将调控元件模型与网络模型、蛋白质结构模型等模块整合,创造出“数字小鼠”乃至“数字人类”。有了这样的“数字生命”,科学家就可以高效进行虚拟实验,测试基因突变的影响或筛选疾病药物和治疗位点,从而大幅缩短研发周期、降低成本,并极大减少实验动物的使用,让未来的临床试验更安全、更精准。

业余时间,郭国骥还是一位歌者。他创作的歌曲《生命》中,有这样一句歌词:“宇宙浩瀚无穷尽,却不及她的珍贵……该如何解开基因的密锁,该如何理清神经的网络,千山万水寻寻觅觅,春去秋来上下求索。”

为生命求索,中国科学家从未停下前进的脚步。F3g即热新闻——关注每天科技社会生活新变化gihot.com

本文链接:http://www.gihot.com/news-8-6056-0.html中国“女娲”让基因组“暗物质”现原形

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇:著名医学生物化学家、医学教育家杨同书逝世

下一篇:著名神经病学家、临床医学教育家饶明俐病逝

为你推荐
山东科技大学: 山东省人民政府决定,任命: 陈绍杰为山东科技大学副校长(试用期...
01-21
辽宁省2024年下半年全国大学英语四、六级考试(CET)和高等学校英语应用能力考试(AB级)将于12月14日和15日举...
01-21
  阿里资产拍卖网络平台显示,1月11日,安邦集团持有的天津信托1.36%股权流拍。  二拍将于1月22...
01-22
经济观察网 记者 胡群 在当前的转型和重塑关键时期,中国银行业面对低息差新常态和数字金融的快速发展,如何审慎评估和应对挑战与机遇?2023年,我国商业银行净利润增速放缓,平均资...
02-13
摩羯座的男生一向以稳重、务实和有责任感而著称。他们通常不会轻易被外界的诱惑所动摇...
01-22
狮子座的男生通常都有着强烈的自尊心和领导欲望,他们喜欢被人关注和赞美。因此,如果你想...
01-22
石家庄时尚盛宴:揭秘模特T台走秀的光彩时刻当我走进石家庄的时尚中心,目光所及之处尽是华丽的灯光、绚烂的服饰,以及那些熠熠生辉的模特。在这个为期数天的T台走秀活动中,观众们...
02-12
170胖子穿搭男生秋季冬季?一、170胖子穿搭男生秋季冬季?170算中等身高吧,当然也会有腿偏短的情况,看个人的实际身材体型了。秋冬季的搭配选择还是挺多的,秋天相对来说会比较凉快...
02-22
成也流量,败也流量。抖音安全中心发布公告称,近期徐熙媛(大S)女士逝世引发广泛关注,广大网友纷纷表达哀思悼念,希望逝者能够安息。但也有部分账号借机炒作,发布谣言,违背公序良俗和...
02-08
2月11日消息,为加力推进农村电商、乡村旅游等乡村产业发展壮大,近日,农业农村部指导抖音等网络平台,开展“星乡村”“星农人”培育工作,以公益方式扶持培育一批有特色有潜力的乡...
02-11
2月14日消息,今年情人节正值周五,途牛截至目前最新预订数据显示,北京、上海、成都、沈阳、南京、广州、重庆、天津、深圳、杭州等地用户出游热情更旺。从年龄来看,85后、90后的...
02-15
3月5日消息,据晚点LatePost消息,美团CEO王兴近日召开了总监级别以上的内部沟通会,美团最高决策层S-team的每一位成员都有发言。此次是美团的15周年,除了核心本地商业,王兴提出在...
03-05
自去年底开始,黄金多头优势逐渐退却,国际现货黄金价格经历几次大跌后一度跌下2700关口,多空进入漫长的震荡周期,多头始终无法找到再度冲高的时机。  北京时间1月21日,国际现货...
01-24
最新数据显示,我国2024年粮食总产量再创历史新高,一举突破1.4万亿斤,达到惊人的1.413万亿斤,同比增加221.8亿斤。这一辉煌成就,是在克服重重自然灾害,如极端高温干旱、洪涝灾害等...
02-09
快科技1月23日消息,根据TrendForce的最新研究报告,NAND内存行业在2025年将继续面临需求疲软和供应过剩的双重压力。 为应对这一挑战,包括美光、铠侠/西部数据、三...
01-24
2月1日,开发商Tripwire Interactive宣布,恐怖第一人称射击游戏《杀戮空间3》将于 3 月 25 日发售,登陆Steam、Epic、PS5和Xbox Series X|S,游戏预购现已开启,Steam...
02-02
外交部发言人宣布:应国家主席习近平邀请,巴基斯坦伊斯兰共和国总统阿西夫·阿里·扎尔达里将于2月4日至8日对中国进行国事访问。...
02-03
据网络平台数据,截至目前,《哪吒之魔童闹海》票房(含点映及预售)破60亿,位居年度票房榜首。...
02-06
1月19日,记者从海军军医大学第一附属医院获悉,该院呼吸内科白冲、石荟教授团队,与海军军医大学组织胚胎学教研室韩超峰教授,共同揭示了良性气道狭窄发...
01-21
据物理学家组织网1月16日报道,德国基尔大学科学家研制出一款新型人工智能(AI)工具。这款工具能以高达99%的准确率,精准识别出虚假新闻,为打击在线错误信...
01-21
  中新社太原1月16日电(记者胡健)“晋祠·唐刻华严石经陈列馆”16日在山西太原晋祠博物馆开馆...
01-22
  新华社北京1月31日电(记者邹多为)据海关统计,2024年我国东北地区进出口达到1.25万亿元,同比增长1.6%,规...
02-01
央视网消息:新年伊始,从空中运输到海上航行,我国各个港口货物来往穿梭,一派繁忙景象。多地增开国际货运航线,立体交通外贸网络织密中国与世界的连接。新年伊始,墨西哥奥胜航空的全...
01-21
1月17日,为迎接中国农历蛇年的到来,重庆街头的蛇年新春装置亮相,呈现出浓浓年味。图为市民在巨型灯笼打造的新春装置处玩耍。中新社记者 周毅 摄  (新春走基层) 重庆...
01-21
1 月 21 日消息,在经过漫长的等待后,特斯拉终于开始要为安卓手机引入超宽带(Ultra-wideband,简称 UWB)技术支持了。这一技术将显著提升手机的定位精度,从而为用户带来更多...
01-21
2 月 2 日消息,深蓝 S09 大六座 SUV 在上月(1 月 29 日)公布了部分座舱内饰细节,新车以“家庭智慧旗舰”为核心定位,首次搭载智能移动中岛与鸿蒙座舱 HarmonySpace。注意...
02-02
最近热播的电视剧《春信不至夜莺来》引起了广泛关注。无论是演员的颜值、出色的演技还是富有戏剧性的剧情,都吸引了大量观众的喜爱。该剧的剧情介绍也成为了...
02-19
《难哄》穆承允是一个什么角色?在《难哄》中,穆承允是一个男四号的配角。外在形象:长相俊秀,五官偏柔,有点男生女相,但身材高挑且强壮,整体给人一种清隽明朗的感觉...
02-19
21世纪经济报道记者季媛媛 上海报道 继2023年出现上市以来首次亏损,科创板首家CRO(医药合同研发服务)企业美迪西(688202.SH)2024年的业绩继续...
01-22
这里是《21健讯Daily》,欢迎与21世纪经济报道新健康团队共同关注医药健康行业最新事件!政策动向两部门:2025年底前 所有省份要将省内异地住院...
02-05
返回

点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

点击右上角QQ

点击浏览器下方“”分享QQ好友Safari浏览器请点击“”按钮