返回上一页
AI模型解读三十亿碱基的“语法”
来源:科技日报 作者:张梦然 2026-09-11
美国加州大学伯克利分校团队创建了基因组语言模型GPN-Star,可解读30亿碱基的“语法”,在识别人类遗传变异方面更快更准。该模型利用全基因组比对数据从进化中学习内容,并以远低于大型模型的计算成本完成训练。团队同步发布全基因组预测注释,供生物学家筛选优先实验的致病变异与调控元件。相关论文9日发表于《自然》杂志。
人类全基因组约30亿个碱基对中,仅1%—2%编码蛋白质,其余包含不编码的“垃圾DNA”及控制基因表达时间、位置和强度的调控序列。非编码区域与癌症、心脏病、自闭症等疾病性状相关。要对变异基因逐个开展实验不现实,GPN-Star以DNA序列为训练对象,把4种碱基A、C、G、T作为“字母”,通过模式识别学习基因组语法,预测变异致病性并标注功能性与非功能性元素。
多数基因组语言模型直接用未比对的单基因组或跨物种未比对序列训练,计算负担大。今年早些时候发布的Evo2覆盖逾10万个物种,可从零生成完整基因组,训练使用2000余块高性能NVIDIA处理器并耗时数月。GPN-Star改用以人类、小鼠、鸡、果蝇、秀丽隐杆线虫和拟南芥分别锚定的全基因组比对:算法把多物种序列与人等参照基因组对齐,突出进化中保守与变化区域。借助这种已筛选功能信号的数据,模型只需数台处理器,训练可压缩至几天甚至数小时,并减少非功能序列干扰。
人类部分使用3种以人为锚定的比对,分别对应不同进化尺度:仅其他灵长类、广义哺乳动物、更广泛的脊椎动物。研究显示,长进化尺度的比对更擅长预测蛋白质中罕见变异的影响,这类变异进化慢、跨物种保守;短进化尺度的比对更擅长预测复杂性状相关变异,例如精神分裂症风险所涉及的大量非编码突变。小鼠、鸡、果蝇、秀丽隐杆线虫与拟南芥的模型训练证明框架可迁移至其他物种。
团队表示,他们的工作目标是用生物学先验帮助模型聚焦功能元素,而非单纯扩大参数和语料。他们已发布基于模型的全基因组评分,突出可能影响性状的变异,用于优先安排致病性实验。
- 上一篇:主动防御型无人巡检系统护卫矿山安全
- 下一篇:最遥远原始星系团发现
最新资讯- 最遥远原始星系团发现
- AI模型解读三十亿碱基的“语法”
- 主动防御型无人巡检系统护卫矿山安全
- 我国首台架空线路施工智能测算全站仪投用
- 厦门科技奖励“指挥棒”助力全链条创新
- 从基础网络链路铺设到AI智能服务输出——我国高端数
- “十五五”时期金融将加力支持科技创新
- 从基础网络链路铺设到AI智能服务输出——我国高端数
- 全球智慧共赴浦江创新之约——2026浦江创新论坛如
- 走进未来居家养老的“样板间”
- 世界政党媒体代表走进北京人形机器人创新中心
- 二百余项新产品新方案亮相,服贸会上感受“数智”脉动
- 以创新活力开辟新赛道、塑造新优势——培育发展新质生
- 从“天上”到“地上” 北斗高精度时空数据迈入新阶段
- 报告显示:AI赋能工业发展正呈现四大态势
手机版

公众号

头条号


