2016年12月,国际学术期刊《核酸研究》(Nucleic Acids Research)发表了中国科学院北京生命科学研究院计算基因组学实验室赵方庆团队题为The combination of direct and paired link graphs can boost repetitive genome assembly 的最新研究成果。该研究基于序列重叠部分构建了contig的直接连接信息图,并在其配对连接信息的帮助下,解决了由短片段重复序列造成的基因组拼接碎片化问题,在保证准确性的前提下延伸了序列的长度,获得了更完整、间隙更少的基因组序列。
一直以来,重复序列都是基因组拼接的主要限制因素,而富含短片段重复序列区域的组装更是难以跨越的障碍。这部分序列的缺失会导致基因断裂,使某些关键遗传信息在后续的研究分析中被遗漏。此前的序列组装算法仅仅使用配对连接信息,忽视了contig本身的连接关系,不仅使算法难度增加,而且拼接结果也存在间隙序列多、错误连接多等问题。特别是对于短片段重复序列,历来的组装算法都选择直接丢弃,使得短片段重复序列富集区域无法有效拼接。
针对这种情况,赵方庆团队开发了基于直接连接信息的基因组组装算法inGAP-sf。该方法根据德布鲁因图的特征,基于contig的重叠部分构建了直接连接信息图,在配对连接信息的监督下拓扑路径,并对这些路径进行整合,同时引入了贝叶斯模型用于去除错误路径,从而得到高质量的拼接结果。通过在多个模拟数据和真实测序数据上的测试,inGAP-sf的结果与其他方法得到的拼接序列相比,连续性、准确性、完整性都有明显的提高。该研究使用的拼接策略极大程度地完善了已有序列组装算法的不足,为序列拼接提供了新的思路。inGAP-sf已发布在https://sourceforge.net/projects/ingap-sf,供相关研究人员使用。
该工作由赵方庆课题组的史文聿和冀培丰共同完成,并得到国家自然科学基金委和科技部重点研发计划的经费支持。
inGAP-sf算法流程
橡胶树是天然橡胶的主要来源。“橡胶树育种面临的主要困难在于周期长和效率低,通过常规育种方法将多抗、高产性状聚合往往需要30~40年。”中国热带农业科学院橡胶研究所研究员程汉告诉《中国科学报》。然而,目......
记者宋喜群、冯帆从山东农业大学获悉,该校农学院教授孔令让研究团队首次组装了小麦远缘杂交常用物种中间偃麦草和鹅观草染色体水平的高质量基因组序列,解析了二者基因组结构差异与独立多倍化演化路径,对两者携带的......
近日,中国农业科学院烟草研究所烟草功能基因组创新团队发现烟草分枝发育“开关基因”,预示着未来作物株型调控有了新靶点。相关研究成果发表在《植物生物技术》(PlantBiotechnologyJourna......
薇甘菊作为全球十大最具危害的恶性入侵杂草之一,以其惊人的繁殖速度和强大的环境适应性,在亚洲、太平洋地区及中国华南地区造成严重生态破坏。然而,其基因组层面的适应性进化机制长期未被系统解析,制约了科学防控......
近日,中国科学院大连化学物理研究所研究员周雍进团队与上海交通大学副教授鲁洪中合作,在酵母系统生物学研究中取得新进展。研究团队通过整合分析全球1807株酿酒酵母菌株的基因组与生态位数据,构建了高覆盖度的......
近日,中国农业科学院农业基因组研究所农业基因编辑技术创新团队深入解析了中亚野猪种群在跨越欧亚大陆百万年的迁徙历程中适应环境的独特遗传密码,为理解大型哺乳动物如何应对环境变化提供了全新视角。相关研究成果......
人类基因组中超98%的遗传变异位于非编码区,这些变异通过调控染色质可及性、三维构象、剪接加工等多种分子机制影响基因表达,最终导致疾病发生。由于调控机制的复杂性和细胞类型特异性,目前解读非编码变异的分子......
近日,中国科学院生物物理研究所徐涛研究组和何顺民研究组在《基因组、蛋白质组与生物信息学报》杂志发表论文。两位科学家牵头的“女娲”中国人群基因组计划旨在构建中国人群的全基因组数据资源,支撑中国人群的疾病......
中外团队历时10年,在东南亚人群基因组研究领域取得里程碑式突破。北京时间14日晚,“东南亚人群基因组计划”首期成果发表在国际期刊《自然》上,东南亚人群的遗传演化之谜被揭开。论文通讯作者之一、中国科学院......
东南亚是全球最重要的人类演化区域之一。该地区人群拥有极高的遗传多样性,但基因组学研究长期缺失,制约了人类环境适应性进化与疾病遗传机制的深度解析,因而被称为全球人类基因组研究“最后一块拼图”。中国科学院......