项目文章丨鮡科鱼类首个T2T基因组的组装与注释

 

黄石爬鮡隶属于鲇形目(Siluriformes)鮡科(Sisoridae)石爬鮡属(Euchiloglanis),是我国长江上游金沙江流域特有的高度适应急流环境的鱼类,在生物学和生态学上具有重要地位。面对山谷急流低温的极端环境,其进化出了一系列独特的生物学适应特征。受近年来过度捕捞、水电开发和栖息地破坏等人为活动影响,黄石爬鮡的自然种群面临严重威胁,已被列为濒危物种。为了有效保护这一特有物种,迫切需要高质量的基因组数据支持种质资源保护、遗传育种及物种恢复工作。

 
 
 
 
 

5月7日,华中农业大学水产学院杨瑞斌教授团队首次构建并发表了黄石爬鮡端粒到端粒(T2T)无间隙基因组,填补了鮡科鱼类基因组研究的空白,为深入解析硬骨鱼类在急流环境中的适应性进化机制提供了新视角,同时也为后续种质资源保护工作奠定了基础,万摩科技承担了本研究的测序和分析相关工作。

文章原名:Telomere-to-telomere gap-free genome assembly of Euchiloglanis kishinouyei

文章译名:黄石爬鮡的端粒到端粒(T2T)无间隙基因组组装

发表时间:2025年5月7日

发表期刊:Scientific Data

IF:5.8

文章链接:https://doi.org/10.1038/s41597-025-05068-8

 

研究内容

1.黄石爬鮡端粒到端粒(T2T)基因组组装

实验样本取自于一尾成熟的雌性黄石爬鮡个体,通过DNBseq平台进行全基因组测序得到60.30 Gb(~68×)的短读长原始数据。基于该数据使用GenomeScope(v2.0)在设置倍性为2的情况下,评估的单倍体基因组大小为 771.74 Mb,杂合率为 0.291%,重复含量为 38.88%(图 1)。

图1. 黄石爬鮡基因组的k-mer Depth和K-mer种类数频率分布图

 

使用HiFiasm(v0.19.6)软件,用PacBio HiFi数据(39.31 Gb (~44×))结合 ONT 超长读长数据(20.42Gb (~23×))和Hi-C数据(73.32Gb (~82×))进行黄石爬鮡的基因组初步组装。经过去冗余后获得一个基因组大小890.82 Mb 、contig N50为27.26 Mb的contig级别的基因组。用Hi-C数据辅助挂载,将整个基因组序列锚定到 27 条染色体上,锚定率为99.19%(图2)。

图2. 黄石爬鮡基因组的染色体Hi-C互作图谱

 

利用 ONT 超长读长数据进行端粒延伸和补洞,短读长数据进行纠错,得到最终黄石爬鮡T2T级别无间隙的基因组,基因组大小为886.74Mb,contig N50为33.25 Mb(图3)。

图3. 黄石爬鮡T2T基因组染色体上contig分布图

 

2.黄石爬鮡T2T基因组注释

使用从头和基于同源的方法来预测基因组的重复元件,45.59%(404.23 Mb)的序列被注释为重复序列。其中DNA 转座子占基因组的19.90%,长末端重复序列 (LTR)占 5.35%,LINE占 13.09%,SINE占 6.76%(图4)。基因预测基于从头预测、同源注释和转录组注释的方法分析,最后用MAKER和HiFAP软件整合,最终预测了24,403个蛋白质编码基因,42,924个蛋白质编码基因的转录本。

图4. 黄石爬鮡基因组圈图展示

 

对于蛋白质编码基因和转录本,使用NR、SwissProt、TrEMBL、KOG、TF 、InterPro、GO、KEGG和Pfam数据库进行功能和代谢途径注释(图5)。约94.37%的基因和94.71%转录本注释到数据库。

图5. 黄石爬鮡蛋白编码基因的功能注释数目upset图

 

根据非编码RNA的特征对其进行预测注释,成功注释了1,376个miRNA、21,818个tRNA、612个rRNA和4,379个snRNA。

 

3.黄石爬鮡T2T基因组组装和注释评估

为了评估组装基因组的质量和准确性,研究者将短读长数据和PacBio长读长数据分别与黄石爬鮡T2T基因组进行比对,短读长数据比对率和覆盖度分别为99.59%、99.05%,PacBio长读长数据比对率和覆盖度分别为99.95%、99.51%。这些结果说明测序reads和基因组的一致性高。同时分析了GC含量与覆盖深度(Depth)关联分析统计图(图6),直观地展示测序均一性。短读长和长读长的QV值分别为41.31和46.96,表明组装的准确性很高。BUSCO和Compleasm评估注释完整性,分别鉴定完整基因的比例为96.90%和96.92%,说明基因组注释的完整性很高。

图6. GC含量与覆盖深度(Depth)关联分析统计图(a:短读长,b:PacBio长读长)

 

研究结论

首个鮡科鱼类的T2T基因组组装不仅为鮡科鱼类的研究提供了宝贵的遗传数据资源,研究长江上游特色急流鱼类的适应性进化机制奠定了基础,为黄石爬鮡的人工繁育和种群恢复提供支撑,助力金沙江特有鱼类资源保护。

 

关于万摩科技

 

武汉万摩科技有限公司(下称“万摩科技”)是一家以多组学数据分析和研发为技术核心且致力于基因科技应用转化的公司。万摩科技致力于为科研院校、研究机构、测序公司、农业生产及育种公司提供软件研发、数据分析和平台开发服务,专注于基因科技在农业育种方向的应用。

 

基于二、三代基因测序,万摩科技深耕生物信息技术的开发和应用,每年完成几百个物种的基因组组装。同时,在泛基因组构建、表观遗传解析、群体演化及多组学分析等多个领域建立了极具优势的技术体系。

 

基于在遗传解析方向的积累,万摩科技深入打造面向种业的应用场景,在种质资源的考察、鉴定、信息库构建、优良性状遗传定位、创制与推广等多个领域建立了极具特色的应用体系。

万摩科技亦致力于成为一家数据公司。数据是生命科学表现与解读的承载体,数据的广泛连接与深度挖掘是基因科技应用的必经之路。万摩科技深入探索AI在基因科学领域的应用场景,聚焦于成为这一产业发展过程中的引领者,推动多组学数据多频次多维度的解析,促进组学技术的深入应用。

 

 

 

 

 

 

T:027-63494989

E: service@onemore-tech.com