当前位置:
经典案例 | 近乎完整黄瓜参考基因组和多组学数据库Cucumber-DB发布!

经典案例 | 近乎完整黄瓜参考基因组和多组学数据库Cucumber-DB发布!

2024-07-05 17:37

近期,中国农业科学院蔬菜花卉研究所在Molecular Plant上发表了研究成果,报道了近乎完整的黄瓜基因组组装、迄今为止最全面准确的基因/转录本结构注释以及黄瓜基因和转录本表达图谱。


图片


文章题目


A near-complete cucumber reference genome assembly and Cucumber-DB, a multi-omics database


第一作者:Jiantao Guan, Han Miao, Zhonghua Zhang, Shaoyun Dong

通讯作者:Shengping Zhang

通讯单位:中国农业科学院蔬菜花卉研究所

杂志:Molecular Plant

影响因子:17.1/Q1

文章链接:

https://doi.org/10.1016/j.molp.2024.06.012

黄瓜数据库:

http://www.cucumberdb.com/


研究背景


黄瓜(Cucumis sativus L.)是重要的蔬菜作物,也是葫芦科植物遗传学和基因组学研究,特别是植物性别决定和维管发育研究的重要模型。作为蔬菜作物中第一个测序的基因组,黄瓜参考基因组一直是比较基因组学和遗传研究的重要遗传资源。然而,利用PacBio长读数数据生成的最新版黄瓜Chinese Long参考基因组(CLv3.0)并不完整。装配完整性如此之低(约62%)主要是由于黄瓜中45s rDNA和微卫星复杂重复序列所占比例较高(约30%),大大高于拟南芥、水稻、玉米和西瓜等许多其他物种,后者所占比例不到5%。


技术方案


PacBio HiFi➕ONT➕Hi-C综合测序

转录组测序与分析


研究意义


通过将本研究数据与公开数据集整合建立了多组学数据库Cucumber-DB,该数据库事将大量基因组和转录本数据与多种数据挖掘工具结合在一起的综合平台,目标是整合新兴的组学数据和先进的人工智能技术(如人工智能育种),以加快黄瓜育种进程。


图片

▲(A):CLv4.0和CLv3.0基因组序列的共线性和基因组特征比较分析


利用PacBio HiFi、ONT和Hi-C综合技术对黄瓜材料进行了测序, 在使用HiFi数据进一步纠错后,最终的基因组组装(命名为Chinese Long v4.0 ,CLv4.0)大小为321.53 Mb ,只有第2条染色体上有一个缺口。


CLv4.0汇编成功填补了CLv3.0里72个缺口中的71个,增加了95.32 Mb的序列。这些新序列的大部分(87.28%)位于异染色质区域,包括卫星序列(I/II/III/IV型)、45S rDNA序列和转座元件(TE),这使得III型卫星序列和45S rDNA的很大一部分(73.78%,8.29 Mb)得以完整组装,唯一剩下的缺口位于Chr.2。


研究人员在着丝粒周围区域检测到了8个和22个大型I/II型和IV型卫星阵列(>100 kb),在着丝粒区域或其附近检测到了28个大型III型卫星阵列。所有七个着丝粒都已完全解析,其位置是根据已发表的使用CsCENH3抗体进行染色质免疫沉淀测序的CsCENH3富集水平确定的。七个着丝粒的平均长度为0.87 Mb,其中最长的在第4号染色体上(1.08 Mb),最短的在第2号染色体上,这表明着丝粒的长度与染色体的大小无关。着丝粒的主要成分是177-bp的III型卫星DNA,平均占78.24%,其次是Copia型(14.50%)和Gypsy型LTR。此外,所有13个富含卫星的亚端粒区都扩增了11.11 Mb,在Chr.6末端解析出了一个完整的端粒。


图片

(B):CLv4.0和CLv3.0基因组组装的5个主要重复序列的长度

(C):黄瓜CLv4.0和CLv3.0基因组中Copia和Gypsy LTRs的拷贝数

(D):饼状图显示了EVM、Illumina和Iso-Seq转录本在CsRTD1中的比例

(E):与CLv3.0注释相比,CsRTD1中的5'UTR、3'UTR、CDS和外显子的长度有显著改善

(F):与CsRTD1(橙色)相比,CLv3.0注释中mis-split和mis-merged基因的示例(紫色)


与CLv3.0相比,CLv4.0组装还发现TE长度增加了两倍多(140.72 Mb对比62.55 Mb)。Copia型LTRCLv3.0中的丰度低于Gypsy型LTR,但在CLv.4.0中显示出较高的丰度,表明其在之前的组装中代表性不足。之前的一项研究表明,黄瓜中的LTRs在大约100万年前出现了一次新的爆发,但这并不影响甜瓜或西瓜。研究所得的近乎完整基因组显示,与Gypsy型LTR 不同,Copia型LTR是这一近期爆发的主要贡献者。这些发现表明CLv4.0作为参考基因组的质量较高。


研究人员采用多种方法评估CLv4.0集合的准确性和完整性,原始数据包括HiFi、ONT和NGS读数)被重新映射到CLv4.0集合,实现了超过99.7%的高映射率。测序读数在整个基因组中显示出均匀的覆盖率,除了单个间隙和不完整的亚基因组区域,来自未组装重复序列的读数也被比对。Merqury k-mer分析得出的质量值达到56,表明CLv4.0组装的准确性很高。此外,BUSCO评估组装完整性为98.8%,LTR组装指数(LAI)为11.1。CLv3.0和CLv4.0基因组之间的共线性分析发现了Chr.3上的两个大的倒位(>100 kb)。通过比较使用Chinese Long的Hi-C数据构建的CLv3.0和CLv4.0基因组的Hi-C接触矩阵,进一步验证了CLv4.0中这些区域的准确组装。


CLv3.0注释缺乏选择性剪接和转录本信息,而这些信息对于accurate transcript quantification(转录本定量)和differential transcript usage (DTU)分析至关重要。为了实现全面准确的基因组注释,研究人员制备了168个样本,代表了处于不同发育阶段的29种不同组织,以及经过七种非生物和生物胁迫处理的叶片,还对所有168个样本进行了ssRNA-Seq处理。通过整合和人工校正构建了第一个版本的黄瓜参考转录本数据集(CsRTD1),其中包括27,360个蛋白编码基因和177,571个转录本,平均每个基因有6.6个转录本。值得注意的是,绝大多数(87.92%)的转录本都表现出了由Iso-Seq长读数数据推导出的结构,剪接接头和转录起始与终止位点都得到了准确定义。CsRTD1的BUSCO得分为99.19%,只有0.62%的基因缺失,表明基因组注释接近完整。


在CsRTD1注释中共发现了5070个新的蛋白编码基因,与CLv3.0注释相比,有1875个基因位于以前未知的区域。表达图谱中有60.69%的基因(1138 个)在一个以上的组织中表达。对这些基因进行的GO分析显示了与苹果酸酶活性、氧化还原酶活性、初级代谢过程和有丝分裂细胞周期相关的重要terms。还发现了四个新的Cs-ACS7基因,它们编码乙烯生物合成途径中的限速酶,其中三个Cs-ACS7基因在热休克后3或6小时内上调,表明它们在热耐受性方面的潜在作用。


图片

▲(G):黄瓜数据库的数据资源、工具包概述以及功能示例


尽管发布了黄瓜基因组变异图谱和泛基因组,但由于没有专门的黄瓜数据库,这些宝贵资源的充分利用一直受到限制。为了解决这个问题,研究人员开发了黄瓜数据库(http://www.cucumberdb.com/),这是一个整合了大量基因组学和转录组学数据的多组学数据库。


这个综合数据库包括三个主要数据集和工具:(1)黄瓜基因组组装和注释:除CLv4.0组装外,Cucumber-DB还提供11个更具代表性的黄瓜基因组组装,包括三个野生种和八个栽培品种

(2)黄瓜变异组:以CLv4.0基因组为参考,从115个核心种质登录的公共重测序数据中鉴定出863万个SNP和180万 InDels;此外,通过将11个代表性基因组与CLv4.0基因组进行比对,检测到了13,551个SVs;还精确定位了黄瓜驯化和分化过程中受到选择的重要基因组区域,以便进行系统发育分析;

(3)黄瓜转录组:利用CsRTD1和大量ssRNA-seq数据创建了全面的基因表达图谱;还加入了用户友好型eFP查看器,以显示空间和胁迫响应基因表达模式,这有助于缩小定位克隆候选基因的范围。


图片

▲Cucumber-DB首页


选择性剪接(AS)调节着各种生物过程中的基因表达和功能,图谱提供了转录本序列和表达谱以及AS信息,为研究AS对特定基因的影响提供了新的见解。例如,在Iso-Seq长读数的支持下,辅助素反应蛋白基因CsARP1(CsaV4_7G000369)检测到了三个不同的转录本,其中包含两个AS事件。CsARP1是CsCRC的直接下游靶标,这三个转录本在整个图谱中显示出不同的表达水平和模式,可能是由于AS事件所致。


还构建了共表达网络以协助进行详细的功能分析,如探索TF的下游靶标。此外,研究人员还创建了一套用户友好型工具包,包括用于序列检索的GetSequence模块、用于序列比对的BLAST模块、ID转换模块、用于PCR的引物设计模块、用于功能分析的GO/KEGG富集模块以及用于基因编辑的CRISPR设计模块。


电话咨询:18802948053
QQ咨询:958097137
微信客服
扫码咨询