WES vs WGS:生信视角下的测序策略抉择

一个 WES trio,从 FASTQ 到 VCF 再到 ACMG 评级,标准管线跑完,剩下 5 个候选变异—全部 VUS,无一能报。但你知道,这张 BAM 文件里还有没被翻过的角落:探针侧翼的 CNV 信号、off-target 里溢出的线粒体 reads、少数几个 STR 位点残留的 flanking 覆盖。如果换个角度重新挖一遍—不额外花一毛钱实验成本——这些"副产物"可能就在你下一个阳性报告里。同时你也知道,有些事情 WES 就是做不到。非编码区的深度内含子变异、复杂结构重排、重复扩增的精确定量—这些只能等 WGS。所以真正的问题是:WES 这张牌,你出到第几层了?什么时候该摊牌上 WGS?这篇文章从生信管线视角出发,分三步讲清楚:先把你手里的 WES 数据"榨"到极致(CNV + 线粒体 + STR),再对比 WGS 真正不可替代的场景,最后给出从 WES 到 WGS 的决策路径图。

01

WES 不止是 SNV/indel ——一张数据的"榨干"指南

很多实验室做完 WES,分析完 SNV 和 indel 就把原始数据打入冷宫了。但 WES 数据里的信息远不止这些。利用得当,同一张 WES 数据可以同时产出 CNV、线粒体变异、甚至 STR 重复扩增的筛查结果—相当于一份检测、四份报告的产出的密度。下面逐个拆解。

1.1 基于 WES 的 CNV 分析

原理概述

WES-CNV 分析的核心思路是"read depth"策略:在同一批次内比对各个外显子区域的 reads 数,通过统计模型识别偏离预期的拷贝数变化。与 WGS-CNV 不同,WES 数据存在天然的捕获偏差(探针效率不均、GC 含量依赖、PCR 扩增偏好),因此专用的校正算法和参考集构建至关重要。

主流工具对比

临床共识:建议采用至少 2 个工具取交集(consensus calling),可大幅降低假阳性率。有研究用 GATK-gCNV + ExomeDepth + CODEX + cn.MOPs 四工具 consensus,WES-CNV 与 CMA 验证一致率 >90%。


1.2 基于 WES 的线粒体 DNA 分析

原理概述

WES 的探针设计目的是富集核基因组的外显子,但线粒体基因组(mtDNA,~16.6 kb,高拷贝数)天然存在于全细胞裂解液中,因此 WES 文库中不可避免地会携带大量的 mtDNA "off-target" reads。这些 reads 虽然未被探针主动抓取,但由于 mtDNA 的拷贝数极高(每个细胞数百到数千个),在 WES 数据中的覆盖率通常可以达到数十甚至数百倍——足以进行全线粒体基因组分析,包括异质性(heteroplasmy)检测。值得关注的是,当前许多实验方案已在探针设计中增设mtDNA补充探针,可进一步将覆盖深度提升至上千倍,显著增强了线粒体变异的检测效能。

关键生信策略

  • reads 分离:将比对到 mtDNA(rCRS/RSRS 参考序列)的 reads 单独提取。

  • 变异检测:与核基因组 SNV 检测不同,mtDNA 分析必须提供等位基因频率(heteroplasmy fraction),而非简单的 genotype。通常需报告 AF≥5% 甚至更低水平的异质性变异。

  • 单倍群分类和变异致病性注释:基于 PhyloTree 进行 haplogroup 预测,并配合 Mitomap、HmtDB 等数据库进行致病性评估。

主流工具

  • MToolBox:最经典的 mtDNA 分析管线,支持 BAM/FASTQ 输入,自动完成 reads 提取→基因组组装→异质性检测→单倍群分类→变异优先级排序。

  • 自行搭管线:核心流程为 BWA-MEM 双比对(先 mtDNA 后核基因组去 NumtS)→ GATK Mutect2 / VarScan2 → 异质性 AF 计算 → 数据库注释。

临床价值:约 1-3% 的 WES 阴性病例可通过 mtDNA 分析找到致病变异——在不增加任何实验成本的情况下,仅凭生信管线的拓展即可捡回这些诊断。


1.3 基于 WES 的 STR/重复扩增筛查

原理概述

WES 检测 STR 重复扩增在技术上先天处于劣势——外显子捕获探针通常只覆盖基因编码区及其近端侧翼序列,而许多致病性重复扩增位于 5'-UTR、3'-UTR 或内含子区域,探针覆盖不全。但近年多个团队证明,利用 WES 外显子区域内含重复序列的"spillover" reads 以及捕获侧翼的 flanking reads,仍可对部分已知 STR 位点进行筛查——尤其是在捕获设计包含相关区域的试剂盒上。

工具对比

重要补充:WES-STR 分析应当定位为"筛查"而非"诊断"。exSTRa 等工具可以在 WES 数据中标记可疑的重复扩增信号,但阳性结果必须通过 PCR + 毛细管电泳或 Southern blot 进行验证确认。


1.4 其他值得关注的 WES 拓展分析

  • SMN1/SMN2 拷贝数分析:脊髓性肌萎缩症(SMA)的致病基因 SMN1 与高度同源的假基因 SMN2 仅差 1 个碱基。利用 WES 在该位点的 reads 深度差异可估算拷贝数,已有工具如 SMN-CopyNumberCaller 支持。

  • LOH/HRD 分析:肿瘤 WES 中,杂合性缺失(LOH)和同源重组缺陷(HRD)评分可直接从 SNP 等位基因频率分布中计算(如 scarHRD、Sequenza),无需额外实验。

  • 假基因/同源基因分析:PKD1、CYP21A2、PMS2 等基因因存在高度同源的假基因,WES 短读长 reads 可能无法唯一比对。但通过解析比对质量、使用专门流程(如 ParalogMapper),可在一定程度上克服。

  • 病毒整合/感染筛查:WES 数据中的非人源 reads 可被分离用于筛查特定病原体(如 CMV、EBV)——虽然不是常规用途,但在免疫缺陷相关遗传病诊断中有潜在价值。


02

WGS 的生信优势——不是"量变",是"质变"

上面我们看到,WES 数据通过生信的"榨干"策略已经能做到不少事。那 WGS 的生信管线优势到底在哪?答案是:WGS 的优势不在"多做几项分析",而在于彻底消除 WES 生信管线中那些系统性且无法弥补的偏差。

优势一:均一覆盖,SNV 检测盲区大幅缩小

WES 的捕获步骤是"罪魁祸首"——探针在高 GC、低复杂度区域的杂交效率天然偏低,导致的覆盖缺口是系统性的、无法通过增加测序深度完全弥补的。Belkadi et al.(2015, PNAS)对同一样本进行 WES 和 WGS 比对,发现 WGS 比 WES 多检出了约 650 个高质量编码区 SNV。从生信角度看:这些"漏网"变异不会出现在任何 WES 的 VCF 文件中——不是"被过滤掉了",是"根本没被测到"。而 PCR-free WGS 从根本上消除了捕获偏差和 PCR 扩增偏好。

优势二:结构变异检测——从"猜"到"看"

WES-CNV 本质上是在 reads depth 这一维度的信息上"猜"结构变异,它无法检测以下类型:倒位(inversion)、平衡易位(balanced translocation)、插入(insertion)、复杂基因组重排(chromothripsis 等)。而 WGS 的 SV 检测拥有多维信息:paired-end reads 的插入片段长度异常(insert size anomaly)、split reads 直接跨越断裂点、reads depth 变化。三路信息合一,可以检测出全谱 SV 类型。

WGS SV 检测主流工具

🔹Manta:Illumina 官方推荐,同时检测 germline 和 somatic SV,速度最快,适合临床管线

🔹DELLY:基于 paired-end + split-read + read-depth 三信号整合,SV 类型覆盖最全

🔹GRIDSS:基于 assembly-based 方法,对插入检测和新序列插入有独特优势

🔹SVABA:Broad 出品,对 indel 和中等大小 SV 检测出色,常与 Manta 配合使用

香港基因组计划(HKGP, 2025)的数据很能说明问题:322 例临床高度怀疑遗传病的患者,WGS 确诊率 42.9%,其中 19 例(13.8%)是 WES 技术上无法检测的结构变异——这些正是 SV caller 的"主战场"。

优势三:STR/重复扩增——WGS 的真正主场

我们在 1.3 中讨论的 WES-STR 分析,本质上是在"残缺数据上强行打补丁"。WGS 才是 STR 分析的真正主场:ExpansionHunter + REViewer 的组合已被 Genomics England 和 Illumina 临床服务实验室验证,在 13 种常见神经遗传性 STR 疾病中灵敏度 >97%。关键的是,ExpansionHunter 可以利用 IRRs(in-repeat reads)和 OTS(off-target sites)来估算超过读长的扩增等位基因—WES 数据的覆盖设计根本无法提供足够的 IRRs 信号。

优势四:非编码区——优势也是负担

WGS 可以检测深内含子剪接变异和非编码调控区变异,这是 WES 无法触及的领域。但生信挑战也随之而来:30× WGS 的原始变异数约 400-500 万个——比 WES 的 ~2-5 万多了两个数量级。其中绝大部分位于非编码区,而目前非编码区变异的注释、预测和致病性评级远不如编码区成熟。SpliceAI、CADD、RegulomeDB 等工具能帮上忙,但临床级解读仍高度依赖人工判读和功能验证。

03

生信分析方法全景对比


04

实操建议:最大化一管血的价值

先看一张推荐的 WES 最大挖掘管线

原始 FASTQ → FastQC 质控 → BWA-MEM 比对到 hg38 → MarkDuplicates → BQSR

├─ 主线:GATK HaplotypeCaller → SNV/indel VCF → 注释(VEP/ANNOVAR)→ ACMG 评级
    ├─ 副线1:CNVkit + ExomeDepth(consensus)→ CNV BED → AnnotSV 注释
    ├─ 副线2:Varscan2 → mtDNA VCF + 异质性 AF →  致病性注释
    └─ 副线3:ExpansionHunter → 可疑扩增位点 → PCR 验证

实操要点

  • 批次管理是 WES-CNV 的生命线:CNVkit和 ExomeDepth 都依赖于批次内归一化。跨批次混用参照集会严重影响 CNV 调用准确率。建议以捕获试剂盒 + 测序平台为分组依据,确保同批次内的样本用相同试剂和平台。

  • 线粒体分析不要用标准 GATK 流程:mtDNA 是多拷贝环形DNA,标准 GATK 的 ploidy model 不适用。必须用专用的 mtDNA 工具(MToolBox 或 Mutect2)。

  • WES-STR 的期望管理:告知临床端"这是筛查不是诊断",阳性必须验证。

  • 重分析是真正的"免费升级":WES 数据不是一次性消费品。随着 ClinVar 更新、新致病基因发现、生信工具迭代,WES 重分析可以额外捡回 10-15% 的诊断。

  • 从 WES 升级到 WGS 前,先确认你"榨干"了 WES 数据:在考虑让患者花更多钱做 WGS 之前,先跑完 CNV + 线粒体 + STR 三条副线、完成最新版重分析——很多 WGS 能检出的东西,其实在这几步中已经可以拿到。


05

结语

WES 和 WGS 不是"下级"和"上级"的关系,而是两种不同策略选择。

对生信团队而言,真正的竞争力不在于"我们有 WGS 管线",而在于:一张 WES 数据你能产出几个维度的分析?你的 CNV pipeline 和 CMA 的一致率是多少?你的 mtDNA 分析是否包含 NumtS 过滤和异质性阈值校准?你有没有建立定期重分析的机制?

把这些做扎实了,再做 WGS 升级决策时,心里就有底了——你知道 WGS 多拿到的诊断率中,有多少是 WES 通路优化后也能拿到的,又有多少是只有 WGS 才能捕获的"真正增量"。


06

参考资料

1.Babadi M, Fu JM, Lee SK, et al. GATK-gCNV enables discovery of rare copy number variants from exome sequencing data. Nature Genetics, 2023; 55:1589-1597.

2.Belkadi A, et al. Whole-genome sequencing is more powerful than whole-exome sequencing for detecting exome variants. PNAS, 2015; 112(17):5473-5478.

3.100,000 Genomes Project Investigators. Whole genome sequencing in previously undiagnosed rare disease families. NEJM, 2023.

4.Ewans LJ, et al. Whole exome and genome sequencing in Mendelian disorders: a diagnostic and health economic analysis. EJHG, 2022; 30:1121-1131.

5.Clark MM, et al. Meta-analysis of diagnostic and clinical utility of genome and exome sequencing. npj Genomic Medicine, 2018; 3:16.

6.Calabrese C, et al. MToolBox: a highly automated pipeline for heteroplasmy annotation. Bioinformatics, 2014; 30(21):3115-3117.

7.Tankard RM, et al. Detecting expansions of tandem repeats in cohorts sequenced with short-read sequencing data. AJHG, 2018; 103(6):858-873. (exSTRa)

8.Dolzhenko E, et al. ExpansionHunter: sequence-based tool for tandem repeat genotyping. Bioinformatics, 2019.

9.Genomics England Rare Disease Genome Analysis Guide — Short Tandem Repeats, 2024.

10.Illumina. A whole-genome sequencing pipeline for diagnosing repeat expansion disorders, 2024.

11.HKGP. Technically challenging variants detected by WGS in patients with high clinical suspicion of rare diseases, ScienceDirect, 2025.

12.Hong X, et al. Benchmarking germline CNV calling tools from exome sequencing data. Scientific Reports, 2021; 11:14416.

13.Consensus-based detection of CNVs for syndromic orofacial clefts utilizing WES of case-parent trios. PMC, 2025.

14.Implementation and clinical utility of GATK gCNV pipeline for rare disease diagnostics using WES. BelBi 2025.

15.Golden Helix. WES vs WGS — Choosing the Right Sequencing Strategy (clinical comparison guide).


关于康测   


about SEQHEALTH

武汉康测科技有限公司成立于2016年,公司坐落武汉,先后获得国家高新技术企业、3551创业人才企业、3551长期创新人才企业、科技小巨人企业、瞪羚企业等认证。

康测科技致力于新一代组学技术的开发和在生物医学研究领域的应用。公司以绝对定量测序技术和自动化IP技术为核心,建立了涵盖基因组、表观基因组、转录组、表观转录组、免疫组和互作组在内的全面的组学服务体系。技术水平在植物、微生物、动物复杂组织的表观遗传研究领域处于行业领先地位,已完成项目数达10000+,拥有数十台高通量核酸提取、QC、IP、建库、pooling、二/三代测序等自动化生产平台。

下辖武汉康测医学检验有限公司,康测医学依托高通量测序技术平台,为医生和患者提供精准的实体瘤、血液肿瘤、遗传病及大健康领域的临床基因检测服务。以SMP液态活检技术为核心,为患者提供高度灵敏、准确的MRD检测服务;同时提供一站式、自动化MRD建设方案。

✅ 电话:027-65563640

✅ 邮箱:medical@seqmed.cn

✅ 官网:www.seqmed.cn

链接已复制,请打开微信粘贴分享