肠道菌群检测 — 一份16S报告背后的生信全流程

同一份粪便样本,分送两家实验室,拿回来的报告却对不上:这边说双歧杆菌占比 8%,那边写 5%;这边列了"普拉梭菌属偏低",那边压根没提这个菌。先别急着怀疑"有一家测错了"。肠道菌群检测从样本到报告,中间要经过一长串生物信息学处理—测什么区域、用什么数据库、怎么归一化、怎么统计,每一个环节的选择都会改变最终数字。这篇文章,我们把这条流水线打开,看看一份报告到底是怎么"算"出来的。


1

先明确:肠道菌群检测到底在测什么?

目前临床上常见的肠道菌群检测,主要有三条技术路线,它们测的东西、能回答的问题并不一样:

为什么16S是主流?细菌的 16S rRNA 基因有几个特点:所有细菌都有、长度适中(约1.5 kb)、既有高度保守的区域(用来设计"通用引物",一把抓住绝大多数细菌),又有 9 个可变区(V1–V9,序列差异用来区分不同菌属)。常规检测多选择 V3–V4 区或 V4 区——保守区下钩、可变区辨种,像用一把带刻度的尺子去量菌群。

但要提前说清楚两个"天生的局限":一是 16S 通常只能准确到属水平,种水平经常给不出确定答案;二是它测的是相对丰度(谁占多少比例),而不是绝对数量(每克粪便里有多少个)。


2

生信六步:从下机数据到菌群报告

测序仪吐出的只是几百万条短序列(reads),它们本身没有任何生物学意义。真正把"ATCG"变成"双歧杆菌 8%"的,是下面这六步。

(一)质控与拼接

测序数据里混着接头序列、低质量碱基和测序错误。生信流程首先用 fastp、Trimmomatic 这类工具做质控:剪掉接头、剔除质量差的碱基。如果是双端测序(同一段 DNA 从两头各读一次),还要按两端的重叠区域拼接成一条完整序列,并识别、去除 PCR 过程中产生的嵌合体(chimera,两条不同菌的序列被错误拼在一起)。这一步做不干净,后面所有结论都会带偏。

(二)去噪,得到 ASV

过去常用 OTU(操作分类单元):把相似度高于 97% 的序列聚成一类。但 97% 这个阈值是人为定的,边界模糊,不同实验室、不同数据集之间难以比较。现在主流改用 ASV(扩增子序列变异):用 DADA2等算法做去噪,输出的每一条 ASV 都是精确的序列,相当于给每种细菌发了一张唯一身份证。ASV 可跨研究复现、可精确比较,这是近十年扩增子分析最重要的方法学升级之一。

(三)物种注释

拿到 ASV 之后,要回答"它是什么菌"。做法是把 ASV 序列比对到参考数据库上:SILVA、Greengenes、GTDB、RDP 等。

这一步是"两家报告不一致"的高发区。同一个ASV,用不同数据库、不同版本、不同注释阈值,可能被标成不同的属。比如数据库大版本从 SILVA 132 更新到 SILVA 138,分类体系就有调整,部分菌的归属会变。所以一份规范的报告,应该注明用了什么数据库、什么版本—不注明,就无法横向比较。

(四)多样性分析

这是报告里最常见的两张图、两个指标:

  • α 多样性(样本内):回答"这个样本的菌群有多丰富、多均匀"。常用 Shannon、Simpson 指数(兼顾丰富度和均匀度)和 Chao1、Observed ASVs(偏重丰富度)。注意:α 多样性高度依赖测序深度,样本测得浅,多样性会被系统性低估,传统做法是分析前抽平(rarefaction)或做覆盖度归一化,但抽平会丢弃数据、损失统计功效,如今更推荐改用不依赖等深度的方法(如 ANCOM-BC 的内部归一化),或直接在报告中说明各样本测序深度。

  • β 多样性(样本之间):回答"两组人的菌群结构差多少"。常用 Bray-Curtis 距离(只看丰度)或 UniFrac 距离(还考虑菌种之间的进化关系,需要先构建系统发育树)。把距离矩阵降维成一张二维图(PCoA 或 NMDS),点与点离得近就是菌群相似,再用 PERMANOVA 等统计方法检验"组间差异是否显著"。

(五)差异分析,找出"关键菌"

哪几个菌在两组之间真有差异?常用 LEfSe、DESeq2 等方法。这里有一个容易被忽略的统计陷阱——组成数据的相对性:菌群数据是"比例",所有菌加起来恒等于 100%。这意味着,A 菌的比例升高,完全可能是 B 菌减少导致的"被动升高",并不代表 A 菌自身变多了。所以差异分析不能只看比例变化,还要用适合组成数据的统计方法,并做多重检验校正。

(六)功能预测

报告里偶尔会出现"丁酸盐合成通路下降"这类功能层面的结论。16S数据本身不含功能基因,这类结论多来自 PICRUSt2 等工具—基于物种组成去推断潜在功能。请记住:这是预测,不是实测。真要确证功能,需要宏基因组测序或代谢组检测。


3

生信里最容易踩的六个坑

开头那两家实验室"对不上"的报告,现在可以给出完整的解释了:大概率不是谁测错了,而是整条方法学链条就没对齐过。2026 年 2 月,美国国家标准与技术研究院(NIST)用同一份标准化粪便参考物质(排除一切生物学变异)同时送检 7 家消费级菌群检测公司,结果发现:公司之间的报告差异,与不同个体之间的生物学差异处在同一量级;18个共有菌属中,没有任何一家的结果与共识值全部吻合,平均只有 10–16 个落在共识范围内。换句话说,两份"对不上"的报告可能都是"自洽"的——各自忠于各自的引物、数据库和阈值。

2025 年《Lancet Gastroenterology & Hepatology》18 国 69 位专家的国际共识则直接划了红线:F/B 比值(厚壁菌门/拟杆菌门比值)应从临床报告中剔除—缺乏临床相关性证据;"菌群失调"目前没有公认的临床定义和参考范围;现有证据尚不足以支持菌群检测常规用于临床实践。这不是否定这项技术,而是提醒:读报告之前,先看它把方法说清楚了没有。


4

为什么 16S 报告后面还要 qPCR 复核?

一句话概括:16S 回答"结构",qPCR 回答"数量"。

16S 告诉你"菌群的比例长什么样",但它给不出"每克粪便里到底有多少个"。当报告写"某菌占比下降"时,存在两种完全不同的可能:这个菌真的变少了,或者它没变、只是别的菌变多了。qPCR(或数字PCR)用特异性引物对目标菌做绝对定量,直接给出拷贝数。用 qPCR 可以精确回答"到底有多少"。这条路线的技术门槛也不低:引物必须能避开近缘种的交叉扩增(特异性),扩增效率通常要求落在 90%–110%,标准曲线 R² 需大于 0.99。可以说,16S给的是"全景地图",qPCR 给的是"关键地点的精确坐标",两者互补,而不是互相替代。


5

拿到报告,怎么读才不焦虑?

1. 看趋势,不看单点:菌群会随饮食、作息、情绪、用药持续波动,单次检测的小幅差异未必有临床意义——同一人24–48小时内的菌群组成波动可达 15%–25%。

2. 分清"比例"和"数量":看到"占比上升/下降"时,先想想是不是绝对量并没有变。

3. 看方法学信息:规范的报告会注明测序区域、数据库版本、是否做绝对定量—这些信息决定了报告能解释到什么程度。

4. 注意采样时机:抗生素会显著改变菌群结构,一般建议停用抗生素至少2–4周后再采样;服用益生菌期间的结果也需谨慎解读。

报告是参考,不是诊断:菌群检测提供的是健康管理层面的信息,不能替代临床诊断,有症状请及时就医。一份菌群报告的"含金量",不取决于数字多漂亮,而取决于它敢不敢把方法说清楚、把局限写在明处。


6

结语

肠道菌群检测报告上那些百分比和图表,背后是一整套生物信息学流程:从质控、去噪、物种注释,到多样性分析、差异分析和功能预测。每一步都有明确的假设和边界—知道这些边界在哪,你才不会把"相对丰度的一个小波动"误读成身体的警报。

真正有价值的菌群检测,不是给出一个漂亮的数字,而是把方法说清楚、把局限讲明白、把结论落在能被验证的地方。


参考来源

1. Caporaso JG, et al. QIIME allows analysis of high-throughput community sequencing data. Nature Methods. 2010.

2. Callahan BJ, et al. DADA2: High-resolution sample inference from Illumina amplicon data. Nature Methods. 2016.

3. Bolyen E, et al. Reproducible, interactive, scalable and extensible microbiome data science using QIIME 2. Nature Biotechnology. 2019.

4. Quast C, et al. The SILVA ribosomal RNA gene database project: improved data processing and web-based tools. Nucleic Acids Research. 2013.

5. Segata N, et al. Metagenomic biomarker discovery and explanation. Genome Biology. 2011.

6. Douglas GM, et al. PICRUSt2 for prediction of metagenome functions. Nature Biotechnology. 2020.

7. Davis NM, et al. Simple statistical identification and removal of contaminant sequences: the decontam package. Microbiome. 2018.Porcari S, et al. A framework for the evaluation of the clinical usefulness of microbiome tests: international expert consensus. Lancet Gastroenterology & Hepatology. 2025.

8. National Institute of Standards and Technology (NIST). Inter-provider variability in direct-to-consumer gut microbiome testing with standardized fecal reference material. Communications Biology. 2026.


关于康测   


about SEQHEALTH

武汉康测科技有限公司成立于2016年,公司坐落武汉,先后获得国家高新技术企业、3551创业人才企业、3551长期创新人才企业、科技小巨人企业、瞪羚企业等认证。

康测科技致力于新一代组学技术的开发和在生物医学研究领域的应用。公司以绝对定量测序技术和自动化IP技术为核心,建立了涵盖基因组、表观基因组、转录组、表观转录组、免疫组和互作组在内的全面的组学服务体系。技术水平在植物、微生物、动物复杂组织的表观遗传研究领域处于行业领先地位,已完成项目数达10000+,拥有数十台高通量核酸提取、QC、IP、建库、pooling、二/三代测序等自动化生产平台。

下辖武汉康测医学检验有限公司,其依托高通量测序技术平台,全面开展实体瘤、血液肿瘤、遗传病及大健康领域的精准临床基因检测服务;以国内首个经国家知识产权局授权的SMP液态活检技术为核心,联合合作医院开展多癌种MRD科研项目,并提供本地化NGS实验室整体解决方案。实验室连续多年满分通过国家卫健委临检中心、美国病理学会等机构组织的室间质评,检验能力获得美国病理学会(CAP)、美国实验室认可协会(A2LA)的ISO 15189双重国际认证。

✅ 电话:027-65563640

✅ 邮箱:medical@seqmed.cn

✅ 官网:www.seqmed.cn

链接已复制,请打开微信粘贴分享