RNA转录组结果说明中心Transcriptome Guide开始查找
转录组分析结果 · 客户使用指南

结果不只要找到,
更要真正读懂。

依据实际交付文件树整理。输入文件名、分析术语或表头字段,快速定位用途、阅读重点和常见误区。

全站检索从一个关键词开始
文件名 / 字段 / 分析术语
输入关键词后,目录与表头词典会同时筛选
热门搜索
7核心分析模块
70+表头字段释义
6推荐阅读步骤
RECOMMENDED PATH

第一次看结果,按这个顺序

从“数据是否可靠”逐步走到“生物学上说明什么”,避免只看一张火山图就下结论。

重要:差异上调或下调的方向取决于比较组书写顺序,例如 P_vs_T 通常表示 P 相对 T;请以项目分组设计与结果说明为准。
DIRECTORY GUIDE

实际结果目录导航

这里以真实交付目录为准:04 与 05 模块下直接分为 gene 和 transcript 两层。

浏览入口
00 网页报告 / report.html适合按页面顺序浏览

双击 report.html 用浏览器打开;必须保留同级 src 文件夹,src 内文件无需逐个打开。

数据入口
01 分析结果适合查表、筛选与二次分析

正式数值和可下载图表以这里为准;每个模块的 read me 是对应结果的直接说明。

已按真实文件树校正04 / 05 下直接为 gene 与 transcript本次文件树未见独立 expldiff_venn 目录alternative_splicing 的实际编号为 06
00

项目总结

01 分析结果 / 00.project_summary
项目总结

项目结果的总入口。建议第一次打开结果时先读 project_summary.txt,再根据统计表定位后续分析。

阅读重点先看整体数据是否完整、各比较组差异数量是否符合预期。
文件 / 目录作用与理解
project_summary.txt首读项目概况、分析内容与核心结果的文本总结
known.gene.expldiff_stat.xls基因层各比较组差异表达数量统计
known.transcript.expldiff_stat.xls转录本层各比较组差异表达数量统计
01

原始数据质量控制

01 分析结果 / 01.rawdata_quality_control
数据质控

汇总原始数据、过滤过程和清洁数据质量,是判断测序是否可靠的第一道关。

阅读重点重点关注 Clean Reads、Q30、GC 含量、接头及低质量序列比例。
文件 / 目录作用与理解
quality_control.summary.xls推荐质控核心指标汇总,适合优先查看
rawdata.stat.xls过滤前原始测序数据统计
cleandata.stat.xls过滤后可用于分析的数据统计
filtering.stat.xls接头、低质量及其他过滤原因统计
fastp/*.fastp.html每个样本的交互式过滤与质量报告
fastqc/raw · clean过滤前后碱基质量、GC、重复度等质控明细
02

参考基因组比对

01 分析结果 / 02.alignment
序列比对

统计 Clean Reads 与参考基因组的匹配情况,用于判断物种参考、样本质量及污染风险。

阅读重点优先查看总比对率、唯一比对率和多重比对比例,并比较样本间一致性。
文件 / 目录作用与理解
alignment.statistics.xls核心表各样本总比对、唯一比对、多重比对及未比对统计
03

基因与转录本注释

01 分析结果 / 03.annotation / known
功能注释

提供基因、转录本的名称、位置与功能注释,是把内部 ID 对应到生物学信息的基础。

阅读重点使用带 annot 的结果表可减少跨表匹配;无注释并不等于没有表达。
文件 / 目录作用与理解
annotstat.xls注释覆盖数量与比例统计
gene.annotation.xls基因层 ID、名称、位置及功能注释
transcript.annotation.xls转录本层 ID、所属基因及功能注释
04

表达水平分析

01 分析结果 / 04.explevel_analysis / gene · transcript
表达分析

分别从基因和转录本层展示表达矩阵、分布、样本相关性及 PCA。

阅读重点Count 用于差异统计;FPKM 适合查看同一基因在不同样本中的相对表达趋势。
文件 / 目录作用与理解
matrix_*.count.xls原始表达计数矩阵,未标准化
matrix_*.fpkm.xls经基因长度和测序深度校正的表达矩阵
matrix_*.count.annot.xls常用附带功能注释的 Count 表
matrix_*.fpkm.annot.xls易读附带功能注释的 FPKM 表
correlation样本两两相关性分析与热图
pca样本整体表达差异和组内重复性评估
05

差异表达与功能解释

01 分析结果 / 05.expldiff_analysis / gene · transcript
差异分析

包含差异识别、可视化、聚类、GO/KEGG 富集、iPath、PPI 与 GSEA,是结果解读的主体。

阅读重点先确认比较方向,再结合 log2FoldChange 与 FDR;富集结果要同时看显著性、富集比例和基因数。
文件 / 目录作用与理解
degenes_analysis.annot.xls参与统计检验的完整结果,含 P 值、FDR 和变化倍数
degenes_all.annot.xls高频达到项目筛选阈值的差异基因或转录本
degenes_up · degenes_down上调与下调结果子集
HeatmapPlot_subcluster差异表达模式聚类图及亚群结果
GO · KEGG功能条目和通路富集结果及配套图表
edges.txt · nodes.txtPPI 网络连边与节点属性,可导入 Cytoscape
gsea.xls · gsea_plot无需预先截取差异基因的基因集富集结果
06

可变剪接分析

01 分析结果 / 06.alternative_splicing / Group.P_vs_T
可变剪接

利用 rMATS 比较组间外显子和剪接位点使用差异,提供 JC 与 JCEC 两套统计。

阅读重点主要看 FDR、IncLevelDifference 与事件坐标;建议结合转录本结构或三代测序验证。
文件 / 目录作用与理解
rMATS.JC.SE.xls仅基于剪接位点 reads 的外显子跳跃事件
rMATS.JCEC.SE.xls结合剪接位点与外显子覆盖的外显子跳跃事件
A3SS · A5SS选择性 3′ / 5′ 剪接位点
MXE互斥外显子事件
RI内含子保留事件
SE外显子跳跃事件,通常数量较多
FIELD DICTIONARY

表头词典:这一列是什么意思?

覆盖质控、比对、表达、差异、富集、网络和可变剪接的高频字段。顶部搜索也会同步筛选这里。

使用范围

以下为本目录体系中的常见字段名与通用解释。软件版本和项目参数可能造成列名、单位或计算口径差异,请以交付表头、同目录 read me 及项目参数为最终依据。

质控测序与质控统计表rawdata.stat.xls · cleandata.stat.xls · filtering.stat.xls · quality_control.summary.xls12

字段可能带 Raw/Clean 前缀或百分号;比较样本时应同时看绝对数据量与比例。

常见字段名中文含义阅读方法
Sample / Sample_ID样本名称或编号应与实验分组表逐一对应,先排除命名错位。
Raw_reads / Total_reads过滤前 reads 数量双端测序中有时按 read pairs、有时按单条 reads 统计,以表注为准。
Clean_reads去接头、去低质量后保留的 reads 数量后续比对与定量实际使用的数据量。
Raw_bases / Clean_bases过滤前后碱基总量常用 Gb 表示;样本间不宜相差过大。
Clean_rate / Retained_rate过滤后数据保留比例过低时需结合接头污染、低质量和 N 比例定位原因。
Q20质量值 ≥20 的碱基比例对应单碱基错误概率约 ≤1%。
Q30质量值 ≥30 的碱基比例对应单碱基错误概率约 ≤0.1%,是最常用质量指标。
GC / GC_contentG 与 C 碱基所占比例关注同批样本是否一致;异常偏离可提示污染或文库偏好。
Error_rate测序碱基错误率估计通常越低越好,需结合平台与报告标准判断。
Adapter_reads含接头并被修剪的 reads 数量或比例偏高可能与插入片段偏短有关。
Low_quality_reads因低质量被过滤的 reads结合 fastp / FastQC 的末端质量分布查看。
N_content / N_rate无法确定碱基 N 的数量或比例比例异常升高会降低可用数据与比对表现。
比对参考基因组比对表alignment.statistics.xls7

不同软件会把 paired-end、properly paired 或 splice mapped 拆成不同列,优先依据本项目 read me。

常见字段名中文含义阅读方法
Total_reads进入比对流程的 Clean Reads应与质控表的可用 reads 基本衔接。
Mapped_reads / Mapping_rate可比对到参考基因组的 reads 数量或比例偏低需考虑参考版本、物种差异、污染或 RNA 降解。
Uniquely_mapped仅匹配到一个基因组位置的 reads通常是定量最可靠的部分,比例越高越理想。
Multiple_mapped可匹配到多个位置的 reads重复序列、同源基因或多拷贝区域会使其升高。
Unmapped_reads未能比对到参考基因组的 reads可与未注释序列、污染或质量问题有关。
Properly_paired方向和插入距离均合理的成对 reads用于评估双端文库与比对的一致性。
Splice_mapped跨外显子连接位点的 readsRNA-seq 特征之一,也是剪接分析的重要证据。
表达与注释注释与表达矩阵gene.annotation.xls · transcript.annotation.xls · matrix_*.count/fpkm*.xls11

表达矩阵第一列通常是基因或转录本 ID,后续各列为样本;带 annot 的版本会在前部增加注释列。

常见字段名中文含义阅读方法
GeneID / gene_id基因唯一标识符跨表合并时优先使用稳定 ID,而不是仅用 gene symbol。
TranscriptID / transcript_id转录本或 isoform 标识符一个基因可对应多个转录本。
GeneName / Symbol易读的基因名称或符号可能存在重名、旧名或缺失,不宜单独作为唯一键。
Description / Annotation基因或蛋白功能描述通常来自参考基因组或公共数据库注释。
Chr / Chromosome所在染色体或 scaffold与 Start、End、Strand 联合定义基因组位置。
Start / End基因或转录本的基因组起止坐标不同格式可能采用 0-based 或 1-based,精确定位时查表注。
Strand正链 + 或负链 −用于理解转录方向与剪接事件坐标。
Length基因有效长度或转录本长度FPKM/TPM 标准化会用到长度信息。
Count / sample columns每个样本分配到该特征的原始 reads 计数差异分析通常基于整数 Count,而不是 FPKM。
FPKM按测序深度和特征长度标准化的表达量适合查看同一特征跨样本趋势;不建议直接作为 DESeq2 输入。
GO / KEGG / KO关联的功能条目、通路或同源功能编号一个基因可对应多个条目,常以分号分隔。
差异差异表达结果表degenes_analysis.annot.xls · degenes_all.annot.xls · degenes_up/down10

最关键的三列是比较方向、log2FoldChange(或 logFC)和 FDR。筛选阈值以项目说明为准。

常见字段名中文含义阅读方法
GeneID / TranscriptID被检验的基因或转录本先确认当前分析处于 gene 还是 transcript 层。
baseMean经标准化后所有样本的平均表达水平极低表达特征的倍数变化通常更不稳定。
Group1_mean / Group2_mean两个组的平均表达量用于直观核对变化方向,具体标准化方法以表注为准。
FoldChange / FC非对数尺度的表达倍数FC=2 表示约 2 倍;若用比值表示,低于 1 为下降。
log2FoldChange / logFC以 2 为底的表达倍数对数+1≈上调 2 倍,−1≈下降至 1/2;方向取决于 A_vs_B。
PValue / pvalue单个特征差异检验的原始 P 值基因数量很多时不能只依据原始 P 值判断。
FDR / padj / qvalue多重检验校正后的显著性通常优先于 P 值;常见阈值为 <0.05,但应遵循项目参数。
Regulation / StatusUp、Down 或 Not significant由项目设定的倍数和显著性阈值共同决定。
Dispersion / stat离散度或检验统计量用于模型计算,一般不作为客户的首要筛选列。
GeneName / Description便于阅读的名称与功能注释候选基因筛选仍建议保留原始 ID 以便追溯。
GO / KEGGGO 与 KEGG 富集结果表GO enrichment tables · pathway_info.xls · 配套 bubble/bar/cnet 图10

显著并不等于效应大。建议同时看 FDR、命中基因数、富集比例和条目冗余。

常见字段名中文含义阅读方法
ID / GO_ID / Pathway_IDGO 条目或 KEGG 通路的唯一编号用于跨数据库查询和复现。
Description / Term / Pathway功能条目或通路名称同一主题常出现多个相近条目,应归类后解读。
OntologyGO 的 BP、CC 或 MF 分类分别代表生物过程、细胞组分和分子功能。
GeneRatio输入差异基因中命中该条目的比例如 12/350;分母通常是参与富集的输入基因数。
BgRatio背景基因中命中该条目的比例背景集选择会直接影响富集结果。
RichFactor / Enrichment条目命中程度的富集指标数值越大通常代表富集程度越高,具体公式以报告为准。
Count命中该条目的输入基因数量命中数过少的条目应谨慎解释。
geneID / Genes命中该条目的具体基因列表用于回到差异表核对方向和表达水平。
PValue富集检验的原始 P 值同时检验多个条目时更应关注校正值。
FDR / p.adjust / qvalue富集结果多重校正值越小越可靠;最终阈值以项目说明为准。
GSEA / PPIGSEA 与蛋白互作网络gsea.xls · edges.txt · nodes.txt · network_stats.txt11

GSEA 关注整个排序列表的协调变化;PPI 的网络中心性提示候选优先级,但不等于已实验证实。

常见字段名中文含义阅读方法
setSize实际参与 GSEA 的基因集大小过小或过大的基因集解释价值可能受限。
ES原始富集分数反映基因集成员在排序列表两端的集中程度。
NES标准化富集分数正负代表富集方向,绝对值便于不同基因集比较。
NOM p-valGSEA 名义 P 值应结合 FDR q-val 与项目阈值共同判断。
FDR q-valGSEA 多重检验校正值经典 GSEA 与常规富集可能采用不同阈值,勿机械套用。
leadingEdge / core_enrichment对富集信号贡献最大的核心基因适合与差异幅度、PPI 和文献证据交叉筛选。
source / targetPPI 连边两端的蛋白或基因edges.txt 的每一行通常代表一条互作关系。
combined_score / weight互作置信度或边权重不同数据库量纲不同,不宜跨数据库直接比较。
Degree节点直接连接的邻居数较高可提示网络枢纽,但会受数据库研究偏倚影响。
Betweenness节点位于最短路径上的程度较高可提示桥接不同网络模块的潜力。
Closeness / Clustering coefficient节点接近网络其他节点的程度 / 局部聚集程度用于补充描述网络拓扑,而非单独证明功能。
可变剪接rMATS 可变剪接结果表rMATS.JC/JCEC.A3SS · A5SS · MXE · RI · SE.xls12

IncLevel 常近似理解为 PSI。IncLevelDifference 通常为组 1 均值减组 2 均值,务必核对比较顺序。

常见字段名中文含义阅读方法
ID剪接事件编号在同一个结果文件内用于唯一定位事件。
GeneID / geneSymbol事件所属基因 ID 与基因符号无 geneSymbol 时仍可用 GeneID 追溯。
chr / strand事件所在染色体和链方向是解释各坐标列的基础。
exonStart_0base / exonEnd可变外显子或目标区域坐标SE、RI、A3SS 等类型的坐标列名称不同。
upstreamES/EE · downstreamES/EE上下游外显子的起止坐标可用于基因组浏览器或引物设计前定位结构。
IJC_SAMPLE_1 / IJC_SAMPLE_2两组支持 inclusion 的 junction counts以逗号分隔各重复样本的计数。
SJC_SAMPLE_1 / SJC_SAMPLE_2两组支持 skipping 的 junction counts与 IJC 联合反映事件支持度。
IncFormLen / SkipFormLeninclusion 与 skipping 形式的有效长度rMATS 用其校正两种形式的计数。
PValue两组剪接水平差异的原始 P 值事件很多时优先结合 FDR。
FDR多重检验校正后的显著性常用筛选条件之一,具体阈值以项目为准。
IncLevel1 / IncLevel2两组各重复样本的 inclusion level范围通常为 0–1,可查看组内一致性。
IncLevelDifference两组平均 inclusion level 之差+0.20 可理解为组 1 的 inclusion 比组 2 高约 20 个百分点。
READING EXAMPLES

三个高频字段,快速读懂

差异表达log2FoldChange = 1.58约上调 3 倍

因为 21.58≈3。若文件为 P_vs_T,通常表示 P 相对 T 更高;需再核对 FDR 和比较方向。

富集分析GeneRatio = 12 / 350350 个输入基因中 12 个命中

还需与 BgRatio、FDR 和具体 genes 联合判断,不能只按气泡大小选择通路。

可变剪接IncLevelDifference = 0.18组 1 inclusion 高约 18 个百分点

同时检查各重复的 IncLevel、junction counts 与 FDR,避免低覆盖事件造成误判。

PRACTICAL TIPS

怎样打开、筛选和使用结果

保留原始交付目录和文件名,另存副本进行筛选、作图或二次统计,便于随时追溯。

HTML交互报告

用 Chrome、Edge 或 Safari 打开;网页报告必须保留 src 文件夹的相对位置。

XLS / TXT数据表格

多数为制表符分隔文本,可用 Excel/WPS、R 或 Python 打开;建议保留原文件副本。

PDF / SVG矢量图

放大不易失真,论文排版优先使用;SVG 可用浏览器或矢量软件打开。

PNG / JPG预览图片

适合快速查看与汇报,正式排版时优先寻找同名 PDF 或 SVG。

MINIMUM CHECKLIST

筛候选结果前,至少确认 4 件事

  1. 1

    比较方向 A_vs_B 中谁相对谁改变。

  2. 2

    数据质量 PCA、相关性、Q30 与比对率无明显异常。

  3. 3

    统计标准 同时记录 log2FC、FDR 和表达水平。

  4. 4

    多证据支持 富集、PPI、文献和实验表型相互印证。

FAQ

客户最常问的问题

点击问题展开。阈值与分组方向仍以具体项目说明为准。

01gene 和 transcript 结果该看哪个?

回答“基因整体表达是否改变”时优先 gene 层;研究 isoform、剪接或同一基因不同转录本变化时看 transcript 层。候选基因筛选通常先 gene,再回到 transcript 核对。

02Count、FPKM 应该怎么选?

Count 是差异统计模型的常用输入;FPKM 主要用于表达概览和同一基因跨样本趋势。不要把 FPKM 直接当作原始计数,也不要跨基因仅凭 FPKM 高低判断功能重要性。

03PValue 显著,为什么 FDR 不显著?

一次检验成千上万个基因会累积假阳性。FDR/padj 是多重检验校正后的结果,通常更适合作为最终显著性依据。

04log2FoldChange 的正负代表什么?

必须先确认比较方向。若文件是 P_vs_T,正值通常表示 P 相对 T 更高,负值表示更低;但项目软件命名规则可能不同,最终以分组说明为准。

05degenes_analysis 和 degenes_all 有什么区别?

analysis 表通常保留完整统计检验结果;all 表通常是按项目阈值筛出的显著差异集合。想调整阈值或复核边缘基因时应使用完整表。

06JC 和 JCEC 应该采用哪一套?

JC 仅用跨剪接位点 reads,证据更直接;JCEC 还加入外显子覆盖 reads,灵敏度可能更高。两者一致的事件通常更稳健,最终还应结合覆盖度与实验验证。

07PCA 中有一个样本偏离,能直接删除吗?

不能只凭 PCA 删除。应联合相关性、测序质控、比对率、实验记录和生物学异质性判断,并保留剔除依据后重新分析。

08GO/KEGG 富集显著就能说明通路被激活吗?

不能直接等同。富集说明差异基因在该功能集合中出现得更多;是否激活还要结合上下调方向、关键基因、GSEA、表型和实验验证。