00 网页报告 / report.html适合按页面顺序浏览双击 report.html 用浏览器打开;必须保留同级 src 文件夹,src 内文件无需逐个打开。
从“数据是否可靠”逐步走到“生物学上说明什么”,避免只看一张火山图就下结论。
P_vs_T 通常表示 P 相对 T;请以项目分组设计与结果说明为准。这里以真实交付目录为准:04 与 05 模块下直接分为 gene 和 transcript 两层。
00 网页报告 / report.html适合按页面顺序浏览双击 report.html 用浏览器打开;必须保留同级 src 文件夹,src 内文件无需逐个打开。
01 分析结果适合查表、筛选与二次分析正式数值和可下载图表以这里为准;每个模块的 read me 是对应结果的直接说明。
01 分析结果 / 00.project_summary项目结果的总入口。建议第一次打开结果时先读 project_summary.txt,再根据统计表定位后续分析。
project_summary.txt首读项目概况、分析内容与核心结果的文本总结known.gene.expldiff_stat.xls基因层各比较组差异表达数量统计known.transcript.expldiff_stat.xls转录本层各比较组差异表达数量统计01 分析结果 / 01.rawdata_quality_control汇总原始数据、过滤过程和清洁数据质量,是判断测序是否可靠的第一道关。
quality_control.summary.xls推荐质控核心指标汇总,适合优先查看rawdata.stat.xls过滤前原始测序数据统计cleandata.stat.xls过滤后可用于分析的数据统计filtering.stat.xls接头、低质量及其他过滤原因统计fastp/*.fastp.html每个样本的交互式过滤与质量报告fastqc/raw · clean过滤前后碱基质量、GC、重复度等质控明细01 分析结果 / 02.alignment统计 Clean Reads 与参考基因组的匹配情况,用于判断物种参考、样本质量及污染风险。
alignment.statistics.xls核心表各样本总比对、唯一比对、多重比对及未比对统计01 分析结果 / 03.annotation / known提供基因、转录本的名称、位置与功能注释,是把内部 ID 对应到生物学信息的基础。
annotstat.xls注释覆盖数量与比例统计gene.annotation.xls基因层 ID、名称、位置及功能注释transcript.annotation.xls转录本层 ID、所属基因及功能注释01 分析结果 / 04.explevel_analysis / gene · transcript分别从基因和转录本层展示表达矩阵、分布、样本相关性及 PCA。
matrix_*.count.xls原始表达计数矩阵,未标准化matrix_*.fpkm.xls经基因长度和测序深度校正的表达矩阵matrix_*.count.annot.xls常用附带功能注释的 Count 表matrix_*.fpkm.annot.xls易读附带功能注释的 FPKM 表correlation样本两两相关性分析与热图pca样本整体表达差异和组内重复性评估01 分析结果 / 05.expldiff_analysis / gene · transcript包含差异识别、可视化、聚类、GO/KEGG 富集、iPath、PPI 与 GSEA,是结果解读的主体。
degenes_analysis.annot.xls参与统计检验的完整结果,含 P 值、FDR 和变化倍数degenes_all.annot.xls高频达到项目筛选阈值的差异基因或转录本degenes_up · degenes_down上调与下调结果子集HeatmapPlot_subcluster差异表达模式聚类图及亚群结果GO · KEGG功能条目和通路富集结果及配套图表edges.txt · nodes.txtPPI 网络连边与节点属性,可导入 Cytoscapegsea.xls · gsea_plot无需预先截取差异基因的基因集富集结果01 分析结果 / 06.alternative_splicing / Group.P_vs_T利用 rMATS 比较组间外显子和剪接位点使用差异,提供 JC 与 JCEC 两套统计。
rMATS.JC.SE.xls仅基于剪接位点 reads 的外显子跳跃事件rMATS.JCEC.SE.xls结合剪接位点与外显子覆盖的外显子跳跃事件A3SS · A5SS选择性 3′ / 5′ 剪接位点MXE互斥外显子事件RI内含子保留事件SE外显子跳跃事件,通常数量较多覆盖质控、比对、表达、差异、富集、网络和可变剪接的高频字段。顶部搜索也会同步筛选这里。
以下为本目录体系中的常见字段名与通用解释。软件版本和项目参数可能造成列名、单位或计算口径差异,请以交付表头、同目录 read me 及项目参数为最终依据。
rawdata.stat.xls · cleandata.stat.xls · filtering.stat.xls · quality_control.summary.xls12 项字段可能带 Raw/Clean 前缀或百分号;比较样本时应同时看绝对数据量与比例。
Sample / Sample_ID样本名称或编号应与实验分组表逐一对应,先排除命名错位。Raw_reads / Total_reads过滤前 reads 数量双端测序中有时按 read pairs、有时按单条 reads 统计,以表注为准。Clean_reads去接头、去低质量后保留的 reads 数量后续比对与定量实际使用的数据量。Raw_bases / Clean_bases过滤前后碱基总量常用 Gb 表示;样本间不宜相差过大。Clean_rate / Retained_rate过滤后数据保留比例过低时需结合接头污染、低质量和 N 比例定位原因。Q20质量值 ≥20 的碱基比例对应单碱基错误概率约 ≤1%。Q30质量值 ≥30 的碱基比例对应单碱基错误概率约 ≤0.1%,是最常用质量指标。GC / GC_contentG 与 C 碱基所占比例关注同批样本是否一致;异常偏离可提示污染或文库偏好。Error_rate测序碱基错误率估计通常越低越好,需结合平台与报告标准判断。Adapter_reads含接头并被修剪的 reads 数量或比例偏高可能与插入片段偏短有关。Low_quality_reads因低质量被过滤的 reads结合 fastp / FastQC 的末端质量分布查看。N_content / N_rate无法确定碱基 N 的数量或比例比例异常升高会降低可用数据与比对表现。alignment.statistics.xls7 项不同软件会把 paired-end、properly paired 或 splice mapped 拆成不同列,优先依据本项目 read me。
Total_reads进入比对流程的 Clean Reads应与质控表的可用 reads 基本衔接。Mapped_reads / Mapping_rate可比对到参考基因组的 reads 数量或比例偏低需考虑参考版本、物种差异、污染或 RNA 降解。Uniquely_mapped仅匹配到一个基因组位置的 reads通常是定量最可靠的部分,比例越高越理想。Multiple_mapped可匹配到多个位置的 reads重复序列、同源基因或多拷贝区域会使其升高。Unmapped_reads未能比对到参考基因组的 reads可与未注释序列、污染或质量问题有关。Properly_paired方向和插入距离均合理的成对 reads用于评估双端文库与比对的一致性。Splice_mapped跨外显子连接位点的 readsRNA-seq 特征之一,也是剪接分析的重要证据。gene.annotation.xls · transcript.annotation.xls · matrix_*.count/fpkm*.xls11 项表达矩阵第一列通常是基因或转录本 ID,后续各列为样本;带 annot 的版本会在前部增加注释列。
GeneID / gene_id基因唯一标识符跨表合并时优先使用稳定 ID,而不是仅用 gene symbol。TranscriptID / transcript_id转录本或 isoform 标识符一个基因可对应多个转录本。GeneName / Symbol易读的基因名称或符号可能存在重名、旧名或缺失,不宜单独作为唯一键。Description / Annotation基因或蛋白功能描述通常来自参考基因组或公共数据库注释。Chr / Chromosome所在染色体或 scaffold与 Start、End、Strand 联合定义基因组位置。Start / End基因或转录本的基因组起止坐标不同格式可能采用 0-based 或 1-based,精确定位时查表注。Strand正链 + 或负链 −用于理解转录方向与剪接事件坐标。Length基因有效长度或转录本长度FPKM/TPM 标准化会用到长度信息。Count / sample columns每个样本分配到该特征的原始 reads 计数差异分析通常基于整数 Count,而不是 FPKM。FPKM按测序深度和特征长度标准化的表达量适合查看同一特征跨样本趋势;不建议直接作为 DESeq2 输入。GO / KEGG / KO关联的功能条目、通路或同源功能编号一个基因可对应多个条目,常以分号分隔。degenes_analysis.annot.xls · degenes_all.annot.xls · degenes_up/down10 项最关键的三列是比较方向、log2FoldChange(或 logFC)和 FDR。筛选阈值以项目说明为准。
GeneID / TranscriptID被检验的基因或转录本先确认当前分析处于 gene 还是 transcript 层。baseMean经标准化后所有样本的平均表达水平极低表达特征的倍数变化通常更不稳定。Group1_mean / Group2_mean两个组的平均表达量用于直观核对变化方向,具体标准化方法以表注为准。FoldChange / FC非对数尺度的表达倍数FC=2 表示约 2 倍;若用比值表示,低于 1 为下降。log2FoldChange / logFC以 2 为底的表达倍数对数+1≈上调 2 倍,−1≈下降至 1/2;方向取决于 A_vs_B。PValue / pvalue单个特征差异检验的原始 P 值基因数量很多时不能只依据原始 P 值判断。FDR / padj / qvalue多重检验校正后的显著性通常优先于 P 值;常见阈值为 <0.05,但应遵循项目参数。Regulation / StatusUp、Down 或 Not significant由项目设定的倍数和显著性阈值共同决定。Dispersion / stat离散度或检验统计量用于模型计算,一般不作为客户的首要筛选列。GeneName / Description便于阅读的名称与功能注释候选基因筛选仍建议保留原始 ID 以便追溯。GO enrichment tables · pathway_info.xls · 配套 bubble/bar/cnet 图10 项显著并不等于效应大。建议同时看 FDR、命中基因数、富集比例和条目冗余。
ID / GO_ID / Pathway_IDGO 条目或 KEGG 通路的唯一编号用于跨数据库查询和复现。Description / Term / Pathway功能条目或通路名称同一主题常出现多个相近条目,应归类后解读。OntologyGO 的 BP、CC 或 MF 分类分别代表生物过程、细胞组分和分子功能。GeneRatio输入差异基因中命中该条目的比例如 12/350;分母通常是参与富集的输入基因数。BgRatio背景基因中命中该条目的比例背景集选择会直接影响富集结果。RichFactor / Enrichment条目命中程度的富集指标数值越大通常代表富集程度越高,具体公式以报告为准。Count命中该条目的输入基因数量命中数过少的条目应谨慎解释。geneID / Genes命中该条目的具体基因列表用于回到差异表核对方向和表达水平。PValue富集检验的原始 P 值同时检验多个条目时更应关注校正值。FDR / p.adjust / qvalue富集结果多重校正值越小越可靠;最终阈值以项目说明为准。gsea.xls · edges.txt · nodes.txt · network_stats.txt11 项GSEA 关注整个排序列表的协调变化;PPI 的网络中心性提示候选优先级,但不等于已实验证实。
setSize实际参与 GSEA 的基因集大小过小或过大的基因集解释价值可能受限。ES原始富集分数反映基因集成员在排序列表两端的集中程度。NES标准化富集分数正负代表富集方向,绝对值便于不同基因集比较。NOM p-valGSEA 名义 P 值应结合 FDR q-val 与项目阈值共同判断。FDR q-valGSEA 多重检验校正值经典 GSEA 与常规富集可能采用不同阈值,勿机械套用。leadingEdge / core_enrichment对富集信号贡献最大的核心基因适合与差异幅度、PPI 和文献证据交叉筛选。source / targetPPI 连边两端的蛋白或基因edges.txt 的每一行通常代表一条互作关系。combined_score / weight互作置信度或边权重不同数据库量纲不同,不宜跨数据库直接比较。Degree节点直接连接的邻居数较高可提示网络枢纽,但会受数据库研究偏倚影响。Betweenness节点位于最短路径上的程度较高可提示桥接不同网络模块的潜力。Closeness / Clustering coefficient节点接近网络其他节点的程度 / 局部聚集程度用于补充描述网络拓扑,而非单独证明功能。rMATS.JC/JCEC.A3SS · A5SS · MXE · RI · SE.xls12 项IncLevel 常近似理解为 PSI。IncLevelDifference 通常为组 1 均值减组 2 均值,务必核对比较顺序。
ID剪接事件编号在同一个结果文件内用于唯一定位事件。GeneID / geneSymbol事件所属基因 ID 与基因符号无 geneSymbol 时仍可用 GeneID 追溯。chr / strand事件所在染色体和链方向是解释各坐标列的基础。exonStart_0base / exonEnd可变外显子或目标区域坐标SE、RI、A3SS 等类型的坐标列名称不同。upstreamES/EE · downstreamES/EE上下游外显子的起止坐标可用于基因组浏览器或引物设计前定位结构。IJC_SAMPLE_1 / IJC_SAMPLE_2两组支持 inclusion 的 junction counts以逗号分隔各重复样本的计数。SJC_SAMPLE_1 / SJC_SAMPLE_2两组支持 skipping 的 junction counts与 IJC 联合反映事件支持度。IncFormLen / SkipFormLeninclusion 与 skipping 形式的有效长度rMATS 用其校正两种形式的计数。PValue两组剪接水平差异的原始 P 值事件很多时优先结合 FDR。FDR多重检验校正后的显著性常用筛选条件之一,具体阈值以项目为准。IncLevel1 / IncLevel2两组各重复样本的 inclusion level范围通常为 0–1,可查看组内一致性。IncLevelDifference两组平均 inclusion level 之差+0.20 可理解为组 1 的 inclusion 比组 2 高约 20 个百分点。log2FoldChange = 1.58约上调 3 倍因为 21.58≈3。若文件为 P_vs_T,通常表示 P 相对 T 更高;需再核对 FDR 和比较方向。
GeneRatio = 12 / 350350 个输入基因中 12 个命中还需与 BgRatio、FDR 和具体 genes 联合判断,不能只按气泡大小选择通路。
IncLevelDifference = 0.18组 1 inclusion 高约 18 个百分点同时检查各重复的 IncLevel、junction counts 与 FDR,避免低覆盖事件造成误判。
保留原始交付目录和文件名,另存副本进行筛选、作图或二次统计,便于随时追溯。
用 Chrome、Edge 或 Safari 打开;网页报告必须保留 src 文件夹的相对位置。
多数为制表符分隔文本,可用 Excel/WPS、R 或 Python 打开;建议保留原文件副本。
放大不易失真,论文排版优先使用;SVG 可用浏览器或矢量软件打开。
适合快速查看与汇报,正式排版时优先寻找同名 PDF 或 SVG。
比较方向 A_vs_B 中谁相对谁改变。
数据质量 PCA、相关性、Q30 与比对率无明显异常。
统计标准 同时记录 log2FC、FDR 和表达水平。
多证据支持 富集、PPI、文献和实验表型相互印证。
点击问题展开。阈值与分组方向仍以具体项目说明为准。
回答“基因整体表达是否改变”时优先 gene 层;研究 isoform、剪接或同一基因不同转录本变化时看 transcript 层。候选基因筛选通常先 gene,再回到 transcript 核对。
Count 是差异统计模型的常用输入;FPKM 主要用于表达概览和同一基因跨样本趋势。不要把 FPKM 直接当作原始计数,也不要跨基因仅凭 FPKM 高低判断功能重要性。
一次检验成千上万个基因会累积假阳性。FDR/padj 是多重检验校正后的结果,通常更适合作为最终显著性依据。
必须先确认比较方向。若文件是 P_vs_T,正值通常表示 P 相对 T 更高,负值表示更低;但项目软件命名规则可能不同,最终以分组说明为准。
analysis 表通常保留完整统计检验结果;all 表通常是按项目阈值筛出的显著差异集合。想调整阈值或复核边缘基因时应使用完整表。
JC 仅用跨剪接位点 reads,证据更直接;JCEC 还加入外显子覆盖 reads,灵敏度可能更高。两者一致的事件通常更稳健,最终还应结合覆盖度与实验验证。
不能只凭 PCA 删除。应联合相关性、测序质控、比对率、实验记录和生物学异质性判断,并保留剔除依据后重新分析。
不能直接等同。富集说明差异基因在该功能集合中出现得更多;是否激活还要结合上下调方向、关键基因、GSEA、表型和实验验证。