相关文章
富集分析:GSEA 分析介绍
2024-11-10 17:09

背景

富集分析:GSEA 分析介绍

之前的一些推文,大部分收录专题于生物信息学,目的是帮助大家入门生物信息学的领域。本次开设新专题,“富集分析”,了解富集分析的各种手段,学会十八般武艺。

不过,因为公众号没有留言功能,大家交流学习讨论不知从“何”下手,为了解决这个问题,大家可以移步论坛发帖。链接如下:

一、GSEA 基本介绍

GSEA 全称是 gene set enrichment analysis 基因富集分析,是博劳德研究所 broad institute 研究团队开发的一个针对全基因组表达谱数据进行分析的工具,免费注册后即可进行下载。

它能够在大量基因或蛋白质中识别与疾病表型有关的过表达基因或蛋白质,从而判断某项干预与某一表型的关系。

GSEA 分析所适用的主场景之一:它能帮助生物学家在两种不同的生物学状态中,判断某一组有特定意义的基因集合的表达模式更接近于其中哪一种。因此 GSEA 是一种非常常见且实用的分析方法,可以将数个基因组成的功能基因数据集与测序及芯片得到的全部数据做出简单而清晰的关联分析。

gsea特点:

1. 无需差异基因;

2. 分析的是基因集合而非单个基因(GO)或少数基因(Pathway);

3. 富集分析。

怎么理解这个富集分析?

想要理解它首先要知道单基因分析,对实验组和对照组进行高通量测序或基因芯片检测获得的数据直接进行比对分析,发现基因表达发生了变化,到此为止就是单基因分析,单基因分析未考虑基因间的相互作用,因此很难对基因的表达变化做出解释。那么,将获得的两组数据进行一定处理后与按先验知识归类的基因集合比对分析,将某个干预和某个生物学功能变化联系起来,这个过程就叫富集分析。

4. 将基因与 MSigDB 中预定义的基因集合进行比较。使用GSEA分析结果发表文章时注意引用网站上的文献。

二、分析前准备

进行分析之前需要准备 3 个文件:表达数据集、样品分组信息和基因数据集。

表达数据集是测序或芯片获得的表达谱信息、样品分组信息是自己构建的文件、基因数据集是已知功能的基因集合。

表达数据集按表达丰度排列,也就是上图中热图所展示的。功能基因数据集中出现在表达数据集当中的基因所处的位置用黑色竖线表示。

富集分数ES是从排序后的表达数据集的第一个基因开始,如果表达数据集中的基因出现在基因数据集中则加分,反之,不在基因数据集中则减分。所以,富集分数ES是动态变化的。这条绿色曲线正是富集得分的体现,绿色曲线的峰值就是最大富集分数。若 ES 为正值说明在顶部富集如 A,若为负值说明在底部富集如 B。

若研究的基因数据集的成员显著聚集在表达数据集的顶部或底部,说明基因数据集中的基因在表达数据集中高表达或低表达;若随机分配说明表达数据集与基因数据集对应的表型无关。Leading-eage subset 即最大 ES 值前对应的基因,即对富集得分贡献最大的基因成员。

三、关键概念

富集得分 ES,在计算过程中不断加分或减分,因此它是个动态的数值,一般的数据图片中往往不呈现 ES 值,有的话也应该是最大 ES 值。

校正后富集得分 NES,是个常数,用来比较表达数据集在不同功能基因数据集中的富集程度。

名义 p 值,因为它没有进行功能基因子集大小和多重假设检验校正,因此称为名义 P 值,它描述的是针对某一功能基因子集得到的富集得分的统计显著性,p 值越小富集性越好。

错误发现率 FDR,该指标进行了功能基因子集大小和多重假设检验矫正,用于判断假阳性率。

总体错误率 FWER,用于检验出尽可能多的候选变量的同时将错误发现率控制在一个可以接受的范围。

Leading-eage subset 即最大ES 值前对应的基因,即对富集得分贡献最大的基因成员(又称为核心基因)。

四、与传统富集分析的区别

GO 富集分析通过分析差异基因在生物学过程,分子功能、细胞组成中的富集定位,从而对基因进行注释和分类,它通过设定 cut-off 值选出差异表达基因,对它们进行 GO terms 富集度统计学分析,计算出差异基因 GO terms 的 p-value 及 p-value 的 FDR 值(q-value),定位差异基因最可能相关的 GO terms,也就找出了该组差异基因最相关的功能或生物学过程或细胞定位等。

KEGG 通路分析和 GO 富集分析类似,选出差异基因,通过统计学分析判断差异基因可能和哪些通路相关。这两个分析方法都需要筛选出差异基因,忽略对结果有贡献但没有落在差异显著范围内的基因。而 GSEA 是利用测序或芯片获得的全基因组表达谱进行分析,不需要指定差异基因阈值,得出的结果更加可靠。

我们看上面这个图,基因数据集显然在表达数据集高表达区富集,而进行 GO 分析时通过 P 值或矫正后的 P 值 FDR 值筛选后只剩下左右两边少量的差异表达基因,与这里显示的基因数据集进行比对时显然没有明显富集,因此就会漏掉部分富集的数据集。

五、GSEA 的操作流程

分为 4 部分

软件下载:GSEA 是基于 JAVA 环境运行,因此保持 JAVA 为最新版本是 GSEA 软件运行的基础。

数据准备与结果解读下文进行详细阐述,

参数设置与软件运行具体内容详见后续课程。

结果分析是第四部分。

准备格式无误的文件是富集分析成功的关键,需要准备 4 种文件,分别为表达数据集、样品分组信息、基因数据集,基因芯片注释。

表达数据集,在生信时代 GEO、TCGA 等数据库是丰富的数据来源,但其本质都是通过各种测序或芯片平台获得的数据,格式多种多样,均可被 GSEA 识别。以 GCT 文件为例,excel 表头以#1.2 为固定格式出现,占据第一行第一列,第二行第一列是基因个数,第二行第二列为样本数,基因 ID 根据测序或芯片平台而有不同,需要在数据分析参数选择界面选择匹配的平台。Description 为基因描述,可空着。

样品分组信息,是我们自制的一个表,告诉 GSEA 分析软件我的数据集里有多少样本以及是如何分组的,使用 EXCEL 构建,按照下图所示构建即可。

功能基因数据集是某一特定功能/表型所包含的所有基因的集合,用来判断表达数据集是否有某种功能聚集最重要的文件;GMT 文件则需要在 GSEA 网页中下载,MSigDB将基因分为各种子集,各取所需。需要注意的是 MSigDB 中只包含人的基因序列。

链接:

基因芯片注释:不同测序或芯片平台所用的基因代码不一样,因此需要基因芯片注释文件来说明基因代码究竟是哪个基因,可以不用下载,GSEA 分析参数选择时直接选择相应的平台,如果你的表达数据库是从 GEO 等数据库下载来的,选择平台时注意和 GEO 中的 platform 一致。

六、结果解读

分析完成后会获得一个文件夹,里面有许许多多的图表。其中有个html文件是总体的分析结果,

红圈5 超链接里点进去可以看到 12 个高表达功能基因子集基因在该组别中的位置,以及详细的重要参数等。

接下来聚焦到具体每个功能基因数据集的结果:

当|NES|>1,P 值<0.05,FDR<0.25 这三者同时满足时,结果才有意义,一定要注意名义 P 值没有经过矫正而 FDR 值经过了功能基因子集大小和多重假设检验矫正,因此这两者都要关注。

下图是 GSEA 分析中最核心的图,由三个部分组成

最后是一个文献实例

    以上就是本篇文章【富集分析:GSEA 分析介绍】的全部内容了,欢迎阅览 ! 文章地址:http://sjzytwl.xhstdz.com/news/1702.html 
     栏目首页      相关文章      动态      同类文章      热门文章      网站地图      返回首页 物流园资讯移动站 http://sjzytwl.xhstdz.com/mobile/ , 查看更多   
最新文章
5寸屏手机有哪些(5寸屏手机哪款性价比高)
  关于《5寸屏手机有哪些》的文章  随着科技的不断发展,智能手机已经成为了我们日常生活中不可或缺的一部分。而在众多手机
真心分享华为HUAWEI nova 7 Pro 5G和荣耀X20 SE哪款好一些?有何区别?优缺点曝光买什么手机比较好用「真心分享华为HUAWEI nova 7 Pro 5G和荣耀X20 SE哪款好一
华为HUAWEI nova 7 Pro 5G和荣耀X20 SE哪个更值得入手?区别有没有?两个华为HUAWEI nova 7 Pro 5G和荣耀X20 SE区别不大的哈,通
如何让手机连接电视手机电视「如何让手机连接电视」
在数字化日益普及的今天,将手机内容投射到电视屏幕上已成为许多用户的日常需求。无论是观看视频、分享照片,还是进行游戏互动,
0P手机多少钱(0p手机最新款多少钱)
  关于《OPPO手机多少钱》的文章  随着科技的飞速发展,智能手机已经成为我们日常生活中不可或缺的一部分。OPPO,作为一个全
在家里如何进行有效健身运动?
在家里如何进行有效健身运动? 随着生活节奏的加快和外出运动场所的限制,许多人开始在家里进行健身运动。但是,在家里进行有效的健身运动并不是一件容易的事情。下面我们就来为您介绍一些在家里进行健身运动的方法,帮助您达到最佳的健身
探索AI视频生成:如何让画面活起来
探索AI视频生成:如何让画面活起来 随着科技的不断发展,人工智能技术在各个领域都有所应用,其中AI视频生成技术正逐渐成为广告营销和影视制作领域的热门话题。借助人工智能技术,视频制作变得更加高效和便捷,同时也为创作者们带来了更多
海底捞节假日期间打折规则详解让你的用餐更省心省钱!
海底捞节假日期间打折规则详解 海底捞是一家以自助火锅为主打的知名餐饮品牌,凭借着精湛的技术和独特的服务理念,深受广大消费者的喜爱。在节假日期间,海底捞更是推出了一系列打折优惠,让顾客们在用餐的同时享受更多的实惠。接下来,让
打造精致高效的中小型企业网站优化设计
精致高效的中小型企业网站优化设计 中小型企业是当今经济发展的重要组成部分,而拥有一家精致高效的企业网站将成为企业发展的重要支柱之一。优化设计不仅可以提升企业形象,更能够吸引更多的潜在客户,提高用户体验,助力企业业务快速增长
张家界市著名旅游景点一览
张家界:自然与人文的完美结合 张家界,是万千游客心中的一片人间仙境。它以其独特的喀斯特地貌著称,奇峰林立、峡谷深邃,犹如画卷般令人向往。这里有浓厚的历史文化氛围,同时又具备无与伦比的自然风光,不仅吸引了无数游客前来游玩,更
打造成功社区团购:水果蔬菜生意的经营秘诀与实操技巧”
打造成功社区团购:水果蔬菜生意的经营秘诀与实操技巧 在当下社会发展的大环境下,社区团购已经成为一种新的经济模式,其中以水果蔬菜生意更是吸引了众多创业者的关注。如何打造成功的社区团购平台,成为了许多人关注的焦点。接下来,我们
相关文章