GSEA


不太懂为什么现在生信分析这一部分都不喜欢写具体的原理,直接上来就是一堆怎么下载文件,怎么调用函数的操作,这篇文章想用通俗易懂的语言写一下原理部分,甚至贴一些代码。
今天看到的一个答案回答方式很喜欢

最简单的答案:

主要是把基因列表降序排列,再来看待富集基因list上的基因,每出现一个,曲线就上升,没出现曲线就下降,计算曲线的最高点的值,背景分布就是把基因顺序打乱,然后同样计算一个类似的值。

中等难度的答案:


这部分就是直接看原理部分,非常漂亮的公式,大致就分为两部分,在待富集基因list上的比例,和不在待富集基因list上的比例,这两部分最后都是1,所以最后能够回到0的位置,也就是曲线其实是两个比例的差值最后是0.
至于这个alpha怎么选就得看更难得公式推导了,一共是分了两种选择,一种是0,一种是1,具体选择哪一种可以看参考文献2,写得非常得详细。

关于为什么得分会存在负数

说明富集在尾部呀

关于NES(Normalized enrichment score)

最后得到的enrichment score是和gene list有关系的,gene list越大,那么得分越高,如何去掉这部分的影响呢,normalize

后记

到这里,就只剩下多重校正这部分还没看完了,后续填坑。但是还是不懂gsea里面pos和neg的区别,这个后续填坑吧。

参考文献:
1、https://www.biostars.org/p/398994/
2、https://www.pathwaycommons.org/guide/primers/data_analysis/gsea/