GSEA
不太懂为什么现在生信分析这一部分都不喜欢写具体的原理,直接上来就是一堆怎么下载文件,怎么调用函数的操作,这篇文章想用通俗易懂的语言写一下原理部分,甚至贴一些代码。
今天看到的一个答案回答方式很喜欢
最简单的答案:
主要是把基因列表降序排列,再来看待富集基因list上的基因,每出现一个,曲线就上升,没出现曲线就下降,计算曲线的最高点的值,背景分布就是把基因顺序打乱,然后同样计算一个类似的值。
中等难度的答案:
这部分就是直接看原理部分,非常漂亮的公式,大致就分为两部分,在待富集基因list上的比例,和不在待富集基因list上的比例,这两部分最后都是1,所以最后能够回到0的位置,也就是曲线其实是两个比例的差值最后是0.
至于这个alpha怎么选就得看更难得公式推导了,一共是分了两种选择,一种是0,一种是1,具体选择哪一种可以看参考文献2,写得非常得详细。
关于为什么得分会存在负数
说明富集在尾部呀
关于NES(Normalized enrichment score)
最后得到的enrichment score是和gene list有关系的,gene list越大,那么得分越高,如何去掉这部分的影响呢,normalize
后记
到这里,就只剩下多重校正这部分还没看完了,后续填坑。但是还是不懂gsea里面pos和neg的区别,这个后续填坑吧。
参考文献:
1、https://www.biostars.org/p/398994/
2、https://www.pathwaycommons.org/guide/primers/data_analysis/gsea/