生物信息学基础课程笔记:发文现状、数据获取、选题策略与方向探索
核心结论:这套基础课程围绕“为什么做生信、数据从哪来、如何获取、如何选题、方向基因怎么找”展开,主张公共数据库挖掘应尽量干湿结合,并以明确、细化、具新颖性的方向作为生信分析的起点。
一、课程定位与五部分结构
课程相当于一个基础课程,主要包含五个部分:
- 发文现状:解决为什么要学习生信,或者为什么要在论文中放入一部分生信内容。
- 基础理论和常用数据库:面向可能没有很多基础的老师,帮助理解数据如何从生物中获取、能够反映哪些信息。
- 选题策略和方向探索:解决如何开始生信分析。原文强调,如果没有明确目标,相当于大海捞针,很难做出比较新颖的点。
- 数据库数据获取:把选题缩小到一个范围,有针对性、有深度地进行生物信息学分析。
- 方向与基因获取:为后续补充实验或机制探索提供目标性。
整体目标是:在分析之初就能比较明确地判断选题好不好、应该选用什么样的选题、数据集怎么找、想要研究方向的相关基因怎么获取。
二、发文现状:为什么建议生信结合实验
2.1 纯生信时代基本结束,干湿结合更稳
原文明确提出:现阶段公共数据库挖掘非常建议补充生信,同时补充实验验证。纯生信的时代在 24 年末到 25 年已经差不多结束。原文说,到 25 年年末到 26 年再看大部分发表文章,基本上都会加一些验证,包括:
- 基础的体外细胞造模;
- 检测一些基因的表达;
- 验证一些通路的蛋白;
- 检验几个炎症因子;
- 做一些基础的表型功能实验。
也就是说,现在更偏向 干湿结合,而不是纯生信。公众号现在还会推纯生信发文,但对于个人来说,实际一点看,生信结合实验会更加稳、更加好投,投稿周期或被拒稿次数都可能小很多。
2.2 公共数据库的优势
原文主要提到两个数据库:
- TCGA:纯肿瘤数据库。
- GEO:包含很多疾病,常见肿瘤和非肿瘤都有。
公共数据库的优势包括:
- 数据丰富度和多样性高
转录组方面包括批量转录组、单细胞转录组,以及近期在高分文献、二区或一区能看到的空间转录组。除转录组外,还有甲基化数据、染色质可及性数据等。原文提到“TTC、ACTC”一类染色质可及性数据,名称转写不完全清晰。数据任何人都可以下载。
- 免费开放与更新迅速
国内一些数据库或国家生物信息平台的数据可能不公开,使用有门槛,比如需要与课题组、通讯作者认识,或本身是教授、副教授才可能申请到。GEO、TCGA 则是免费开放的数据集,更新速度也较快。例如肿瘤开发了新药物,过一段时间可能就有针对细胞或小鼠给药、非给药的测序结果,可以利用别人的数据判断选题或方向有没有研究价值,至少节省成本。
- 技术门槛相对较低
做生信分析只需要一台电脑、R 语言这个免费软件,以及一些基本编程语言,就可以进行基础数据分析。相比实验验证,比如动物造模、小鼠造模、培养细胞,实验不光涉及技术,还涉及器械,比如流式需要买对应仪器,去高校借用也可能按次付费。因此生信门槛相对低。
- 发文效率较高
原文提到一个基础调研:最近几年结合单细胞或空间转录组的发文数量逐年递增,检索到的文章二区或一区占比较高,三区也有,但很少出现结合空转、单细胞和一堆生信分析后还只是四区工作量的情况。若结果不好或主线不清晰,才可能落到较低分区。因此生信分析的重要性逐年递增。
- 周期短
相比做实验,生信周期肯定短。课程隔一段时间上一节,一边学一边就可能得到自己想要的结果。整理生信结果、得到基因后,再有针对性地做实验,比毫无目的地通过文献检索再找方向更快。
- 符合期刊要求
有些老师会怀疑生信是否专业、审稿人是否认可。原文明确说不是。看现在的 Nature、Cell 等高顶刊,大部分测序数据都很丰富。甚至有研究针对一个或一群患者取样,进行单细胞分析,只弄清楚研究疾病中组织里免疫微环境的组成、每种细胞有多少种或多少亚型、是否有相互协同作用,通篇只做这一件事,也能发到很好分数。当然,这也因为其更偏临床,取样和成本都很高。但至少说明生信分析满足现在文章或主流期刊要求。
- 机制可以做得更深
如果想深入机制,可以通过生信分析得到靶点并验证,再做敲除、过表达等实验,得到 A 基因的下游基因、下游通路,完成“表型→基因→通路→B 基因”的完整一条线或一条轴。这种有深度的挖掘基本可以到二区,可挖掘价值较高。
三、基础理论:组学数据从何而来
3.1 中心法则与组学产生逻辑
高中就学过中心法则:DNA 转录成 RNA,翻译成蛋白质,最终蛋白参与代谢过程,把水、碳水化合物等基础能量转化成生命活动所需的代谢物,维持生命。组学就是在这些过程中产生的。
- 基因组:所有 DNA 的集合,包含所有遗传信息。DNA 以 ATCG 碱基排序储存遗传信息,并以染色质形式存在。原文提到“21 对常染色体、性染色体”,此处数字可能有口误。基因组研究更偏向探究不同疾病是否由某一个突变造成,对比哪些位点发生突变。
- 转录组:研究 DNA 转录成 RNA 的过程,包括哪些蛋白或调控过程促进 RNA 降解、维持 RNA 稳定、加快转录。RNA 是把信息翻译成蛋白的中间环节。如果模板减少,对应蛋白数量可能减少;但如果模板数量没有改变,蛋白含量增加或减少还需要进一步研究。生命体很聪明,会评估自身状态,节约能量和资源。转录组 mRNA 翻译成蛋白涉及很多能量过程,比如招募氨基酸、以大亚基小亚基形式结合在链上、结合游离氨基酸、进行翻译。
- 蛋白组:测蛋白组时一定以氨基酸链形式去测。但真正有没有功能,还要看蛋白结构,必须经过高尔基体等细胞器修饰、空间折叠,形成三维立体结构,还可能需辅酶修饰,最终才能成为有活性的蛋白酶。因此很难在蛋白组上评估它是否真的发挥了确切的蛋白酶功能。
- 代谢组:需要深入看确切的由酶参与的 A 物质转换成 B 物质的过程,是否真的造成中间产物变化。
转录组、基因转录、蛋白和代谢紧密相连。如果想研究得很深入,需要做常见的多组学联合分析。但课程主要针对转录组进行初步探索。如果发现某一个转录本数量有变化,就可以针对这个转录本做实验,比如研究 A 基因到 A 蛋白,A 蛋白是否催化一个过程,有针对性地探究相互关系。
3.2 柠檬酸合酶与 TCA 循环的例子
原文用 TCA 循环第一部分举例:柠檬酸合酶催化,最终产生柠檬酸。希望学习者看着四个组学去思考:
- 想研究柠檬酸合酶的数量:可通过转录组和蛋白组。
- 想知道柠檬酸合酶是否因为突变造成功能缺失:可针对基因组研究。
- 想知道确切的柠檬酸合酶是否因为数量变化或功能缺失,导致不能完成催化反应:可能需要结合代谢组,看是否真的影响到柠檬酸含量。
即使是一个很短的反应过程,也能用组学思考方式进行思考。
四、各组学作用、场景与差异
原文强调,分析主要以 GEO 公共数据库来做。下面是原文对转录组、单细胞转录组、蛋白组、代谢组的对比。
| 组学 | 原文描述的特征 | 常见用途 | 数据来源/工具 | 局限 |
|---|---|---|---|---|
| 转录组 | 更趋向组织平均水平,忽略不同细胞、同种细胞不同状态,以平均水平看待问题 | 检测血液或一块组织整体基因水平改变;筛选核心基因或与研究方向相关的基因集 | GEO、TCGA 等公共数据库 | 看不到细胞异质性 |
| 单细胞转录组 | 把研究拉到更微观水平,知道组织中有哪些细胞、哪些亚型 | 研究细胞间相互作用、免疫微环境、药物对细胞影响、CD8T 被招募到恶性上皮细胞周围杀伤等 | 大部分来自 GEO;CellMarker 查 marker | marker 有组织特异性,外周巨噬细胞与组织固有巨噬细胞 marker 可能有差异 |
| 蛋白组 | 以测序为主;真正有异常的蛋白数量少于转录组数量 | 看转录后翻译调控;非编码 RNA 可能调控翻译过程,抑制或阻碍翻译 | 常需自测序 | 公共数据集不多,多上传原始数据,非处理好的矩阵 |
| 代谢组 | 以自测序为主;分靶向和非靶向 | 靶向如脂质代谢组学,测不饱和/饱和脂肪酸链,可关联氧化应激;非靶向范围大,看组织中有多少化合物 | 常需自测序;可关联 16S | 公共数据集不多,多上传原始数据,非处理好的矩阵 |
4.1 转录组
转录组测序结果是一个二维矩阵:横坐标是每个样本的样本名,纵坐标是注释到或芯片上测到的基因名,中间是对应每个样本、每个基因的表达量。主要过程是提取总 RNA,逆转录成 cDNA。真核生物转录过程会加工,去掉内含子,只保留外显子,所以需要提取 RNA、逆转录成 cDNA,再读取有编码信息的序列。它全面检测全部 RNA 分子种类和数量,主要研究对象是有编码蛋白质能力的 RNA,即 mRNA,原文写作“mi”。
常见用途:
- 两两比较,比如疾病与正常、治疗与疾病,找到疾病组相对正常组中异常激活或沉默的基因,即差异分析。
- 常见图:火山图、热图;后面也可以画小提琴图。
- 原文特别强调:如果做耐药与非耐药,或者后面针对 A 基因敲除送测,组间样本数量至少是 3V3 才具有统计学意义。小于 3V3 没有统计学意义,肯定会被质疑。
- 获取差异基因后,进行 KEGG 和 GO 富集分析,看有没有关注的信号通路、相关表型。
- 还可以做 PPI,关注蛋白是否有调控其他蛋白的可能性。如果蛋白异常后可以调控其他蛋白,重要性就体现出来。蛋白和蛋白互作很常见,有些蛋白被翻译出来后会拽着其他蛋白一起进入消耗或降解过程,所以需要放 PPI 图,体现筛选基因之间潜在的相互作用关系。
4.2 单细胞转录组
单细胞转录组也是转录组,提取总 RNA、逆转录成 cDNA、再测序。但除了样本和对应基因表达量一一对应之外,单细胞还多了细胞信息,因为它以每一个细胞去识别、再测序,相当于多了一个维度。
分析步骤包括:
- 质控归一化;
- 聚类和注释;
- 差异分析;
- 富集分析;
- 细胞通讯,研究免疫环境;
- 拟时序分析。
拟时序可简单理解为:取样那一刻,即使巨噬细胞也存在多种状态,对细胞进行持续模拟,看哪些细胞处于分化早期、哪些已到末端。探究每个细胞或亚型主要在哪个阶段分布也有意义。
原文提到单细胞结果组 figure 基本可用五张图:
- 聚类注释好的图;
- 可以把不同部位转移单独展示,或疾病亚型每个亚型放一个图;
- marker 的 UMAP,展示所选 marker 确实有特异性,只在一簇细胞中表达;
- 富集图,区分细胞中哪些基因发生异常改变、富集到哪些通路;
- 网络图,直观看到 T 细胞、免疫细胞、NK 细胞与成纤维、上皮细胞在同一网络上体现,线条粗细、程度反映强度和通讯频率,根据基因表达量计算,可估算细胞间潜在互作关系;
- 拟时序图,有时序起点,颜色有人喜欢由浅及深,也有文章由深及浅。时序零相当于初始状态,还没有分化,较早期;越往后越到末端分化状态。
注释 marker 时,可参考公共数据库数据集的原文献。原文说,发表出去后自测区大部分在二区及以上,注释结果比较准确,可作为分析基础参考。不同组织 marker 有特异性,比如同样都是巨噬细胞,外周巨噬细胞和组织内固有巨噬细胞在 marker 上会有差异。
4.3 蛋白组与代谢组
蛋白组方面,根据分析经验或测试经验,测序回来后会真正有异常的蛋白数量少于转录组数量。这对应了转录后翻译仍有调控作用,比如非编码 RNA 可能调控翻译过程、抑制或阻碍翻译。
代谢组也以自测序为主,主要有两种类型:
- 靶向代谢组学:可有选择地做脂质代谢组学,测到不饱和脂肪酸或饱和脂肪酸链,有具体名称,可知道组织中哪些脂质相关代谢物含量有变化。若要关联方向,比如不饱和脂肪酸增加是否促进氧化应激,是否作为氧化应激底物最终导致细胞死亡,这种研究很多。
- 非靶向代谢组学:范围较大,没有明确只研究酸类、氨基酸类,只是想看组织中有多少化合物,推荐做非靶向。
蛋白组和代谢组做到后面,为降低成本,大部分是针对体外细胞做关键基因敲除,再测序,观察 A 基因影响哪些通路或代谢物含量变化。代谢组还可以关联 16S,不一定必须测组织或血液,可以测粪便。现在很多研究做菌群含量变化,导致粪便中微生物产生次级代谢产物,分泌到小肠上面被吸收进入循环,然后可研究粪便中有哪些化合物、是否入血、是否能通过血脑屏障进入脑。蛋白、代谢和 16S 都需要以自测序为主。公共数据库虽然有,但关于这三个组学的数据集不是特别多,而且大部分情况下不会上传处理好的矩阵,一般以原始数据形式上传。所以没有必要去处理,完全可以自己做有针对性的研究。
五、常用数据库与数据获取
5.1 TCGA
TCGA 主要是癌症数据,一般包含基因组、转录组和临床数据,对同一批患者同时记录三种不同信息。
- 基因组:可知道基因是否发生突变;不同样本中该基因突变是否常见;基因突变是否影响患者生存。
- 转录组:基因表达量。
- 临床数据:因为做肿瘤更关注患者生存,以及某些基因或治疗方案是否影响生存,所以记录更详细,包括患者年龄、性别、肿瘤分期、分级、生存、治疗方案等。性别对某些肿瘤有明显偏向,比如前列腺、乳腺,其他肿瘤性别区分少一点。可进行组间对比,探究关注基因在生存时间、年龄、肿瘤分期或转移情况下是否有差别。
获取方式:
- GDC:公共官方门户,原文也写作 JDC。信息没有处理,自己还要进行很多处理。
- UCSC:比较推荐,因为它已经做好基础信息整合,整理成二维矩阵。遗传信息可以通过原文标注的“bile”数据库获取,名称转写不完全清晰。
GDC 获取步骤原文描述:
- 进入 GDC 门户,看到数据集页面;
- 点击相当于构建数据集,缩小范围;
- 选择数据库,里面有 20 多种数据库,只勾选 TCGA;
- 进入对应数据集;
- 点击个性化筛选;
- 跳转页面后有标签,告诉你项目包含哪些数据、TCGA 项目、具体分型;
- 一般会有未公开数据,需要选择转录组数据,然后选公开;
- 添加到购物车,看到购物车有多少样本;
- 每个样本信息很多,可下载临床信息或具体矩阵。
原文说,一般情况下处理起来比较麻烦,所以更推荐 UCSC。大部分癌症都能找到。通过 UCSC 的 DATASETS 数据集,可有针对性地选择想要关注的数据。原文以结肠腺癌为例,可获取结肠腺癌基础信息。下面矩阵是每个患者对应的每个基因表达量。它分得很细,包括基因矩阵信息,不同格式代表不同标准化过程:count 是最一开始的数量,FPKM 和 TPM 都是常见格式,甚至 TPM 是现在主要进行数据标准化的格式。生存信息和其他临床信息最终匹配下来以生存信息为主,最终可能也就是 510 多个样本。每种格式比如 OS 会以 0 和 1 形式记录,比如存活了多久、最终结局是什么,这些信息都整理好,下载比较容易。
5.2 GEO
GEO 肿瘤和非肿瘤都可以用,信息不只转录组,还有单细胞转录组数据。它由美国构建。原文提到,国内数据库很难获取,一般国家基因组科学数据中心的数据获取不了,可能有关系可以尝试要一下,但可能被不理或拒掉,所以还是以 GEO 为主。
GEO 结构:
- 高通量测序有两种:芯片测序和高通量。
- 芯片:比较旧的萃取方法,可理解为在一个芯片上有很多探针,每个探针对应芯片上的探针名字,还有一个表格说明探针对应的基因名是什么。探针上有一段序列,会抓取对应基因片段,即 mRNA 片段。需要下载对应公司的产品编号,一般以 GPL 开头,常见的是 GPL570、GPL96,其他现在也用得很多。
- 数据集样本信息:数据集编号是常见编号。每个研究都会有一个对应包含多个样本编号的集合。主要研究三个:芯片、数据集编号、样本编号。每个样本匹配一个编号,编号下面有对应样本测到的芯片和具体值,所以记录比较多。
- 数量关系:DATASETS 很标准,只有部分数据能被标记为很标准的数据,所以数量比较少;大部分任何人上传数据都会得到一个数据集编号,数量很多;sample 是每个数据集中的每个样本都会有一个变化,所以数量最多。只要知道芯片、数据集编号和样本是什么,GEO 数据库基本上都能看懂。
GEO 数据集信息:
- 点开任何数据集,能看到数据集上报时间、研究名称、取样物种、实验主要做了哪些内容;
- 还能看到哪些文献引用了这篇文章或这个数据集;
- 芯片信息:最关键的是探针名称,以及最后 gene symbol,即基因比较标准的名称。我们只需要用这两点进行转化,把芯片 ID 转化成常见基因名;
- 下载:转录组一般可通过数据下载矩阵文件,是 TXT 格式,点 TXT 就可以获取矩阵数据。如果这个地方没有,或者很明显看到文件很小,可能只有几 K,那大概率放在 supplementary 补充文件里。补充文件也可以个性化下载,因为有时分组比较多,可以只下载需要的分组。所以只需要获取芯片数据和矩阵文件就可以。
肿瘤患者信息更多,因为非肿瘤 GEO 很少上报个人信息,属于隐私。但肿瘤患者比较急切,所以常见生存信息、患者特征,可以通过点每个样本编号看到,里面有一些基础信息。
单细胞方面,大部分信息与转录组一致,只是格式问题。单细胞是三维矩阵,所以会有:
- 记录了基因表达矩阵的信息;
- 基因和其他特征的信息;
- 具体细胞是谁的信息。
也就是三个矩阵文件。原文说“这个时长这个是最标准的格式”,名称转写不完全清晰,可能指 10x 一类标准格式。有这三个文件的数据集肯定能用。单细胞还有其他格式,比如 H5、注释好的 RDS 文件,或者把几个矩阵信息匹配到一起组成整体 TXT 和 Z,或者 CSV 格 Z 压缩形式,也还是可以用。不要因为格式有问题就不用它。但如果数据集数量比较多、可选比较多,还是优先建议用这种标准格式,比较好理解或比较好用。
初步整理建议:
- 对要研究的疾病,整理可用的数据集有多少、组织类型是什么、分组信息是什么、样本量多少;
- 单细胞数据集还要收集对应原文献,后面做注释可以采用它的 marker;
- 建议自己收集一个 Excel 表格,以芯片、数据集、有哪些信息这样的格式收集,比较规整;
- 后面做验证或没有筛到想要的基因、想换数据集时,不会那么盲目,知道可以换相同测序、相同组织类型的数据集。
六、选题策略
6.1 疾病怎么确定:大众还是小众
选题策略主要涉及关键问题:疾病怎么确定。来听课的人可能已有明确目标,但这个目标选得好不好、合不合适,需要通过这一部分解决:如何评价选的疾病适不适合做分析、好不好发文章。实际一点,主要是看数据集的可及性与质量。
大众疾病,如癌症、糖尿病、脓毒症、心血管疾病:
- 优势:常见,数据集很多;尤其转录组或单细胞转录组丰富度高;有多种组织,比如取血、取组织,可根据个人条件和实验选择性使用数据集。
- 劣势:已经研究很多。前几年讲卷了的铁死亡、铜死亡、各种自噬凋亡、氧化应激,基本都已被做过,常见还有衰老。面对的问题是如何通过新颖出发点、新颖视角看待大热门疾病。
- 新颖点如“安代谢安死郎”、a loop、G4 等,原文名称转写不完全清晰。这些方向可能已被人同步研究,如果进度慢,等到要发时可能已被抢发,竞争激烈。
小众疾病,如肝豆状核变性:
- 本身是由于某个基因突变造成铜代谢异常,原文写作“酮代谢异常”,可能为铜代谢。
- 优势:因为稀缺,如果能得到一点分析、有研究价值的机制或通路,发文也会容易一些,可能就是一个原创性研究;选择方向或出发点时更容易。
- 劣势:调研数据集时比较受限。比如在做 GEO 时,原文提到“westen be”,可能指 Wilson 病,现在只有一个比较好的单细胞数据集,想换都没地方换;没有注意到想要的细胞,想换一换或增加细胞数量都很受限。不像肿瘤可以一直往里面叠加数据,把单细胞数量扩大到十几万、二十万甚至三四十万,用大量样本量或细胞数量支撑分析。
6.2 在大众疾病内部缩小范围
如果不想以泛角度谈问题,可以有针对性地以成熟亚型做研究:
- 按基因表达分型:乳腺癌常见 ER 阳、ER 阴、HER 阳、HER?以及三阴乳腺癌,有比较细的分型。可根据分型设定范围。一旦范围有针对性,就有新的选题。
- 按基因突变分组:比如研究 TP53 突变患者中还有哪些异常,突变和非突变可作为分组依据或选题框架。
- 按进展阶段:肿瘤出现淋巴结转移或远端转移,甚至转移到骨头造成骨痛,有更细研究。小众或别人还没研究的领域可以再做。
- 耐药与非耐药:这是比较有临床价值的选题。肿瘤患者药物更新迭代速度快,更新迭代也主要因为会出现耐药性。不同分型患者会出现治疗有效、无效、有效但不完全的情况。可以针对某一种药物的耐药患者,找比较关键的靶点,作为之后开发抑制剂、做治疗的方向。这样既连接临床,又有自己的独到思考。
- 非肿瘤分型:更像临床诊断时做的分析。比如心肌病有扩张型、缺血型,可以只做缺血性心肌病,缩小范围。
- 脓毒症:结合临床患者数据常用血液,但如果想知道脓毒症是否影响肾脏或心肌病,也可以取受累器官研究,小鼠到模型的数据集也很多,可有针对性地整合,变成可用的大样本数据。
- 糖尿病:受累器官很多,比如血液、皮肤、糖尿病视网膜病变、骨骼肌病变等。可以从大众的血液疾病细化到针对某一具体组织研究。
原文建议:因为一开始提到需要进行实验验证,所以选题时要统筹思考。统筹和思考是设计文章之初最关键的能力。除了选题是否好做、是否有新颖性、是否有数据基石,还要考虑后面做实验能否取到样本。比如做临床,能取到哪些样本;是否可做多组学验证、多组织验证,既测血液又测组织;做体外时如何造模,造模是否容易,能通过哪些方式进行模型构建。
例如帕金森病:单细胞数据可取的细胞有很多种,比如神经元、兴奋适应神经元、小胶质细胞、双纤维细胞等,但选择哪一个细胞作为关键的单细胞分析细胞,需要结合实验验证。如果后期知道要做实验,就尽量选择可以造模的细胞。研究脑部疾病时,大多数人会优先选择小胶质或神经元细胞,因为它在造模上有参考文献,后面有比较宽泛的能力去选择如何验证、如何挖掘。所以设计或选题时不要只考虑分析,如果要发文,还是稍微多看文献,整理现在用哪些造模、哪些是新颖方法。
总结:小众疾病更容易找选题方向、更容易发文,但自我分析过程比较困难,可能需要不停调整阈值;没有好结果时可能没有换数据的方法,最终还是会落到自己测序。大众疾病虽然数据很多,但要找到别人没有思考过的点也很困难。综合下来,最后一个板块比较重要:如何选题、如何找切入点。
七、方向探索与切入点
7.1 切入点的重要性
为发文,切入点的重要性在于:
- 有实际应用价值;
- 明确目标、有针对性。
否则,对于筛选出来的基因,不知道要往哪个方向研究。肿瘤可能筛出几千个差异基因,非肿瘤也可能有两三千个;富集之后通路也很多,怎么选?做完机器学习也许还会剩下一些基因。即使继续学习后可能剩更多,三五十个不可能都做满。方向会让研究更有针对性:某个基因和方向有没有关系、有没有被人家做过、如果做功能实验验证能做哪些、下游是什么、最终影响什么表型、能不能做验证。基于这些考量,可以把研究落到实处,进而推得更深。
临床基础结合:耐药和非耐药是较好切入点。非肿瘤疾病也会有一些药物治疗数据,可以针对某一个疾病,在 GEO 数据库里特异性地找有没有这种治疗数据,结合进来,写背景时更容易跟临床价值挂钩。
申报课题:现在不管是医生、博士,甚至硕士,申请科研项目、写申请书,总得告诉审核专家:做这一切的落脚点是什么、出发点是什么,这很关键。要有实际应用场景。例如研究青光眼,最终研究表型是否跟氨基酸代谢有关系,是否由于氨基酸代谢异常或某一个脂肪酸代谢异常造成疾病加重,抑制这个表型是否有所恢复。它会落脚到一个比较具体的小部分。如果太泛,其实不好写重要性。
7.2 获取前沿信息和方向的方式
- 文献和综述
比较常用。综述是总结性文章,可以总结现在哪些稀缺,查缺补漏。但综述是之前几年研究累积,有滞后性,太旧,需要选择地看。
- 国自然热点
现在国自然申报应该结束了,原文提到去年的申报结果,是中医研究院的一些项目。大多数题目能够把一个机制或预期机制写得比较明确。比如研究哪个药方通过哪个机制治疗疾病;有些会明确提到研究的靶点是什么,通过调控 CD4T 和 B 之间相互作用研究疾病。范围更小。所以不能把一个很泛的题目当作目标,需要在分析之前或设计之前就有比较细节的问题。
- 文献和盘面数据库检索
通过数据库检索。比如做肿瘤,会有很多同质性肿瘤。对于乳腺癌,铁死亡这条通路被抑制了,那么在其它实质性肿瘤中是否也存在相同或类似机制?可以借鉴其他肿瘤的研究方向。如果这个方向没有在你关注的肿瘤中做过,就可以拿来作为选题。 肿瘤和非肿瘤思考方式不一样:肿瘤尽可能在肿瘤细胞中激活铁死亡;非肿瘤疾病可能要抑制铁死亡,不要让它产生那么多损伤、那么多细胞凋亡、加重疾病。筛选到基因后,总得思考这个基因对疾病是促进还是抑制。 检索到的结果一般是生信文章,会比较明确:用了哪些算法、哪些数据、方向是什么、研究过程是什么。例如第一个例子用单细胞转录组数据分析,揭示泛素化会促进慢性疾病加重,比如肝或肺由 COPD 或非酒精性脂肪肝向肝纤维化或肝肺纤维化转化。关注的基因是促进还是抑制这个过程,需要通过分析数据结果、通路,甚至前期调研、前期文献来确定最终机制。但一开始就要考虑好研究的表型是什么,比如关注慢性疾病到纤维化,肿瘤一般关注预后、生存到死亡。常见的是疾病到疾病诊断,或者肿瘤预后。写题目时也可以更明确一点,如果更深入,可以写成糖酵解当中的某一个基因作为什么什么的预测机制。
- 公众号
原文把公众号放最后,也不怎么推荐用公众号获取方向或选题。因为公众号有特殊性:有可能是约稿,也有可能是人家自测序。虽然看起来做得不难,但单细胞测序一个样现在都得七八千,可能测了几十个甚至 100 个,前期投入成本非常大,肯定不是小课题组去做。人家获取临床信息也很困难,比如设立治疗和非治疗两个组,需要收患者、需要随访,成本很高。所以不能光看它说纯生信、只做简单分析就投到某个分区,还是要结合实际判别它是不是比较特殊的文章。一般情况下,如果现在自己生信结合实验,想要发表,实验工作量会很大。
7.3 最关键原则:新颖性
最关键的原则还是新颖性。必须至少保证所关注的疾病结合方向,没有人通过生信挖掘过。不然别人筛过了,对于这个数据和方向来说,这些基因很重要,再去强调这个事情就没有什么吸引眼球或创新的地方。要结合切入点,让审稿人发现:这个切入点当中,疾病里面有哪些基因很关键,并关联到了切入点的表型。
7.4 推荐方向
原文简单罗列了一些现在方向,标红部分比较推荐。原因如下:
- 翻译后修饰:可能做不了实验。
- 微生物互作、肠道菌群、免疫微生物组串扰:必须做动物,小鼠肠道微生物检测成本太高。
- 比较推荐做常见分析方向:
- 程序性死亡:可以选一些不怎么常见的,比如溶酶体依赖性死亡;
- 免疫:可以选择巨噬细胞当中的某一个亚型,研究它促进或抑制疾病;
- 代谢紊乱:肿瘤和非肿瘤都比较常做。代谢紊乱会影响疾病。比如对于骨头,可能关注氨基酸代谢或脂质代谢是否影响膜的生成。后期要测一个细胞当中是否真的发生这个过程,测代谢物含量,甚至有一些会有试剂盒,很容易检测。综合评定下来,比较推荐代谢紊乱。
- 如果要互作,单细胞也可以体现。比如关注小胶质与神经元互作,可以通过单细胞实现;免疫细胞与基质细胞互作,也可以通过单细胞实现。原文说这里设立的几个方向都是实验上比较好做、申请上也可以实现检测的最终方向,可以作为参考。具体需要结合疾病,再去数据库检索。
7.5 方向基因如何获取
一般获取方式有四种:
- 高分文献整理
比如线粒体和溶酶体接触,或者肿瘤中的肿瘤线粒体转移。做这个方向的文章会总结哪些基因确切影响这个过程,也会有更高分文献备注。如果做相同方向,可以参考它获取方向基因的方法。
- 数据集和数据库
“基因 cut”很常见,可能十篇文章前有八篇都用这个数据库,但现在不是很推荐。因为输入什么都会有八点出来,根据置信度或相关性检索,准确性有问号。还是推荐通过文献获取,或者通过后面提到的“E口清这个 MC 和 dB”“AGG”或“reaction(Reaction)”等反应数据库获取。原文名称转写不完全清晰。 做免疫、铁死亡、衰老,会有很单独的数据库,但这种单独数据库也比较少,也就这么几个方向有。再加上 a loop、G4 也有。可以检索方向相关文章,生信文章都会罗列。如果前人研究比较多,以至于单独整理出数据库,就可以获取。 如果做代谢通路方向,有代谢紊乱,那这三个数据库就可以获取相关通路中的一些基因,并解析具体这个通路当中哪些基因发生异常。
- 药物数据库
从国自然也能发现,现在做药物研究很多,比如中药复方进一步挖掘潜在治疗靶点,通过哪些表型治疗疾病。如果自己是中医,或者有科室经验方,或者老师研究某一个药物、小活性成分,可以尝试把它作为一个方向:某活性成分可作为潜在治疗某疾病的药物,然后挖掘机制。 毒物也可以。24 年年底网毒发文非常容易,比如常见的农药残留、兽药残留,甚至药物制备过程当中的单体残留,可以作为潜在损伤靶点。研究思路和网药不一样:网药是治疗疾病,网毒是农药、兽药残留进入体循环后可能造成疾病。逻辑一样:检索毒物潜在靶点,作为一个方向。
- 细胞作为方向
后面会做单细胞分析。如果做完差异,想关注巨噬细胞在疾病和对照之间异常的基因,可能影响疾病,那么可以把巨噬细胞当中获取的差异基因作为方向,以目标细胞作为研究起始点,也是不错的。现在做相互作用的文章也很多。
八、整体总结与行动清单
课程整体基础内容介绍完毕,涉及五个部分:发文现状、基础理论、数据库怎么看、选题策略、方向应该怎么选。有这几部分作为开始,至少可以在分析之初比较明确:
- 选题好不好;
- 应该选用什么样的选题;
- 数据集怎么找;
- 想要研究方向的相关基因怎么获取。
可整理为行动清单:
- 优先干湿结合:纯生信时代基本结束,生信结合实验更稳、更好投。
- 至少保证 3V3:做组间比较、耐药与非耐药、敲除后送测,组间样本数至少 3V3,否则缺乏统计学意义。
- 熟悉核心数据库:TCGA 用于肿瘤,GEO 用于肿瘤和非肿瘤;TCGA 可通过 GDC 或 UCSC 获取,推荐 UCSC 的已整合矩阵;GEO 重点掌握芯片、数据集编号、样本编号、GPL、TXT 矩阵、补充文件。
- 单细胞重点看三矩阵文件:基因表达矩阵、基因和其他特征、细胞信息;有这三个文件通常可用;其他格式如 H5、RDS、TXT+Z、CSV 压缩也可用,但可选多时优先标准格式。
- 自己整理 Excel:记录芯片、数据集、组织类型、分组、样本量、原文献和 marker,便于后续换数据集和验证。
- 选题要统筹:考虑数据可及性、新颖性、实验样本、造模难易、多组织/多组学验证可能性。
- 方向要明确:避免太泛;结合临床价值、国自然热点、文献检索、药物数据库、细胞差异基因;推荐代谢紊乱、程序性死亡、免疫亚型、细胞互作等实验相对好做的方向。
- 新颖性是底线:至少保证疾病+方向没有被生信挖掘过。
九、限制与待确认问题
原文是口语化课程转录,部分专有名词、数字和方向名称转写不清,需要在后续学习中核对:
- TCGA:原文多处写作“TCJ/TCJ”。
- GEO:原文也写作“JO/GO/GOTCJ/GO”。
- GDC:原文也写作“JDC”。
- UCSC 中用于遗传信息的数据库:原文标注为“bile”,名称转写不清。
- 染色质可及性数据:原文提到“TTC、ACTC”,名称转写不清。
- 单细胞标准格式:原文说“这个时长这个是最标准的格式”,可能指 10x 一类标准格式,但名称不确定。
- 方向基因数据库:原文提到“E口清这个 MC 和 dB”“AGG”“reaction(Reaction)”,名称转写不清。
- “基因 cut”:可能指 GeneCards 一类数据库,但原文如此,准确性存疑。
- “安代谢安死郎”“a loop”“G4”:原文转写不清,可能对应某些新方向名称,需核对。
- “westen be”:可能指 Wilson 病,但不确认。
- “酮代谢异常”:在肝豆状核变性语境下可能为铜代谢异常,原文如此。
- “21 对常染色体、性染色体”:原文数字可能有口误,人类通常为 22 对常染色体加 1 对性染色体。
- 时间:纯生信时代在 24 年末到 25 年差不多结束;25 年年末到 26 年大部分文章加验证;24 年年底网毒发文容易。
- 数据:TCGA 生存信息最终匹配可能为 510 多个样本;单细胞测序一个样七八千;有文章测几十个甚至 100 个;3V3 是原文强调的最低统计要求。
- 原文未提供来源链接或具体文献列表,后续需要自行检索核对。