420万细胞+382表面蛋白:CAPTAIN多模态单细胞基础模型,让"转录组算蛋白"成为现实
一句话结论:现有的单细胞基础模型几乎都只"读"转录组,而 Nature Communications 最新发布的 CAPTAIN 首次把**转录组 + 382种表面蛋白**一起预训练,在 420 万共测单细胞上学会"统一表征",既能零样本预测蛋白表达,又能把细胞注释、批次整合、细胞通讯一次性做透——尤其发现了与 COVID-19 重症相关的 S100A9–CD36 免疫轴。
单细胞测序让我们能看清每个细胞的"身份",但一个长期被忽视的事实是:基因表达只是中间代理,真正决定细胞表型的是蛋白质。尤其在免疫、发育等场景里,表面蛋白(CSP)才是关键表型决定因子。可现有的单细胞基础模型(scGPT、Geneformer、scFoundation 等)全都只拿转录组训练,天然"看不见"蛋白层面。
这篇 Nature Communications 论文给出的答案,是一个叫 CAPTAIN 的多模态基础模型——它把"转录组"和"蛋白质"放在同一个表征空间里一起学。下面用 5 张关键图,把它到底强在哪讲清楚。
一、CAPTAIN 是什么:一套"RNA+蛋白"统一表征
CAPTAIN 的核心思路并不复杂:用 CITE-seq 这类"共测"数据,把转录组和表面蛋白配对喂给同一个 Transformer,让模型在预训练阶段就学会两种模态之间的依赖关系。
支撑它的,是一个名为 scT&P-4M 的预训练语料库:
- 420 万+ 共测单细胞(人 + 鼠) - 382 种 经过严格标准化注释的表面蛋白作为"蛋白词表" - 覆盖 13+ 组织器官系统、11 类 疾病类型

▲ 图1|CAPTAIN 模型架构、训练策略与预训练语料总览。左:基于 Transformer 的多任务联合训练,学习转录组–蛋白组的统一表征;中:可迁移到蛋白填补、聚类、整合、细胞注释、批次校正、细胞通讯等下游任务;右:scT&P-4M 语料的规模与覆盖面(420 万细胞 / 382 蛋白 / 13+ 组织 / 11 疾病)。
换句话说,CAPTAIN 不是"为某个任务定制"的模型,而是一个通用的、蛋白感知的单细胞底座。
二、从 RNA 预测蛋白:微调与零样本都顶用
最直观的能力——只给转录组,能不能算出表面蛋白表达?
论文在 4 个 CITE-seq 数据集上,把 CAPTAIN 和 Seurat、sciPENN、TotalVI、scTranslator、scTEL 五类方法对比,用 Pearson 相关系数(PCC)和均方根误差(RMSE)衡量:
- 在微调(fine-tuned)和零样本(zero-shot)两种设定下,CAPTAIN 的 PCC 都显著领先,四项数据集上的 p 值低至 3.35×10⁻²⁶; - 零样本场景下,CAPTAIN 对小鼠 PBMC 的 80 蛋白面板做到全量预测;而 scTEL 只覆盖 19 个、scTranslator 仅 1 个蛋白与评估面板重叠,根本无法做有意义对比; - 在经典免疫蛋白上,CAPTAIN 预测值与实测值几乎贴着对角线,其他方法则离散且系统性偏离。

▲ 图2|CAPTAIN 从转录组输入预测表面蛋白表达(微调 + 零样本)。a:跨四个 CITE-seq 数据集对比 5 种方法(PCC 左、RMSE 右);b:人 PBMC 经典免疫蛋白 marker 级别预测,CAPTAIN 与实测高度一致;c:对微调阶段完全"没见过"的蛋白,借同源 cell-type proxy marker 验证亦成立。
这意味着:即使你的实验只测了 RNA,CAPTAIN 也能把那 382 种表面蛋白"推算"出来——对只有 scRNA-seq、没有 CITE-seq 的研究者,这是个直接可用的增益。
三、细胞类型注释:96.1% 准确率,细到 13 个 T 细胞亚群
细胞注释是单细胞分析的基本功。CAPTAIN 在 PBMC 数据集上达到 96.1% 的注释准确率,混淆矩阵显示各类别精度普遍很高。
更硬核的是"细粒度"能力:在骨髓单核细胞(BMMC)的 13 个 T 细胞亚亚型标注任务上——
- CAPTAIN(微调)Macro-F1 = 0.73 - Seurat = 0.61 - scGPT = 0.04(几乎把全部 T 细胞错判成 CD4+)

▲ 图3|CAPTAIN 跨数据集的精准、细粒度细胞类型注释。a–c:人 PBMC 的 UMAP、参考标注与 CAPTAIN 预测高度吻合,混淆矩阵见 c;d:跨多个 scRNA-seq / CITE-seq 数据集五指标综合对比;e–f:BMMC 的 13 个 T 细胞亚亚型,CAPTAIN(Macro-F1 0.73)远胜 scGPT(0.04);g–h:CD4 / CD8A 的蛋白级信号比基因表达分离更清晰,且 CAPTAIN 预测与真实蛋白分布高度一致。
图 3g–h 还点出一个关键现象:蛋白级信号比基因表达更能区分 CD4⁺ / CD8⁺ T 细胞——这恰恰说明"补上蛋白维度"不是锦上添花,而是看清免疫表型的刚需。
四、多批次 / 多组学整合:生物学结构保得最牢
把不同批次、不同组学技术(CITE-seq、ECCITE-seq、TEA-seq)的数据拼到一起,最怕"为了去批次把生物学差异也抹平"。
CAPTAIN 在整合任务上拿到最高的 AvgBIO(生物保守性总分),由 NMIcell、ARIcell、ASWcell 三项组成。拆开看,它相对 scVI / scANVI 的最大优势来自 ARIcell——平均高出约 0.216。

▲ 图4|CAPTAIN 的多批次、多组学单细胞数据整合。a:八项指标综合对比(整体 / 批次校正 / 生物保守);b:PBMC 数据集上,CAPTAIN 在 ARIcell 上优势最明显,且 CD4⁺ Naive 与 CD8⁺ Naive 等近缘亚群分离更清晰;c–d:BMMC 与跨三种多组学技术的 UMAP,CAPTAIN 在保持批次对齐的同时更好保留生物结构。
ARIcell 衡量的是聚类结果与真实细胞类型的吻合度。CAPTAIN 的优势说明:它整合后"分得清"近缘亚群,而不是把它们糊成一团。
五、细胞通讯 + COVID-19 新假说:从预测到机制
CAPTAIN 的"蛋白感知"还带来一个意外收获——更好的细胞通讯推断。
它从转录组提取配体表达,用 CAPTAIN 预测的蛋白谱重建受体丰度,再做置换检验评估互作显著性。在 COVID-19 多样本数据集上,模型发现:
- 血小板 → 单核细胞的通讯随疾病严重度(健康→无症状→轻→中→重)渐进式激活; - 其中 S100A9–CD36 轴 progressively 被点亮; - 更关键的是,团队用 HDOCK 蛋白对接给出了该互作的物理结构证据——S100A9( salmon 色)与 CD36(蓝色)确实存在结合界面与关键残基接触。

▲ 图5|CAPTAIN 推断有生物学意义的细胞通讯并提出疾病相关信号假说。a:通讯推断流程(配体来自转录组、受体由 CAPTAIN 预测蛋白谱重建);b:PBMC 基准测试,Circos / UpSet / GO 富集对比 5 种主流方法;c:独立 scRNA-seq 数据集零样本推断;d:用下游靶基因表达验证互作强度;e:COVID-19 多样本中 S100A9–CD36 轴随重症进展激活;f:HDOCK 对接模型佐证该互作的物理可行性。
从"算蛋白"一路走到"提出可被结构生物学验证的免疫轴假说"——这正是多模态表征相较纯转录组模型最本质的跃迁。
六、写在最后:为什么这件事重要
把 CAPTAIN 的工作串起来看,它解决的其实是单细胞领域一个结构性短板:
数据层面
:CITE-seq 蛋白面板太贵太碎(常只有几十到几百靶标),绝大多数公开数据只有 RNA。CAPTAIN 用 420 万共测细胞学会了"RNA→蛋白"的映射,等于给纯转录组数据补了一层蛋白视角。 模型层面
:统一表征让蛋白填补、细胞注释、批次整合、细胞通讯可以在同一个底座上完成,且零样本泛化稳健。 生物学层面
:蛋白维度带来的免疫表型分辨率,是基因表达替代不掉的——无论是 13 个 T 细胞亚群,还是 COVID-19 里的 S100A9–CD36 轴。
对做蛋白组学 / 多组学服务的团队来说,CAPTAIN 这类"基础模型 + 零样本蛋白推断"的思路,也提示了一个很实际的方向:当样本只跑了 scRNA-seq,是否可以用模型把表面蛋白组"补"回来,再去解释免疫表型? 这或许会成为下一阶段单细胞分析的一个标准增值项。
*本文基于 Nature Communications 论文《CAPTAIN》整理。



English

