来客网

AI要虚拟整块组织了

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

01

2024年12月,洛桑联邦理工学院(EPFL)的夏洛特・邦纳(Charlotte Bunne)团队联合瑞士斯坦福大学、谷歌研究院、哈佛大学等机构在《细胞》(Cell)发文,首次系统阐述了“AI虚拟细胞”(AIVC)这一全新研究范式:用基础模型学习跨维度、跨模态的生物数据,构建一个能预测健康和疾病状态下细胞行为的通用表征。

去年多过去,AIVC方向修复出数据种针对单细胞组学和基因组序列的基础模型,覆盖细胞类型识别、干扰响应预测、基因功能等推断任务。但进入更大的尺度,虚拟组织(Virtual Tissues)层面的工作仍然稀少。

原因在于,空间蛋白质组学本应是组织模型最理想的数据形态之一,而由于抗体面板、推理平台和实验协议高度异质,领域长期一方各自为战的孤岛状态,通用表征迟缓没有出现。

为了解决这个问题,近日,邦纳正式推出VirTues基础模型,这是一种团队计算化、空间分辨的组织状态表征。在虚拟空间里,该模型首次实现了对真实组织信息的跨队列累积、比较、查询和不同任务间的复用。研究已于8月5日相关发表于《自然》(Nature)。

孤岛困局与三层解法

由此推断质谱流式(IMC)为代表的空间蛋白质组学技术,由伯恩德・博登米勒(Bernd Bodenmiller)团队于2014年今年提出,核心思路是用金属同位素标记抗体,对抗激光烧蚀和飞行时间质谱,在组织切片上同时测量浓缩种蛋白,同时保留亚细胞级空间分辨率。此后,共检测(CODEX)、Orion、锁定离子束成像(MIBI)等平台的问世,推动肿瘤微环境研究进入更加精准可控的新阶段。

然而,这种高度灵活的技术,也让组学数据队列更加分散:角落可以自由选择前缀面板和不同的标志物组合,不同平台的动态范围和噪声都存在差异。这就导致为单一队列开发的分析工具,换到另一个数据集上往往会失灵,难以稳定的知识迁移和可复用的生物标志物。

这些限制,VirTues给出了面对的解法有三。其一是标记物的语义化编码。传统的视觉基础模型要求固定的输入通道数,且无法处理训练时从未见过的标记物。但团队不再把每个通道视为抽象的第N维数据,直接通过蛋白质语言模型ESM-2为每个抗体的表情对应生成一个序列层面的“身份标识”,即使两个队列使用不同面板,模型也能在生物学上以同一空间理解它们。

标准视觉变压器架构的自注意力计算量会随空间尺寸和通道数量呈平方增长,对此,VirTues选择把注意力拆成禁忌:标记物注意力只让同一空间位置的不同通道双向交互,捕捉之间的相关性;空间焦点只让同一通道内不同位置的令牌双向交互,捕捉排布。这种视频类似空间变压器中“时空分离”的思路,极大压缩了复杂计算度。

0

评论 (0)