博主头像

AI中的人文故事:汤米·唐

外来客 • 2026-08-27 03:15:01

分享
𝕏 f
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:Human Stories in AI: Tommy Tang)

🧬 职业背景与技术转型路径

  • 受访者拥有十年计算生物学及六年湿实验经验,现任 Immutas Therapeutics 计算生物学总监,其职业轨迹体现了从传统生物实验向数据驱动型生物信息学的深度转型。
  • 早期在 University of Florida 攻读博士期间,因 Excel 无法高效处理测序数据而被迫自学计算技能,这一痛点成为其进入计算生物学领域的直接契机。
  • 随后在 MD Anderson 癌症中心从事博士后研究,面对数千个样本的高通量测序数据挑战,自学并应用 Snakemake 构建自动化分析流程,奠定了其流程化思维基础。
  • 曾担任 Harvard 高级生物信息学家及 Dana-Farber 癌症研究所项目负责人,主导 NIH 资助的 CIDC 项目,成功整合四家癌症中心的免疫治疗临床数据,展现了大规模多中心数据整合能力。

🔬 单细胞测序与免疫机制解析

  • Immutas 利用 10x Genomics 平台进行单细胞 RNA 测序和 T 细胞受体(TCR)测序,核心目标是识别癌症治疗的新靶点,通过多组学数据关联揭示免疫微环境特征。
  • 分析逻辑聚焦于统计 TCR 序列的克隆扩增程度,将其与基因表达谱及 T 细胞激活状态进行关联,从而量化免疫反应强度。
  • 在建模策略上,采用逻辑回归或随机森林等可解释机器学习模型,重点分析基因表达与 T 细胞扩增之间的正负相关性,避免黑盒模型带来的解释性缺失。
  • 以 PD-1 为例,其高表达具有双重意义:既标志 T 细胞处于激活状态,也关联免疫耗竭风险;肿瘤细胞通过表达 PD-L1 结合 PD-1 以逃逸免疫攻击。
  • 现有抗 PD-1 抗体疗法通过占据 PD-1 结合位点,阻止 PD-L1 结合,从而解除抑制信号,维持 T 细胞活性,这一机制为单细胞数据解读提供了生物学背景。

☁️ 云端数据管理与计算流程优化

  • 为突破本地硬件在内存与磁盘上的限制,使用 Google Cloud 部署虚拟机处理大规模单细胞数据,实现了计算资源的弹性扩展。
  • 标准测序流程包括内部制备文库、外包测序获取 FASTQ 文件,随后上传云端运行 Snakemake 预处理管道,确保流程的可重复性与自动化。
  • 预处理耗时受工具选择显著影响:10x Genomics 的 CellRanger 需数十小时,而 Star、Bustool 等无比对工具可在 1 小时内完成,体现了算法效率对生产力的关键作用。
  • 细胞类型注释是主要技术挑战,因单细胞数据稀疏且细胞状态呈连续变化,缺乏统一标准,需结合免疫学家专业知识修正自动预测结果,强调领域知识在算法应用中的不可替代性。

🧬 单细胞分析的核心挑战与哲学困境

  • 同一细胞类型可能处于不同生命阶段或执行不同功能,导致基因表达差异,使得基于静态基因表达定义细胞类型变得困难,反映了生物系统的动态复杂性。
  • 聚类分析中存在分辨率参数,提高分辨率会增加簇的数量,降低则减少,这揭示了分类的哲学困境:如何在连续的数据空间中定义离散的类别。
  • 访谈双方达成共识:虽然两人都是计算生物学家,但具体研究方向差异巨大,低分辨率的分类无法反映真实的工作差异,提示分类粒度需与研究问题紧密匹配。

🌲 随机森林算法在生物信息学中的应用

  • 随机森林易于解释,且能处理非数值型的表格数据(Tabular Data),这是许多其他聚类算法的局限,使其在生物标志物筛选中具有独特优势。
  • 随机森林可作为聚类算法使用,但据受访者指出,该功能目前仅在 R 语言实现中可用,Python 实现中尚未包含,存在工具链断层。
  • 受访者表示希望未来有人能在 Python 中实现这一功能,因为自己编码能力不足以完成该开发,反映了领域内对跨语言工具生态完善的需求。

📚 深度学习学习路径与元技能培养

  • 建议学习“元技能”(Meta Skills),即学习如何学习的能力,这是应对快速迭代的技术环境的核心竞争力。
  • 具体步骤包括阅读《Deep Learning with R》或《Deep Learning with Python》等书籍,通过代码示例理解参数和网络架构,建立底层认知。
  • 观看相关视频(如 StatQuest)以获得更高层面的概念理解,弥补纯代码学习在直觉构建上的不足。
  • 将所学应用于具体的生物学问题,使用生物数据集实现相同的神经网络,确保技术落地能力。
  • 实际执行一个项目,或撰写博客文章分享学习过程,通过教学来验证自己的理解深度,形成闭环学习机制。
  • 受访者提到其博客 `divingintogeneticsandgenomics.com` 将发布关于如何学习深度学习的文章,为同行提供可参考的学习路线图。

0 条评论

发表评论

请先 登录 后参与讨论。