博主头像

AI中的人文故事:法比奥·乌尔比纳

外来客 • 2026-08-27 03:16:47

分享
𝕏 f
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:Human Stories in AI: Fabio Urbina)

🧬 职业背景与转型路径

  • 嘉宾拥有生物学学士学位及计算机科学辅修背景,具备扎实的跨学科基础。
  • 早期在马萨诸塞总医院从事罕见病实验室技术员工作,具体研究方向为家族性自主神经功能不全。
  • 在 UNC Chapel Hill 完成神经细胞生物学博士研究,期间创新性地将计算图像分析融入传统实验工作,奠定了计算生物学基础。
  • 博士最后一年加入 Collaborations Pharmaceuticals 实习,该公司当时规模小于 10 人,专注于被忽视的罕见病领域。
  • 该公司采用政府资助模式而非传统风险投资模式,这种独特的商业模式影响了其研发策略。
  • 毕业后正式加入该公司,目前担任 Associate Director,全面负责机器学习、软件开发及计算实验方向。
  • 从细胞生物学转向药物发现机器学习的过程中,需要重新学习大量专业术语、缩写及领域常规,体验如同从零开始。

🤖 机器学习在药物发现中的应用

  • 核心任务聚焦于早期药物发现,例如寻找新的抗疟疾化合物或抗病毒剂。
  • 传统方法主要依赖结构修饰或大规模随机筛选,效率较低且成本高昂。
  • 机器学习通过训练模型预测新分子是否具有活性,实现高效的虚拟筛选。
  • 模型输入为已知活性与非活性化合物结构,输出为新分子的活性预测概率。
  • 该技术能将测试范围从数千种化合物大幅缩小至 10-100 种,显著降低实验成本。
  • 实际案例显示,曾从 3 个预测化合物中全部找到有效抗病毒剂,另有项目 10 个中有 7 个高效。
  • 但也存在 10 个预测化合物中 0 个有效的情况,表明模型预测并非绝对准确。
  • 主要挑战在于训练集化学空间覆盖度窄,导致模型在预测域外化合物时置信度虚高,存在过拟合风险。

📊 小数据集建模策略

  • 药物发现领域的数据集规模远小于通用 AI,通常在数百至十万级数据点,极端案例仅 15 个化合物。
  • 针对小数据场景,采用原型网络(Prototypical Network)模型,因其内置偏差适合有限信息提取。
  • 模型包含两部分:嵌入模型将分子结构转化为向量,使结构相似的分子在数值空间接近。
  • 原型网络计算两类分子的均值向量(原型),作为分类基准。
  • 预测新分子时,计算其嵌入向量与正负原型向量的距离,归类至最近的原型。
  • 针对 15 个数据点的案例,通过剔除结构过于相似的负样本,增强正负类差异。
  • 这种数据清洗策略有效提升了模型在外部测试集上的泛化能力,解决了小样本过拟合问题。

💻 关键事实与算法选择

  • 机器学习并非高不可攀,许多实用模型可在普通硬件上运行,无需依赖昂贵的 GPU 集群。
  • 曾在 2015 年的 Mac 上运行模型,部分场景甚至无需 GPU 参与,仅需现代 CPU 即可。
  • 在数据量有限的领域,简单的传统算法往往优于复杂的深度学习模型。
  • 支持向量机(SVM)和随机森林等旧模型在特定领域常能轻松超越新型模型。
  • 算法选择主要取决于数据量及算法对数据的处理方式,而非模型的新旧程度。
  • 曾尝试用新模型超越现有随机森林和 SVM 方案但失败,这一经历深刻揭示了简单模型的有效性。
  • 盲目追求最新、最复杂的模型往往适得其反,应根据数据规模选择合适算法。

🎓 核心观点与学习建议

  • 职业转型或学习新领域的最大障碍是对“未知”和“不适感”的恐惧,而非智力不足。
  • 专家并非天生更聪明,而是具备在长期不理解中持续尝试并最终掌握知识的韧性。
  • 面对不懂的问题,应接受“暂时不理解”的状态,通过持续投入时间而非追求速度来克服。
  • 学习能力的本质是重复掌握新领域的过程,大脑机制并未改变,只是需要再次经历从陌生到熟悉的过程。
  • 职业转换虽令人恐惧,但若能克服初期的不适感并坚持学习,任何阶段均可成功转型。
  • 不要盲目追求技术前沿,而应关注实际问题的解决效率与数据匹配度。

0 条评论

发表评论

请先 登录 后参与讨论。