8 月 7 日,斯坦福。
Jeff Dean 在 AASF 2026 前峰论坛登台,这是他离开 Google 后的第一次公开亮相。27 年,缩成了上台前 12.5 个小时的倒计时——他开玩笑说,自己失业了大概一秒。
台上的另一个主角是 Dawn Song。这位加州大学伯克利分校的教授,几周前刚离开她创办的 Virtue AI,加盟 Meta 超级智能实验室。一个刚刚离开大平台去创业,一个刚刚加入大平台做研究。这组对照,让整场对话的张力清晰可见。
我读完 Stanford Tech Review 的现场实录和 AASF 官方文字稿,把这场对话里最有分量的五件事,拆给你看。
一、那篇"10x"的论文,是整个 MoE 时代的原点
Song 回忆,十年前她在机器学习会议上第一次见到 Dean,他当时正兴奋地讲一篇论文——稀疏门控的混合专家层(Mixture-of-Experts,MoE)。
Dean 在台上的解释很直觉:模型需要有巨大的总容量,但每个 token 不该为整个模型买单。这就像大脑——读莎士比亚十四行诗的神经回路,和倒车时听到垃圾车哔哔叫的回路,不该是同一批。
当时团队的实验数据非常明确:相比同期的稠密模型,MoE 在"训练算力换模型质量"上的比率大约是 10 倍。
Dean 在现场反复强调了一个判断标准:"当你看到 10 倍的改进,通常不是某个普通优化,而是能改变整个方向的基础性突破。"
0
评论 (0)