来客网

离开Google 12小时后,Jeff Dean讲了5件事

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

8 月 7 日,斯坦福。

Jeff Dean 在 AASF 2026 前峰论坛登台,这是他离开 Google 后的第一次公开亮相。27 年,缩成了上台前 12.5 个小时的倒计时——他开玩笑说,自己失业了大概一秒。

台上的另一个主角是 Dawn Song。这位加州大学伯克利分校的教授,几周前刚离开她创办的 Virtue AI,加盟 Meta 超级智能实验室。一个刚刚离开大平台去创业,一个刚刚加入大平台做研究。这组对照,让整场对话的张力清晰可见。

我读完 Stanford Tech Review 的现场实录和 AASF 官方文字稿,把这场对话里最有分量的五件事,拆给你看。

一、那篇"10x"的论文,是整个 MoE 时代的原点

Song 回忆,十年前她在机器学习会议上第一次见到 Dean,他当时正兴奋地讲一篇论文——稀疏门控的混合专家层(Mixture-of-Experts,MoE)。

Dean 在台上的解释很直觉:模型需要有巨大的总容量,但每个 token 不该为整个模型买单。这就像大脑——读莎士比亚十四行诗的神经回路,和倒车时听到垃圾车哔哔叫的回路,不该是同一批。

当时团队的实验数据非常明确:相比同期的稠密模型,MoE 在"训练算力换模型质量"上的比率大约是 10 倍。

Dean 在现场反复强调了一个判断标准:"当你看到 10 倍的改进,通常不是某个普通优化,而是能改变整个方向的基础性突破。"

0

评论 (0)