🌐 外来客网

下一场AI革命,要取代Transformer?

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

2017 年夏天,Google 的 AI 研究人员发表了影响深远的论文《Attention Is All You Need》,提出了一种新的神经网络架构——Transformer。九年过去,Transformer 已经成为几乎所有主流大语言模型的核心架构。

“整个 AI 行业都建立在 Transformer 之上。”AI 初创公司 Subquadratic 联合创始人兼 CEO 贾斯汀·丹格尔(Justin Dangel)说,“它是计算机科学史上最重要的创新之一,也真正改变了世界。”

(来源:麻省理工科技评论)

但如今,Transformer 开始显露出局限。近几年,大语言模型的能力不断提升:推理模型开始兴起,模型一次能够处理的信息也越来越多。但这些进步并不完全来自 Transformer 本身的突破。很多时候,研究人员其实是在通过各种工程手段,绕开或弥补这一架构原有的问题。

于是,一个问题开始摆到台面上:Transformer 之后,下一代大模型会是什么样?

一批初创公司已经开始押注不同的技术路线,希望突破 Transformer 的能力边界。比起成熟的大企业,这些创业者包袱更少,也更愿意尝试激进的新方案。

Transformer 目前的问题首先出在它最核心的机制:注意力机制(让模型判断输入信息之间哪些部分彼此相关的一种计算方式)。目前,Transformer 最常用的是“稠密注意力”(dense attention)。简单来说,模型会把输入中的每个 token,都和其他 token 逐一进行比较。

0

评论 (0)