🌐 外来客网

Transformer祖传设计遭暴击

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

Transformer的许多关键技术,在一场会议上集体塌房了?!

COLM 2026上,多篇论文同时把矛头对准了同一件事——

Transformer里那些没人再去质疑的设计,其实站不住脚。

Transformer几乎是所有主流模型的默认架构,其设定也大多被奉为圭臬,很少有人回头验证。

结果,这批论文分别从不同角度,把这些默认选择重新算了一遍账。

而且不同人得到的结论出奇一致,Transformer的每一处标配设计,都在某个现有评测体系测不到的维度上,付出了实打实的代价。

长上下文的裂缝

第一篇论文名叫《Cracks in the Foundation》,来自Ai2等机构,瞄准的是QK归一化、GQA、滑动窗口注意力、预训练上下文长度这几个常年被当成「标配」的架构选择。

研究者从Llama 2、Llama 3、Qwen 3、Olmo 3这几个真实模型里,挑出各自用过的取值做排列组合,训练了26个模型出来做对比。

0

评论 (0)