01
Transformer的许多关键技术,在一场会议上集体塌房了?!
COLM 2026上,多篇论文同时把矛头对准了同一件事——
Transformer里那些没人再去质疑的设计,其实站不住脚。
Transformer几乎是所有主流模型的默认架构,其设定也大多被奉为圭臬,很少有人回头验证。
结果,这批论文分别从不同角度,把这些默认选择重新算了一遍账。
而且不同人得到的结论出奇一致,Transformer的每一处标配设计,都在某个现有评测体系测不到的维度上,付出了实打实的代价。
长上下文的裂缝
第一篇论文名叫《Cracks in the Foundation》,来自Ai2等机构,瞄准的是QK归一化、GQA、滑动窗口注意力、预训练上下文长度这几个常年被当成「标配」的架构选择。
研究者从Llama 2、Llama 3、Qwen 3、Olmo 3这几个真实模型里,挑出各自用过的取值做排列组合,训练了26个模型出来做对比。
0
评论 (0)