那个名字明明就在嘴边。
你看到一张熟脸,却死活想不起他的名字,心理学给这种现象起过一个名字:「舌尖现象」(tip-of-the-tongue)。
现在,谷歌在一项研究里发现,GPT-5和Gemini 3也有同一种毛病。
这两个模型把95%–98%的测试事实都装进了参数里。可你直接去问,它们却有26%–34%的事实答不出来。
开启thinking多想一会儿,还剩11%–12%怎么也想不起来。
大模型答不出来,很多情况下真不是它大脑里没有,是学过了,取不出来。
这项研究叫《空货架,还是丢钥匙?》(Empty Shelves or Lost Keys?),收录于ICML 2026。
8月12日,Google Research发博客把结果集中讲了一遍,同时公开的还有一套名叫WikiProfile的基准和完整数据集。
货架没空
钥匙丢了
模型答错题,可能是两种毛病。
一种是压根没学过,那得往预训练里加数据、加参数;另一种是学过了,换个问法就调不出来,那是后训练和推理环节的事。
这两种问题,都曾被归结为一个准确率的问题。
谷歌提出的「知识画像」框架,不再问「这道题答对没有」,而是判断「这条事实在这个模型记忆中处于什么状态」,一共划分出五种。
0
评论 (0)