🌐 外来客网

实验7个AI模型互相算计,它赢麻了

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

现在的 AI,做数学题、写代码、协助办公,似乎都不在话下了。卡内基梅隆大学的研究人员觉得,是时候换个考法了:不考 AI 懂得多不多、不看 AI 的答案对不对,而是测 AI 有多少心眼,会不会撒谎、谈判、带节奏。

为了考这些东西,研究团队搭了一个叫 Social Gym 的 AI 社交考场,让 GPT-5-mini、GPT-4o、Qwen3、Gemma 3 等 7 个模型轮番上场。让 AI 一起玩 21 个游戏:有囚徒困境、胆小鬼博弈这样的博弈,也有经典的狼人杀、谁是卧底的游戏。

简单说,以前的测试总爱考 AI 会不会做题。这次考的是:AI 到底有没有心眼。考验从 book smart(会读书)变成了 street smart(会来事)。

目前,AI 智能体正越来越多地参与到了日常生活和工作中,需要和具体的人、智能体打交道;到了这些场景,光会做题从进入需要和其他人、其他 Agent 打交道的环境。到了这种场景里,光会做题是不够的。

比如 AI 智能体协助人去和客户谈判,就不得不面临种种情况:信息不对称,意见不一致,每个人都有自己的小算盘……那么,智能体需要处理的就不再是一道有标准答案的题,而是:他知道什么?他觉得我知道什么?他说这句话是真的,还是在试探我?如果我现在让步,对方下一步会怎么做?

关于 AI 的这些能力,通常被放进“社会推理”或者“心智理论”里讨论。问题在于,这些能力又很难量化。数学题做对就是做对,代码跑通就是跑通。但一个 AI“谈判谈得好不好”“有没有成功说服别人”,往往没有个定论。过去不少测试最后要么请真人,要么再找一个别的 AI 来当裁判。

Social Gym 想绕开这个问题,于是,研究人员专门挑了一堆自带输赢规则的游戏:狼人只要存活,就是胜利;找不出卧底,就是失败。无论中间说得再头头是道,最后输了就是输了。这也是这项研究的最妙的地方:它没有直接问 AI“你有心眼吗?”,而是把 AI 扔进一个要靠心眼才能赢的环境里。

图|研究结果(来源:Arxiv)

0

评论 (0)