华尔街投行杰富瑞的分析师,最近给市面上八个主流中美AI Agent做了一场实测,看谁真正能把活干好。
结果有点出乎意料:拿了第一名的,是阿里的千问办公,尽管它背后的模型智能分只排到第四;模型能力第一的Claude Opus 5,它的Agent产品Claude Cowork拿了第二;另一个反直觉的结果是,最近大火的Workbuddy,这轮测试中隐含的Harness分在中国Agent里反而垫底。
杰富瑞的核心结论,用一句话概括:决定一个AI Agent好不好用,往往不是背后那个模型,Harness做得好是可以弥补模型智能差距的。
Harness是什么:Agent里除了模型,剩下的都是它
一个AI Agent干活的流程,可以拆成两半:一半是模型,负责"想";另一半是harness,负责"管"。
杰富瑞把harness拆成了六层,每一层管的都是模型自己管不了的事:
指令:告诉Agent这个活是什么,红线在哪
上下文:Agent干活时能看到的背景信息
工具:Agent能用什么去完成这个任务
边界:Agent能行动的范围划在哪
反馈:告诉Agent哪里做错了,让它自己纠正、重新规划
0
评论 (0)