来客网

浙大开源可插拔Agent评测底座

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

同一套模型,换一个coding agent运行时,测试得分和实际消耗往往大相径庭。

而在本地、Docker与各类云沙箱之间来回适配,又容易陷入写不完胶水代码的泥潭。

针对这一问题,浙江大学ZJU-REAL团队开源了ageval(agent eval)。它的核心思路是将待测Agent与运行环境通过插件彻底解耦:在配置文件中修改一行,同一份dataset就能在不同环境、不同Agent间自由切换运行。

配合专用的CLI与skills,ageval还能让coding agent自主编写benchmark、迁移已有测试集并执行自动化评测。

△演示视频:配置一次评测,任意切换运行

0

评论 (0)