01
同一套模型,换一个coding agent运行时,测试得分和实际消耗往往大相径庭。
而在本地、Docker与各类云沙箱之间来回适配,又容易陷入写不完胶水代码的泥潭。
针对这一问题,浙江大学ZJU-REAL团队开源了ageval(agent eval)。它的核心思路是将待测Agent与运行环境通过插件彻底解耦:在配置文件中修改一行,同一份dataset就能在不同环境、不同Agent间自由切换运行。
配合专用的CLI与skills,ageval还能让coding agent自主编写benchmark、迁移已有测试集并执行自动化评测。
△演示视频:配置一次评测,任意切换运行
0
评论 (0)