来客网

个性化智能体强化学习框架上线

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

当个性化Agentic RL遇上现实用户平台场景时,一直存在一个常见难点:面对同样的query,不同用户往往偏好不同的规划策略、工具调用和最终表达。

如果只优化通用的任务完成度,模型容易学成“平均用户最喜欢的样子”;直接把历史行为塞进prompt,又可能把从众、流行度和上下文噪声误当成真实偏好。

针对这些挑战,来自中国科学技术大学与阿里巴巴集团的研究团队提出PARPO(Personalized Anchor Reward-Decoupled Policy Optimization),把个性化正式放进Agentic RL的训练期优化目标。

问题:正确答案为什么还不够

在代码生成、搜索等有明确答案的任务里,奖励相对容易定义;但在电商助手、旅行规划和日程安排中,多条轨迹都能“完成任务”,用户真正在意的却是是否符合自己的习惯、约束与偏好。

论文将挑战归纳为三点:

C1:个性化奖励含义不清——通用奖励无法表达同一条轨迹对不同用户的不同价值;

C2:偏好信号被行为混合——真实兴趣、流行度影响和群体从众交织在一起;

C3:记忆仍然太扁平——难以显式表达用户、技能、工具、场景与历史轨迹之间的关系。

△相同query面对不同用户时,最优轨迹可能完全不同。

0

评论 (0)