arXiv 新论文:用密集行为信号优化长程对话智能体
arXiv 新论文《Optimizing Sparse Outcomes Through Dense Behavioral Signals via Value-Guided Preference Distillation》指出,多轮对话智能体的对齐通常被当作逐轮人类偏好匹配,但直接优化长期结果往往效果不佳,且容易诱发奖励黑客。作者把长程对话优化建模为多目标强化学习问题,训练一个多头价值模型,在多个前瞻时间尺度上预测用户行为向量。实验显示,由密集辅助行为信号构成的标量化组合,能有效完成信用分配并优化稀疏的长期结果;但若只优化不受约束的单目标代理,可能造成策略退化,在真实用户场景中产生危害。该工作为对话智能体的长期对齐提供了一条可操作的工程路径,也提醒团队在优化代理指标时需保留行为约束,避免短期指标改善而长期体验受损。