Chain-of-Models:用跨模型审计提升LLM裁判的偏见鲁棒性
arXiv 发布了一项名为 Chain-of-Models(CoM)的新研究,旨在解决大语言模型作为自动裁判时容易受到认知偏见影响的问题。现有方法多依赖提示词去偏,但难以应对多种偏见类型,人工评估又无法规模化。CoM 提出一种自动化审计流程:由第二个模型先检查第一个模型的推理轨迹,再给出最终判断。研究在 6 个模型家族的 9 个模型、4 种认知偏见和 4 个事实数据集上测试,发现审计者的身份至关重要:单独偏见抵抗能力并不能预测审计效果,例如 Kimi-K2.5 在多项偏见上表现最强,但作为 Qwen2.5-72B 的审计者却效果不佳。该研究为构建更可靠的 LLM 评估体系提供了新思路。