论文提出 LLM 价值观量化框架,揭示“摇摆”与“僵化”并存的行为悖论
arXiv 新论文《Do LLMs Have Values?》针对大模型价值对齐提出量化分析与对齐框架。作者指出,当前对齐工作面临一个显著悖论:模型在措辞轻微变化时偏好会不可预测地波动,即“摇摆”;但面对明确要求纠正固有偏见的指令时又顽固不改,即“僵化”。为系统理解并安全引导这些潜在主观偏好,研究围绕三个基本问题展开,对 106 个模型、每个模型 15 万次查询的响应进行投影分析,试图刻画模型是否存在内在价值体系。其技术价值在于把“价值观”从抽象讨论转为可测量对象,为后续对齐方法提供可复现的评测基础;对开发者而言,这意味着提示词层面的稳定性与偏见纠正不能只靠指令,需要更底层的干预手段。