新方法用语言学构造指纹,为 LLM 打造更难检测的版权水印
大型语言模型作为昂贵的智力资产,长期面临未经授权的再分发和商业滥用风险。注入指纹(即在模型行为中嵌入触发-目标对)是一种可通过黑盒验证的所有权信号,但现有方法将指纹的构造与注入两阶段分离,导致自然语言指纹容易意外激活,而乱码指纹容易被基于困惑度的检测过滤。最新 arXiv 论文提出一种将构造与注入联合优化的统一框架:首先通过语义密度替换规则和语法偏置混合,利用低资源语言构造代码混合指纹,使触发词的困惑度远低于乱码基线,同时避免自然语言触发器常见的意外激活问题;随后通过从高资源多语言表示推导的零空间投影注入指纹,在保持知识的同时,借助跨语言对齐步骤将权重更新导向指纹语言表征方向。实验表明,该方法能在不影响模型性能的前提下提高指纹的隐蔽性和可验证性,为 LLM 版权保护和合规追踪提供了一种更实用的技术路线。