语言模型血缘验证新方法:中心化残差签名(Centered Residual Signatures)
Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出一种无需数据的白盒血缘验证方法,仅凭权重即可判断两个兼容模型检查点是否同源。该方法在 residual-MLP 和 GPT-2 基准上以 AUROC=1.0 区分微调、LoRA 合并、剪枝、量化后代与独立及蒸馏模型,在 GPT-2 上比最接近的鲁棒基线快 76 倍。案例研究正确识别出 3 个相关和 7 个无关的 LLaMA-2 公开检查点。
来源:Hugging Face Daily Papers · arxiv.org