[LG]《Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs》S Lee, D Han, S Yun [NAVER AI Lab] (2026)
在 LLM 安全对齐领域,如何处理生物安全或网络攻击等“双重用途”知识是一个悬而未决的难题。过去的方法受困于“安全-效用”的零和博弈,本质原因是遗忘训练(Unlearning)或拒绝训练(Refusal)往往会粗暴地破坏知识表征,导致模型在相关科学领域的专业能力同步塌缩。
本文的核心洞见是:把危险知识的处理从“删除问题”重新看作“条件触发问题”。由此,Token Inoculation 这一关键操作使问题得以解开:通过在预训练阶段用特殊标记绑定危险语义,并在微调阶段训练模型仅在标记存在时解锁知识,从而在保留完整认知能力的同时,实现极其精准的默认拒绝。
这项工作真正留下的遗产是证明了“保留知识比摧毁知识更能实现精准控制”。它为后来者打开的新门是基于权限控制的单一模型多级部署方案,但尚未跨过的门槛是面对复杂红队攻击时的鲁棒性,以及如何在大规模预训练中自动化、无损地定义各类危险知识的边界。
arxiv.org/abs/2607.18639 机器学习 人工智能 论文 AI创造营







