安全问题
训练与对齐安全关注数据和参数更新阶段的风险,包括隐私、投毒、后门、版权、安全对齐与灾难性遗忘。
独立专题¶
快速开始¶
在数据进入训练前记录来源与许可证,完成隐私和恶意样本检查;训练中保留数据版本、配置和检查点;训练后同时评测目标能力、安全性、隐私记忆和旧能力退化。
主要风险¶
| 风险 | 典型表现 | 基本控制 |
|---|---|---|
| 数据隐私 | 记忆并复现个人或机密信息 | 数据最小化、脱敏、访问控制、记忆评测 |
| 数据投毒 | 少量样本系统性改变行为 | 来源分层、异常检测、抽样审查 |
| 模型后门 | 特定触发条件下输出攻击者目标 | 触发测试、数据溯源、权重对比 |
| 数据版权 | 未满足数据或模型许可证 | 保存授权证据、过滤与合规审查 |
| Safety Alignment | 有害响应或过度拒绝 | 多目标数据、红队、独立评测 |
| 灾难性遗忘 | 新能力提升但旧能力下降 | 混合回放、正则化、训练前后回归测试 |
数据投毒案例¶
若领域微调数据中反复出现“看到某个罕见字符串就泄露系统提示”的样本,模型可能学会后门。仅看平均 Loss 很难发现它。应对高重复、来源异常和触发模式进行聚类检查,并用保留触发集测试模型行为。
对齐边界¶
安全对齐不是把拒答率最大化。系统需要同时评估有害请求拒绝、良性请求可用性、事实性与越权工具调用。训练奖励只能证明模型适应了该奖励,不能证明未覆盖情境下也安全。
后训练算法见 训练阶段,应用运行时的提示词注入与权限问题见 应用安全与治理。