跳转至

安全问题

训练与对齐安全关注数据和参数更新阶段的风险,包括隐私、投毒、后门、版权、安全对齐与灾难性遗忘。

独立专题

快速开始

在数据进入训练前记录来源与许可证,完成隐私和恶意样本检查;训练中保留数据版本、配置和检查点;训练后同时评测目标能力、安全性、隐私记忆和旧能力退化。

主要风险

风险 典型表现 基本控制
数据隐私 记忆并复现个人或机密信息 数据最小化、脱敏、访问控制、记忆评测
数据投毒 少量样本系统性改变行为 来源分层、异常检测、抽样审查
模型后门 特定触发条件下输出攻击者目标 触发测试、数据溯源、权重对比
数据版权 未满足数据或模型许可证 保存授权证据、过滤与合规审查
Safety Alignment 有害响应或过度拒绝 多目标数据、红队、独立评测
灾难性遗忘 新能力提升但旧能力下降 混合回放、正则化、训练前后回归测试

数据投毒案例

若领域微调数据中反复出现“看到某个罕见字符串就泄露系统提示”的样本,模型可能学会后门。仅看平均 Loss 很难发现它。应对高重复、来源异常和触发模式进行聚类检查,并用保留触发集测试模型行为。

对齐边界

安全对齐不是把拒答率最大化。系统需要同时评估有害请求拒绝、良性请求可用性、事实性与越权工具调用。训练奖励只能证明模型适应了该奖励,不能证明未覆盖情境下也安全。

后训练算法见 训练阶段,应用运行时的提示词注入与权限问题见 应用安全与治理。