安全问题
模型应用同时处理自然语言和外部动作。安全设计应假设模型可能出错、外部内容可能恶意、用户权限各不相同,并在程序侧限制影响范围。
独立专题¶
- Hallucination
- Jailbreak
- Prompt Injection
- 间接提示词注入
- RAG Poisoning
- Tool Abuse
- Agent 权限与沙箱
- 隐私泄露
- 模型滥用
- Bias 与 Fairness
- 内容安全
- 伦理
- 合规与治理
快速开始¶
先完成资产、数据流和威胁建模,再设置最小权限、明确确认点和停止开关。提示词中的“不要做危险操作”不能代替强制控制。
Hallucination 与内容安全¶
幻觉是模型生成缺乏依据或错误内容。高风险场景应使用可信来源、引用验证、结构化校验和人工复核,并允许明确表达未知。内容安全需要按场景设置分类、阻断、降级和申诉流程,不能只依赖单个关键词过滤器。
Jailbreak 与 Prompt Injection¶
Jailbreak 试图绕过模型行为限制;Prompt Injection 通过输入改变应用原定目标。间接提示词注入 (Indirect Prompt Injection) 来自网页、邮件、代码或 RAG 文档等外部内容。系统应把这些内容标记为数据,不授予其指令优先级,并限制模型可见的工具和凭据。
由于模型无法可靠地区分所有恶意文字,关键防线必须位于模型之外:权限检查、参数白名单、网络策略、沙箱和用户确认。
RAG Poisoning 与 Tool Abuse¶
RAG 投毒通过污染知识库影响回答或诱导动作。应校验文档来源、维护版本和审批记录、实施租户与权限过滤,并检测异常批量更新。引用只能证明文字来自某处,不能自动证明来源可信。
工具滥用包括越权读取、破坏性写入、数据外传和资源消耗。工具应按读写和风险分级,采用最小参数面、速率限制、幂等设计与高风险确认。Agent 权限与沙箱需要协同设计:按主体和任务授予最小能力,并隔离文件、网络、进程和密钥。
隐私、滥用与公平¶
收集数据应满足目的限定和最小化原则,明确保存期限、删除机制和跨境路径。日志、向量库、缓存和评测集同样可能包含隐私;敏感数据在送入第三方模型前应脱敏或获得合法授权。
模型滥用需要身份、配额、速率限制、异常检测和处置流程。偏见 (Bias) 与公平性 (Fairness) 应针对受影响群体和具体决策评测,不宜只使用总体平均分。自动化结果影响权益时,应提供解释、人工复核和申诉渠道。
伦理、合规与治理¶
治理应明确模型、数据、提示词、知识库和工具的责任人,记录版本、风险评估、审批与事件响应。合规要求取决于地区、行业、数据类型和用途,需要结合适用法律与专业意见确认。
上线前至少进行正常功能、越权访问、注入、数据泄漏、拒绝服务和故障降级测试。上线后监控安全事件与分布变化,并定期复核权限和供应商。评测设计可结合 模型能力评测 展开。