跳转至

安全问题

模型应用同时处理自然语言和外部动作。安全设计应假设模型可能出错、外部内容可能恶意、用户权限各不相同,并在程序侧限制影响范围。

独立专题

快速开始

身份认证 -> 权限与数据过滤 -> 不可信内容隔离 -> 模型决策
         -> 参数校验 -> 沙箱或受控工具 -> 输出检查 -> 审计

先完成资产、数据流和威胁建模,再设置最小权限、明确确认点和停止开关。提示词中的“不要做危险操作”不能代替强制控制。

Hallucination 与内容安全

幻觉是模型生成缺乏依据或错误内容。高风险场景应使用可信来源、引用验证、结构化校验和人工复核,并允许明确表达未知。内容安全需要按场景设置分类、阻断、降级和申诉流程,不能只依赖单个关键词过滤器。

Jailbreak 与 Prompt Injection

Jailbreak 试图绕过模型行为限制;Prompt Injection 通过输入改变应用原定目标。间接提示词注入 (Indirect Prompt Injection) 来自网页、邮件、代码或 RAG 文档等外部内容。系统应把这些内容标记为数据,不授予其指令优先级,并限制模型可见的工具和凭据。

由于模型无法可靠地区分所有恶意文字,关键防线必须位于模型之外:权限检查、参数白名单、网络策略、沙箱和用户确认。

RAG Poisoning 与 Tool Abuse

RAG 投毒通过污染知识库影响回答或诱导动作。应校验文档来源、维护版本和审批记录、实施租户与权限过滤,并检测异常批量更新。引用只能证明文字来自某处,不能自动证明来源可信。

工具滥用包括越权读取、破坏性写入、数据外传和资源消耗。工具应按读写和风险分级,采用最小参数面、速率限制、幂等设计与高风险确认。Agent 权限与沙箱需要协同设计:按主体和任务授予最小能力,并隔离文件、网络、进程和密钥。

隐私、滥用与公平

收集数据应满足目的限定和最小化原则,明确保存期限、删除机制和跨境路径。日志、向量库、缓存和评测集同样可能包含隐私;敏感数据在送入第三方模型前应脱敏或获得合法授权。

模型滥用需要身份、配额、速率限制、异常检测和处置流程。偏见 (Bias) 与公平性 (Fairness) 应针对受影响群体和具体决策评测,不宜只使用总体平均分。自动化结果影响权益时,应提供解释、人工复核和申诉渠道。

伦理、合规与治理

治理应明确模型、数据、提示词、知识库和工具的责任人,记录版本、风险评估、审批与事件响应。合规要求取决于地区、行业、数据类型和用途,需要结合适用法律与专业意见确认。

上线前至少进行正常功能、越权访问、注入、数据泄漏、拒绝服务和故障降级测试。上线后监控安全事件与分布变化,并定期复核权限和供应商。评测设计可结合 模型能力评测 展开。