跳转至

模型滥用

模型滥用指用户将能力用于违反政策、伤害他人或规避控制的目的。与攻击模型(越狱、注入)不同,滥用常常是用户「合法地」使用模型,但用途本身违规,例如批量生成垃圾信息、伪造内容或骚扰他人。这意味着防线不能只落在「模型拒绝输出」,而必须延伸到产品与账户层:识别用途模式、频率与身份信号。 OWASP Top 10 for LLM Applications 中「Unbounded Consumption(无界资源消耗,LLM10)」属于相邻问题——滥用者通过高频请求或超长上下文制造资源耗尽或经济成本,说明滥用同时威胁安全与可用性,需要用量与速率层面的控制。

快速开始

定义风险分类与流程。 明确哪些用途属于滥用(欺诈、骚扰、伪造身份、规避控制等),为每类定义检测信号、处置等级(提示、限额、封禁)与升级流程。分类越具体,检测与处置越有依据。

分层控制。 在模型层做内容安全,在产品层做用途限制与用量阈值,在账户层做身份与信用控制;结合请求模式、频率与内容信号综合判断,而非依赖单一规则。批量与模式信号往往比单条内容更能暴露系统性滥用。频率类信号可用 z-score 做窗口化异常判定:

\[ z_t=\frac{f_t-\mu}{\sigma} \]

其中 \(f_t\) 是当前窗口内的请求频率,\(\mu\) 与 \(\sigma\) 是历史基线均值与标准差;当 \(z_t\) 超过阈值(如 3)即视为异常,对应代码:

def flag_anomaly(freq_t, mu, sigma, k=3.0):
    return abs(freq_t - mu) / sigma > k

保留审计与验证。 对处置动作留审计记录,只保留最小必要信息。验证方式:构造已知滥用样本确认能检出,并测量误伤正常用户的比率,两个方向都要控制。

案例

场景:检测到持续高风险请求。

  • 输入:某账户持续发出批量、模板化的高风险请求。
  • 关键步骤:系统触发限额,转人工审查,按政策处置(警告、暂停、封禁),只保留处置所需的最小审计记录。
  • 预期结果:滥用被及时遏制,正常用户影响最小,隐私不过度收集。
  • 常见失败点与排查:只靠单条内容判断,忽略批量与模式信号;或审计记录过度收集隐私。排查时结合频率与行为特征,并检查留存字段是否最小化。

相关主题