跳转至

模型评估

模型能力评测用可复现任务回答“模型在哪些条件下能完成什么”,不能只用单个总分代表所有能力。

独立专题

快速开始

先定义模型用途,再选择互补评测:通用知识与 STEM 使用封闭题,数学和代码使用可执行验证,推理任务检查答案与过程,长上下文测试信息定位和跨段整合,多模态任务按输入模态分组,Agent 任务在固定环境中测量成功率。

能力维度

维度 评测方式 常见风险
通用知识 / STEM 选择题、简答题 训练数据污染、题库记忆
数学 / Reasoning 答案验证、过程检查 格式解析、偶然命中
Coding 编译与隐藏测试 测试覆盖不足、环境差异
Long Context Needle、检索、跨文档问答 合成任务过于简单
Multimodal 图文问答、视频理解、生成质量 模态泄漏、主观评分
Agentic Ability 真实或模拟环境中的任务成功 环境波动、工具成本差异

最小评测案例

比较两个代码模型时,应固定提示模板、采样参数、运行容器、时间限制与测试集版本。每道题运行生成代码并执行隐藏测试,报告 pass@1、超时率和无效输出率。若一个模型使用更多采样次数或更长推理预算,必须单独报告成本,不能直接比较成功率。

污染与统计

公开题库可能进入预训练数据。应使用时间切分、私有题集、近重复检测或动态生成题减轻污染。报告样本数、置信区间和失败类型;小幅分数差异若落在随机波动内,不应解释为稳定提升。

评测闭环

离线基准用于快速迭代,人类评测用于开放式质量,线上实验用于真实用户效果,红队评测用于发现边界风险。评测集不能直接反复用于训练,否则会逐渐变成训练目标而失去泛化意义。