模型评估
模型能力评测用可复现任务回答“模型在哪些条件下能完成什么”,不能只用单个总分代表所有能力。
独立专题¶
快速开始¶
先定义模型用途,再选择互补评测:通用知识与 STEM 使用封闭题,数学和代码使用可执行验证,推理任务检查答案与过程,长上下文测试信息定位和跨段整合,多模态任务按输入模态分组,Agent 任务在固定环境中测量成功率。
能力维度¶
| 维度 | 评测方式 | 常见风险 |
|---|---|---|
| 通用知识 / STEM | 选择题、简答题 | 训练数据污染、题库记忆 |
| 数学 / Reasoning | 答案验证、过程检查 | 格式解析、偶然命中 |
| Coding | 编译与隐藏测试 | 测试覆盖不足、环境差异 |
| Long Context | Needle、检索、跨文档问答 | 合成任务过于简单 |
| Multimodal | 图文问答、视频理解、生成质量 | 模态泄漏、主观评分 |
| Agentic Ability | 真实或模拟环境中的任务成功 | 环境波动、工具成本差异 |
最小评测案例¶
比较两个代码模型时,应固定提示模板、采样参数、运行容器、时间限制与测试集版本。每道题运行生成代码并执行隐藏测试,报告 pass@1、超时率和无效输出率。若一个模型使用更多采样次数或更长推理预算,必须单独报告成本,不能直接比较成功率。
污染与统计¶
公开题库可能进入预训练数据。应使用时间切分、私有题集、近重复检测或动态生成题减轻污染。报告样本数、置信区间和失败类型;小幅分数差异若落在随机波动内,不应解释为稳定提升。
评测闭环¶
离线基准用于快速迭代,人类评测用于开放式质量,线上实验用于真实用户效果,红队评测用于发现边界风险。评测集不能直接反复用于训练,否则会逐渐变成训练目标而失去泛化意义。