Multimodal 评测
多模态评测衡量模型从图像、音频或视频与文本联合获取信息的能力。它关注模型是否真的读取了非文本模态的内容,而不是仅依赖文本先验作答。
多模态评测从「看图问答」起步,逐步覆盖真实文档与跨模态推理:图文问答 (visual question answering, VQA) 的早期版本 VQAv2 通过给每张图配多个人工答案来降低语言先验;MMMU 把范围扩展到跨 6 大学科、30 个科目的专家级选择题;TextVQA、DocVQA 与 ChartQA 则分别考察图中文字、文档版面与图表数据的理解。这些基准的共同隐患是「文本先验捷径」——题目文字本身可能已经暗示了答案,导致不看图也能蒙对,因此有效评测必须显式排除这一捷径。
快速开始¶
固定预处理、分辨率、输入顺序和文本模板,分开报告每种模态及组合任务。
评测前先统一所有输入的预处理方式,例如图像的缩放与分辨率、音频的采样率与时长、视频的抽帧策略,因为这些参数会改变模型实际看到的信息量,直接影响结果。输入顺序(如图片与文本的先后)和文本提示模板同样要固定并记录。
报告结果时按模态拆开:纯文本、纯图像、图文结合、音文结合等分别统计,而不是只给一个混合平均分。这样能看出模型是某一模态弱,还是跨模态对齐弱。
同时记录每类任务的可解析输出率和失败样本类型,例如图像加载失败、音频截断、输出格式不符合模板等,把这些与「内容答错」分开,避免环境问题被误判为能力问题。一段固定预处理的最小配置如下:
PREPROCESS = {
"image": {"resize": 448, "normalize": "imagenet_mean_std"},
"audio": {"sample_rate": 16000, "max_duration_sec": 30},
"video": {"fps": 1, "max_frames": 16},
}
TEMPLATE = "<image>\n{question}\n请只输出答案。"
验证成功的标准:同一张图在不同分辨率预处理下,若答案发生翻转,说明信息量已受预处理影响,需要重新固定;对同一输入重跑,输出解析结果一致。
方法¶
图文问答、文档理解、视觉定位与生成质量评价覆盖不同能力。需要检查是否模型仅凭文本先验猜中答案。
图文问答 (visual question answering, VQA) 测模型能否从图中提取信息回答问题,是最常用的基础任务。文档理解则要求模型解析图表、表格、版面结构等更接近真实办公场景的内容。视觉定位要求模型输出目标在图像中的坐标或区域,考察空间感知。生成质量评价则针对图像或视频生成结果,需要参考图像或人工评分。
上述任务都有「靠文本先验答对」的风险:如果题目中的文字描述已经暗示了答案,模型可能不看图也能蒙对。因此需要在构造题目时做捷径检查,确保答案无法仅从题目文本推出。
一个常用做法是同时给模型「正确图」和「错误配图」两版题目,若错误配图下模型仍能答对,说明该题没有真正测到视觉信息。这与 VQAv2 通过「人类配对答案的一致性」来压低语言先验的思路一致。
案例¶
对图表问答同时提供正确图、遮蔽图和错误配图;若遮蔽图也能答对,说明基准可能没有真正测视觉信息。
取一道「根据柱状图回答某类别数值」的题目,构造三个版本:正确图、把关键数据区域遮蔽掉的图、以及一张内容无关的错误配图。三个版本的题目文字完全相同,仅图像不同。
分别记录模型在三版上的正确率。正确图与错误配图之间应有明显差距,遮蔽图则应在正确图与错误配图之间。若遮蔽图甚至错误配图也能答对,说明模型依赖题目文字中的线索而非图像内容,该题或该基准的视觉有效性存疑。一段最小构造逻辑如下:
def make_variants(question, image):
return {
"correct": (question, image),
"masked": (question, mask_key_region(image)), # 遮蔽关键数据区
"negative": (question, unrelated_image()), # 内容无关的错误配图
}
排查时还可以比较模型在「纯文本问题」与「图文问题」上的分数差:若两者接近,说明图像信息几乎没有被利用,需要回到预处理环节检查图像是否被正确传入、是否被降采样到无法识别关键内容。