基准测试是什么?
模型 A 说「我很强」,模型 B 也说「我很强」,怎么比?基准测试(benchmark)就是一套公开、标准化的「考试卷」:固定的题目、固定的评分规则,谁都能拿自己的模型来跑一遍,得分一目了然。常见基准有哪些?
知识问答比如 MMLU,考你从物理到法律的各科知识,衡量模型「知道多少」。
推理与数学
像 GSM8K、MATH 这类,用数学题和逻辑题测「会不会想」。
代码能力
HumanEval、SWE-bench 等,看模型能不能写出能跑通的代码、修好 bug。
通用综合
不少团队还会用自家评测集,覆盖长文本、多轮对话、工具调用等。
怎么看榜单才不踩坑?
小心「刷题」有些模型在训练时「见过」考题,分数虚高,这叫数据污染。看榜时要多留个心眼。
分数高 ≠ 用起来好
基准测的是某个切片,真实场景千差万别,最终还得回到你自己的任务上测。
它的意义
基准测试让整个行业有了「共同语言」:厂商用它标榜进步,研究者用它定位差距,你用它能快速筛掉不靠谱的选项。一句话记住:基准测试就是给 AI 出「统考」。分数能参考,但不能只信分数。
评论