模型评估与基准
核心难题:LLM能力维度极广(知识/推理/代码/数学/创意/安全),单一指标无法覆盖。人工标注一致率仅60-80%。
基准饱和趋势
基准 | 状态 | 2026前沿分数 |
MMLU | 饱和(88%+) | 已无法区分顶级模型 |
GPQA | 当前分水岭 | Gemini 3 Pro 92.6% |
HumanEval | 接近饱和 | 85%+ |
SWE-bench Pro | 极难 | GPT-5 仅23.1% |
评估方法三大类
方法 | 代表 | 优劣 |
静态基准 | MMLU/GPQA/HumanEval | 可复现但易污染 |
人工偏好 | Chatbot Arena(500万票) | 最可信但成本高 |
LLM-as-Judge | GPT-4评分 | 80-90%人工一致率,成本低500-5000× |
Chatbot Arena:盲测两模型输出 → 用户投票 → Elo排名。499万票覆盖296模型,行业最权威排名。
LLM-as-Judge注意:位置偏差(偏好第一个答案)、长度偏差(偏好更长回答)、自偏好(模型偏好自己输出)。
数据污染四防
优先用新发布基准(LiveCodeBench、AIME 2025/2026)
发布n-gram重叠率(通常13-gram)
语义等价改写对照测试,差距>5%需调查
选不可搜索的数据集(GPQA Diamond)
企业评估三层防线
任务专属测试集:覆盖真实业务场景
领域基准:行业标准化评测
A/B测试:线上真实流量对比
核心原则:公开基准用于筛选,自有数据评估决定上线。
