跳到正文
原文
Hugging Face Blog·· 29 天前精选AI 评分68

BenchMIRT:LLM 基准测试实际上在测量什么?

BenchMIRT: What are LLM benchmarks actually measuring?

AI 导读

AllenAI 介绍 BenchMIRT,一种在单个提示词和任务层面审计 LLM 基准测试、拆分潜在能力信号的方法。该方法基于 100 个 LLM、16 个基准和超过 34K 个问题训练,独立识别出安全与通用推理两个主要维度。实验显示,保留 10% 的问题通常能接近完整评测的能力判断,预测未观测问题正确率为 79%,高于简单基线的 70%。

推荐理由

BenchMIRT将基准分数拆解到模型能力与单个题目层面,帮助研究者识别安全和推理信号的混杂,并压缩评测规模。

来源:Hugging Face Blog · huggingface.co