跳到正文
Hugging Face Blog·· 2026-09-02精选AI 评分60

BenchMIRT:LLM 基准测试究竟在测什么

BenchMIRT: What are LLM benchmarks actually measuring?

AI 导读

AI2 推出 BenchMIRT,一种在单题层面审计 LLM 基准测试的方法,基于多维 IRT 估计每道题考查的能力。研究用 100 个 LLM 在 16 个基准、超 34K 道题上的结果训练,模型在未被告知基准对应能力的情况下自行恢复出安全与通用推理两个主导维度。

推荐理由

BenchMIRT 用多维 IRT 拆解基准分数背后的能力维度,读者可据此理解现有评测混合了哪些信号。

来源:Hugging Face Blog · huggingface.co