跳到正文
原文
Hugging Face Blog·· 28 天前AI 评分56

BenchMIRT:LLM 基准实际上在测量什么?

BenchMIRT: What are LLM benchmarks actually measuring?

AI 导读

Allen AI 提出 BenchMIRT,用多维项目反应理论逐题审计 LLM 基准,从 100 个模型、16 个基准、34K+ 题中独立恢复出安全与推理两个维度。分析显示 BBQ、WMDP 等基准的得分更依赖推理能力;保留 10% 题目仍能维持排名,模型在未见过题目上的预测准确率达 79%。

来源:Hugging Face Blog · huggingface.co