Hugging Face Blog·· 28 天前AI 评分56
BenchMIRT:LLM 基准实际上在测量什么?
BenchMIRT: What are LLM benchmarks actually measuring?
AI 导读
Allen AI 提出 BenchMIRT,用多维项目反应理论逐题审计 LLM 基准,从 100 个模型、16 个基准、34K+ 题中独立恢复出安全与推理两个维度。分析显示 BBQ、WMDP 等基准的得分更依赖推理能力;保留 10% 题目仍能维持排名,模型在未见过题目上的预测准确率达 79%。
来源:Hugging Face Blog · huggingface.co