跳到正文
原文
Hugging Face Blog·· 29 天前AI 评分58

BenchMIRT 研究:LLM 基准究竟在衡量什么?

BenchMIRT: What are LLM benchmarks actually measuring?

AI 导读

BenchMIRT 用多维项目反应理论分析基准中的单道题目,从 100 个 LLM、16 个基准及超过 34K 道题的结果中识别出安全与通用推理两个主要维度。研究发现 BBQ 与通用推理的关联更强,保留 10% 的题目通常仍能近似呈现完整题集反映的能力强弱,预测未观测题目答对与否的准确率为 79%,简单基线为 70%。

来源:Hugging Face Blog · huggingface.co