头版Folia Daily Briefing
← 返回头版
人工智能

研究人员用99美元成本验证MUD游戏评估大型语言模型的可行性

研究人员发表论文探索利用MUD(文本冒险游戏)来评估大型语言模型,总耗资仅99美元。研究对四个行为维度进行评分,其中两个依赖LLM分类器。

研究人员发表论文探索利用MUD(文本冒险游戏)来评估大型语言模型,总耗资仅99美元[1]。研究对四个行为维度进行评分,其中两个依赖LLM分类器[1]。

实验发现了LLM评判器的严重可靠性问题。两个评判器之间的模型一致性范围从85%至22%[1],在探针检测上的aggregate kappa值仅为0.04[1]。这个结论本身比LLM排名结果更具价值[1]。当移除两个LLM分类器维度后,一个前沿模型的排名下降了六位[1]。

研究中每个模型仅运行50次[1]。研究人员强调这项工作仅构成概念验证而非正式基准[1],已将全部数据和代码开源,论文和数据采用CC BY 4.0许可,代码采用MIT许可[1]。相关研究成果已上传至Zenodo[1]。


LLM评估MUD游戏AI基准测试LLM评判器可靠性proof of concept