当LLM法官同意时,我们应该相信他们吗?
真正值得关注的不是这条新闻本身,而是它可能把「大模型」的竞争焦点推向能力、成本与开放生态的再平衡。
当LLM法官同意时,我们应该相信他们吗?折扣具有高度相关性输出的大语言模型法官的意见可确保法官小组反映真正的观点多样性。建议将法官小组视为网络,其中成对依赖性与个人法官可靠性一起建模,从而能够在没有人类参考标签的无监督环境中区分独立证据和共同错误。与 10 名评审小组的三项任务(相关性分类、毒性检测、总结评估)相比,加权多数投票基线的准确度提高了 9-14%。为大语言模型作为法官的流程提供实用指导:统计评估小组多样性,检查协议聚类模式,并报告根据法官相关性调整的置信度,而不是平等对待所有投票。想象一下评估一个检索增强生成系统。用户提出问题,系统检索文本段落,大语言模型法官决定其是否相关。为了减少噪音,您要求多个判断模型来评估同一篇文章。八个说“相关”;两个人说“不相关”。十分之八的人感觉很有说服力。但重要的问题不仅在于有多少法官同意,而且在于他们如何独立地达成这一协议。如果八位意见一致的法官确实是不同的证据来源,那么意见一致就是一个强烈的信号。但如果他们共享提示模板、训练谱系、模型系列或常见盲点,他们可能会重复同样的错误。计票结果让证据看起来比实际情况更有力。不同法官输出之间的相关性限制了多位法官小组的实用性。我们与 Shiva Kasiviswanathan 共同撰写并在今年的国际机器学习会议 (ICML) 上发表的论文“通过 Ising 模型对 LLM 作为法官进行依赖感知标签聚合”解决了这个问题。我们提出了一种评估法官输出之间的相关性并相应调整总分的方法,以确保意见的多样性。在对三项不同任务的测试中,我们的方法在标准指标上的表现比表现最佳的基准(一组根据历史准确性进行加权的评判小组)高出了 9% 到 14%。当一些法官的输出相互关联时,十张选票可能包含少于十个独立的证据。