Kimi K3与神鬼寓言有竞争力; 《Kimi K3》和《神鬼寓言》是 SoTA
真正值得关注的不是这条新闻本身,而是它可能把「智能体」的竞争焦点推向从演示效果到真实工作流的可用性验证。
原文链接:https://fireworks.ai/blog/kimik3-fable
Kimi K3与神鬼寓言有竞争力; Kimi K3+寓言是SoTA。
Kimi K3与神鬼寓言有竞争力; Kimi K3+寓言是SoTA。
K3 是一款前沿品质的开放式型号,但成本仅为其一小部分。更重要的是,它可预测地补充了《神鬼寓言》,这使得通过路由任务获得最高质量的情报成为可能。我们在 K3 和 Fable 之间的路由实现了 93% 的准确率。在长代理循环上,结果比单独使用 Fable 的成本效益高出约 50 倍,并且每个用例的成本始终较低。我们对基准进行了平均,每个基准针对不同类型的工作,并通过相同的工具运行 K3 和 Fable 5。真实代理循环中总共约有 1,030 个任务。系列 测试内容 任务 SWE Real repo bug 修复(SWE-bench 风格) 460 终端 长代理操作:安全、加密、反向工程、系统管理 89 算法 LeetCode / AtCoder 风格的问题 100 跨六种语言的多语言实现 225 法律 法律代理人基准(律师分级任务) 120 在我们进入结果之前,先做一个快速定义。
Oracle 路由是一种通过每个模型运行任务然后选择最便宜的正确选项(成本/性能上限)来衡量最佳理论性能的方法。在实际的路由器中,您无法针对多个模型运行任务。路由器会预测哪种模型具有最佳的成本和质量权衡,但最终这只是一个猜测。在本研究中,预言机路由证明 K3 被选择用于 72-96% 的任务。这表明,通过了解日常任务和前沿工作的真正长尾之间的差异,可能可以实现近乎完美的路由器。确切地说,这将需要更多的路由数据和现实世界的性能。从 10,000 英尺的高度来看,很容易看到这两个模型并认为它们势均力敌。例如,如果您查看头条基准 SWE,K3 获得 92.4%,Fable 获得 92.6%。在我们进行基准测试的五种类型的任务中,这两个模型往往彼此相差几个点,其中 Fable 在编码语言广度(多语言)方面稍稍领先。图 1 · 按类别划分的任务解决率。总体平均值几乎相同;擅长下面的不同事情。很容易就到此为止并说“它们大致相等”。消息是,它们在不同的任务类型上都有明显更好的表现。