通过竞技场对战测评模型的游戏设计和编程能力

林一二2026年05月27日 17:00

这个游戏我搁了好久没写,目前策划已经被我改得面目全非,变成一个单机的巨构地牢探险游戏了。

但是最近因为 DeepSeek、Mimo 等国产模型的大幅降价,Kimi2.6 GLM5.1 等模型拥有接近 Sonnet 4.6 的能力,我开始更多地用国产模型,但要评测它们,目前主要还是看各种论坛,大家道听途说,很难有一个明确的指标。我主要想对比一下 mimo deepseek,看看要不要续订 mimo,结果看了一下,现在没有 Agent 时代的合理的评测网站啊,很多都是单轮对话的,对于我们用 OpenCode 的没有什么用

https://arena.ai/ 那种竞技场,我都没去用,我身边的开发者也很少用。我都不知道是哪些人在用它们、在评价上面的LLM,因为它打开就是一个像 GPT 那样的对话框,让我想起 GPT-3.5 刚出的时候,我们是把代码复制粘贴到上面来让它编程。而现在基本只有一些落后于时代的老头子会这么用了。但如果让他接入 Copilot 或 OpenCode 的话,又不知道他要怎么样给出两个结果来对比评测,所以这个在 Agent 时代用起来应该不是特别客观。

所以我就想还是把这个废案拾起来,搞一个多智能体决斗,而且主要是评测游戏相关开发能力的竞技场。必须要让他们能够用一些基本的 API,自己组合出可用的游戏内的技能、特效等系统,并在运行时参与决策,以评价长时间运行后的工具调用能力。