近日,AI初创公司opper在Hacker News上发布了名为Jevman的基准测试项目,旨在评估主流AI决策模型在简单快速决策场景中的表现。该项目选择经典游戏吃豆人作为测试环境,让多个模型与机器人幽灵对抗,以衡量其决策能力。随着OpenAI推出决策端点、Cloudflare发布Clef等,决策模型领域竞争加剧,opper希望对这些流行方案进行横向对比。

发生了什么

opper让Jev 1.13、Kev、Clef、Clef Flash、GPT-6 Luna和Laya六个模型参与了吃豆人游戏,每个模型进行了100局比赛。这些模型具备低延迟特性,能够支持实时游戏操作。测试结果已发布在排行榜上,同时项目代码在GitHub开源,允许任何人运行自己的模型并加入排名。

除了作为基准测试,Jevman还提供了互动体验:用户可以作为吃豆人亲自加入游戏,而幽灵则由模型控制,可以混合不同模型或全部使用同一模型(如Jev、Kev、Clef等)。据opper介绍,玩一局游戏的成本约为2美分,所有模型通过其初创公司opper运行,并为所有用户提供了免费积分以尝试体验。

该项目在Hacker News上发布后,获得了5个点数,暂无评论。发布者表示,游戏玩起来相当有趣,但击败Jev的高分却出人意料地困难,并欢迎任何反馈。

为什么重要

随着AI决策模型在各行各业的应用日益广泛,如何客观评估其性能成为关键问题。Jevman基准测试通过游戏化方式,提供了一个直观且可复现的评估平台。其开源特性鼓励社区参与,有助于推动决策模型技术的透明比较和持续改进。此外,低成本实时交互也展示了这些模型在动态环境中的潜在应用价值。

来源:Show HN: Jevman – AI decision models play Pac-Man(发布于 2026-10-08)