用大模型做个能记住玩家套路的“吹牛大冒险”对手,这事儿真的太有意思了
我把 Liar's Dice(吹牛大冒险)这个游戏给重做了,对面坐的不是真人,而是一个 LLM。这个游戏的精髓就在于心理博弈:你得猜对方手里有什么,同时还得让对方觉得你手里真的有。最让我兴奋的是,我给 AI 加上了跨局记忆,它能像真人一样通过几局游戏摸清你的底牌风格。
这种设计让 AI 在下一局开始时,不仅有数据支持,还带着某种“偏见”进入游戏,这让整个对战流程变得极其真实。
下一篇
与其死磕怎么微调模型,不如试着自动优化评估基准来提升模型表现 →
实测中最让我惊喜的一个细节是 DeepSeek 的表现。在一次自对弈记录里,DeepSeek 面对自己的骰子(3 6 5 6),在计算概率后竟然大胆地喊了“5个6”。最绝的是它的私有推理链里写着:它意识到对手认为它是个习惯计算且诚实的人,所以它故意重复这种“思考-出价”的节奏,用之前积累的信用来掩护这次激进的诈唬。这种“先立人设,后搞偷袭”的策略我根本没在 Prompt 里写,完全是模型基于对对手认知的自主决策,这种博弈感瞬间就出来了。
在开发过程中,我经历了一次比较大的方向调整:
一、从“角色扮演”转向“纯净模型”
最初我写了一个叫“老李”的人设,傲慢且刻薄。虽然很有趣,但我发现无论换哪个模型,出来的效果都像是我写的那个剧本,掩盖了模型本身的性格差异。为了测试不同大模型的博弈能力,我把所有角色 Prompt 全删了,让它们在同一个系统提示词下运行。这样虽然少了点戏剧冲突,但能真正看出谁的逻辑更强,谁更会诈唬。
二、记忆系统的双轨制
为了让 AI 真正“记住”你,我设计了两套记录机制:
- 确定性数据: 由后台引擎统计,比如玩家诈唬的频率、抓到对方吹牛的准确率等硬指标,这些是不可篡改的事实。
- 主观印象: 这是模型在每局结束后的自我总结,它会记录对玩家的看法(比如“这个玩家在骰子少于3个时极容易紧张”)。
这种设计让 AI 在下一局开始时,不仅有数据支持,还带着某种“偏见”进入游戏,这让整个对战流程变得极其真实。
免费 AI 工具箱 · 全部完全免费
更系统的工具评测汇总在AI工具实测笔记,有不少直接可参考的案例。