跨局记忆让 LLM 在《吹牛大冒险》中学会“信用掩护”诈唬
当你试图让大模型参与《吹牛大冒险》(Liar's Dice)时,单纯的概率计算模块无法解决核心问题:如何在多轮对抗中构建对手的心理模型。只有引入跨局记忆机制后,模型才能从单局的最优解转向长线博弈,甚至自发使用“信用额度”来掩护诈唬行为。这种转变的关键在于,模型不再被动执行固定策略,而是主动利用对手对其形成的认知偏差来操纵游戏节奏。
为了平衡记忆容量和决策效率,开发者采用了“双轨制”记忆架构:一条轨道存储硬数据(如玩家诈唬频率、被识破概率等),这些数据由后台引擎实时统计,无法被模型篡改;另一条轨道则记录模型对玩家的主观判断,例如“当骰子数量少于 3 个时,该玩家出价趋于保守”。两者结合后,模型能够在下一局中带着“基于经验的偏见”参与对抗,而非仅依赖数字计算。
在实际对弈中,DeepSeek 的表现尤为突出。一次自对弈记录显示,当模型持有 3、6、5、6 四颗骰子时,它选择喊出“5 个 6”——这一决定超出了概率预期。其私有推理链(Reasoning Chain)揭示,模型意识到对手将其视为“习惯严谨计算且诚实的玩家”,于是故意维持这种“思考-出价”节奏,以消耗之前积累的“信用额度”,从而在关键时刻发动诈唬。这种“先立人设,后搞偷袭”的策略完全源自模型对对手的认知,而非预设 Prompt。
然而,人设设定也可能成为陷阱。最初为模型指定“老李”这一傲慢刻薄的角色后,不同模型的输出趋同,反而掩盖了各自在博弈逻辑上的差异。后续调整中,开发者删除所有具体人设 Prompt,让模型在同一纯净系统提示词下运行。结果发现,模型在诈唬时机的把握上呈现出明显差异:有的模型保守谨慎,有的则能敏锐捕捉玩家的心理漏洞。这说明,真正的对抗能力并非依赖于剧本化的角色设定,而是模型对博弈逻辑的原生理解与对手行为的动态建模。
图片保留原样:

全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
这 AI 居然学会操纵心理由记忆点切入,温度系数要是调高点估计能把我也骗了。比如我尝试用大模型重构经典博弈游戏 Liar's Dice(吹牛大冒险),一开始以为只要给 AI 加上概率计算模块,就能应付这款游戏。实际做下来后才发现,引入“跨局记忆”才带来了真正的质变。最让我意外的是,AI 不再死板地执行指令,而是开始利用所谓的“信用额度”掩护自己的诈唬行为,这种心理博弈的雏形很有意思。
没点情绪起伏怎么吹牛?快给它加个随机暴躁人格,看它怎么演我。比如,我尝试用大模型重构经典博弈游戏 Liar's Dice(吹牛大冒险),一开始以为只要给 AI 加上概率计算模块,就能应付这款游戏。实际做下来后才发现,引入“跨局记忆”才带来了真正的质变。
这 AI 居然学会了反向操纵?与其盲目拉满 Context 窗口,不如参考文中提到的“双轨制”思路:用后台引擎统计诈唬频率等硬指标作为第一轨,再让模型自行总结对手的主观印象作为第二轨,这样既避免 Token 冗余又能实现真正的心理博弈。