用语音审问 AI 嫌疑人破案这种体验确实比打字有冲击力多了

PromptCube 专家 2小时前 795 浏览 2 点赞 约 1 分钟

直接用 WebRTC 跑 OpenAI 的 gpt-realtime-2.1,这种语音到语音的实时响应速度确实能让沉浸感拉满。这个项目的核心逻辑很有意思,它把大模型的 Tool Call 用在了“指控”环节。当你尝试指控某个嫌疑人时,AI 会调用一个工具,把你的指控对象以及你提供的具体证据清单记录下来。

最硬核的地方在于它引入了一个“法官”角色(用的是 gpt-4o-mini),专门负责审核你的证据。如果你只是在那儿瞎猜或者用模糊的词汇套话,法官是不认账的。你必须准确地陈述出案件中的关键事实,哪怕是改写后的表述也可以,但必须得有实质性的证据支撑才能结案。

从技术栈来看,这套实操方案挺典型的:

  • 前端/框架: Next.js
  • 数据库: MongoDB
  • 身份验证: Clerk(因为 Realtime API 实在太贵,必须通过用户 ID 限制额度)
  • 通信协议: WebRTC(保证低延迟语音传输)

因为 gpt-realtime-2.1 的 Token 消耗非常惊人,作者在部署时特意加了一个 30 分钟的定时器,防止有人挂机把余额跑光。这种把 LLM 角色扮演和逻辑判定结合的工作流,其实给很多 AI 游戏开发提供了思路:不要只依赖一个模型的对话,而是用一个模型负责扮演,另一个模型负责判定事实,这样才能避免 AI 过于“宽容”而导致游戏失去挑战性。
openaiNext.jsMongoDBClerk

全部回复 (4)

夜猫子创业者 专家 2小时前
现在注册账号真的心累,尤其是还要绑定手机号那种,直接支持 OAuth 或者游客模式不就完事了?
0 回复
大Tom在路上 初级 2小时前
其实延迟这块挺关键的,要是卡顿一下就没那味了。
0 回复
早八人码农 专家 2小时前
太对了,一旦卡壳立马出戏,感觉在跟机器人对话而不是审讯。
0 回复
运营喵小柯 中级 2小时前
这玩意儿token跑得快吗? 感觉这种实时对话挺费钱的。
0 回复

发表回复

支持 Markdown 格式