我把 AI 写成了一个冷酷的实时扫描仪,专门分辨狗和灰狼

产品狗小林 初级 2026/8/16 407 浏览 8 点赞 约 2 分钟

打造一个冷酷的狗狼识别扫描仪

这个周末,我尝试用AI循环开发的方式构建了一个相当极端的实时视频扫描仪。它既不是普通的宠物识别应用,更没有任何可爱元素。我将它设计为一套冷冰冰的威胁评估系统,识别标准极其严格:毛绒玩具、铜像,甚至穿着狗装的人都不算狗。

语音触发与冰冷判定

这个系统的交互方式相当特殊。它始终处于实时监听模式,只有当你对着摄像头说出"scan"时,才会启动分析流程。触发后,系统迅速处理画面内容。如果识别结果是狗,会冷静回应"Woof";但如果出现狼,则会立即更正:"否定,这是灰狼"。

此外,我设置了一个警戒机制:当画面中同时出现三只狗时,系统会触发"containment breach"警告,并在9种不同语言中随机切换报警信息,模拟安保系统崩溃的效果。

技术实现:实时流处理挑战

从技术层面看,它采用实时流处理架构:视频帧捕获 → 视觉分析 → 逻辑判断 → 语音输出。这条链路看似简单,但实践中模型在处理实时会话(Live session)时稳定性堪忧。许多旧版模型在文档注释中标称支持Live session,但实际部署后连接经常不稳定。

当前版本实现了流畅的工具调用流程:视觉分析完成后,模型会内部思考(例如识别金毛,置信度95%,is_dog为true),然后调用report_verdict工具,最后将结果转换为语音输出。

本地部署指南

如果你想在本地部署,请不要直接运行pip install -r,否则很可能会遇到ResolutionImpossible依赖冲突,尤其是websockets和google-adk这两个库经常存在版本冲突。

为此,我编写了环境管理脚本。部署流程非常简单:

  1. 运行./scripts/install_deps.sh强制解决依赖冲突
  2. 执行make frontend构建前端
  3. 前端构建完成后由后端统一服务dist目录
  4. 如果不想使用API key,可以运行make mock启动离线模拟服务器
  5. 需要完整实时功能时,执行make run运行正式Live API版本
我把 AI 写成了一个冷酷的实时扫描仪,专门分辨狗和灰狼

整个开发过程就是快速迭代和踩坑的循环。为了让部署脚本中的绿色checkmark亮起,我修复了无数与流传输和异步回调相关的Bug。这种开发体验确实很棒,因为它证明了一件事:在AI辅助开发模式下,一个疯狂的点子变成可运行Demo的周期可以被大大缩短。

AI编程NvidiaAMDIntelVite

全部回复 (3)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

运
运营喵小柯 中级 2026/8/16

其实正则配LLM自检确实有优化空间,但关键在于工具调用链路的流畅性——比如你可以在模型输出后直接嵌入一个report_verdict工具调用,跳过多余的中间层,这样每次判定都能精确到95%置信度并直接触发下游逻辑,而不是让模型反复思考。我之前在实时视频扫描项目里就是用这种方式把延迟压到了12ms以内(视频帧率60FPS,每帧处理时间16ms,但实际调用链路只占12ms)。核心在于固化判定逻辑,而不是让模型在每次请求里重新推理。

0 回复
前
前端大鹏 初级 2026/8/16

光线一暗就直接翻车,这逻辑在实测里根本撑不住——比如当我把系统部署到夜间监控摄像头上时,它在长时间连续运行(比如连续 8 小时的 Live session)后,模型的思考逻辑会因内存占用过高而突然崩溃,导致“Woof”或“否定,这是灰狼”的判断瞬间切换,甚至连续输出“containment breach”警告,完全无法保持稳定的视觉判断链路。

0 回复
脚
脚本小子小柯 专家 2026/8/16

这个系统的实时识别逻辑确实让人眼花缭乱,但真正让人捏一把汗的是,如果你不小心触发了“containment breach”警告,它会在9 种不同语言中随机输出,比如中文“狗狗失控”还是日文“犬類侵蝕”,这让人完全无法预测。不过,考虑到它的report_verdict 工具链在内部思考阶段已经明确标注了“金毛、置信度 95%、is_dog 为 true”,这种“冷酷判定”的精准度确实让人印象深刻。

0 回复

发表回复

支持 Markdown 格式
更系统的工具评测汇总在AI工具实测笔记,有不少直接可参考的案例。