用 AI 撸了个专门检测是不是狗的安保扫描仪,能识别出狼不是狗

产品狗小林 初级 1小时前 356 浏览 8 点赞 约 2 分钟

一个周末时间,我用 AI 循环开发搞了个挺离谱的东西:一个实时视频扫描仪,只要对着镜头说“scan”,它就会判断画面里是不是狗。如果是,它会冷冰冰地回一句“Woof”;如果是狼,它会告诉你“否定,这是灰狼”;要是画面里出现三只狗,它会直接触发“ containment breach”( containment 崩溃)警告,而且还能在 9 个语言里随机切换。

用 AI 撸了个专门检测是不是狗的安保扫描仪,能识别出狼不是狗

最逗的是这个系统的逻辑设定,它把自己定位成一个冷酷的威胁评估系统,完全没有所谓的“萌点”。为了增加实操难度,我特意把识别界限划得很死,比如毛绒玩具、铜像、甚至是穿狗装的人,在它眼里统统不是狗。这种强定义让这个项目不再是简单的 zero-shot 识别,而是变成了一个有标准答案的测试实验。

这套东西的底层逻辑是基于实时流处理,识别流程大概是:捕获帧 → 视觉分析 → 逻辑判断 → 语音输出。

如果你想在本地部署试一下,直接跑 pip install -r 大概率会因为依赖冲突(尤其是 websocketsgoogle-adk 的版本打架)而报错,建议直接用我写好的脚本:

./scripts/install_deps.sh # 解决 ResolutionImpossible 依赖冲突
make frontend # 构建前端,由后端统一服务 dist 目录
make mock # 跑一个离线模拟服务器,不需要 API key,完全免费
make run # 运行正式的 Live API 版本,这个会产生费用

在开发过程中我发现了一个挺深的坑,就是模型在处理实时会话时的稳定性。有些旧模型虽然注释里写着支持 Live session,但实际跑起来根本开不起来。而现在的版本能实现非常流畅的工具调用链路,视觉分析完之后,它会先在内部思考(例如:识别出金毛,置信度 95%,is_dog 为 true),然后调用 report_verdict 工具,最后才出声。

整个项目的部署其实就四行命令,但为了让那几个绿色的 checkmark 亮起来,我中间修了无数个 Bug。这种用 AI 快速迭代、快速踩坑的体感确实很爽。

AI编程NvidiaAMDIntelVite
更系统的工具评测汇总在AI工具实测笔记,有不少直接可参考的案例。

全部回复 (3)

运营喵小柯 中级 1小时前
我一般用个简单的正则配合LLM自检,虽然偶尔会漏,但好歹能拦住大部分乱码,你那边是用什么方案?
0 回复
前端大鹏 初级 1小时前
之前搞过类似的,这种识别逻辑最容易在光线暗的时候翻车。
0 回复
脚本小子小柯 专家 1小时前
我也试过这种,建议加个延迟,不然识别太快容易刷屏。
0 回复

发表回复

支持 Markdown 格式