用 AI 撸了个专门检测是不是狗的安保扫描仪,能识别出狼不是狗
一个周末时间,我用 AI 循环开发搞了个挺离谱的东西:一个实时视频扫描仪,只要对着镜头说“scan”,它就会判断画面里是不是狗。如果是,它会冷冰冰地回一句“Woof”;如果是狼,它会告诉你“否定,这是灰狼”;要是画面里出现三只狗,它会直接触发“ containment breach”( containment 崩溃)警告,而且还能在 9 个语言里随机切换。
下一篇
用 CSS 搓一个像美食手账一样的落地页到底怎么设计 →
最逗的是这个系统的逻辑设定,它把自己定位成一个冷酷的威胁评估系统,完全没有所谓的“萌点”。为了增加实操难度,我特意把识别界限划得很死,比如毛绒玩具、铜像、甚至是穿狗装的人,在它眼里统统不是狗。这种强定义让这个项目不再是简单的 zero-shot 识别,而是变成了一个有标准答案的测试实验。
这套东西的底层逻辑是基于实时流处理,识别流程大概是:捕获帧 → 视觉分析 → 逻辑判断 → 语音输出。
如果你想在本地部署试一下,直接跑 pip install -r 大概率会因为依赖冲突(尤其是 websockets 和 google-adk 的版本打架)而报错,建议直接用我写好的脚本:
./scripts/install_deps.sh # 解决 ResolutionImpossible 依赖冲突
make frontend # 构建前端,由后端统一服务 dist 目录
make mock # 跑一个离线模拟服务器,不需要 API key,完全免费
make run # 运行正式的 Live API 版本,这个会产生费用在开发过程中我发现了一个挺深的坑,就是模型在处理实时会话时的稳定性。有些旧模型虽然注释里写着支持 Live session,但实际跑起来根本开不起来。而现在的版本能实现非常流畅的工具调用链路,视觉分析完之后,它会先在内部思考(例如:识别出金毛,置信度 95%,is_dog 为 true),然后调用 report_verdict 工具,最后才出声。
整个项目的部署其实就四行命令,但为了让那几个绿色的 checkmark 亮起来,我中间修了无数个 Bug。这种用 AI 快速迭代、快速踩坑的体感确实很爽。
免费 AI 工具箱 · 全部完全免费
更系统的工具评测汇总在AI工具实测笔记,有不少直接可参考的案例。
