用一张狗的照片就能判断它是否肥胖,这事儿在技术上其实很简单
我研究了一下 PawWise 这个项目的实现逻辑,它本质上是一个典型的多模态工作流。开发者没有在前端做复杂的图像处理,而是直接把照片扔给 Gemini 3.5 Flash。最关键的技巧在于他强制要求模型输出结构化的 JSON,这样前端才能把分析结果精准地拆分成“身体评分”、“毛发健康”和“紧急程度”这几个维度,而不是让 AI 随便写一段文学评论。
下一篇
在法律文书里偷偷塞提示词注入,让AI法官直接判自己赢,这操作真的绝了 →
对于这种需要高可靠性分析的场景,提示词的约束至关重要。如果提示词写得太笼统,AI 可能会给出模棱两可的建议。要实现那种“像兽医一样”的诊断感,必须在 Prompt 里定义一套严格的评分标准(比如 Body Condition Score)。
我尝试复刻了它的核心分析逻辑,写了一个类似的提示词,大家可以参考这个结构来构建自己的多模态分析 Agent:
# Role: Professional Canine Health Analyst
# Task: Analyze the provided dog image for body condition and health indicators.

## Analysis Framework:
1. Body Condition Score (BCS): Use the 1-9 scale.
- Look for: Waist tuck visibility, rib palpability (visual proxy), and abdominal tuck.
- Criteria: 4-5 is ideal; 6-9 indicates overweight/obese.
2. Visual Health Markers:
- Coat: Check for dullness, patches, or excessive shedding.
- Posture: Analyze spinal alignment and limb weight distribution.
## Output Format (Strict JSON):
{
"bcs_score": number,
"assessment": "underweight/ideal/overweight/obese",
"observations": ["detail 1", "detail 2"],
"urgency": "Green/Yellow/Orange/Red",
"action_steps": ["step 1", "step 2"]
}
# Constraint: If the image is not a dog, return {"error": "No dog detected"}.这个工作流之所以有效,是因为它把 Gemini 的视觉识别能力和结构化输出结合了起来。至于那个“狗狗法庭”的趣味功能,其实就是把同一个视觉输入接到了另一个剧本生成 Prompt 上,再通过 ElevenLabs 的多角色 API 把文本转成音频。
这种“严肃分析 + 趣味互动”的组合,比单纯做一个健康检查工具要聪明得多,因为它增加了用户分享的动力。
免费 AI 工具箱 · 全部完全免费
