用一张狗的照片就能判断它是否肥胖,这事儿在技术上其实很简单

沪漂运营喵 中级 1天前 153 浏览 10 点赞 约 1 分钟

我研究了一下 PawWise 这个项目的实现逻辑,它本质上是一个典型的多模态工作流。开发者没有在前端做复杂的图像处理,而是直接把照片扔给 Gemini 3.5 Flash。最关键的技巧在于他强制要求模型输出结构化的 JSON,这样前端才能把分析结果精准地拆分成“身体评分”、“毛发健康”和“紧急程度”这几个维度,而不是让 AI 随便写一段文学评论。

用一张狗的照片就能判断它是否肥胖,这事儿在技术上其实很简单

对于这种需要高可靠性分析的场景,提示词的约束至关重要。如果提示词写得太笼统,AI 可能会给出模棱两可的建议。要实现那种“像兽医一样”的诊断感,必须在 Prompt 里定义一套严格的评分标准(比如 Body Condition Score)。

我尝试复刻了它的核心分析逻辑,写了一个类似的提示词,大家可以参考这个结构来构建自己的多模态分析 Agent:

# Role: Professional Canine Health Analyst
# Task: Analyze the provided dog image for body condition and health indicators.

![用一张狗的照片就能判断它是否肥胖,这事儿在技术上其实很简单](/uploads/articles/550de7f10a37eec5.webp)

## Analysis Framework:
1. Body Condition Score (BCS): Use the 1-9 scale. 
   - Look for: Waist tuck visibility, rib palpability (visual proxy), and abdominal tuck.
   - Criteria: 4-5 is ideal; 6-9 indicates overweight/obese.
2. Visual Health Markers:
   - Coat: Check for dullness, patches, or excessive shedding.
   - Posture: Analyze spinal alignment and limb weight distribution.

## Output Format (Strict JSON):
{
  "bcs_score": number,
  "assessment": "underweight/ideal/overweight/obese",
  "observations": ["detail 1", "detail 2"],
  "urgency": "Green/Yellow/Orange/Red",
  "action_steps": ["step 1", "step 2"]
}

# Constraint: If the image is not a dog, return {"error": "No dog detected"}.

这个工作流之所以有效,是因为它把 Gemini 的视觉识别能力和结构化输出结合了起来。至于那个“狗狗法庭”的趣味功能,其实就是把同一个视觉输入接到了另一个剧本生成 Prompt 上,再通过 ElevenLabs 的多角色 API 把文本转成音频。

这种“严肃分析 + 趣味互动”的组合,比单纯做一个健康检查工具要聪明得多,因为它增加了用户分享的动力。

Gemini提示词devchallengeElevenLabsPawWise

全部回复 (4)

阿杰在路上 中级 1天前
其实提示词里的量化标准很重要,不然AI给的分数很随意。
0 回复
脚本小子阿强 初级 1天前
这个Google AI key现在申请还是秒过的吧?想试试那个家具被拆的判决,不知道对中文的理解能不能整出那种幽默感。
0 回复
产品经理阿强 中级 1天前
申请应该很快,不过中文梗这块儿估计得看运气,你试完记得分享下结果!
0 回复
脚本小子小柯 专家 1天前
那如果照片角度不对,Gemini能识别出来并提醒重新拍吗?
0 回复

发表回复

支持 Markdown 格式