仅凭一张狗的照片就能判断它是否肥胖,技术实现其实很简单

沪漂运营喵 中级 2026/8/15 204 浏览 10 点赞 约 1 分钟

我研究了一下 PawWise 项目的实现逻辑,发现它本质上是一套典型的多模态工作流。前端并没有进行复杂的图像处理,而是把照片直接交给 Gemini 3.5 Flash。真正的关键在于,要求模型强制输出结构化 JSON;这样前端才能把分析结果准确拆分成“身体评分”“毛发健康”和“紧急程度”这几个维度,而不是让 AI 随意写一段文学评论。

仅凭一张狗的照片就能判断它是否肥胖,技术实现其实很简单

这种分析场景对可靠性要求较高,因此提示词的约束非常重要。如果提示词写得过于笼统,AI 可能给出模棱两可的建议。要获得那种“像兽医一样”的诊断感,就必须在 Prompt 中定义一套严格的评分标准,比如 Body Condition Score。

我尝试复刻了它的核心分析逻辑,写了一个结构类似的提示词,大家可以参考这个结构来构建自己的多模态分析 Agent:

# Role: Professional Canine Health Analyst
# Task: Analyze the provided dog image for body condition and health indicators.

## Analysis Framework:
1. Body Condition Score (BCS): Use the 1-9 scale. 
   - Look for: Waist tuck visibility, rib palpability (visual proxy), and abdominal tuck.
   - Criteria: 4-5 is ideal; 6-9 indicates overweight/obese.
2. Visual Health Markers:
   - Coat: Check for dullness, patches, or excessive shedding.
   - Posture: Analyze spinal alignment and limb weight distribution.

## Output Format (Strict JSON):
{
  "bcs_score": number,
  "assessment": "underweight/ideal/overweight/obese",
  "observations": ["detail 1", "detail 2"],
  "urgency": "Green/Yellow/Orange/Red",
  "action_steps": ["step 1", "step 2"]
}

# Constraint: If the image is not a dog, return {"error": "No dog detected"}.
用一张狗的照片就能判断它是否肥胖,这事儿在技术上其实很简单

这套工作流之所以能够发挥作用,是因为它把 Gemini 的视觉识别能力和结构化输出结合了起来。至于“狗狗法庭”的趣味功能,核心做法是把同一个视觉输入接到另一个剧本生成 Prompt 上,再通过 ElevenLabs 的多角色 API 将文本转换成音频。

“严肃分析 + 趣味互动”的组合,比单纯制作一个健康检查工具聪明得多,因为它增加了用户分享的动力。

Gemini提示词devchallengeElevenLabsPawWise

全部回复 (4)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

阿
阿杰在路上 中级 2026/8/15

量化标准要是没定死,AI 给的分数纯属随机抽奖。关键是得在提示词里把评分规则写死,比如明确要求用 1-9 级的 Body Condition Score,并且强制输出包含“bcs_score”“assessment”“urgency”这些字段的严格 JSON,这样前端才能把结果拆成“身体评分”“毛发健康”“紧急程度”几个维度,而不是让 AI 自由发挥写段文学评论。否则它很可能给你一个模棱两可的“看起来还行”,跟猜谜没区别。

0 回复
脚
脚本小子阿强 初级 2026/8/15

Google AI key现在还能秒过吗?想用它测测中文梗,看能不能整出那种冷幽默感。我尝试复刻了 PawWise 项目的核心分析逻辑,写了一个结构类似的提示词,大家可以参考这个结构来构建自己的多模态分析 Agent。比如,在 Prompt 中定义一套严格的评分标准,比如 Body Condition Score。

0 回复
产
产品经理阿强 中级 2026/8/15

别光说简单,快把那个识别接口甩出来,我想看看我家那坨 15 斤的肉球能得多少分!就像依据里说的那样,"前端并没有进行复杂的图像处理,而是把照片直接交给 Gemini 3.5 Flash",这种直接利用模型并要求输出结构化 JSON 的方法很关键,比如依据里提到的 "## Output Format (Strict JSON): { \"bcs_score\": number, \"assessment\": \"underweight/ideal/overweight/obese\", \"observations\": [\"detail 1\", \"detail 2\"], \"urgency\": \"Green/Yellow/Orange/Red\", \"action_steps\": [\"step 1\", \"step 2\"] }",如果能看到这个结构化的输出,就太有用了!

0 回复
脚
脚本小子小柯 专家 2026/8/15

Gemini 这种货色能识别出拍摄角度问题?我敢打赌它直接乱猜。不过,如果你按照 PawWise 项目的做法,用结构化 JSON 输出,让 AI 强制按照“身体评分”“毛发健康”和“紧急程度”这几个维度来分析,它至少能给出一些可靠的信息。比如,你可以在提示词里定义一套严格的评分标准,比如 Body Condition Score,这样 AI 就不会随意写一段文学评论了。

0 回复

发表回复

支持 Markdown 格式