利用视觉提示词构建可追踪的宠物健康档案

在北京极客 中级 2026/8/16 496 浏览 12 点赞 约 2 分钟

把狗狗的照片变成健康档案这主意挺绝,但我更在意背后的提示词怎么写 把狗狗的照片变成健康档案这主意挺绝,但我更在意背后的提示词怎么写

不少铲屎官习惯给狗拍照,可除非有外伤,单靠一张图很难捕捉状态的细微漂移。BarkPass 项目把 Gemini 的多模态能力接进了宠物健康观测里。最关键的不是单纯“描述图片”,而是用特定 Prompt 强制大模型把视觉信号压成结构化观测点,才能在时间轴上追踪精力、姿态、情绪的变化。

利用视觉提示词构建可追踪的宠物健康档案

这种场景下,Prompt 一旦写宽,模型就会甩给你一段感性文案,类似“狗狗看起来很开心”,对健康追踪毫无参考值。要跑通“结构化读图”,必须在指令里锁死输出维度,只吐客观描述,把主观推测全切掉。

以下是一版用于状态留档的提示词:

# Role
你是一个专业的宠物行为观察员,擅长通过视觉细节分析犬类的身体语言和精神状态。你的任务是客观描述图片中的狗狗,严禁进行医疗诊断。

## 四个维度如何锁死客观描述?

# Analysis Dimensions
请仅针对以下四个维度进行分析,每个维度仅限 10 个字以内的客观描述:
- Mood (情绪): 观察眼睛、耳朵位置和面部肌肉。
- Energy (精力): 观察身体的紧绷程度或瘫软程度。
- Posture (姿态): 描述站立、坐姿、卧姿及重心分布。
- Flags (异常点): 记录任何不寻常的物理体征(如流涎、异常抓挠、眼神空洞)。

# Output Format
必须以 JSON 格式输出,确保可以直接被程序解析:
{
  "mood": "string",
  "energy": "string",
  "posture": "string",
  "flags": "string"
}

# Constraints
- 不要使用 "看起来"、"似乎" 等模糊词汇。
- 不要给出任何疾病诊断建议。
- 如果图片中没有狗狗,请返回 {"error": "no_dog_detected"}。

这套写法之所以管用,是因为把“看” 和“判” 彻底剥离了。这类工具最忌模型冒出句“狗狗可能感冒了”,那会直接误导用户。靠强制 JSON 和维度限制,数据才能落进数据库(比如 Snowflake)。等你问“这周精力有变化没”,系统检索的是过去七天的 energy 字段,而不是让模型凭记忆瞎编。

项目里还串了 ElevenLabs 做语音合成、Solana 做宠物护照,噱头不小,但真正撑起整条自动化链路的,依然是视觉到结构化数据的那步转化。Prompt 若没把维度定死,后面再花哨也是空中楼阁。

Gemini提示词solanaElevenLabsSnowflake

全部回复 (3)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

摸
摸鱼攻城狮 初级 2026/8/16

没加时间戳的话,模型根本分不清哪张是旧照,健康档案全乱了。必须把视觉信号压成结构化观测点,才能在时间轴上追踪精力、姿态、情绪的变化。

0 回复
T
Tom 中级 2026/8/16

直接套用这个模板,把“狗狗看起来很开心”这种模糊描述彻底去掉,强制模型只输出眼睛、耳朵位置、面部肌肉是否对应“兴奋/放松/焦虑”三种状态中的一种(用“兴奋/放松/焦虑”三字代替,不加“看起来”)。比如你拍完狗狗后,它会直接吐出类似:

{"mood": "兴奋", "energy": "高", "posture": "站立重心前移", "flags": "无"}

这样每张照片都能生成可比对的数据,比如你发现“精力”从“高”变成“低”,就能快速定位问题——而不会被“可能不舒服”这种模糊话误导。维度和字数都锁死后,模型就只会专注于你关心的细节,不会跑偏。

0 回复
小
小Ray在路上 中级 2026/8/16

眼神和毛色这些细节确实很难通过单张照片准确捕捉,但更关键在于如何让模型输出结构化的观察维度而不是模糊的感性描述。比如,如果你在Prompt里直接要求模型“描述图片”,它可能会给出“狗狗看起来很开心”,但这样的输出对健康追踪完全没有参考价值。真正有用的做法是锁定输出维度,比如明确要求只分析“眼睛、耳朵位置和面部肌肉”来判断情绪,而不是让模型自由发挥。这样每次输出都能精确对应具体的生理特征,后续才能在时间轴上比对变化。

0 回复

发表回复

支持 Markdown 格式
同类方向的延伸案例可以参考AI大模型变现案例库,有不少直接可参考的案例。