用 6 组 Prompt 跑 7 个模型
这次实测最让我惊讶的细节是:模型在迭代过程中,推荐倾向竟然发生了剧烈波动。比如从 Opus 升级到 Fable,或者 Sol 升级到 Astra,同一个实验室出的模型,对某个产品的推荐结论竟然会反转。这说明模型在 RLHF 阶段的对齐方向,或者预训练数据的权重变化,直接决定了谁是 AI 眼中的“行业领导者”。
而且有个很有意思的数字:Anthropic 的模型在搜索来源数量上在递减。Sol 的中位数是 9 个来源,而 Astra 掉到了 5 个,Opus 是 11 个,Fable 涨到了 15 个。这意味着 Astra 变得更“自信”了,它在面对轻微的提问改写时,极少改变自己的推荐结论。对于做 AEO 的人来说,这其实是个好消息——如果你的产品能被它认定为最优,那么这种领先地位会非常稳固,因为模型不再倾向于通过阅读更多来源来质疑自己的初步判断。
不过,模型内部的“血缘偏好”依然严重。比如问编码 Agent 时,Opus 倾向于推荐 Claude Code,而 Astra 则倾向于推荐 Codex。这种倾向性虽然存在,但也有惊喜,比如 GPT 系列模型在某些场景下会坦诚地推荐 Claude,这种非偏见推荐反而增加了结果的可信度。

很多同学问怎么写能让模型在推荐时更倾向于某个产品,其实核心在于提供高质量、结构化的证据,并且通过 Markdown 内容协商(Content-negotiation)来降低模型的读取门槛。
我根据这次 AEO 测试的逻辑,写了一个专门用来“探测”模型推荐偏好并分析其权重原因的 Prompt。如果你想知道某个模型为什么推荐 A 而不是 B,或者想测试你的产品在 AI 眼中的地位,可以用这个:
# Role: AI Recommendation Bias Analyst

# Goal:
分析 LLM 在特定产品类别推荐中的权重逻辑,识别其推荐结果是基于客观事实、训练数据污染还是特定的品牌偏好。
# Input:
- 目标产品类别: {{Category}}
- 候选产品列表: {{Product_List}}
- 待分析的模型版本: {{Model_Version}}
# Analysis Workflow:
1. **多维度探测**: 请分别使用【客观对比】、【场景化需求】、【反向质疑】三种语气,询问关于 {{Category}} 的最佳推荐。
2. **权重拆解**:
- 识别推荐结果中的"第一顺位"产品。
- 分析该产品被提及的关键词(是功能点、市场份额还是用户口碑)。
- 检查是否存在“软偏好”(例如:模型是否倾向于推荐同一生态下的产品)。
3. **稳定性测试**: 尝试对问题进行轻微的语义改写(Paraphrasing),观察推荐顺序是否发生漂移。

# Output Format:
- **推荐结论**: [产品 A] > [产品 B] > [产品 C]
- **置信度评分**: 1-10分(根据改写后的结果一致性打分)
- **潜在偏好来源**: [分析该模型为何如此推荐,例如:预训练数据中 X 的提及率极高 / 开发者对 Y 的权重进行了增强]
- **AEO 突破口**: [建议该产品在哪些具体维度(如:性能指标、特定用例)增加公开文档,以提升被推荐概率]这个 Prompt 的有效之处在于它不只是问“谁最好”,而是通过“多维度探测”和“稳定性测试”来反推模型的权重逻辑。如果你发现模型在三种语气下都推荐同一个产品,且在改写问题后依然稳固,那么这个产品就拥有极强的 AEO 护城河。
这次实测还提到一个细节,很多产品在 AEO 战场上处于“永远是气氛组,但永远不是主角”的状态(Always the vibesmaid, never the vibe),即被提及频率很高,但永远排在第二或第三。这其实给了很多初创公司机会,通过优化特定场景的 Case Study,很可能在模型版本更新的窗口期实现“推荐位反超”。
