智能体 QA 结果分诊
agent-qa-result-triage
Agent QA 结果分诊 (Agent QA Result Triage)
概述
根据记录的证据对失败的 Agent QA 运行进行分类,而非凭空猜测。通过检查运行记录、步骤、产物和日志,选择一个固定的类别,并返回置信度、可能的责任方以及基于证据的下一步行动。
使用场景
- 调查失败或中断的 Agent QA 运行。
- 检查运行产物、步骤结果或执行日志。
- 对比近期相关的运行记录,以寻找重复出现的失败模式。
- 判定失败属于测试用例、产品、Hook、浏览器/移动端运行时还是基础设施所有者。
工作流
1. 首先调用 agent_qa_get_run 获取运行状态、套件子上下文、步骤和尝试次数。
2. 在做出决定前获取证据:
- agent_qa_get_run_artifact
- agent_qa_get_run_steps
- agent_qa_get_run_logs
- agent_qa_get_run_execution_logs
3. 调用 agent_qa_classify_failure,除非有更强有力的证据反驳,否则将其类别作为默认分类。
4. 当分类器输出中包含近期相关运行记录时,进行对比。
5. 返回简洁的分诊结果:类别、置信度、证据、可能的修复领域和下一步行动。
6. 对于代码更改,在分诊完成后切换至 agent-qa-debug-fix。
类别
必须从 references/triage-categories.md 中选择且仅选择一个类别:
timeout(超时)
appium_startup(Appium 启动失败)
browser_disconnect(浏览器断开连接)
element_not_found(未找到元素)
assertion_failure(断言失败)
hook_failure(Hook 失败)
infrastructure(基础设施问题)
unknown_failure(未知失败)
证据规则
- 引用或总结具体的产物、日志或步骤证据。
- 当缺失的产物部分限制了置信度时,请予以注明。
- 不要虚构 MCP 未返回的截图、视频、日志或内存上下文。
- 如果 MCP 不可用,请使用仪表盘 REST API 或 Agent QA CLI 输出作为备选,并说明哪些证据不可用。
- 在报告中脱敏凭据、会话令牌、个人数据和无关的应用内容。
示例
json
{
"category": "element_not_found",
"confidence": "high",
"evidence": ["Step 4 could not resolve the described checkout button"],
"likely_fix_area": "test definition or changed product UI",
"next_action": "Inspect the captured UI context, then compare the current checkout screen"
}局限性
- 分类的可靠性取决于保留的运行产物和日志。
- 失败类别仅识别最可能的失败层面,并不证明根因。
- 缺失截图、DOM/无障碍上下文、设备日志或历史运行记录必须降低置信度。
- 本技能不修改测试或应用代码;请使用
agent-qa-debug-fix进行授权修复。