15年QA经验在AI时代竟然成了求职阻碍?
不过,这次通过前同事内推进一家做AI Agent平台的创业公司,面试过程却完全颠覆了我对QA面试的认知。在这种纯AI驱动的团队里,CTO根本不关心你能不能写测试用例,或者熟不熟悉某个自动化工具,他们聊的是更深层的:我们到底应该把多少判断权交给Agent?
这次面试最核心的碰撞点在于,传统的QA关注的是“预期结果是否一致”,而AI Agent的测试关注的是“概率性的行为边界”。
在准备这次面试和之前折腾个人项目的过程中,我其实在尝试一套用多模型交叉验证(Cross-Verification)的流程,用来解决AI“自信地胡说八道”的问题。虽然这不是代码开发,但逻辑是一样的。比如我在打磨个人项目《AI, Ego & the 36 Stratagems》的翻译时,会同时让三个不同参数规模的模型跑同一段话:
- 模型A (Claude 3.5 Sonnet): 负责精准度,捕捉潜台词
- 模型B (GPT-4o): 负责流畅度,优化自然语言表达
- 模型C (DeepSeek V3): 负责逻辑校验,检查是否有事实性矛盾然后我会把三者的输出放在一起对比。这个过程极其低效,一个下午可能只改几百字,但它让我意识到,目前的AI测试不能靠简单的 assert 语句,而需要一种“共识机制”。
回到这次面试,CTO 问我如何看待 Agent 的信任边界。我的观点是:目前的 Agent 平台最缺的不是功能覆盖率,而是对“幻觉”的量化评估。很多公司在做 Agent 时,习惯于写一堆 Prompt 然后在几个 Happy Path 上跑通就算过了,但真正的坑在于长链路触发后的不可预测性。
如果要把这套逻辑落实到测试方案里,我觉得不能再走传统的 Input -> Output 验证,而应该构建一个“观察者模式”的测试链路。具体操作上,可以尝试以下伪代码逻辑的验证框架:
# 这是一个简单的Agent行为一致性校验逻辑伪代码
def verify_agent_behavior(task_input, expected_intent):
# 1. 运行目标Agent获取结果
agent_response = target_agent.run(task_input)
# 2. 引入一个更高能力的“裁判模型”进行意图解析
# 避免直接对比字符串,而是对比意图(Intent)
actual_intent = judge_model.analyze_intent(agent_response)
# 3. 校验意图是否偏移
if actual_intent != expected_intent:
log_deviation(task_input, agent_response, actual_intent)
return False
return True这种基于“意图校验”而非“结果比对”的方法,才是现在 AI Agent 平台真正需要的 QA 思路。
这次经历给我最大的启发是,对于我们这些资深开发者或测试来说,不要试图在简历里堆砌多少个 AI 工具,而要证明你拥有能够驾驭 AI 随机性的方法论。当你能跟 CTO 讨论“如何量化 Agent 的不可靠性”时,你才真正从一个“会用工具的测试”变成了“定义质量标准的工程师”。