Abnormal AI 用 Amazon Bedrock AgentCore 跑邮件安全检测
直接给结论:如果你的 Agent 每天要处理数十亿次操作,且涉及大量数据聚合和验证,单纯靠 LLM 的语义推理绝对会翻车,必须给它配一个像 Amazon Bedrock AgentCore Code Interpreter 这样的「计算草稿本」来执行确定性代码。
我一直在质疑,很多公司吹 Agent 能替代工作流,但实际上 LLM 做数学、处理大数据集时的幻觉率极高。Abnormal AI 这次公开的案例挺有参考价值,他们保护了超过 25% 的财富 500 强公司,现在的实时邮件威胁检测已经全面接入了 AgentCore Code Interpreter。最硬核的一点是,这些系统在生产环境下每天处理数十亿条消息,而且是 inline(实时拦截)执行,这意味着代码执行的延迟和稳定性被压到了极致。
看到一个挺激进的数据:Abnormal AI 现在 80% 的代码变更都用了 Agent 参与,其中 40% 甚至是背景 Agent 全自动完成(End-to-End),完全不需要人辅助。这种 AI-native 的开发模式,其实就是把 Code Interpreter 当成 Agent 的运行时,让它在沙箱里跑代码验证结果,而不是在那儿「猜测」答案。
Amazon Bedrock AgentCore Code Interpreter 到底解决了什么问题?
很多所谓的代码执行工具只是简单的函数调用,但 AgentCore 提供的是一个完全托管的 serverless 运行时。我分析了它的几个关键技术点,这决定了它能否在工业级规模下跑通:
- 临时 MicroVM 会话: 它不是一个简单的进程,而是 MicroVM。TTL(生存时间)可以配置,默认 15 分钟,最长能撑 8 小时。这意味着长任务能跑完,但跑完即焚,不会残留垃圾。
- 隔离性: 在宿主机操作系统层面做完全隔离,防止会话之间的数据泄露。对于做安全产品的 Abnormal AI 来说,这是刚需。
- 网络灵活性: 支持 VPC 模式或直接上公网,这解决了 Agent 访问私有数据源的问题。
- 文件处理能力: 通过 API 直接传文件上限 100 MB,更大的数据集得走 Amazon S3。
- 预装环境: 自带 Python 和 Node.js,且预装了统计、可视化和数据处理库,省去了每次启动都要 pip install 的时间。
为什么语义推理不能替代计算草稿本?
很多人觉得 Prompt 写好了 LLM 就能算对,但在邮件安全这种容错率极低的场景下,语义推理(Semantic Reasoning)是不够的。
一个典型的逻辑是:LLM 擅长理解「这封邮件看起来像钓鱼」,但它不擅长「计算这 1000 个发件人 IP 的分布频率并验证其是否在黑名单范围内」。后者需要确定性的计算。
如果把计算逻辑交给 AgentCore 这种沙箱环境,流程就变成了:
1. Agent 识别出需要进行数据验证。
2. Agent 编写一段 Python 代码。
3. 调用 AgentCore API 在 MicroVM 中运行该代码。
4. Agent 获取确定性的计算结果,再基于此结果给出最终判断。
这种「推理 → 编写代码 → 执行 → 验证」的闭环,才是 Agent 真正能规模化落地的路径。
这种东西要是没配代码解释器,处理个 100 行以上的 CSV 都能把结果算错,我上次就被坑到怀疑人生。