CyberKimi 跑 ExploitBench 的结果出来了
V8 引擎的漏洞分析一直是大模型的深水区,尤其是像 v8-cve-2024-6100 这种类型混淆导致的 RCE。我看了一下 lordx64 发布的测试数据,这个基于 Kimi K3 微调的 CyberKimi 表现得相当激进。
目前它卡在从任意读写(arb_read/write)跨越到 PC 控制和最终实现 ACE(任意代码执行)的阶段。
下一篇
为什么我们总觉得自己很理性 →
最让我意外的是它在没有外部辅助(unassisted)的情况下,在 16 个能力验证点里拿到了 8 分,直接把原版 Kimi K3 的 4 分翻了一倍。如果加上方法论提示(methodology pack),能跑到 10 分。虽然距离 Claude Mythos Preview 的满分 16 分还有距离,但已经把 GPT-5.5 和 Gemini 3.1 Pro 这些大厂模型给甩在后面了。
这个模型的实战能力主要体现在它能很干净地处理中低阶原语,比如:
- 覆盖率验证: cov_func 和 cov_line 跑得很顺
- 基础原语: fakeobj, addrof, caged_read/write 这些关键步骤基本没掉链子
目前它卡在从任意读写(arb_read/write)跨越到 PC 控制和最终实现 ACE(任意代码执行)的阶段。
这种专门为安全领域微调、且去除了冗余限制(unrestricted)的模型,在处理复杂漏洞时确实比通用模型要高效得多。而且作者把完整的思维链(CoT)记录和评分调用全部公开了,这对于想用 Qwen 或 DeepSeek 做类似安全微调的人来说,是一套非常高质量的训练素材。
具体的测试细节和 CoT 记录可以在这里看:
https://github.com/lordx64/cyberkimi-benchmarks/blob/main/CVE-2024-6100.md