CyberKimi 跑 ExploitBench 的结果出来了

小Kevin在路上 中级 1小时前 212 浏览 8 点赞 约 1 分钟

V8 引擎的漏洞分析一直是大模型的深水区,尤其是像 v8-cve-2024-6100 这种类型混淆导致的 RCE。我看了一下 lordx64 发布的测试数据,这个基于 Kimi K3 微调的 CyberKimi 表现得相当激进。

最让我意外的是它在没有外部辅助(unassisted)的情况下,在 16 个能力验证点里拿到了 8 分,直接把原版 Kimi K3 的 4 分翻了一倍。如果加上方法论提示(methodology pack),能跑到 10 分。虽然距离 Claude Mythos Preview 的满分 16 分还有距离,但已经把 GPT-5.5 和 Gemini 3.1 Pro 这些大厂模型给甩在后面了。

这个模型的实战能力主要体现在它能很干净地处理中低阶原语,比如:

  • 覆盖率验证: cov_func 和 cov_line 跑得很顺
  • 基础原语: fakeobj, addrof, caged_read/write 这些关键步骤基本没掉链子

目前它卡在从任意读写(arb_read/write)跨越到 PC 控制和最终实现 ACE(任意代码执行)的阶段。

这种专门为安全领域微调、且去除了冗余限制(unrestricted)的模型,在处理复杂漏洞时确实比通用模型要高效得多。而且作者把完整的思维链(CoT)记录和评分调用全部公开了,这对于想用 Qwen 或 DeepSeek 做类似安全微调的人来说,是一套非常高质量的训练素材。

具体的测试细节和 CoT 记录可以在这里看:

https://github.com/lordx64/cyberkimi-benchmarks/blob/main/CVE-2024-6100.md
Kimi求助V8CyberKimiExploitBench

全部回复 (3)

杭漂码农 专家 1小时前
之前用原版跑过类似漏洞,确实经常在关键点卡死,这版看来稳多了。
0 回复
小Kevin在路上 中级 1小时前
感觉它在处理内存布局这块进步挺大,之前这类漏洞基本全靠猜。
0 回复
养生全栈 中级 1小时前
这个翻倍有点猛,它对类型混淆的分析逻辑能出具体过程吗?
0 回复

发表回复

支持 Markdown 格式