Cloudflare 借助 AI 规划后量子迁移之路
在 Cloudflare,我们正紧锣盖缝地争取在 2029 年前实现完全的后量子就绪状态。尽管我们在将产品迁移到后量子加密方面取得了显著进展,但仍有工作需要完成,尤其是在身份验证和协议兼容性方面。为应对这场庞大的迁移工作,我们开发了一个名为 CryptoLabe 的内部工具,并将其驱动力量放在人工智能上。下面写的是我们如何利用 AI 绘制代码库中的密码学地图、识别升级路径、追踪进度以及处理前提条件,同时应对规模和不断演变的标准所带来的复杂性。
我们如何利用 AI 发现并分类代码库中的密码学技术?
我们选择了 NVIDIA Ising-Calibration-1.5,这是一个预训练的视觉语言模型,基于 Gemma 4 进行了微调。该模型专注于量子计算校准实验分析——它可以查看校准运行中的绘图,判断实验是否成功或失败,提取定量参数并诊断问题。
尽管我们的使用场景与其完全不同(密码迁移而非量子比特调优),但其底层能力是相同的:我们要求 AI 查看一段数据(源代码),并提取结构化信息(密码基元)。
我们首先将该模型输入了来自我们整个代码库的随机代码片段,并要求其识别其中是否使用了密码学技术。我们训练它识别代码中常见的模式——例如特定 TLS 密码套件的实例化,或用于密钥交换的密码学库的使用,并将其分类为“经典”或“后量子”。
为确保准确性,我们采用了 Chain-of-Thought 提示技术。我们没有仅仅要求进行二分类判断,而是指示该模型“大声思考”:用文字解释其推理过程,提供其决策背后的理由。这使得我们能够将其结论与我们自己的理解进行交叉核对,并验证它是否正确识别了各种密码基元。
通过分析我们的密码学足迹,我们获得了哪些洞见?
AI 扫描显示,Cloudflare 拥有广泛的后量子加密使用,特别是在我们的 TLS 1.3 握手实现中。然而,我们目前正处于混合模式,这意味着我们同时支持经典(如 X25519)和后量子(如 X25519MLKEM768)密钥交换。
此外,我们发现存在一类“长尾”的非 TLS 连接,这些连接仍严重依赖经典密码学。这些往往位于代码库的旧部分,或与尚未升级以支持后量子标准的协议相关联。
另一个关键发现是:虽然我们已经具备使用后量子认证(签名)的基础设施,但它尚未成为默认配置。系统默认使用经典签名,这意味着启用完整的后量子套件需要用户或操作员做出特定且有意的选择。
我们如何追踪迈向后量子就绪的进度?
为了追踪迁移进度,我们需要将 AI 提供的定性洞见转化为定量指标。为此,我们实现了一个系统,用于统计代码库中经典和后量子基元的实例数量。
具体来说,我们正在追踪以下内容:
- 经典 vs. 后量子计数: 使用经典密码学的地点总数与使用后量子密码学的地点总数。
- 仓库级别追踪: 我们根据各个代码仓库所包含的密码学内容为其打分。这有助于我们识别哪些团队在迁移工作中更加领先。
- 前提条件识别: 我们寻找代码库尝试使用后量子功能,但底层库或协议尚不支持的情况。这告诉了我们哪些外部依赖我们需要等待或帮助开发。
这些指标正被输入我们的内部仪表盘,让我们能够可视化迁移状态,并设定逐步减少经典密码使用量的目标。
展望未来,我们仍面临哪些挑战?
展望未来,最大的挑战之一是密码学领域仍在快速演变。虽然我们已经拥有良好的后量子密钥交换和签名候选方案,但这些标准尚未最终确定,所需的软件库也仍在成熟过程中。
这带来了一个典型的先有鸡还是先有蛋的问题:我们无法完全迁移,直到协议和库准备就绪;但我们也无法在没有真实部署数据的情况下测试和完善这些协议。因此,我们的策略中至关重要的一部分将是积极参与这些标准和生态系统的开发,确保我们拥有所需的工具,以满足我们在 2029 年的目标。
