IBM量子化学基准测试翻车:用Claude复现发现其结果并非单态

强迫症脚本小子 专家 2026/8/7 650 浏览 5 点赞 约 2 分钟

最近在复盘 IBM 关于铁硫簇(iron-sulfur clusters)的 SQD/QSCI 基准测试时,我发现了一个极其严重的问题:他们在论文中声称达到了单态(singlet, $\langle S^2 \rangle = 0$),但实际的测量数据却在 4.7 到 7.0 之间波动。在量子化学计算中,如果自旋平方期望值 $\langle S^2 \rangle$ 对不上,那么无论最后算出来的能量值看起来多么漂亮,在物理意义上都是毫无价值的。这意味着计算结果根本没有收敛到目标电子态,而这个误差量级恰恰是目前学术界争议的焦点。

为了验证这个结论,我尝试了多种不同的初始猜测,结果全部落在了同一个错误区间。最令人沮丧的是,即便我采用了 IBM 官方提供的缓解方案,虽然子空间规模扩大了 4 倍(从 48,600 个行列式增加到了 194,481 个),但最终的能量值几乎没有任何变化,依然无法产生一个真正的单态。

我决定直接分析 IBM 公开的数据存档,对 [2Fe-2S] 和 [4Fe-4S] 的硬件测量记录进行回溯。结果显示,[4Fe-4S] 的计算结果实际上收敛到了一个纯三线态(S=1),这导致其与参考值的差距高达 1,438 mHa。这意味着 IBM 拿到的可能是一个在数学上很“干净”的状态,但从物理定义上来看,这绝对是一个“错误”的状态。

在这次审计过程中,我将 Claude 作为核心助手,整个端到端的审计流程在我的指导下大约耗时 72 小时完成。让我感到惊喜的不是 AI 的处理速度,而是它的自我纠错能力。我在流程中预设了一套严密的“验证门禁”机制,Claude 在执行过程中通过交叉比对 IBM 发布的能量表,自己发现了五处逻辑错误。最硬核的一幕是,当新的测量工具显示之前的结论其实是自旋扇区的人为偏差时,Claude 竟然主动撤回了之前那个最支持量子计算的结论。

这种审计逻辑可以用一段简单的伪代码来概括,核心在于建立一个对抗性的审核机制,而不是盲目信任 AI 的输出:

# 验证自旋纯度的逻辑检查
if (measured_S2 > threshold) {
    log("Spin contamination detected");
    trigger_adversarial_review(); # 触发对抗性审查,强制 AI 寻找反证
} else {
    proceed_to_energy_comparison();
}

这次实操给我最大的启发是:在处理这种高复杂度、高专业性的技术审计时,不能把 AI 当成一个简单的“答案生成器”,而应该把它当成一个“可审计的执行单元”。如果你不建立一套严密的验证门禁,AI 很容易在错误的方向上给你一个极其自信、但完全错误的答案。对于量子化学这种对精度要求极高的领域,这种“自信的错误”往往比直接报错更可怕。

Claude工作流IBMQiskitQSCI

全部回复 (3)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

架构师Neo 中级 2026/8/7

只要基组换个大一点的估计就能收敛,IBM这次翻车太离谱了

0 回复
老陈 专家 2026/8/7

自旋污染这坑太深了,Claude这次居然直接给揪出来了

0 回复
产品经理阿强 中级 2026/8/7

换个簇合物试试,看看自旋污染是不是依然这么离谱?

0 回复

发表回复

支持 Markdown 格式