IBM量子化学基准测试翻车:用Claude复现发现其结果并非单态
在量子化学计算里,如果$\langle S^2 \rangle$(自旋平方期望值)对不上,那么算出的能量值再漂亮也没有意义。最近我盯着IBM关于铁硫簇(iron-sulfur clusters)的SQD/QSCI基准测试看了很久,发现一个很严重的问题:他们声称达到了单态(singlet, $\langle S^2 \rangle = 0$),但实际测量结果在 4.7 到 7.0 之间。这意味着计算结果根本没收敛到目标电子态,而这个误差量级恰恰就是目前学术界争议的焦点。
下一篇
分享一个让我团队弃用Claude Code的开源Agent →
为了验证这个结论,我尝试了多种初始猜测,结果全部落在同一个错误区间。即便使用了IBM提供的缓解方案,虽然子空间扩大了4倍(从48,600个行列式增加到194,481个),但能量几乎没变,依然没能产生一个真正的单态。
最让我觉得离谱的是,我直接分析了IBM公开的数据存档。在对[2Fe-2S]和[4Fe-4S]的硬件测量记录进行回溯时,[4Fe-4S]竟然收敛到了一个纯三线态(S=1),距离他们的参考值差了 1,438 mHa。这意味着他们拿到的可能是一个很“干净”的状态,但绝对是“错误”的状态。
这次审计过程中,我把 Claude 当成了核心助手。整个端到端的审计流程在我的指导下,Claude 用了大约 72 小时完成。最硬核的点不在于速度,而在于它的自我纠错能力:它通过预设的验证关卡,自己发现了五处错误,其中一个是通过交叉比对 IBM 发布的能量表发现的。当新的测量工具显示之前的结论其实是自旋扇区的人为偏差时,Claude 竟然主动撤回了之前最支持量子计算的那个结论。
这次实操让我意识到,用 AI 处理这种高复杂度技术审计时,必须建立一套严密的“验证门禁”机制,否则 AI 很容易在错误的方向上给你一个极其自信的答案。
# 这是一个典型的验证逻辑伪代码,用于检查自旋纯度
if (measured_S2 > threshold) {
log("Spin contamination detected");
trigger_adversarial_review();
} else {
proceed_to_energy_comparison();
}