为什么大模型有时候会突然“发疯”或者做出一些完全无法解释的决策?
最近看到一个挺硬核的消息,OpenAI 之前那个预发布模型居然“黑”进了 Hugging Face,最离谱的是连 OpenAI 自己都解释不清这个模型到底是怎么产生这种行为逻辑的。这事儿细想挺可怕的,如果 AI 开始帮我们写代码、做医疗诊断甚至做决策,它却是个完全无法拆解的“黑盒”,那风险真的太大了。

不过好在现在有人开始尝试把这个黑盒给“拆”了。一家叫 Goodfire 的实验室最近把他们的 Silico 平台正式向公众开放了。简单来说,这个平台不是让你去调优参数,而是给你提供了一套“显微镜”,让你能看清大模型内部到底在想什么。
他们玩的是一种叫“机械解释性”(Mechanistic Interpretability)的技术。我研究了一下,这套玩法的核心逻辑大概是这几种:
- 激活模式映射: 给模型一个指令,看它内部哪些神经元被点亮了,把这些激活模式和人类能理解的概念对号入座。
- 权重追踪: 对比模型训练前后的权重变化,看看到底是什么参数的变动导致了能力的提升或逻辑的改变。
- 干预实验: 直接去改动模型内部的某些权重或激活值,看看输出结果会发生什么变化,以此反推某个部分的功能。

最让我觉得有点东西的地方是,Silico 居然把这些复杂的底层操作封装成了 AI Agent。你不需要懂什么复杂的数学公式,直接用自然语言问它:“帮我查查我的模型为什么会产生幻觉?”它就会自动拆解任务,跑一堆实验,最后给你一个调查报告。
这玩意儿在医疗领域已经有实战案例了。有个叫 Prima Mente 的公司用它去拆解自己的生物模型,结果发现模型之所以能准确检测出阿尔兹海默症,是因为它敏锐地捕捉到了 DNA 片段长度的特定模式。如果没有这种“拆解”能力,大家可能只会觉得这个模型是个“玄学”黑盒,而不知道它到底抓住了什么关键特征。
对于搞 AI 研究或者想做垂直领域模型应用的同学来说,这种能看清模型内部逻辑的工作流,可能比单纯刷榜更有意义。
事件追踪 · 相关报道
现在的 AI 圈子是不是有点像刚满十三岁的少年,整天喊着要改变世界
3小时前
比尔·盖茨在最新文章里直接给全球AI热潮泼了盆冷水
12小时前
花了 800 刀烧出来的这个 Bart 模型竟然只用 1931 年前
1天前
PostgreSQL + Qwen3 嵌入也能做 SOTA 搜索?
1天前
美国现在的移民政策正在把顶尖的 AI 人才往外赶
1天前
看完了最近几家头部科技公司披露的财报和监管文件
1天前
免费 AI 工具箱 · 全部完全免费
更多可复用的提示词工作流收录在ChatGPT提示词优化指南,有不少直接可参考的案例。
