AI 生成的食物为什么看起来都像某种不可名状的克苏鲁生物
我最近观察到一个非常诡异的现象:AI 生成的食物图片里,几乎没有一种东西是符合物理逻辑或生物构造的。这已经不是简单的“画得不像”了,而是一种本质上的逻辑崩塌。
这种“食物恐怖感”到底从哪儿来
这种视觉上的违和感,拆解开来看其实是扩散模型在处理高频细节和语义关联时的硬伤。
- 纹理逻辑的错位: 扩散模型是基于噪声还原图像的,它理解“面条”这个概念时,可能只是抓取了“细长、弯曲、有光泽”这些像素特征,但它并不理解面条是由淀粉构成的连续线条。结果就是,你会看到那种像蠕虫一样的面条,或者是长得像面条的酥皮点心。这种材质感的混乱,让食物看起来不再是食物,而是一种生物组织。
- 拓扑结构的崩坏: 为什么 AI 画的汉堡看起来像个怪物?因为它不理解物体的层次和堆叠逻辑。在它的生成逻辑里,面包、生菜、肉饼可能只是在同一个空间坐标内进行像素融合。于是,你会看到肉饼里长出了类似建筑材料的颗粒,或者汉堡的结构呈现出一种非自然的、扭曲的挤压感。
- 密集的空洞与突起: 这是最让人生理不适的地方。很多 AI 生成的卷饼(Burrito)或者面包,表面布满了奇怪的孔洞和凸起,这在视觉上极其容易触发密集恐惧症。它生成的不是食物的孔隙(比如面包里的气孔),而是一种类似于某种寄生虫巢穴或者真菌孢子的纹理。
为什么品牌方明知效果烂还要用
按理说,这些图一眼就能看出是假的,品牌方不觉得丢人吗?其实这里面涉及到一个非常实际的成本与效率问题。
以前拍一套高质量的商业美食摄影,你需要专业的灯光师、摆盘师、甚至还要准备干冰和喷雾来营造新鲜感,成本极高。而现在,只要输入一段类似 gourmet burger, hyper-realistic, cinematic lighting, 8k 的提示词,几秒钟就能出图。
对于很多预算有限的小型餐饮品牌或低端广告代理商来说,他们并不追求“真实”,他们追求的是“看起来很贵”。只要色调够鲜艳、光影够华丽,他们就觉得能唬住用户。但他们忽略了,人类对食物的欲望是建立在对“质感”和“新鲜度”的直觉判断上的。当这种直觉被 AI 生成的、带有“石材感”或“肉质纤维感”的错误图像打破时,产生的不是食欲,而是生理性的厌恶。
技术层面的思考
从技术角度看,这反映了当前生成式模型在“物理常识”上的缺失。目前的模型(无论是 Midjourney 还是 Stable Diffusion)本质上是在做概率分布的拟合,它们在学习“看起来像什么”,而不是“实际上是什么”。
如果要解决这个问题,单纯靠堆参数或者增加训练集里的美食图片可能没用。因为模型依然无法理解什么是“软”,什么是“脆”,什么是“流体”。除非未来的模型能引入物理引擎的约束,或者在训练阶段加入更深层的语义逻辑——比如让模型理解“油脂”在热力作用下的流动性,或者“面团”在烘焙过程中的膨胀逻辑。
目前的状况是,我们正处于一个视觉过剩但质量塌陷的阶段。AI 把食物从“可食用的艺术品”降级成了“像素组成的概率堆砌物”。如果你在菜单上看到那种看起来像大脑一样的冰淇淋,或者像建筑碎石一样的炸鸡,别点,那真的不是在挑战你的胃,而是在挑战你的神经系统。
