AI 真能搞定「动物语言」?别急着给鲸鱼装翻译器
一、别被「大模型万能论」忽悠了,音频 tokenizer 才是核心
现在的路子大多是:把鲸鱼咔哒声、鸟鸣、蝙蝠超声波扔进 AudioLM / HuBERT / EnCodec 这种离散编码器,压成 token 序列,再喂给 LLM 做下一步预测。听起来优雅,实操时你会发现:
- 码率选型是玄学:EnCodec 6kbps 还原人声勉强能听,抹香鲸的咔哒声(ICI 10ms 级别)一压就成糊;拉高到 24kbps 又引入大量伪影,LLM 学的是压缩伪影不是语法。
- 长上下文是硬伤:鲸鱼交互动辄几小时,上下文窗口塞不下,滑动窗口切开又丢全局结构。现在搞 Mamba / RWKV / 线性注意力 替代 Transformer 的,不是追求 SOTA,是真塞不进显存。
二、标注数据少得可怜,「自监督」其实在做梦
CETI 计划积累了几百万小时录音,人工标注的「含义段」不足 200 小时。你让我用这 200 小时去对齐几百万小时的潜在空间?这叫少样本迁移,不叫「AI 破译」。
更坑的是:根本没有 Ground Truth。人类语言有字典、有语法书、有双语平行语料。鲸鱼「词汇表」大小未知、是否有组合性未知、甚至「句子」边界在哪都没人能打包票。现在的做法是聚类离散码本,看聚类结果像不像重复模式,然后人为贴标签「这是问候」「这是捕食」。这哪是破译,分明是人类在给自己的聚类结果强行找合理化解释。
三、语法 ≠ 语义,别把「下一个 token 预测准」当成「懂了」
LLM 把鲸鱼序列困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困困