谷歌花 1000 万美金买灵航的邮件、航班记录和内部文件
一、为什么偏偏是航空数据
通用语料早就被刷烂了,Common Crawl、Reddit、Wikipedia 轮番跑了无数轮,边际收益递减到可怜。但航空运控、机务排故、排班优化这种强逻辑、强时序、强约束的垂直领域,公开网页上根本找不到结构化语料。
灵航这堆「垃圾」里藏着:
- 真实排班冲突与解决记录:几百万条 Crew Scheduling 交互,天然的 CoT 训练素材
- 机务故障码与维修动作对齐:ACARS 报文 + MEL 手册引用 + 维修签放,直接能做故障推理 RAG
- 非正常运行恢复案例:天气、空管、机械故障触发的连环取消/备降,决策链条完整
二、1000 万买的是「确定性」
市面上卖几十万刀的合成数据,全是 GPT-4 生成再人工过一遍, hallucination 率根本压不住。灵航这套数据是真实业务系统跑出来的,每条记录都有时间戳、责任人、执行结果,天然带 Ground Truth。
举个栗子:某航班因发动机震动备降,邮件链里有机长决策理由、运控协调备选机场、维修站准备备件清单、客服安置旅客话术。这一整条链路丢给模型做 SFT,比合成十万条「假装航空专家对话」管用得多。
三、谷歌图的不止是 Gemini
别光盯着大模型预训练。Google Cloud 的 Vertex AI 已经在推 Aviation AI Solution,卖给达美、美联航做排班优化、延误预测。手里握着真实航空公司的全量历史数据,做 Fine-tuning 或者构建行业 Knowledge Graph,护城河直接挖深了三米。
再联想一下 Waymo:自动驾驶最缺长尾 Corner Case,航空同理。低能见度、跑道污染、多故障叠加这些极低频高风险场景,灵航 30 年运营积累的 Case Study 就是现成的「长尾数据集」。
四、数据清洗才是真正的坑
别以为拿到手就能喂模型。PST 邮件归档里夹着大量 Outlook 内部格式、附件是扫描件 PDF、ACARS 报文还是 ARINC 424/620 二进制。光解析工具链就得搭一套:
# 伪代码:处理 ARINC 424 路径点记录
from arinc424 import Parser
import pdfplumber
def parse_spirit_archive(raw_bytes):
if is_arinc(raw_bytes):
return Parser().decode(raw_bytes)
elif is_pst(raw_bytes):
return extract_pst_emails(raw_bytes)
elif is_scanned_pdf(raw_bytes):
return pdfplumber.open(io.BytesIO(raw_bytes)).extract_text()
return None更别提 PII 脱敏、GDPR/CCPA 合规、竞品敏感信息过滤,法务团队得审到明年。
五、这笔交易的信号意义
1000 万对 Alphabet 是零花钱,但对数据交易市场是个定价锚点:真实、高密度、强逻辑的垂域业务数据,估值完全脱离「每条多少美分」的通用爬虫行情。
下一个被大厂盯上的,大概率是破产零售连锁的库存调拨记录、或者区域性银行的贷款审批全流程日志。数据资产证券化,破产重组清单里的「无形资产」终于有了真买家。