用 Google 的 OKF 格式在 Qwen2.
直接看结果,在 Qwen2.5-Coder 的 7B、3B 和 1.5B 这三个版本之间做知识传递时,如果放弃传统的自然语言描述,改用 Google 的 Open Knowledge Format (OKF) 传输预分词的整数数组(pre-tokenized integer arrays),首字响应时间(TTFT)能直接降低 28% 到 37%。
下一篇
通义千问这次出个 Qwen3. →
这种做法的核心逻辑是绕过了大模型在处理复杂知识时的重复编码过程。OKF 本质上是一个 Markdown 结合 YAML 的骨架,原本设计是让人和 AI 交换信息,但我把它用来做 Agent 之间的“接力”。在实操中,我让 7B 模型把处理好的知识直接转化为 token ID 数组,然后通过 OKF 的 YAML 结构封装传给 3B 或 1.5B。
为了防止这种“快捷方式”导致模型产生幻觉或解析错误,我特意加了一个全词表等价性检查(full-vocabulary equivalence check)。如果不做这个校验,直接传 ID 数组在不同量化版本或微调版本之间可能会出现偏移,导致模型读到完全不同的词。
具体的 OKF 知识交换结构大概长这样:
knowledge_exchange:
source_model: "Qwen2.5-Coder-7B"
target_model: "Qwen2.5-Coder-1.5B"
payload:
token_ids: [1203, 452, 9981, 2034, 1102]
context_hash: "a1b2c3d4"
metadata:
encoding: "utf-8"
priority: "high"在这种工作流下,1.5B 模型不需要重新理解 7B 模型输出的冗长解释,而是直接读取 ID 数组并将其还原为语义空间。对于需要频繁在不同规模模型间迁移上下文的 AI Agent 场景,这种实操方案比单纯写 Prompt 引导要高效得多。
免费 AI 工具箱 · 全部完全免费