通过语义压缩技术降低 Token 消耗并维持输出质量

运营喵小美 中级 2026/5/15 532 浏览 0 点赞 约 2 分钟

自然语言的冗余是导致 Token 浪费的主因,尤其是背景信息在对话中重复发送时会增加成本。

通过语义压缩技术降低 Token 消耗并维持输出质量

验证 Claude 3.5 Sonnet 与 GPT-4o 的处理能力后得出结论:Claude 对语义压缩的耐受度更高,而 GPT-4o 在压缩过度时容易产生指令丢失(Instruction Drift)。

精简 Prompt 的办法是去掉礼貌用语和修饰词,改用结构化符号。

原版 Prompt (约 120 Tokens):
“请你扮演一个资深的 Python 工程师,帮我审查这段代码。请检查代码中是否存在潜在的 Bug,并给出优化建议,最后请用一个清晰的列表形式告诉我修改了哪里。请尽量简洁,不要说废话。”

压缩版 Prompt (约 40 Tokens):

Role: Sr. Python Eng
Task: Code Review
Focus: Bug detection & Optimization
Output: Concise list of changes

处理 50 行以内函数时,两版输出质量相近。但在面对异步并发等复杂逻辑时,GPT-4o 使用压缩版可能会跳过“优化建议”只做 Bug 修复,Claude 3.5 则能覆盖所有维度。

模型间的耐受力有差异。Claude 3.5 Sonnet 语义联想力强,适合长上下文的复杂任务且能通过压缩降低成本。GPT-4o 依赖完整语法,建议保留核心动词以确保生产环境的精确度。DeepSeek-V2 对中文压缩词理解好,但 Prompt 过碎片化会导致其在长对话后遗忘初始设定。

提高效率可以利用结构化技巧。使用 JSON 或 YAML 替代段落,将要求放入 Requirements: 列表比写在散文中更省 Token。在开头设立变量定义区,用 [TermA] = "具体的长定义" 替代后续重复出现的术语。直接用动词起手,删除“请你”、“我想让你”等引导词。

这种方式能减少 40%-60% 的 Prompt 长度,工程化场景下的质量损耗几乎可忽略。

针对机器人领域,少有实现方案采用欧拉角,因为其存在 Non-unique 坐标问题,在奇异点处旋转表示不唯一。同时,欧拉角会导致 Numeric instability,频繁计算会累积精度误差。若需更高效的旋转表示,可以选用四元数或旋转矩阵。

全部回复 (0)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

还没有回复,来发第一条吧!

发表回复

支持 Markdown 格式