如何通过 Prompt 压缩技巧在不损失质量的前提下降低 Token 消耗
最有效的手段是抛弃自然语言的废话,改用类似伪代码或 JSON 结构的指令。
实测对比:自然语言 vs 结构化指令
场景:要求 AI 扮演资深前端工程师,审查代码并给出修改建议。
常规写法(Token 消耗高,且重点分散):
你现在是一个非常资深的 React 前端开发专家。请你帮我检查下面这段代码,看看里面有没有性能问题或者不符合最佳实践的地方。如果有的话,请告诉我哪里错了,为什么要改,然后给我一个修改后的版本。请尽量简洁,不要说太多废话。压缩写法(Token 消耗低,指令更明确):
# Role: Senior React Expert
# Task: Code Review
# Constraints:
- Focus: Performance, Best Practices
- Output: [Issue] -> [Reason] -> [Optimized Code]
- Style: Concise在 10 组随机代码片段的测试中,结构化指令的响应质量不仅没有下降,反而因为减少了干扰信息,模型对“性能问题”的捕捉率提升了约 15%。
针对不同模型的压缩策略差异
Claude 3.5 系列: 对 XML 标签极其敏感。与其写“请参考以下背景资料”,不如直接用 <context></context> 包裹。这种方式在压缩 Token 的同时,能极大地增强模型对边界的感知,减少幻觉。
GPT-4o: 比较吃“指令权重”。可以使用大写字母或符号强化关键约束,比如用 CRITICAL: No yapping 代替 Please do not provide unnecessary explanations。
DeepSeek: 逻辑推理能力强,但对冗长的礼貌用语反应一般。直接给逻辑链路(Chain of Thought)的引导词,比如 Step-by-step analysis:,比写一段话要求它详细分析要省钱且高效。
核心压缩技巧总结
删除冗余修饰词:把“请尽可能地详细地描述”改为“详细描述”。
利用符号代替连接词:用 -> 表示流程,用 | 表示选项,用 # 表示层级。
定义简写映射:在 Prompt 开头定义 C=Context, Q=Question, A=Answer,后续直接使用缩写(适用于超长上下文对话)。
通过这种方式,我把一个复杂的自动化工作流 Prompt 从 1200 Tokens 压到了 600 Tokens 左右,而输出结果的逻辑一致性维持在 98% 以上。
全部回复 (0)
还没有回复,来发第一条吧!
