← 返回首页目录
# LLM Token优化策略:2026年完全指南
## 作者:吉祥法师
LLM API按Token计费。你发送和接收的每一个Token都有其成本。当你从原型开发扩展到生产环境——从每天数十次请求增长到数千次——优化与未优化的Token使用之间的差异,每年可能高达数万美元。本指南涵盖了LLM Token优化策略的完整版图。它的内容基于对Anthropic官方文档的研究、真实世界的使用数据,以及关于检索增强生成和长上下文性能的学术发现。
核心论点:Token优化是一个上下文工程问题,而非提示词缩短问题。大多数团队在徒劳地缩短提示词上浪费精力,而真正的成本驱动因素是臃肿的上下文、闲置的工具模式和过时的对话历史。
### 为何Token优化现在至关重要
三大趋势使得Token优化日益重要:
**定价层级**:Anthropic当前的模型(Opus 4.8、Opus 4.7、Opus 4.6和Sonnet 4.6)以标准定价包含完整的100万Token上下文窗口——长上下文附加费已于2026年3月取消。Claude Opus 4.8现已成为最强大的Opus级模型(2026年5月28日发布),定价与Opus 4.7/4.6相同,均为每百万输入Token 5美元、每百万输出Token 25美元。在此之上,Claude Fable 5于2026年6月9日发布,作为Anthropic最强大的广泛发布模型,定价为每百万输入Token 10美元、每百万输出Token 50美元,并拥有100万Token的上下文窗口(Mythos 5作为仅限邀请的模型,通过Project Glasswing提供)。Sonnet 4和Opus 4模型于2026年6月15日退役——请分别迁移至Sonnet 4.6和Opus 4.8。Opus 4.1于2026年8月5日退役。Claude Haiku 3已于2026年4月20日退役;请迁移至Haiku 4.5。
OpenAI的旗舰模型是GPT-5.5,定价为每百万输入Token 5美元、每百万输出Token 30美元,并提供90%的缓存输入折扣(缓存输入价格为每百万Token 0.50美元)——但GPT-5.5 Pro(每百万输入Token 30美元、每百万输出Token 180美元)不提供缓存输入折扣。之前的GPT-5.4系列(标准版每百万输入Token 2.50美元、每百万输出Token 15美元;mini版分别为0.75美元和4.50美元;nano版分别为0.20美元和1.25美元)仍然可用,同样提供90%的缓存输入折扣。
一个重要警告:Opus 4.7和4.8(以及Fable 5/Mythos 5)配备了一个新的分词器,对于相同的文本,其Token使用量比Opus 4.6高出多达35%(在代码和结构化数据方面尤为明显,在普通英语文本中则微乎其微)——在迁移或估算成本时请务必将此因素纳入考量。
**智能体架构**:编码智能体、工具使用工作流和多步骤推理都会使Token使用量成倍增加。单个智能体会话可能比简单的API调用消耗多达10到100倍的Token。
**长上下文的收益递减**:研究一致表明,埋在长上下文中间的相关信息,其被使用的可靠性较低。更多的Token不仅成本更高,而且可能导致更差的结果。
以下策略按对大多数团队而言的投资回报率从高到低排列。
### 1. 上下文工程与会话管理
LLM应用中Token浪费的最大单一来源是上下文膨胀——发送的上下文远超模型完成当前步骤所需。
**关键策略**:
**分阶段工作**:将发现、实施和验证分开在不同的会话中进行。来自失败尝试的陈旧上下文会在随后的每一轮对话中向你收费,同时降低输出质量。
**即时检索**:在需要的时候,精确拉取所需的信息。针对性文件读取和LSP导航远胜于整个代码仓库的转储。关于迭代式仓库检索(RepoCoder)的研究表明,与文件内补全相比,其准确性提高了超过10%,同时使用了更少的上下文。
**仓库记忆**:将持久的项目知识(架构、约定、构建命令)放入结构化的配置文件(如CLAUDE.md)中,使其自动加载,而不是在每个对话中都手动输入。
**服务端上下文摘要(压缩API)**:Anthropic的压缩API(测试版,2026年2月)使得Opus 4.6、4.7和4.8能够自动摘要并压缩对话历史,从而实现真正意义上的无限对话,而无需手动裁剪上下文或重置会话。
**持久记忆与“梦境”**:对于需要跨越多个会话工作的智能体而言,Anthropic的记忆工具(公共测试版,2026年4月)和“梦境”功能(2026年5月宣布)允许智能体将精选过的事实保存在服务端文件系统中,并在会话之间以异步方式整合它们——用每次新会话中紧凑的记忆加载,取代成千上万个回放的历史Token。对于大多数团队来说,这是最具影响力的单一优化措施。
**详细解读**:上下文工程:为何减少Token用量不是关于缩短提示词
### 2. 提供商特定的API技术
每个LLM提供商都有专门设计来降低成本的特性,但大多数开发者并未使用它们,或使用不当。
**关键策略**:
**提示词缓存**:Anthropic的缓存读取成本仅为基础输入价格的0.1倍——即90%的折扣。Anthropic现支持多轮对话的自动缓存(一个顶级的`cache_control`字段可自动管理断点),以及现有的显式断点方法。GPT-5.5和GPT-5.4均提供90%的缓存输入折扣,与Anthropic的费率相匹配(例外:GPT-5.5 Pro无此折扣)。
**顾问工具**(2026年4月测试版):将一个便宜的执行模型(Sonnet 4.6或Haiku 4.5)与Opus 4.6/4.7/4.8配对,后者作为仅在需要时咨询的高智能顾问。典型的编码智能体会话费用比单独使用Opus便宜73%到87%,因为大多数轮次按Sonnet/Haiku费率处理,而顾问每次咨询仅生成400到700个Token。注意:如果使用Opus 4.7或4.8作为顾问,在估算那些顾问轮次的成本时,需考虑新的分词器。
**抑制思考输出**:支持`thinking.display: "omitted"`的模型(如Claude 4.6系列)可从API响应中剥离推理轨迹。模型内部仍会进行推理,但你无需为会丢弃的轨迹支付输出Token费用。
**结构化输出**:工具模式和JSON模式消除了由格式错误响应引起的重试循环。每一次消除的重试都是一次你无需支付的完整API调用。
**批量API**:所有主要提供商(OpenAI、Anthropic、Google)都为非时间敏感型工作负载提供50%的节省。
**输出约束**:设置现实的`max_tokens`,要求输出差异补丁而非完整重写,并使用停止序列。
**详细解读**:如何降低OpenAI和Claude API Token成本
### 3. 工具与模式开销削减
大多数开发者不知道的一个浪费来源:工具定义会包含在每次API请求中。在真实世界的设置中,在工作开始之前,工具定义的开销已被测量为55K到134K个Token。
**关键策略**:
**禁用未使用的MCP服务器**:每个服务器的工具定义都会在每个请求时加载,无论你是否使用它们。
**按需工具加载**:使用工具搜索模式,仅在需要时加载工具。这使得一个设置的开销从134K个Token降至8.7K个Token——减少了85%。
**优先使用CLI工具**:当直接的命令行工具能完成工作时,它可以避免MCP层的模式开销。
**渐进式披露**:使用Skills或等效模式,仅在触发时才加载完整的指令。
**详细解读**:削减MCP和工具开销,每次请求节省数千个Token
### 4. 提示词缓存架构
缓存不是一个开关——它是一项架构设计。大多数团队启用了提示词缓存,但命中率很低,因为他们的提示词并非为此设计。
**关键策略**:
**稳定前缀模式**:将稳定内容(系统指令、工具定义)放在前面,将可变内容(用户输入)放在后面。
**多级缓存**:使用断点分别缓存以不同频率变化的段落。
**避免缓存破坏者**:系统提示词中的时间戳、打乱顺序的少样本示例和动态工具列表都会破坏缓存命中率。
**详细解读**:为提示词缓存命中设计:如何节省90%的输入Token
### 5. 模型路由与适当选型
并非每个任务都需要你使用最昂贵的模型。一个路由层将简单任务分配给廉价模型,将困难任务分配给昂贵模型,可以削减40%到60%的成本。
**关键策略**:
**基于任务的路由**:分类、提取和格式化工作交给小模型(Haiku 4.5,GPT-5.4-nano,价格为每百万Token 0.20美元)。复杂的推理和架构决策交给大模型(Opus 4.8,Opus 4.7,GPT-5.5 Pro)。对于规模化的、最棘手的推理任务,Claude Fable 5(每百万输入Token 10美元、每百万输出Token 50美元)位于Opus层级之上。值得注意的是,o3价格下降了80%(2026年4月)至每百万输入Token 2美元、每百万输出Token 8美元,使得强大的推理能力以中端价格可得——如果你之前因其价格而跳过它,现在值得重新评估。当路由到Opus 4.7/4.8或Fable 5时,请先验证Token预算——对于代码密集型的输入,新的分词器相比Opus 4.6最多会增加35%的Token。
**思考/精力控制**:扩展性思考会消耗输出Token(最昂贵的那种)。对于简单任务,请将其调低。
**子智能体模型选择**:将简单的子智能体工作路由到更便宜的模型。智能体团队的Token使用量约是标准会话的7倍,因此模型选择更为重要。
**了解更多**:今天降低LLM API成本的5种方法
### 6. 测量与监控
你无法优化你无法衡量的东西。而且大多数团队因为未测量Token的实际去向而优化了错误的对象。
**关键策略**:
**使用内置工具**:Claude Code的`/cost`、`/context`和`/mcp`命令可显示实时的Token使用情况。
**API级别跟踪**:Token计数API(执行前检查)和用量与成本API(按模型、缓存和上下文层级进行事后分解)。
**找到真正的热点**:研究表明,审查和重做循环平均消耗约59%的Token——而非初始生成。输入上下文的增长,而非提示词的大小,通常是主要的成本驱动因素。
**详细解读**:如何测量和监控LLM Token使用量
### 7. Token高效提示模式
你提示模型的方式——以及你要求的输出格式——可以独立于上下文大小,对Token使用量产生巨大影响。
**关键策略**:
**思维草稿**:一种提示技术,其准确度可与思维链相媲美,但使用的推理Token仅为后者的7.6%。模型不是进行冗长的逐步推理,而是以大约5个词起草每个步骤。
**输出格式优化**:对于相同的数据,JSON使用了大约比YAML或TSV多2倍的Token。对于兼容性不那么关键的内部管道,切换格式可以使结构化输出成本减半。
**提示词压缩**:像LLMLingua这样的工具可以将提示词压缩多达20倍,同时保持模型正确回答的能力——对于带有长检索块的RAG管道尤其有效。
**语义缓存**:应用层面的缓存,匹配语义上相似的查询(不仅仅是精确前缀),从而为重复的问题类型完全避免API调用。
**详细解读**:Token高效提示模式:思维草稿、输出格式和提示词压缩
### 三个投资回报率最高的改变
如果你只有时间进行三项优化,研究和生产数据表明这些举措能带来最大的效果:
**1. 规划用一个会话,实施用一个全新的会话**。在阶段之间重置上下文,消除了陈旧历史不断累积的成本。这是免费实施的,并能立即减少后续每一轮的Token使用量。
**2. 用目标检索取代仓库转储**。使用代码智能、LSP导航和聚焦的文件读取,而不是将整个文件或目录转储到上下文中。更少的上下文,更好的结果,更低的成本。
**3. 修剪工具和MCP服务器,然后依靠缓存处理剩下的稳定部分**。禁用未使用的服务器,切换到按需工具加载,并确保你剩下的工具定义是缓存友好的。这打击了在每一次请求中都会收费的恒定开销。
这三项优化针对的是几乎每一轮都会出现的重复性Token泄漏:陈旧的历史、不相关的代码上下文和闲置的工具模式。
### 这些策略跨提供商通用
尽管本指南中的例子特别提到了Claude和OpenAI,但底层问题——有限的注意力、长上下文性能退化、检索与转储的对比、以及工具模式的开销——并非特定于某个提供商。同样的策略适用于Gemini、Codex以及任何其他基于LLM的工具或API。基本原理不会改变:在正确的时间发送正确的上下文,测量你的Token流向何处,并优化真正的热点。
### 参考文献
* Anthropic: Claude定价——定价层级和缓存费率
* Anthropic: 模型概述——当前产品线,包括Opus 4.8和Claude Fable 5
* Anthropic: 节省Token的更新——工具开销分析(55K-134K Token)和按需加载结果
* RepoCoder: 仓库级代码补全——迭代检索 vs. 文件内补全
* 迷失在中间:语言模型如何使用长上下文——长上下文的收益递减
* 思维草稿——以7.6%的Token匹配思维链准确度
* OpenAI: API定价——模型定价和批量API费率
关于更具体的话题,请探索我们的其他指南:
* Claude Code效率技巧
* 上下文工程
* 降低OpenAI和Claude API成本
* 削减工具开销
* 为提示词缓存命中设计
* 测量和监控Token使用量