介绍
大多数团队并不挣扎 mcp 令牌开销 因为一个提示太长了。他们陷入困境,因为工作流程不断重新读取上下文、在没有预算的情况下调用工具、重试失败的步骤以及将例行工作发送到昂贵的模型。
因此 mcp 令牌开销 应从清除废物入手,而不是盲目迅速缩短。目标很简单:在改进答案的地方花费代币,并在仅重复、重新格式化或重新处理系统已有信息的地方停止花费代币。
在本文中, mcp 令牌开销 是主要关键字。 MCP 和 CLI 令牌效率、提示缓存、上下文压缩和模型路由等相关想法是支持主题。
通过代币预算启动 MCP 代币开销
较短的提示可能会降低代理的成本,同时也会降低代理的性能。如果提示丢失了保持输出正确的约束、示例或源材料,代理可能会重试、要求澄清或产生必须由人员修复的低质量工作。
相反,为每个已完成的任务设置预算。
| 工作流程步骤 | 追踪什么 | 为什么这很重要 |
|---|---|---|
| 规划 | 输入标记、刀具计划长度 | 臃肿的计划经常重复任务指令 |
| 检索或工具使用 | 工具调用次数、返回文本大小 | 原始输出可能会淹没下一个模型调用 |
| 推理 | 使用的模型、重试、输出令牌 | 用于日常步骤时,高级型号价格昂贵 |
| 最终答案 | 编辑率、接受率 | 如果人类重写它,廉价的产出并不便宜 |
使用提示缓存减少 MCP 令牌开销
仅当提示的重复部分保持稳定时,提示缓存才有帮助。如果您的系统提示、示例、架构或工具指令在每次调用时略有变化,则缓存命中率会下降,节省的成本也会消失。
MCP 令牌开销缓存候选者
- System instructions that rarely change
- 输出模式和验证规则
- 许多类似任务中使用的少量示例
- 跨运行重复使用的工具描述
是什么破坏了缓存命中
- 用户特定的上下文混合到第一个提示块中
- 时间戳、随机 ID 或动态元数据放置在稳定指令之前
- 检索在可重用提示前缀之前插入的文档
- 每次运行都会改变的长工具输出
在昂贵的 MCP 令牌开销之前压缩上下文
上下文压缩并不意味着将所有内容总结为模糊的注释。这意味着保留下一个决策所需的字段并放弃其余字段。
MCP 令牌开销上下文压缩清单
- 模型接下来会做出什么决定?
- 该决定需要哪些事实?
- 哪些部分是证据,哪些部分是噪音?
- 哪些内容必须准确引用?
- 什么可以转换为结构化字段?
示例:如果代理审查 40 页的保单文档,请勿将完整文档传递到每个下游步骤。首先提取条款、日期、义务、例外情况和来源参考。然后将紧凑结构发送到执行最终推理的模型。
按风险路由模型以减少 MCP 代币开销
模型路由是降低成本的最简洁方法之一,但前提是路由规则是特定的。 “尽可能使用更便宜的型号”并不是一条规则。这是一个希望。
按任务风险划分的路由规则
| 任务类型 | 型号选择 | 原因 |
|---|---|---|
| 将短输入分类为已知标签 | 更便宜的型号 | 低歧义,易于验证 |
| 将原始文本转换为固定模式 | 更便宜或中档型号 | 带验证的确定性输出 |
| 在相互矛盾的证据之间做出决定 | 更强的模型 | 判断比节省代币更重要 |
| 撰写最终执行建议 | 更强的模型 | 错误是显而易见且代价高昂的 |
| 修复无效的 JSON | 更便宜的型号 | 机械任务,重试成本低 |
在 MCP 工作流上设置停止条件以控制 MCP 令牌开销
MCP 和工具密集型代理工作流程可能会产生令牌开销,因为每个工具描述、调用结果和中间观察都可以成为模型上下文的一部分。该开销仅在改变下一个决策时才有用。
代理工作流程的 MCP 令牌开销控制
- 每个任务的最大工具调用次数
- 每个工具结果的最大返回字符数
- 停止前必须找到的必填字段
- 结束搜索的置信阈值
- 当代理找不到足够的证据时的后备路径
在 MCP 代币开销崩溃之前清理输入
令牌控制还取决于模型接收的输入的质量。原始网页、长日志、重复记录、导航文本和未经过滤的工具输出都会将噪音推入上下文窗口。
模型调用之前的输入清理
- 保留下一个决策所需的字段。
- 删除样板文件、重复导航、空字段和重复文本。
- 当源 URL、时间戳、ID 和精确引用影响信任时,保留它们。
- 仅当下一步不需要原始措辞时才通过摘要。
MCP 代币开销启动前检查表
- 记录输入标记、输出标记、工具调用、重试、模型选择和最终任务状态。
- 计算每个成功任务的成本,而不仅仅是每个 API 调用的成本。
- 将稳定的指令、模式和示例移至缓存友好的前缀中。
- 在稳定前缀之后保留动态用户上下文。
- 在昂贵的推理步骤之前将长输入压缩为特定于任务的结构。
- 将低风险任务路由到更便宜的模型,并在更改后监控重试率。
- 限制 MCP 或工具密集型工作流程的工具调用计数和返回的文本大小。
- 在令牌减少之前和之后添加输出质量的回归测试。
避免导致 MCP 代币开销过高的错误
优化测量工作流程之前的提示。 这通常会在可见提示中节省一些标记,同时忽略重试和工具输出的隐藏成本。
压缩证据。 摘要很有用,但某些工作流程需要准确的报价、ID、价格、日期或引文。显式保留这些字段。
将所有内容路由到一个小模型中。 较便宜的型号非常适合狭窄的台阶。当判断错误导致重试时,它们并不会自动变得更便宜。
常见问题解答:选择正确的 MCP 代币开销策略
首先要衡量的是什么? 衡量每项成功任务的成本。包括重试、工具调用和失败的输出。每次通话费用隐藏太多。
我什么时候应该使用提示缓存? 当在许多类似的请求中重复使用相同的大型指令块、模式或示例集时,请使用它。将动态上下文放在稳定前缀之后。
我如何知道更便宜的型号是否实际上更便宜? 比较重试和人工编辑后的总成本。故障率较高的较便宜型号可能会失败。
底线:MCP 代币开销是工作流程设计
mcp 令牌开销 当它被视为工作流程设计时效果最好。衡量完整的任务,缓存保持稳定的内容,在昂贵的步骤之前压缩上下文,按风险路由模型,并对工具密集型工作流程进行限制。
在开始从每个提示中删除单词之前,请执行此操作。最大的节省通常来自于消除重复的工作和嘈杂的输入,而不是通过稍微缩短一个好的指令。