Introdução
cache de prompt não se trata de tornar cada prompt mais curto. Trata-se de tornar a parte cara e repetida do prompt estável o suficiente para que o provedor do modelo possa reutilizá-la em vez de cobrar o mesmo contexto repetidamente.
Para construtores de IA, operadores de SaaS e fundadores técnicos, a parte difícil é decidir o que pertence ao prefixo armazenável em cache e o que deve permanecer dinâmico. Um fluxo de trabalho amigável ao cache separa instruções, esquemas e exemplos do contexto específico do usuário.
Start Prompt Caching With a Stable Prefix Map
Antes de reescrever os prompts, divida o fluxo de trabalho em blocos estáveis e variáveis. Blocos estáveis são reutilizados em muitas execuções; blocos variáveis mudam por tarefa.
| Bloco de prompt | Ajuste de cache | Razão |
|---|---|---|
| System instructions | High | Usually reused across tasks |
| Output schema | High | Should not change per user |
| Few-shot examples | Medium to high | Útil quando exemplos são reutilizados |
| Documentos recuperados | Low | Usually task-specific |
| Timestamps and run IDs | Bad | They break prefix stability |
Melhore o cache de prompts movendo o contexto dinâmico posteriormente
Uma falha comum no cache acontece quando as equipes colocam dados específicos do usuário antes de instruções reutilizáveis. Mesmo um carimbo de data/hora ou ID de tarefa próximo ao início pode alterar o prefixo e reduzir os acessos ao cache.
Prompt Caching Prefix Rule
- Coloque a função, a política, o esquema e os exemplos primeiro.
- Coloque a solicitação do usuário, os snippets recuperados e a saída da ferramenta após o bloco estável.
- Mantenha a formatação consistente entre as execuções.
- Evite IDs aleatórios no primeiro bloco de prompt.
Meça o cache de prompt com taxa de acertos de cache, não com esperança
O cache de prompt deve ser medido no nível do fluxo de trabalho. Rastreie a taxa de acertos do cache, tokens de entrada armazenados em cache, tokens de entrada não armazenados em cache, latência e taxa de sucesso da tarefa final.
| Métrica | Bom sinal | Sinal Bad |
|---|---|---|
| Cache hit rate | Rises as similar tasks repeat | Drops after prompt edits |
| Cached tokens | Large stable block reused | Only tiny prefix cached |
| Retry rate | Flat or lower | Higher after prompt restructuring |
| Output acceptance | Quality unchanged | Editors rewrite more output |
Avoid Prompt Caching Failure Modes
O maior risco é economizar tokens e ao mesmo tempo tornar o agente menos confiável. Mantenha um conjunto de regressão de tarefas representativas e compare os resultados antes e depois das alterações no cache.
Prompt Caching Invalidation Checklist
- Versão do prompt do seu sistema.
- Documente quando os exemplos mudarem.
- Registre o comportamento do cache específico do provedor.
- Teste novamente quando os esquemas ou as descrições das ferramentas mudarem.
Use Prompt Caching With Model Routing
O cache de prompt e o roteamento de modelo funcionam bem juntos. Armazene em cache o bloco de planejamento ou instrução estável e, em seguida, encaminhe subtarefas de rotina para modelos mais baratos e reserve modelos mais fortes para etapas de julgamento pesado.
Routing Rules by Cache Stability
- A extração de esquema estável pode usar modelos mais baratos.
- O raciocínio ambíguo deve utilizar modelos mais fortes.
- O reparo de formatação não deve usar modelos premium.
- As recomendações finais sobre o risco High precisam de uma revisão mais rigorosa.
Apply Prompt Caching in Production
Na produção, o cache imediato precisa de propriedade. Atribua uma pessoa ou proprietário do fluxo de trabalho para aprovar alterações no prefixo armazenado em cache, pois uma pequena edição em esquemas, exemplos ou descrições de ferramentas pode redefinir o comportamento do cache em muitas execuções. Mantenha um registro de custos antes e depois para cada versão do prompt: tokens de entrada, tokens em cache, tokens de saída, latência, taxa de novas tentativas e taxa de saída aceita. Isso evita uma falha comum em que a equipe vê custos de entrada mais baixos, mas perde uma carga de edição maior no downstream.
Exemplo: um fluxo de trabalho Claude Code que analisa solicitações pull semelhantes pode manter a rubrica de revisão, o esquema de saída e as regras de segurança no prefixo estável. Os arquivos alterados e a solicitação do usuário permanecem após esse prefixo. Se a rubrica for reutilizada em dezenas de execuções, o cache imediato reduz o custo de contexto repetido sem enfraquecer os critérios de revisão.
Após o lançamento, revise o desempenho do cache semanalmente. Procure quedas repentinas de acertos no cache após edições de prompt, latência mais longa após alterações de esquema e taxas de repetição mais altas após a remoção dos exemplos. O melhor sinal é o custo por resultado aceito, porque captura tanto a economia simbólica quanto o retrabalho editorial. Mantenha esses números visíveis antes de cada revisão do prompt e anote cada experimento com a versão do prompt que causou a alteração. Se um experimento de cache reduzir o custo, mas aumentar as edições humanas, reverta-o e inspecione qual instrução estável foi enfraquecida.
Checklist pré-lançamento de Prompt Caching
- Mapeie blocos de prompt estáveis e dinâmicos.
- Mova o contexto dinâmico após o prefixo reutilizável.
- Rastreie a taxa de acertos do cache e o volume de tokens armazenados em cache.
- Mantenha um conjunto de regressão para qualidade de saída.
- A versão avisa quando os esquemas ou exemplos são alterados.
- Compare o custo por tarefa bem-sucedida, não apenas o custo por solicitação.
Perguntas frequentes: cache de prompt
Quando o cache imediato vale a pena? Quando um prefixo de prompt grande é reutilizado em muitas solicitações semelhantes e não muda entre as execuções.
O que interrompe o cache de prompt com mais frequência? Metadados dinâmicos, conteúdo recuperado e contexto específico do usuário colocados antes do bloco de instrução estável.
Should I shorten the cached prefix? Não necessariamente. Um prefixo estável maior pode ser econômico quando evita cobranças repetidas e preserva a qualidade.
Bottom Line: O cache de prompt é um problema de design de prefixo
cache de prompt funciona quando o fluxo de trabalho é projetado em torno de um contexto reutilizável estável. Separe o prefixo, meça os acessos ao cache e proteja a qualidade com testes de regressão.