Perché le tue sessioni Claude Code si esauriscono così velocemente (non è quello che pensi)
Apri una sessione, incolli alcuni file, chiedi a Claude di rifattorizzare una funzione e trenta minuti dopo stai fissando un messaggio di limite di velocità. Ti sembra familiare?
La parte frustrante non è che i gettoni finiscano. È che finiscono invisibilmente, e più velocemente di quanto suggerirebbe qualsiasi matematica lineare.
Here's why: La masterizzazione di token Claude Code è composto, non additivo. Ogni chiamata dello strumento Claude (leggendo un file, eseguendo un comando bash, cercando nel tuo progetto) aggiunge token al contesto. Quindi quegli output si trovano nella cronologia delle conversazioni. Poi Claude li legge nuovamente al turno successivo. Non spenderai gettoni una volta per azione. Stai spendendo nuovamente ogni azione precedente per ogni azione successiva.
Una singola sessione dell'agente che esegue 8 chiamate a strumenti, legge 4 file ed esegue 3 comandi bash può consumare 40.000–80.000 gettoni prima di aver scritto una singola riga di nuovo codice. La maggior parte degli utenti stima di averne utilizzati 5.000.
Questa guida copre tutto: cosa sono effettivamente i token, come Claude Code li conta in modo diverso dall'interfaccia di chat, la situazione reale del piano 2026 e un playbook di ottimizzazione classificato dalle vittorie senza sforzo agli hook di preelaborazione avanzati.
Claude Code Tokens Explained — Da zero a fluente
UN gettone è l'unità di testo che un ampio modello linguistico elabora. Non è esattamente una parola e nemmeno un carattere: si trova da qualche parte nel mezzo. Come punto di riferimento approssimativo:
function= 1 gettonegetUserById= 3–4 token- Una tipica riga di codice = 5–15 token
- 1.000 parole di prosa ≈ 1.300 gettoni
- 1.000 parole di TypeScript denso ≈ 1.500–2.000 token
Il codice tokenizza in modo meno efficiente rispetto alla prosa perché identificatori, parentesi, rientri e caratteri speciali richiedono ciascuno il budget del token. Un file di 500 righe può facilmente costare 8.000-12.000 token solo per inserirlo nel contesto.
Come funziona effettivamente il conteggio dei token in Claude Code (non nella chat di Claude)
Nell'interfaccia chat di Claude.ai, invii un messaggio, Claude risponde. Costo token = il tuo messaggio + la risposta di Claude. Pulito e prevedibile.
Claude Code è fondamentalmente diverso. Ogni sessione include:
| Componente | Costo approssimativo dei gettoni |
|---|---|
| System prompt (built-in) | 3.000–6.000 gettoni |
| CLAUDE.md file (if present) | 500-5.000 token (la tua configurazione) |
| Injected file contents | Varies: spesso 5.000–30.000 token |
| Conversation history (all turns) | Accumulates every turn |
| Tool call inputs + outputs | 500–3.000 token per chiamata |
| Bash command output | Highly variable — può essere enorme |
IL riferimento del prompt del sistema significa che stai già spendendo migliaia di token prima di digitare un singolo carattere. /clear reimposta la cronologia delle conversazioni ma non elimina il prompt di sistema o l'overhead di CLAUDE.md: questi vengono reinseriti a ogni sessione.
Il costo simbolico nascosto delle sessioni di Agentic
Quando Claude Code opera in modo agente (leggendo file, eseguendo bash, prendendo decisioni sequenziali) ogni passaggio viene fatturato e ogni passaggio viene accumulato nel contesto.
Ecco un esempio pratico per una modesta attività "aggiungi autenticazione a questo percorso":
- Claude reads your route file → +4.000 gettoni
- Claude reads your auth middleware → +2.500 gettoni
- Claude esegue
grepper trovare le importazioni correlate → +800 token (comando + output) - Claude edits the file → +1.200 token (diff + conferma)
- You ask a follow-up question → l'intera cronologia sopra viene inviata nuovamente → +8.500 token solo per ristabilire il contesto
- Claude runs your test suite → +5.000 token di output di test iniettati
Total: ~22.000 token per un'attività la maggior parte degli utenti prevede costi pari a 2.000. Moltiplicatelo per una mattinata di lavoro e i conti diventano brutali. Questo effetto cumulativo, e non la durata pura della sessione, è il motivo per cui gli utenti esperti raggiungono i limiti molto più velocemente degli utenti occasionali.
2026 Plan Reality Check: cosa ti offre effettivamente Claude Code
A partire dall'aprile 2026, la struttura del piano di Anthropic è cambiata in modi che contano per chiunque preveda il budget per l'utilizzo dei token.
| Piano | Claude Code Accesso | ca. Budget mensile dei token | Ideale per |
|---|---|---|---|
| Free | Limited / gated | Very low; primarily per la valutazione | Occasional exploration |
| Pro ($20/mo) | Included, but rationed | Moderate; subject to usage caps per session | Solo devs, light daily use |
| Team ($25/user/mo) | Included | Higher per-user allocation; pooled limits | Small engineering teams |
| Max ($100–200/mo) | Full | Significantly higher limits | Heavy daily professional use |
| API (pay-per-token) | Direct access | Unlimited (billed per token) | Enterprise, automation, CI |
La situazione di aprile 2026: Anthropic ha segnalato potenziali modifiche all'inclusione di Claude Code nel piano Pro, con segnalazioni di limitazioni e restrizioni di accesso per gli utenti Pro più assidui. Se ti affidi quotidianamente a Claude Code come abbonato Pro, tratta il tuo accesso come variabile, non garantito a tasso fisso. La migrazione di flussi di lavoro ad alto volume all'API garantisce la prevedibilità dei costi anche se elimina la semplicità della tariffa fissa.
Key implication: L'ottimizzazione dei token non è più solo una questione di efficienza: per gli utenti del piano Pro, si tratta di rimanere all'interno di un modello di accesso che potrebbe restringersi ulteriormente.
Il playbook completo per l'ottimizzazione dei token (classificato in base all'impatto)
Invece di un semplice elenco di suggerimenti, ecco una ripartizione a più livelli classificata in base al risparmio stimato sui token e allo sforzo di implementazione.
Tier 1 — Impatto elevato, sforzo zero (fai prima queste cose)
1. Usa /clear in modo aggressivo
La singola azione con la leva finanziaria più elevata disponibile. La cancellazione del contesto tra attività distinte elimina l'accumulo di cronologia delle conversazioni. Risparmio stimato: 15.000–40.000 token per sessione per gli utenti che attualmente eseguono conversazioni lunghe e continue.
Regola pratica: se hai terminato un'attività coerente e ne stai iniziando un'altra diversa, /clear.
2. Selezionare il modello giusto per l'attività
Non tutte le attività necessitano di Sonnet o Opus. Claude Haiku gestisce ricerche in stile grep, semplici ridenominazioni di variabili, generazione di boilerplate e formattazione del codice, a circa Costo per gettone 20 volte inferiore rispetto all'Opus.
Risparmio stimato: 30–60% della spesa totale per i team che svolgono lavori di complessità mista.
3. Mantieni CLAUDE.md snello e specifico
CLAUDE.md viene iniettato all'inizio di ogni sessione. Un file CLAUDE.md da 3.000 token gonfiato aggiunge quel costo a ogni singola sessione, prima che tu abbia digitato qualsiasi cosa. Rimuovi documentazione, esempi e tutto ciò che non costituisce un'istruzione diretta. Target under 800 tokens.
Tier 2 — Impegno medio, guadagni maggiori (abitudini architettoniche)
4. Caricare file con ambito dell'attività, non del progetto
La differenza tra "guarda il mio sistema di autenticazione" e "guarda src/auth/middleware.ts e src/routes/login.ts" può essere 10.000–25.000 gettoni per sessione.
5. Suddividere attività di grandi dimensioni in sottosessioni isolate
Invece di una lunga sessione, suddividila in sottosessioni mirate con /clear tra ciascuna. Il costo del token Total è spesso 40–60% in meno perché elimini il sovraccarico della reiniezione della cronologia.
- Sessione 1: Refactoring
user-service.ts→ /clear - Sessione 2: aggiornamento dei percorsi dipendenti → /clear
- Sessione 3: Test di aggiornamento
6. Utilizzare differenze mirate, non riscritture di file Full
Le riscritture di file Full di un file di 400 righe costano 6.000-10.000 token solo in output. Una differenza mirata della stessa modifica: 300–800 token.
Tier 3 — Tecniche avanzate (hook di preelaborazione e compressione)
7. Hook di preelaborazione
La documentazione ufficiale di Anthropic riguarda gli hook di preelaborazione, un meccanismo per trasformare gli input prima che raggiungano il modello. Ciò consente di eliminare l'output dettagliato del registro, troncare le letture di file di grandi dimensioni in sezioni pertinenti e riepilogare l'output del test. Un hook di preelaborazione che rimuove i codici ANSI e tronca l'output bash a 50 righe può ridurre i costi dei token di chiamata allo strumento 60–80% in flussi di lavoro pesanti.
function preprocessBashOutput(output) {
const lines = output.replace(/\x1B\[[0-9;]*m/g, '').split('\n');
return lines.slice(0, 50).join('\n') +
(lines.length > 50 ? '\n[truncated]' : '');
}
8. Plugin di compressione del contesto (valutazione onesta)
Diversi strumenti della community utilizzano regex o riepilogo basato su LLM per comprimere la cronologia delle conversazioni prima della re-iniezione. I compromessi contano:
- Funziona bene per: Lunghe conversazioni ricche di prosa, sessioni di domande e risposte
- Funziona male per: Sessioni ad alto contenuto di codice in cui la sintassi esatta è importante
- Risk: La compressione con perdita può far sì che Claude effettui presupposti errati sullo stato del codice
La compressione basata sul riepilogo è più sicura dello stripping delle espressioni regolari. Utilizzare con cautela nei flussi di lavoro di produzione.
Your Token Strategy by Workflow Type
I consigli generici ignorano il fatto che uno sviluppatore indipendente e un consumatore di API aziendali non hanno quasi nulla in comune nelle loro priorità di ottimizzazione.
Solo Developer: massimizza ogni sessione
Il tuo vincolo è il Pro plan session cap. Ogni token sprecato è una sessione che non hai ottenuto.
- Implementa una rigorosa disciplina
/cleartra le attività - Indirizza tutte le attività non creative a Haiku
- Mantieni un CLAUDE.md minimo e mirato (sotto i 500 token)
- Raggruppa le domande relative ai batch in singoli turni anziché in molteplici scambi avanti e indietro
- Evita di chiedere a Claude di "esplorare": fornisci sempre target di file espliciti
Target: Rimani sotto i 50.000 token per attività significativa. La maggior parte delle attività da solista non richiedono altro.
Small Teams — Limiti condivisi e coordinamento
Il tuo vincolo è sovraccarico di coordinamento — diversi membri del team con diverse configurazioni e abitudini di CLAUDE.md creano spese condivise imprevedibili.
- Standardizza un team CLAUDE.md condiviso tramite il controllo della versione: una fonte di verità, ottimizzata per la brevità
- Imposta limiti di spesa espliciti per utente nella dashboard del team
- Stabilire una convenzione di squadra per la selezione del modello in base al tipo di attività (ad esempio, Haiku per la revisione, Sonnet per l'architettura)
- Designare una persona per controllare mensilmente l'utilizzo dei token e contrassegnare le sessioni anomale
- Utilizzare sottosessioni isolate per le revisioni PR per evitare che la cronologia delle revisioni contamini le sessioni di implementazione
API / Enterprise: costo su larga scala
Il tuo vincolo è economia unitaria - paghi per token e hai bisogno di costi prevedibili per flusso di lavoro.
- Attrezzo memorizzazione nella cache tempestiva per contesto statico: i token memorizzati nella cache costano circa 10 volte in meno in caso di riscontro nella cache
- Costruisci un livello di instradamento del modello che classifica automaticamente la complessità delle attività e le indirizza al livello del modello appropriato
- Impostare dashboard di monitoraggio dell'utilizzo con attribuzione dei costi per flusso di lavoro
- Applica hook di preelaborazione a livello di infrastruttura, non per sessione
- A partire da 10 milioni di token al mese, il routing del modello in genere offre risultati soddisfacenti Riduzione dei costi del 50–70%. sui compiti di routine
Benchmark dei token di tipo progetto: Monorepo vs. Greenfield vs. Legacy
Diversi archetipi di progetto hanno profili di token fondamentalmente diversi. Utilizza questa tabella per calibrare le aspettative prima di iniziare un nuovo tipo di progetto.
| Tipo di progetto | Intervallo tipico di token di sessione | Conducente principale | Ottimizzazione chiave |
|---|---|---|---|
| Greenfield microservice | 15,000–40,000 | Small codebase; frequent new file creation | Low overhead; model selection |
| Monorepo (active feature) | 40,000–120,000 | Large context; cross-module dependencies | Scoped file loading è fondamentale |
| Legacy codebase refactor | 60,000–200,000+ | Dense history; exploratory reads; test output | isolamento Sub-session; ganci di preelaborazione |
| Documentation / content | 10,000–25,000 | Prose-heavy; lower code density | Haiku è sufficiente per la maggior parte delle attività |
| CI/CD automation scripting | 20,000–50,000 | Bash-heavy; verbose command output | Preprocessing hooks per il troncamento dell'output |
Legacy refactors sono il contesto a più alto rischio di superamento dei token. La natura esplorativa del lavoro è fortemente accentuata. Applica la disciplina delle sottosessioni e gli hook di preelaborazione fin dal primo giorno.
Perché EasyClaw vince grazie all'efficienza dei token
EasyClaw è costruito come un agente AI nativo per desktop, il che significa che funziona senza il sovraccarico del cloud, l'ingombro del contesto e i limiti di sessione imprevedibili che affliggono gli strumenti basati su browser. Ogni sessione rimane locale, ogni finestra di contesto è sotto il tuo controllo e ogni ottimizzazione descritta in questa guida è più semplice da implementare perché sei proprietario dell'infrastruttura.
- Hook di preelaborazione nativi integrati nel livello del flusso di lavoro: non sono necessari wrapper personalizzati
- Routing modello per attività pronto all'uso: assegna automaticamente Haiku, Sonnet o Opus in base alla complessità dell'attività
- L'equivalente CLAUDE.md (configurazione del progetto) rimane snello in termini di progettazione: campi strutturati, non testo a mano libera
- L'isolamento Sub-session è una funzionalità di prima classe: i limiti delle attività sono espliciti, non manuali
- Nessuna sorpresa in termini di limitazioni del piano: il tuo computer locale, i tuoi limiti
Frequently Asked Questions
D: /clear salva effettivamente i token o ripristina semplicemente il display?
A: Risparmia davvero token. /clear cancella la cronologia delle conversazioni che viene inviata nuovamente ad ogni turno. Il prompt di sistema e CLAUDE.md vengono comunque reinseriti, ma si elimina il crescente carico utile della cronologia, che è il luogo in cui avviene la maggior parte dell'accumulo di token nelle lunghe sessioni. Per una sessione con più di 10 turni, questo può far risparmiare decine di migliaia di gettoni nell'attività successiva.
D: Vale la pena utilizzare Claude Code con il piano Pro nel 2026, visti i rapporti di limitazione?
R: Per un uso quotidiano da leggero a moderato (meno di 5-6 sessioni mirate al giorno), Pro offre comunque valore. Per gli utenti assidui che eseguono Claude Code come ambiente di codifica principale tutto il giorno, le restrizioni di accesso segnalate all'inizio del 2026 rendono il piano Max o l'accesso API una scelta più affidabile. La semplicità della tariffa fissa di Pro diventa meno preziosa quando non puoi prevedere se riuscirai a raggiungere un limite di sessione durante l'attività.
D: Come faccio a sapere quale livello del modello utilizzare per una determinata attività?
R: Un'utile regola empirica: se l'attività richiede un ragionamento genuino, un giudizio architettonico o una risoluzione creativa dei problemi, utilizzare Sonnet o Opus. Se l'attività è meccanica (cercare, formattare, rinominare, generare boilerplate da specifiche chiare) usa Haiku. In caso di dubbi, inizia con l'Haiku. Se la qualità dell'output è insufficiente, intensificare. La maggior parte degli sviluppatori è sorpresa da quanto Haiku può gestire.
D: Posso implementare hook di preelaborazione senza utilizzare direttamente l'API?
R: Gli hook di preelaborazione Full richiedono l'accesso API perché è necessario intercettare gli output dello strumento prima che vengano reinseriti nel contesto. All'interno dell'interfaccia utente Claude Code, l'equivalente più vicino è troncare manualmente l'output bash (ad esempio, reindirizzando i comandi a head -n 50) ed essere espliciti su quali sezioni del file si desidera leggere. Non altrettanto potente, ma significativo per ridurre i costi dei token di chiamata allo strumento.
D: Come funziona la memorizzazione nella cache dei prompt e vale la pena configurarla?
R: La memorizzazione nella cache dei prompt è una funzionalità API che consente a Anthropic di riutilizzare il contesto precedentemente calcolato per input statici ripetuti, come il prompt del sistema o la documentazione condivisa. Gli accessi alla cache costano circa 10 volte meno rispetto alla nuova elaborazione dei token. Per i flussi di lavoro aziendali in cui lo stesso messaggio di sistema viene inviato migliaia di volte al giorno, i risparmi sono sostanziali. Per i singoli sviluppatori, la complessità della configurazione in genere non vale la pena, a meno che non si stia automatizzando su larga scala.
D: Qual è l'errore più grande che la maggior parte degli utenti Claude Code commette con i token?
R: Esecuzione di una sessione continua per tutta la giornata senza utilizzare /clear. Il costo complessivo della cronologia di una sessione che accumula più di 20 turni, anche su attività apparentemente piccole, fa impallidire ogni altra ottimizzazione. Prendi l'abitudine /clear giusta e tutto il resto sarà un miglioramento incrementale su basi solide.
Verdetto finale: la tua lista di controllo per il controllo dei token in 5 minuti
Eseguilo prima della prossima sessione Claude Code:
Contesto Igiene
- ☐ CLAUDE.md ha meno di 800 token? Rimuovi tutto ciò che non è un'istruzione diretta.
- ☐ Stai caricando solo i file specifici necessari per questa attività?
- ☐ Hai usato /clear dal tuo ultimo compito distinto?
Selezione del modello
- ☐ Questo compito è davvero abbastanza complesso da giustificare Sonetto/Opus?
- ☐ Haiku potrebbe gestire questo passaggio? (Formattazione, ricerca, boilerplate: sì.)
Struttura della sessione
- ☐ Si tratta di un compito di grandi dimensioni che dovrebbe essere suddiviso in 2-3 sottosessioni?
- ☐ Stai ponendo domande composte da più parti in turni singoli?
Avanzato (se su API)
- ☐ Il prompt del tuo sistema è memorizzato nella cache?
- ☐ L'output di bash viene troncato prima dell'iniezione?
- ☐ Esiste un'attribuzione dei costi per flusso di lavoro?
Plan awareness: Se utilizzi Pro, considera il tuo accesso Claude Code come potenzialmente razionato. Considera se il costo del piano Max è giustificato dal tuo attuale livello di utilizzo prima di colpire un muro di accesso a metà sprint.
Il singolo cambiamento di maggior impatto che la maggior parte degli utenti può apportare oggi: utilizzare /clear tra le attività e interrompere l'esecuzione di sessioni monolitiche per tutto il giorno. Tutto il resto si basa su quelle fondamenta.
L'ottimizzazione dei token in Claude Code non riguarda l'utilizzo ridotto dell'intelligenza artificiale. Si tratta di usarlo in modo preciso, in modo che ogni sessione offra il massimo valore entro i limiti del piano che hai scelto.