Por qué sus sesiones Claude Code se agotan tan rápido (no es lo que piensa)
Abres una sesión, pegas algunos archivos, le pides a Claude que refactorice una función y treinta minutos después estás mirando un mensaje de límite de velocidad. ¿Te suena familiar?
La parte frustrante no es que se acaben las fichas. es que se acaban invisiblemente, y más rápido de lo que sugeriría cualquier matemática lineal.
Here's why: La quema de tokens Claude Code es compuesto, no aditivo. Cada herramienta que llama Claude (leer un archivo, ejecutar un comando bash, buscar en su proyecto) agrega tokens al contexto. Luego, esos resultados se ubican en el historial de conversaciones. Luego Claude los lee nuevamente en el siguiente turno. No estás gastando fichas una vez por acción. Estás volviendo a gastar cada acción anterior en cada acción posterior.
Una única sesión agente que ejecuta 8 llamadas a herramientas, lee 4 archivos y ejecuta 3 comandos bash puede consumir 40 000 a 80 000 fichas antes de haber escrito una sola línea de código nuevo. La mayoría de los usuarios estiman que utilizaron 5.000.
Esta guía cubre todo: qué son realmente los tokens, cómo Claude Code los cuenta de manera diferente desde la interfaz de chat, la situación real del plan 2026 y un manual de optimización clasificado, desde victorias sin esfuerzo hasta ganchos de preprocesamiento avanzados.
Claude Code Tokens Explained: de cero a fluido
A simbólico es la unidad de texto que procesa un modelo de lenguaje grande. No es exactamente una palabra ni exactamente un carácter: se encuentra en algún punto intermedio. Como punto de referencia aproximado:
function= 1 fichagetUserById= 3–4 fichas- Una línea de código típica = entre 5 y 15 tokens
- 1.000 palabras en prosa ≈ 1.300 fichas
- 1000 palabras de TypeScript denso ≈ 1500-2000 tokens
El código tokeniza de manera menos eficiente que la prosa porque los identificadores, corchetes, sangrías y caracteres especiales reclaman cada uno un presupuesto de token. Un archivo de 500 líneas puede costar fácilmente entre 8.000 y 12.000 tokens solo para insertarlo en contexto.
Cómo funciona realmente el conteo de tokens en Claude Code (no en el chat Claude)
En la interfaz de chat de Claude.ai, envía un mensaje y Claude responde. Costo del token = su mensaje + respuesta de Claude. Limpio y predecible.
Claude Code es fundamentalmente diferente. Cada sesión incluye:
| Componente | Costo aproximado del token |
|---|---|
| System prompt (built-in) | 3000 a 6000 fichas |
| CLAUDE.md file (if present) | 500–5000 tokens (su configuración) |
| Injected file contents | Varies: a menudo entre 5000 y 30 000 tokens |
| Conversation history (all turns) | Accumulates every turn |
| Tool call inputs + outputs | 500 a 3000 tokens por llamada |
| Bash command output | Highly variable: puede ser enorme |
El línea de base del aviso del sistema significa que ya estás gastando miles de tokens antes de escribir un solo carácter. /clear restablece el historial de conversaciones pero no elimina el mensaje del sistema ni la sobrecarga de CLAUDE.md; estos se reinyectan en cada sesión.
El costo del token oculto de las sesiones de agentes
Cuando Claude Code opera de manera agente (leyendo archivos, ejecutando bash, tomando decisiones secuenciales) cada paso se factura y cada paso se acumula en contexto.
A continuación se muestra un ejemplo práctico de una modesta tarea de "agregar autenticación a esta ruta":
- Claude reads your route file → +4000 fichas
- Claude reads your auth middleware → +2500 fichas
- Claude ejecuta
greppara buscar importaciones relacionadas → +800 tokens (comando + salida) - Claude edits the file → +1200 tokens (diff + confirmación)
- You ask a follow-up question → se reenvía todo el historial anterior → +8,500 tokens solo para restablecer el contexto
- Claude runs your test suite → +5000 tokens de salida de prueba inyectados
Total: ~22.000 tokens para una tarea que la mayoría de los usuarios suponen cuesta 2.000. Multiplica esto en una mañana de trabajo y las matemáticas se vuelven brutales. Este efecto agravante (no la duración bruta de la sesión) es la razón por la que los usuarios avanzados alcanzan los límites mucho más rápido que los usuarios ocasionales.
2026 Plan Reality Check: lo que realmente le ofrece Claude Code
A partir de abril de 2026, la estructura del plan de Anthropic ha cambiado de manera importante para cualquiera que presupuesta el uso de tokens.
| Plan | Acceso Claude Code | Aprox. Presupuesto mensual de tokens | Mejor para |
|---|---|---|---|
| Free | Limited / gated | Very low; primarily para evaluación | Occasional exploration |
| Pro ($20/mo) | Included, but rationed | Moderate; subject to usage caps per session | Solo devs, light daily use |
| Team ($25/user/mo) | Included | Higher per-user allocation; pooled limits | Small engineering teams |
| Max ($100–200/mo) | Full | Significantly higher limits | Heavy daily professional use |
| API (pay-per-token) | Direct access | Unlimited (billed per token) | Enterprise, automation, CI |
La situación de abril de 2026: Anthropic señaló posibles cambios en la inclusión de Claude Code en el plan Pro, con informes de limitaciones y restricciones de acceso para usuarios habituales de Pro. Si confía en Claude Code diariamente como suscriptor Pro, trate su acceso como variable, no garantizado a tipo fijo. La migración de flujos de trabajo de gran volumen a la API le brinda previsibilidad de costos incluso si elimina la simplicidad de la tarifa fija.
Key implication: La optimización de tokens ya no se trata solo de eficiencia: para los usuarios del plan Pro, se trata de permanecer dentro de un modelo de acceso que puede restringirse aún más.
El manual completo de optimización de tokens (clasificado por impacto)
En lugar de una lista plana de consejos, aquí hay un desglose por niveles clasificados según el ahorro estimado de tokens y el esfuerzo de implementación.
Tier 1: alto impacto, cero esfuerzo (haga esto primero)
1. Utilice /clear agresivamente
La única acción de mayor apalancamiento disponible. Limpiar el contexto entre distintas tareas elimina la acumulación del historial de conversaciones. Ahorros estimados: 15 000 a 40 000 tokens por sesión para usuarios que actualmente mantienen largas conversaciones continuas.
Regla general: si ha terminado una tarea coherente y está comenzando otra diferente, /clear.
2. Seleccione el modelo adecuado para la tarea
No todas las tareas necesitan Sonnet u Opus. Claude Haiku maneja búsquedas de estilo grep, cambios de nombre de variables simples, generación de texto repetitivo y formato de código, aproximadamente Costo por token 20 veces menor que el Opus.
Ahorros estimados: 30-60% del gasto total para equipos que realizan trabajos de complejidad mixta.
3. Mantenga CLAUDE.md simple y específico
CLAUDE.md se inyecta al inicio de cada sesión. Un archivo CLAUDE.md inflado de 3000 tokens agrega ese costo a cada sesión, antes de que hayas escrito algo. Elimine documentación, ejemplos y todo lo que no sea una instrucción directa. Target under 800 tokens.
Tier 2 — Esfuerzo medio, grandes ganancias (hábitos arquitectónicos)
4. Cargue archivos relacionados con la tarea, no con el proyecto
La diferencia entre "mirar mi sistema de autenticación" y "mirar src/auth/middleware.ts y src/routes/login.ts" puede ser 10 000 a 25 000 fichas por sesión.
5. Divida las tareas grandes en subsesiones aisladas
En lugar de una sesión larga, divídala en subsesiones enfocadas con /clear entre cada una. El costo del token Total es a menudo 40-60% menos porque elimina los gastos generales de reinyección del historial.
- Sesión 1: Refactorizar
user-service.ts→ /clear - Sesión 2: Actualizar rutas dependientes → /clear
- Sesión 3: Pruebas de actualización
6. Utilice diferencias específicas, no reescrituras de archivos Full
Las reescrituras de archivos Full de un archivo de 400 líneas cuestan entre 6.000 y 10.000 tokens solo en salida. Una diferencia específica del mismo cambio: 300 a 800 tokens.
Tier 3 — Técnicas avanzadas (preprocesamiento de ganchos y compresión)
7. Ganchos de preprocesamiento
La documentación oficial de Anthropic cubre los ganchos de preprocesamiento, un mecanismo para transformar las entradas antes de que lleguen al modelo. Esto le permite eliminar la salida detallada del registro, truncar lecturas de archivos grandes en secciones relevantes y resumir la salida de la prueba. Un gancho de preprocesamiento que elimina los códigos ANSI y trunca la salida de bash a 50 líneas puede reducir los costos de los tokens de llamada de herramientas al 60–80% en flujos de trabajo con muchos registros.
function preprocessBashOutput(output) {
const lines = output.replace(/\x1B\[[0-9;]*m/g, '').split('\n');
return lines.slice(0, 50).join('\n') +
(lines.length > 50 ? '\n[truncated]' : '');
}
8. Complementos de compresión de contexto (evaluación honesta)
Varias herramientas comunitarias utilizan expresiones regulares o resúmenes basados en LLM para comprimir el historial de conversaciones antes de volver a inyectarlo. Las compensaciones importan:
- Funciona bien para: Largas conversaciones llenas de prosa, sesiones de preguntas y respuestas.
- Funciona mal para: Sesiones con mucho código donde la sintaxis exacta importa
- Risk: La compresión con pérdida puede hacer que Claude haga suposiciones incorrectas sobre el estado del código
La compresión basada en resumen es más segura que la eliminación de expresiones regulares. Úselo con precaución en flujos de trabajo de producción.
Your Token Strategy by Workflow Type
Los consejos genéricos ignoran la realidad de que un desarrollador independiente y un consumidor de API empresarial no tienen casi nada en común en sus prioridades de optimización.
Solo Developer: maximice cada sesión
Tu restricción es la Pro plan session cap. Cada token desperdiciado es una sesión que no obtuviste.
- Implementar una estricta disciplina
/clearentre tareas - Enrutar todas las tareas no creativas a Haiku
- Mantenga un CLAUDE.md mínimo y enfocado (menos de 500 tokens)
- Agrupe las preguntas relacionadas con lotes en turnos únicos en lugar de múltiples intercambios de ida y vuelta
- Evite pedirle a Claude que "explore"; proporcione siempre destinos de archivos explícitos
Target: Manténgase por debajo de 50.000 tokens por tarea significativa. La mayoría de las tareas en solitario no necesitan más.
Small Teams — Límites compartidos y coordinación
Tu restricción es gastos generales de coordinación — diferentes miembros del equipo con diferentes configuraciones y hábitos de CLAUDE.md crean un gasto compartido impredecible.
- Estandarice un equipo CLAUDE.md compartido mediante control de versiones: una fuente de verdad, optimizada para ser breve
- Establezca límites de gasto explícitos por usuario en el panel del equipo
- Establecer una convención de equipo para la selección de modelos por tipo de tarea (por ejemplo, Haiku para revisión, Sonnet para arquitectura)
- Designar a una persona para auditar el uso de tokens mensualmente y marcar sesiones atípicas
- Utilice subsesiones aisladas para revisiones de relaciones públicas para evitar que el historial de revisiones contamine las sesiones de implementación.
API / Enterprise — Costo a escala
Tu restricción es economía unitaria — estás pagando por token y necesitas un costo predecible por flujo de trabajo.
- Implementar almacenamiento en caché rápido para contexto estático: los tokens almacenados en caché cuestan aproximadamente 10 veces menos cuando se accede a la caché
- construir un capa de enrutamiento del modelo que clasifica la complejidad de las tareas y las rutas al nivel de modelo apropiado automáticamente
- Configuración paneles de control de uso con atribución de costos por flujo de trabajo
- Aplicar ganchos de preprocesamiento en la capa de infraestructura, no por sesión
- Con más de 10 millones de tokens/mes, el enrutamiento del modelo generalmente ofrece resultados Reducción de costos del 50 al 70 % en tareas rutinarias
Puntos de referencia de tokens de tipo proyecto: Monorepo frente a Greenfield frente a Legacy
Los diferentes arquetipos de proyectos tienen perfiles simbólicos fundamentalmente diferentes. Utilice esta tabla para calibrar las expectativas antes de comenzar un nuevo tipo de proyecto.
| Tipo de proyecto | Rango típico de tokens de sesión | Conductor principal | Optimización clave |
|---|---|---|---|
| Greenfield microservice | 15,000–40,000 | Small codebase; frequent new file creation | Low overhead; model selection |
| Monorepo (active feature) | 40,000–120,000 | Large context; cross-module dependencies | Scoped file loading es fundamental |
| Legacy codebase refactor | 60,000–200,000+ | Dense history; exploratory reads; test output | Aislamiento Sub-session; ganchos de preprocesamiento |
| Documentation / content | 10,000–25,000 | Prose-heavy; lower code density | Haiku es suficiente para la mayoría de las tareas |
| CI/CD automation scripting | 20,000–50,000 | Bash-heavy; verbose command output | Preprocessing hooks para truncamiento de salida |
Legacy refactors son el contexto de mayor riesgo para los excesos de tokens. La naturaleza exploratoria del trabajo complica enormemente. Aplique disciplina de subsesión y ganchos de preprocesamiento desde el primer día.
Por qué EasyClaw gana en eficiencia de tokens
EasyClaw está diseñado como un agente de IA nativo de escritorio, lo que significa que funciona sin la sobrecarga de la nube, la sobrecarga de contexto y los límites de sesión impredecibles que afectan a las herramientas basadas en navegador. Cada sesión permanece local, cada ventana de contexto está bajo su control y cada optimización de esta guía es más fácil de implementar porque usted es dueño de la infraestructura.
- Ganchos de preprocesamiento nativos integrados en la capa de flujo de trabajo: no se necesitan contenedores personalizados
- Enrutamiento del modelo por tarea listo para usar: asigna automáticamente Haiku, Sonnet u Opus por complejidad de la tarea
- El equivalente de CLAUDE.md (configuración del proyecto) se mantiene simple por diseño: campos estructurados, no texto de formato libre
- El aislamiento Sub-session es una característica de primera clase: los límites de las tareas son explícitos, no manuales
- Sin sorpresas que limiten el plan: su computación local, sus límites
Frequently Asked Questions
P: ¿/clear realmente guarda tokens o simplemente restablece la pantalla?
R: Realmente ahorra tokens. /clear borra el historial de conversaciones que se reenvía en cada turno. El indicador del sistema y CLAUDE.md aún se reinyectan, pero se elimina la creciente carga útil del historial, que es donde ocurre la mayor acumulación de tokens en sesiones largas. Para una sesión con más de 10 turnos, esto puede ahorrar decenas de miles de tokens en la siguiente tarea.
P: ¿Vale la pena Claude Code en el plan Pro en 2026, dados los informes de limitación?
R: Para un uso diario de ligero a moderado (menos de 5 a 6 sesiones concentradas por día), Pro aún ofrece valor. Para los usuarios habituales que ejecutan Claude Code como entorno de codificación principal todo el día, las restricciones de acceso informadas a principios de 2026 hacen que el plan Max o el acceso API sean una opción más confiable. La simplicidad de tarifa plana de Pro se vuelve menos valiosa cuando no puedes predecir si te toparás con un muro de sesión a mitad de la tarea.
P: ¿Cómo sé qué nivel de modelo usar para una tarea determinada?
R: Una regla general útil: si la tarea requiere un razonamiento genuino, juicio arquitectónico o resolución creativa de problemas, utilice Sonnet u Opus. Si la tarea es mecánica (buscar, formatear, cambiar el nombre, generar texto estándar a partir de una especificación clara), utilice Haiku. En caso de duda, comience con Haiku. Si la calidad del resultado es insuficiente, intensifique. La mayoría de los desarrolladores se sorprenden de cuánto puede manejar Haiku.
P: ¿Puedo implementar enlaces de preprocesamiento sin utilizar la API directamente?
R: Los enlaces de preprocesamiento Full requieren acceso API porque es necesario interceptar los resultados de la herramienta antes de reinyectarlos en contexto. Dentro de la interfaz de usuario de Claude Code, el equivalente más cercano es truncar manualmente la salida de bash (por ejemplo, canalizar comandos a head -n 50) y ser explícito sobre qué secciones de archivo desea leer. No es tan poderoso, pero sí significativo para reducir los costos de los tokens de llamada de herramientas.
P: ¿Cómo funciona el almacenamiento en caché de avisos? ¿Vale la pena configurarlo?
R: El almacenamiento en caché de mensajes es una característica de API que permite a Anthropic reutilizar el contexto previamente calculado para entradas estáticas repetidas, como el mensaje del sistema o la documentación compartida. Los accesos a la caché cuestan aproximadamente 10 veces menos que el procesamiento de tokens nuevos. Para los flujos de trabajo empresariales en los que se envía el mismo mensaje del sistema miles de veces al día, los ahorros son sustanciales. Para los desarrolladores individuales, la complejidad de configurarlo normalmente no vale la pena a menos que estén automatizando a escala.
P: ¿Cuál es el error más grande que cometen la mayoría de los usuarios de Claude Code con los tokens?
R: Ejecutar una sesión continua durante todo el día sin usar /clear. El costo histórico compuesto de una sesión que acumula más de 20 turnos, incluso en tareas aparentemente pequeñas, eclipsa cualquier otra optimización. Adquiera el hábito /clear correctamente y todo lo demás será una mejora incremental sobre una base sólida.
Veredicto final: su lista de verificación de auditoría de tokens de 5 minutos
Ejecute esto antes de su próxima sesión Claude Code:
Higiene del contexto
- ☐ ¿CLAUDE.md tiene menos de 800 tokens? Elimine todo lo que no sea una instrucción directa.
- ☐ ¿Está cargando sólo los archivos específicos necesarios para esta tarea?
- ☐ ¿Has usado /clear desde tu última tarea distinta?
Selección de modelo
- ☐ ¿Es esta tarea lo suficientemente compleja como para justificar Sonnet/Opus?
- ☐ ¿Podría Haiku realizar este paso? (Formato, búsqueda, texto repetitivo, sí).
Estructura de la sesión
- ☐ ¿Es esta una gran tarea que debería dividirse en 2 o 3 subsesiones?
- ☐ ¿Estás haciendo preguntas de varias partes en turnos individuales?
Avanzado (si está en API)
- ☐ ¿El mensaje de su sistema está almacenado en caché?
- ☐ ¿Se trunca la salida de bash antes de la inyección?
- ☐ ¿Tiene atribución de costos por flujo de trabajo?
Plan awareness: Si está en Pro, trate su acceso Claude Code como potencialmente racionado. Considere si el costo del plan Max está justificado por su nivel de uso actual antes de llegar a un muro de acceso a mitad del sprint.
El cambio más impactante que la mayoría de los usuarios pueden realizar hoy: use /clear entre tareas y deje de ejecutar sesiones monolíticas de todo el día. Todo lo demás se basa en esa base.
La optimización de tokens en Claude Code no se trata de usar menos IA. Se trata de usarlo con precisión, para que cada sesión brinde el máximo valor dentro de las limitaciones del plan que esté siguiendo.