Claude Code 세션이 너무 빨리 종료되는 이유(생각과는 다릅니다)
세션을 열고 파일 몇 개를 붙여넣고 Claude에 함수 리팩터링을 요청하면 30분 후에 속도 제한 메시지가 표시됩니다. 익숙한 것 같나요?
실망스러운 부분은 토큰이 부족하다는 것이 아닙니다. 다 소진됐다는 거죠 눈에 보이지 않게, 선형 수학이 제안하는 것보다 빠릅니다.
Here's why: Claude Code 토큰 소각은 첨가물이 아닌 혼합. 파일 읽기, bash 명령 실행, 프로젝트 검색 등 Claude이 수행하는 모든 도구 호출은 컨텍스트에 토큰을 추가합니다. 그런 다음 해당 출력은 대화 기록에 저장됩니다. 그런 다음 Claude은 다음 차례에 다시 읽습니다. 행동당 토큰을 한 번만 사용하지 않습니다. 모든 후속 작업에 대해 모든 이전 작업을 다시 지출하고 있습니다.
8개의 도구 호출을 실행하고, 4개의 파일을 읽고, 3개의 bash 명령을 실행하는 단일 에이전트 세션은 다음을 사용할 수 있습니다. 토큰 40,000~80,000개 새로운 코드 한 줄을 작성하기 전에 말이죠. 대부분의 사용자는 5,000을 사용했다고 추정합니다.
이 가이드에서는 실제로 토큰이 무엇인지, Claude Code이 채팅 인터페이스와 어떻게 다르게 토큰을 계산하는지, 실제 2026 계획 상황, 노력이 필요 없는 승리부터 고급 전처리 후크까지 순위가 매겨진 최적화 플레이북 등 모든 것을 다룹니다.
Claude Code Tokens Explained — 0에서 Fluent까지
에이 토큰 대규모 언어 모델이 처리하는 텍스트 단위입니다. 그것은 정확히 단어도 아니고 문자도 아닙니다. 그것은 그 사이 어딘가에 위치합니다. 대략적인 벤치마크로는 다음과 같습니다.
function= 1 토큰getUserById= 3–4 토큰- 일반적인 코드 줄 = 5~15개 토큰
- 1,000단어의 산문 ≒ 1,300토큰
- 1,000단어의 조밀한 TypeScript ≒ 1,500–2,000개 토큰
식별자, 대괄호, 들여쓰기 및 특수 문자가 각각 토큰 예산을 요구하기 때문에 코드는 산문보다 덜 효율적으로 토큰화됩니다. 500줄 파일은 컨텍스트에 삽입하는 데만 8,000~12,000개의 토큰이 소요될 수 있습니다.
Claude Code에서 토큰 계산이 실제로 작동하는 방식(Claude 채팅 아님)
Claude.ai의 채팅 인터페이스에서 메시지를 보내면 Claude이 응답합니다. 토큰 비용 = 귀하의 메시지 + Claude의 답변. 깨끗하고 예측 가능합니다.
Claude Code은 근본적으로 다릅니다. 각 세션에는 다음이 포함됩니다.
| 요소 | 대략적인 토큰 비용 |
|---|---|
| System prompt (built-in) | 토큰 3,000~6,000개 |
| CLAUDE.md file (if present) | 500~5,000개 토큰(귀하의 구성) |
| Injected file contents | Varies — 종종 5,000~30,000개의 토큰 |
| Conversation history (all turns) | Accumulates every turn |
| Tool call inputs + outputs | 호출당 500~3,000개의 토큰 |
| Bash command output | Highly variable — 엄청날 수 있습니다 |
그만큼 시스템 프롬프트 기준선 이는 단일 문자를 입력하기 전에 이미 수천 개의 토큰을 지출하고 있음을 의미합니다. /clear은 대화 기록을 재설정하지만 시스템 프롬프트나 CLAUDE.md 오버헤드를 제거하지는 않습니다. 이러한 오버헤드는 세션마다 다시 주입됩니다.
에이전트 세션의 숨겨진 토큰 비용
Claude Code이 에이전트 방식으로 작동하는 경우(파일 읽기, bash 실행, 순차적 결정 수행) 모든 단계에 비용이 청구되고 모든 단계가 상황에 따라 누적됩니다..
다음은 "이 경로에 인증 추가" 작업에 대한 실제 예제입니다.
- Claude reads your route file → 토큰 +4,000개
- Claude reads your auth middleware → 토큰 +2,500개
- Claude은
grep을 실행하여 관련 가져오기를 찾습니다. → +800 토큰(명령어 + 출력) - Claude edits the file → 토큰 +1,200개(차이 + 확인)
- You ask a follow-up question → 위의 전체 기록이 다시 전송됩니다. → 컨텍스트를 다시 설정하기 위해 +8,500개의 토큰
- Claude runs your test suite → 테스트 출력 토큰 +5,000개 주입
Total: ~22,000 토큰 대부분의 사용자는 작업 비용을 2,000으로 가정합니다. 아침 출근 시간에 이것을 곱하면 수학은 잔인해집니다. 원시 세션 길이가 아닌 이러한 복합 효과는 고급 사용자가 일반 사용자보다 훨씬 빠르게 제한에 도달하는 이유입니다.
2026 Plan Reality Check — Claude Code이 실제로 제공하는 것
2026년 4월 현재 Anthropic의 계획 구조는 토큰 사용 예산을 책정하는 모든 사람에게 중요한 방식으로 변경되었습니다.
| 계획 | Claude Code 액세스 | 대략. 월간 토큰 예산 | 최고의 대상 |
|---|---|---|---|
| Free | Limited / gated | 평가용 Very low; primarily | Occasional exploration |
| Pro ($20/mo) | Included, but rationed | Moderate; subject to usage caps per session | Solo devs, light daily use |
| Team ($25/user/mo) | Included | Higher per-user allocation; pooled limits | Small engineering teams |
| Max ($100–200/mo) | Full | Significantly higher limits | Heavy daily professional use |
| API (pay-per-token) | Direct access | Unlimited (billed per token) | Enterprise, automation, CI |
2026년 4월 상황: Anthropic은 Pro 계획에 Claude Code을 포함하는 것에 대한 잠재적인 변경 사항을 알리고 Pro 사용자에 대한 제한 및 액세스 제한에 대한 보고를 했습니다. Pro 구독자로서 매일 Claude Code을 사용하는 경우 액세스를 다음과 같이 취급하십시오. 변하기 쉬운, 고정된 비율로 보장되지는 않습니다. 대용량 워크플로를 API로 마이그레이션하면 정액 요금의 단순성이 제거되더라도 비용 예측 가능성이 제공됩니다.
Key implication: 토큰 최적화는 더 이상 효율성에 관한 것이 아닙니다. Pro 플랜 사용자의 경우 더욱 엄격해질 수 있는 액세스 모델 내에 머무르는 것입니다.
완전한 토큰 최적화 플레이북(영향력 기준)
단순한 팁 목록이 아니라 예상 토큰 절약 및 구현 노력을 기준으로 순위가 매겨진 계층별 분석입니다.
Tier 1 — 큰 영향, 제로 노력(먼저 수행)
1. /clear을 적극적으로 사용하세요
단일 최고 레버리지 작업을 사용할 수 있습니다. 서로 다른 작업 간의 컨텍스트를 지우면 대화 기록이 누적되지 않습니다. 예상 절감액: 세션당 15,000~40,000개의 토큰 현재 오랫동안 지속적으로 대화를 나누는 사용자를 위한 것입니다.
경험 법칙: 하나의 일관된 작업을 완료하고 다른 작업을 시작하는 경우 /clear.
2. 작업에 적합한 모델 선택
모든 작업에 Sonnet이나 Opus가 필요한 것은 아닙니다. Claude Haiku은 grep 스타일 검색, 간단한 변수 이름 바꾸기, 상용구 생성 및 코드 형식 지정을 대략적으로 처리합니다. 토큰당 비용 20배 절감 오퍼스보다
예상 절감액: 총 지출의 30~60% 복합적인 작업을 수행하는 팀을 위한 것입니다.
3. CLAUDE.md를 간결하고 구체적으로 유지하세요
CLAUDE.md는 모든 세션이 시작될 때 삽입됩니다. 3,000개의 토큰으로 구성된 CLAUDE.md 파일은 사용자가 아무 것도 입력하기 전에 모든 단일 세션에 해당 비용을 추가합니다. 문서, 예제 및 직접적인 지침이 아닌 모든 항목을 제거하십시오. Target under 800 tokens.
Tier 2 — 중간 정도의 노력, 큰 이득(건축 습관)
4. 프로젝트가 아닌 작업 범위의 파일 로드
"내 인증 시스템 보기"와 "src/auth/middleware.ts 및 src/routes/login.ts 보기"의 차이점은 다음과 같습니다. 토큰 10,000~25,000개 세션당.
5. 대규모 작업을 격리된 하위 세션으로 나누기
하나의 긴 세션 대신 각 세션 사이에 /clear을 사용하여 집중된 하위 세션으로 나눕니다. Total 토큰 비용은 종종 40~60% 더 낮음 히스토리 재주입 오버헤드가 제거되기 때문입니다.
- 세션 1:
user-service.ts리팩터링 → /clear - 세션 2: 종속 경로 업데이트 → /clear
- 세션 3: 업데이트 테스트
6. Full 파일 재작성이 아닌 대상 차이점 사용
400줄 파일을 Full 파일로 다시 작성하려면 출력 비용만 6,000~10,000토큰이 소요됩니다. 동일한 변경의 목표 차이: 300–800 토큰.
Tier 3 — 고급 기술(후크 및 압축 전처리)
7. 전처리 후크
Anthropic의 공식 문서에는 입력이 모델에 도달하기 전에 변환하는 메커니즘인 전처리 후크가 포함되어 있습니다. 이를 통해 자세한 로그 출력을 제거하고, 대용량 파일 읽기를 관련 섹션으로 자르고, 테스트 출력을 요약할 수 있습니다. ANSI 코드를 제거하고 bash 출력을 50줄로 자르는 전처리 후크는 도구 호출 토큰 비용을 다음과 같이 줄일 수 있습니다. 60–80% 로그가 많은 워크플로에서
function preprocessBashOutput(output) { const lines = output.replace(/\x1B\[[0-9;]*m/g, '').split('\n'); return lines.slice(0, 50).join('\n') + (lines.length > 50 ? '\n[truncated]' : ''); } 8. 컨텍스트 압축 플러그인(정직한 평가)
여러 커뮤니티 도구는 정규식 또는 LLM 기반 요약을 사용하여 다시 삽입하기 전에 대화 기록을 압축합니다. 장단점이 중요합니다.
- 다음 용도에 적합합니다. 산문이 많은 긴 대화, Q&A 세션
- 다음과 같은 경우에는 제대로 작동하지 않습니다. 정확한 구문이 중요한 코드가 많은 세션
- Risk: 손실 압축으로 인해 Claude이 코드 상태에 대해 잘못된 가정을 할 수 있음
요약 기반 압축은 정규식 제거보다 안전합니다. 프로덕션 작업 흐름에서는 주의해서 사용하세요.
Your Token Strategy by Workflow Type
일반적인 조언은 개인 인디 개발자와 엔터프라이즈 API 소비자가 최적화 우선순위에 있어 공통점이 거의 없다는 현실을 무시합니다.
Solo Developer — 모든 세션 극대화
당신의 제약은 Pro plan session cap. 낭비되는 모든 토큰은 얻지 못한 세션입니다.
- 작업 간에 엄격한
/clear규율을 구현합니다. - 창의적이지 않은 모든 작업을 Haiku으로 라우팅합니다.
- 최소한의 집중적인 CLAUDE.md를 유지하세요(토큰 500개 미만).
- 여러 번 왔다 갔다 하는 대신 관련 질문을 한 번에 일괄 처리합니다.
- Claude에 "탐색"을 요청하지 마세요. 항상 명시적인 파일 대상을 제공하세요.
Target: 의미 있는 작업당 토큰을 50,000개 미만으로 유지하세요. 대부분의 솔로 작업에는 더 이상 필요하지 않습니다.
Small Teams — 공유 한도 및 조정
당신의 제약은 조정 오버헤드 — 서로 다른 CLAUDE.md 구성과 습관을 가진 여러 팀원이 예측할 수 없는 공유 지출을 만듭니다.
- 버전 제어를 통해 공유되는 팀 CLAUDE.md 표준화 — 단일 정보 소스, 간결성을 위해 최적화됨
- 팀 대시보드에서 명시적인 사용자별 지출 한도 설정
- 작업 유형별 모델 선택을 위한 팀 규칙 설정(예: 검토용 Haiku, 아키텍처용 Sonnet)
- 매월 토큰 사용을 감사하고 이상치 세션을 표시할 사람을 한 명 지정합니다.
- PR 검토를 위해 격리된 하위 세션을 사용하여 검토 기록이 구현 세션을 오염시키는 것을 방지합니다.
API / Enterprise — 규모에 따른 비용
당신의 제약은 단위경제학 — 토큰당 비용을 지불하고 있으며 워크플로당 예측 가능한 비용이 필요합니다.
- 구현하다 프롬프트 캐싱 정적 컨텍스트의 경우 — 캐시된 토큰은 캐시 적중 시 비용이 ~10배 저렴합니다.
- 빌드 모델 라우팅 계층 작업 복잡성을 분류하고 자동으로 적절한 모델 계층으로 라우팅합니다.
- 설정 사용량 모니터링 대시보드 워크플로별 비용 귀속 포함
- 세션별이 아닌 인프라 계층에서 전처리 후크를 적용합니다.
- 월 1,000만 개 이상의 토큰에서 모델 라우팅은 일반적으로 다음을 제공합니다. 50~70% 비용 절감 일상적인 업무에
프로젝트 유형 토큰 벤치마크 — Monorepo vs. Greenfield vs. Legacy
다양한 프로젝트 원형은 근본적으로 다른 토큰 프로필을 갖습니다. 새 프로젝트 유형을 시작하기 전에 이 표를 사용하여 기대치를 조정하세요.
| 프로젝트 유형 | 일반적인 세션 토큰 범위 | 기본 드라이버 | 주요 최적화 |
|---|---|---|---|
| Greenfield microservice | 15,000–40,000 | Small codebase; frequent new file creation | Low overhead; model selection |
| Monorepo (active feature) | 40,000–120,000 | Large context; cross-module dependencies | Scoped file loading이 중요합니다 |
| Legacy codebase refactor | 60,000–200,000+ | Dense history; exploratory reads; test output | Sub-session 격리; 전처리 후크 |
| Documentation / content | 10,000–25,000 | Prose-heavy; lower code density | Haiku은 대부분의 작업에 충분합니다. |
| CI/CD automation scripting | 20,000–50,000 | Bash-heavy; verbose command output | 출력 잘림을 위한 Preprocessing hooks |
Legacy refactors 토큰 오버런에 대한 위험이 가장 높은 컨텍스트입니다. 작업의 탐구적 성격이 매우 복잡해졌습니다. 첫날부터 하위 세션 규율과 전처리 후크를 적용합니다.
EasyClaw이 토큰 효율성에서 승리하는 이유
EasyClaw은 데스크톱 기반 AI 에이전트로 구축되었습니다. 즉, 브라우저 기반 도구를 괴롭히는 클라우드 오버헤드, 컨텍스트 팽창 및 예측할 수 없는 세션 제한 없이 작동한다는 의미입니다. 모든 세션은 로컬로 유지되고, 모든 컨텍스트 창은 사용자가 제어할 수 있으며, 인프라를 소유하고 있으므로 이 가이드의 모든 최적화를 구현하기가 더 쉽습니다.
- 워크플로 레이어에 기본 사전 처리 후크가 내장되어 있어 맞춤 래퍼가 필요하지 않습니다.
- 즉시 사용 가능한 작업별 모델 라우팅 — 작업 복잡성에 따라 Haiku, Sonnet 또는 Opus를 자동으로 할당합니다.
- CLAUDE.md와 동등한 프로젝트 구성(프로젝트 구성)은 설계상 간결하게 유지됩니다. 자유 형식 텍스트가 아닌 구조화된 필드입니다.
- Sub-session 격리는 최고 수준의 기능입니다. 작업 경계는 수동이 아닌 명시적입니다.
- 예상치 못한 제한이 있는 계획은 없습니다. 로컬 컴퓨팅, 한계
Frequently Asked Questions
Q: /clear는 실제로 토큰을 저장합니까, 아니면 디스플레이만 재설정합니까?
A: 실제로 토큰을 절약합니다. /clear는 매 턴마다 다시 전송되는 대화 기록을 지웁니다. 시스템 프롬프트와 CLAUDE.md는 여전히 다시 주입되지만, 긴 세션에서 대부분의 토큰 축적이 발생하는 증가하는 기록 페이로드를 제거합니다. 10회 이상의 턴이 있는 세션의 경우 다음 작업에서 수만 개의 토큰을 절약할 수 있습니다.
Q: 조절 보고서를 고려할 때 Claude Code은 2026년 Pro 계획에서 그만한 가치가 있습니까?
A: 가벼운 수준에서 보통 수준의 일일 사용(하루 5~6회 집중 세션 미만)의 경우 Pro는 여전히 가치를 제공합니다. 하루 종일 Claude Code을 기본 코딩 환경으로 실행하는 헤비 사용자의 경우 2026년 초에 보고된 액세스 제한으로 인해 Max 플랜 또는 API 액세스가 더욱 안정적인 선택이 됩니다. 작업 도중에 세션 벽에 부딪힐지 여부를 예측할 수 없으면 Pro의 정액 요금 단순성은 가치가 떨어집니다.
Q: 특정 작업에 사용할 모델 계층을 어떻게 알 수 있나요?
A: 유용한 경험 법칙: 작업에 진정한 추론, 구조적 판단 또는 창의적인 문제 해결이 필요한 경우 Sonnet 또는 Opus를 사용하십시오. 검색, 서식 지정, 이름 바꾸기, 명확한 사양에 따른 상용구 생성 등 기계적인 작업인 경우 Haiku를 사용하세요. 의심스러우면 하이쿠부터 시작해 보세요. 출력 품질이 충분하지 않으면 에스컬레이션하세요. 대부분의 개발자는 Haiku이 얼마나 많은 것을 처리할 수 있는지 보고 놀랐습니다.
Q: API를 직접 사용하지 않고 전처리 후크를 구현할 수 있습니까?
A: Full 사전 처리 후크에는 도구 출력이 컨텍스트에 다시 삽입되기 전에 이를 가로채야 하기 때문에 API 액세스가 필요합니다. Claude Code UI 내에서 가장 가까운 것은 bash 출력을 수동으로 자르고(예: head -n 50에 대한 파이프 명령) 읽고 싶은 파일 섹션을 명시하는 것입니다. 강력하지는 않지만 도구 호출 토큰 비용을 줄이는 데 의미가 있습니다.
Q: 프롬프트 캐싱은 어떻게 작동하며 설정할 가치가 있나요?
A: 프롬프트 캐싱은 Anthropic이 시스템 프롬프트 또는 공유 문서와 같은 반복되는 정적 입력에 대해 이전에 계산된 컨텍스트를 재사용할 수 있게 해주는 API 기능입니다. 캐시 적중 비용은 새로운 토큰 처리보다 약 10배 저렴합니다. 동일한 시스템 프롬프트가 하루에 수천 번 전송되는 기업 워크플로의 경우 상당한 절감 효과가 있습니다. 개별 개발자의 경우 대규모로 자동화하지 않는 한 일반적으로 설정의 복잡성은 가치가 없습니다.
Q: 대부분의 Claude Code 사용자가 토큰과 관련하여 저지르는 가장 큰 실수는 무엇입니까?
A: /clear을 사용하지 않고 하루 종일 연속 세션 1개를 실행합니다. 20회 이상의 턴을 누적하는 세션의 복합 기록 비용은 겉보기에 작은 작업에서도 다른 모든 최적화를 왜소하게 만듭니다. /clear 습관을 올바르게 갖추면 그 밖의 모든 것은 탄탄한 기반 위에 점진적인 개선이 됩니다.
최종 평결 — 5분 토큰 감사 체크리스트
다음 Claude Code 세션 전에 이를 실행해 보세요.
상황 위생
- ☐ CLAUDE.md는 800개 토큰 미만인가요? 직접적인 지시가 아닌 것은 모두 제거하십시오.
- ☐ 이 작업에 필요한 특정 파일만 로드하고 있습니까?
- ☐ 마지막 개별 작업 이후 /clear를 사용하셨나요?
모델 선택
- ☐ 이 작업이 실제로 Sonnet/Opus를 보증할 만큼 충분히 복잡한가요?
- ☐ Haiku이 이 단계를 처리할 수 있습니까? (서식, 검색, 상용구 - 예)
세션 구조
- ☐ 이것은 2~3개의 하위 세션으로 나누어야 하는 하나의 큰 작업인가요?
- ☐ 한 번에 여러 부분으로 구성된 질문을 하시나요?
고급(API에 있는 경우)
- ☐ 시스템 프롬프트가 캐시되어 있나요?
- ☐ 주입 전에 bash 출력이 잘리나요?
- ☐ 워크플로별 비용 귀속이 있나요?
Plan awareness: Pro를 사용하는 경우 Claude Code 액세스를 잠재적으로 할당된 것으로 간주하세요. 스프린트 도중에 액세스 벽에 부딪히기 전에 Max 플랜의 비용이 현재 사용량 수준에 의해 정당화되는지 고려하십시오.
현재 대부분의 사용자가 수행할 수 있는 가장 영향력 있는 변경 사항은 다음과 같습니다. 작업 간에 /clear을 사용하고 모놀리식 종일 세션 실행을 중지합니다.. 다른 모든 것은 그 기초 위에 세워집니다.
Claude Code의 토큰 최적화는 AI를 덜 사용하는 것이 아닙니다. 그것은 정확하게 사용하는 것입니다. 따라서 각 세션은 현재 사용 중인 계획의 제약 내에서 최대 가치를 제공합니다.