Lekce 02.7: Kolik to stálo? (How Much Did It Cost?)
🧠 Mentální model & teoretický rozbor
Protože je model bezestavový a při každém dalším tahu se celá historie odesílá znovu, spotřeba tokenů neroste lineárně ($N$), ale v čase má kumulativní charakter:
$$ ext{Celkové tokeny} pprox \sum_{i=1}^{M} ( ext{Prefix} + ext{Historie}_i + ext{Soubory}_i)$$
Tahy v rámci jednoho sezení:Tah 1: [Instrukce 5k] + [Vstup 1k] = 6 000 tokenůTah 2: [Instrukce 5k] + [Tah 1 (6k)] + [Soubor A 10k] = 21 000 tokenůTah 3: [Instrukce 5k] + [Tahy 1-2 (21k)] + [Výstup testu 15k] = 41 000 tokenůTah 4: [Instrukce 5k] + [Tahy 1-3 (41k)] + [Soubor B 20k] = 66 000 tokenů─────────────────────────────────────────────────────────────────────────────Celkem odesláno na API během pouhých 4 tahů: 134 000 tokenů!Prompt Caching: Zachránce peněženky
Anthropic zavedl technologii Prompt Caching:
- Pokud se úvodní část kontextu (systémový prompt,
CLAUDE.md, definice nástrojů) mezi požadavky nezmění, server si zprocesované tokeny uloží do rychlé paměti na 5 minut. - Cena za cachovaný vstupní token je o 90 % nižší než za čerstvý token!
- Jakmile však změníte začátek kontextu, cache se zneplatní (cache miss) a platíte plnou sazbu.
🏢 Realistický scénář z praxe
Firma nasadila Claude Code pro 10 vývojářů bez inženýrského proškolení:
- Vývojáři nechávali sezení běžet celý den, do kontextu tahali 10MB CSV soubory a nespouštěli
/clear. - Účet za API za první měsíc: $3 400.
- Po zavedení inženýrských pravidel kurzu (čistá sezení pro každý ticket, limity na výstupy testů, využívání Prompt Cache):
- Účet za druhý měsíc při stejném objemu odvedené práce: $380 (pokles o téměř 90 %!).
💻 Konkrétní ukázky kódu & promptů
Sledování financí přímo v Claude Code:
# Zobrazení detailního rozpisu nákladů/costVýstup příkazu:
Cost details for this session:┌────────────────────────┬─────────────┬───────────┐│ Category │ Tokens │ Cost │├────────────────────────┼─────────────┼───────────┤│ Base Input Tokens │ 4,200 │ $0.0126 ││ Cache Write Tokens │ 8,500 │ $0.0318 ││ Cache Read Tokens │ 142,000 │ $0.0426 │ <── 90% sleva díky cache!│ Output Tokens │ 1,850 │ $0.0277 │├────────────────────────┼─────────────┼───────────┤│ Total Session Cost │ │ $0.1147 │└────────────────────────┴─────────────┴───────────┘⚠️ Analýza selhání & Anti-patterns
Anti-pattern: Editace CLAUDE.md uprostřed rozdělaného sezení
Pokud uprostřed dlouhého sezení upravíte soubor CLAUDE.md:
- Zneplatníte cache marker na samém začátku kontextu.
- V dalším tahu musí server znovu zaindexovat celých 80 000 tokenů za plnou cenu.
- Pravidlo: Systémová pravidla upravujte mezi sezeními, ne uprostřed práce.
🛠️ Inženýrský postup krok za krokem (Playbook)
- Hlídejte Cache Hit Rate: Chcete, aby naprostá většina vašich input tokenů spadala do kategorie
Cache Read. - Filtrujte výstupy příkazů:
npm test | head -n 30(stojí 300 tokenů).npm testbez filtru (může stát 25 000 tokenů).
- Pravidelný reset: Každý
/clearušetří na následujících tazích desítky tisíc zbytečných tokenů.
🧪 Praktické cvičení (Hands-on Lab)
Úkol:
Spočítejte si reálnou finanční úsporu díky prompt cachingu.
Kroky:
- Spusťte
claudea zadejte dotaz na architekturu repozitáře. - Zkontrolujte
/cost. - Položte doplňující otázku.
- Znovu zkontrolujte
/costa podívejte se na řádekCache Read Tokens. - Vypočítejte, kolik by vás tento krok stál bez podpory mezipaměti!