Přeskočit na obsah

Lekce 02.7: Kolik to stálo? (How Much Did It Cost?)

⏱️ 3 min čtení Lekce 02.7

🧠 Mentální model & teoretický rozbor

Protože je model bezestavový a při každém dalším tahu se celá historie odesílá znovu, spotřeba tokenů neroste lineárně ($N$), ale v čase má kumulativní charakter:

$$ ext{Celkové tokeny} pprox \sum_{i=1}^{M} ( ext{Prefix} + ext{Historie}_i + ext{Soubory}_i)$$

Tahy v rámci jednoho sezení:
Tah 1: [Instrukce 5k] + [Vstup 1k] = 6 000 tokenů
Tah 2: [Instrukce 5k] + [Tah 1 (6k)] + [Soubor A 10k] = 21 000 tokenů
Tah 3: [Instrukce 5k] + [Tahy 1-2 (21k)] + [Výstup testu 15k] = 41 000 tokenů
Tah 4: [Instrukce 5k] + [Tahy 1-3 (41k)] + [Soubor B 20k] = 66 000 tokenů
─────────────────────────────────────────────────────────────────────────────
Celkem odesláno na API během pouhých 4 tahů: 134 000 tokenů!

Prompt Caching: Zachránce peněženky

Anthropic zavedl technologii Prompt Caching:

  • Pokud se úvodní část kontextu (systémový prompt, CLAUDE.md, definice nástrojů) mezi požadavky nezmění, server si zprocesované tokeny uloží do rychlé paměti na 5 minut.
  • Cena za cachovaný vstupní token je o 90 % nižší než za čerstvý token!
  • Jakmile však změníte začátek kontextu, cache se zneplatní (cache miss) a platíte plnou sazbu.

🏢 Realistický scénář z praxe

Firma nasadila Claude Code pro 10 vývojářů bez inženýrského proškolení:

  • Vývojáři nechávali sezení běžet celý den, do kontextu tahali 10MB CSV soubory a nespouštěli /clear.
  • Účet za API za první měsíc: $3 400.
  • Po zavedení inženýrských pravidel kurzu (čistá sezení pro každý ticket, limity na výstupy testů, využívání Prompt Cache):
  • Účet za druhý měsíc při stejném objemu odvedené práce: $380 (pokles o téměř 90 %!).

💻 Konkrétní ukázky kódu & promptů

Sledování financí přímo v Claude Code:

Terminál
# Zobrazení detailního rozpisu nákladů
/cost

Výstup příkazu:

Cost details for this session:
┌────────────────────────┬─────────────┬───────────┐
│ Category │ Tokens │ Cost │
├────────────────────────┼─────────────┼───────────┤
│ Base Input Tokens │ 4,200 │ $0.0126 │
│ Cache Write Tokens │ 8,500 │ $0.0318 │
│ Cache Read Tokens │ 142,000 │ $0.0426 │ <── 90% sleva díky cache!
│ Output Tokens │ 1,850 │ $0.0277 │
├────────────────────────┼─────────────┼───────────┤
│ Total Session Cost │ │ $0.1147 │
└────────────────────────┴─────────────┴───────────┘

⚠️ Analýza selhání & Anti-patterns

Anti-pattern: Editace CLAUDE.md uprostřed rozdělaného sezení

Pokud uprostřed dlouhého sezení upravíte soubor CLAUDE.md:

  • Zneplatníte cache marker na samém začátku kontextu.
  • V dalším tahu musí server znovu zaindexovat celých 80 000 tokenů za plnou cenu.
  • Pravidlo: Systémová pravidla upravujte mezi sezeními, ne uprostřed práce.

🛠️ Inženýrský postup krok za krokem (Playbook)

  1. Hlídejte Cache Hit Rate: Chcete, aby naprostá většina vašich input tokenů spadala do kategorie Cache Read.
  2. Filtrujte výstupy příkazů:
    • npm test | head -n 30 (stojí 300 tokenů).
    • npm test bez filtru (může stát 25 000 tokenů).
  3. Pravidelný reset: Každý /clear ušetří na následujících tazích desítky tisíc zbytečných tokenů.

🧪 Praktické cvičení (Hands-on Lab)

Úkol:

Spočítejte si reálnou finanční úsporu díky prompt cachingu.

Kroky:

  1. Spusťte claude a zadejte dotaz na architekturu repozitáře.
  2. Zkontrolujte /cost.
  3. Položte doplňující otázku.
  4. Znovu zkontrolujte /cost a podívejte se na řádek Cache Read Tokens.
  5. Vypočítejte, kolik by vás tento krok stál bez podpory mezipaměti!