Przejdź do treści
← Blog

Tokeny i okno kontekstu

21 lip 2026 · RS Management

W skrócie

  • Rachunek rośnie nie przez liczbę zapytań, tylko przez ich rozmiar.
  • Największą pojedynczą oszczędność daje zwykle pamięć podręczna promptu, pod warunkiem że stała część promptu jest naprawdę stała. Odczyt kosztuje dziesiątą część ceny zwykłego wejścia.
  • Reszta technik ustawia się w kolejności od godzin do tygodni wdrożenia.

Rachunek za AI rzadko rośnie dlatego, że zespół nagle zaczął zadawać więcej pytań. Częściej rośnie dlatego, że każde pytanie z osobna stało się droższe. Modele rozliczają się z tokenów, czyli kawałków tekstu wchodzących do modelu i z niego wychodzących, a większość organizacji nie wie, ile tokenów faktycznie wysyła przy jednym zapytaniu. Bez tej wiedzy optymalizacja sprowadza się do zgadywania. Narzędzie do policzenia tego stoi po stronie dostawcy: Anthropic udostępnia osobną funkcję zliczającą tokeny jeszcze przed wysłaniem zapytania.

Dlaczego kontekst puchnie sam z siebie

Za większość wzrostu odpowiadają trzy mechanizmy.

  • Rozmowa z modelem jest bezstanowa. Model nie pamięta poprzedniej tury, więc aplikacja przy każdym kolejnym pytaniu wysyła całą dotychczasową historię od nowa. Dziesiąta wiadomość kosztuje wielokrotnie więcej niż pierwsza, choć użytkownik napisał dokładnie tyle samo.
  • Instrukcje powtarzają się w każdym wywołaniu. Polecenie systemowe z opisem roli, zasadami, przykładami i definicjami narzędzi potrafi mieć kilka tysięcy tokenów i jedzie z każdym zapytaniem, także z tym, które dałoby się obsłużyć jednym zdaniem.
  • Dokumenty wklejane w całości. Ktoś wrzuca 80-stronicowy regulamin, żeby zapytać o jeden paragraf. Płacimy za 80 stron, i to przy każdym kolejnym pytaniu o ten sam dokument. Okna kontekstu sięgają dziś 1 mln tokenów1, ale za duże okno też trzeba zapłacić. Płaci się za to, co się w nim faktycznie umieści.

Te trzy mechanizmy nakładają się na siebie i to jest sedno problemu. Historia rośnie z każdą turą, instrukcja systemowa jedzie przy każdej z nich, a wklejony dokument powiela się razem z historią. Rachunek rośnie więc nie liniowo, tylko szybciej, mimo że zespół zadaje dokładnie tyle samo pytań co miesiąc temu.

Pamięć podręczna promptu

Jeśli duża część promptu jest za każdym razem identyczna, dostawcy pozwalają zapamiętać ją po swojej stronie. W API (interfejs programistyczny) Anthropic odczyt z pamięci podręcznej kosztuje 10% ceny zwykłego wejścia2, a utworzenie wpisu 1,25 raza tej ceny przy pięciominutowym czasie życia albo dwa razy przy godzinnym (stan na sierpień 2026). Przy krótszym wariancie mechanizm wychodzi na zero już przy drugim wywołaniu tego samego prefiksu, przy godzinnym potrzebne są co najmniej trzy. U innych dużych dostawców logika jest zbliżona, choć czas życia wpisu i dopłata za zapis różnią się między platformami, więc każdy cennik trzeba sprawdzić osobno.

Technika Nakład wdrożenia Kiedy się zwraca
Pamięć podręczna promptu Godziny Od drugiego wywołania tego samego prefiksu
Skrócenie instrukcji systemowej Godziny Natychmiast, przy każdym zapytaniu
Routing zadań do tańszych modeli Dni Przy stałym wolumenie rutynowych zadań
Przetwarzanie wsadowe Dni Gdy odpowiedź nie musi być natychmiastowa
Streszczanie historii rozmowy Tygodnie Przy długich sesjach z powracającym kontekstem

Jest przy tym haczyk, który w praktyce psuje więcej wdrożeń niż wszystko inne razem. Dopasowanie działa na prefiksie, znak po znaku. Wystarczy, że na początku promptu systemowego znajdzie się aktualna data, identyfikator sesji albo imię użytkownika, i cała reszta przestaje się zapisywać. Jedna zmiana unieważnia wszystko, co jest za nią. Stąd prosta zasada projektowa: treść stała idzie na początek, treść zmienna na koniec.

Dwa ograniczenia warto znać zawczasu. Bardzo krótkie prompty w ogóle nie trafiają do pamięci podręcznej, a próg zależy od modelu i mieści się mniej więcej między 512 a 4096 tokenami. Druga rzecz jest najczęściej mylona: rabat obejmuje wyłącznie wejście. Tokeny wygenerowane przez model kosztują tyle samo co zwykle, więc każda kalkulacja oszczędności rozciągnięta na wyjście jest zawyżona.

Streszczanie zamiast przewijania historii

W dłuższych rozmowach i w agentach, które wykonują po kilkadziesiąt kroków, historia rośnie szybciej niż wartość, jaką niesie. Sensowny wzorzec wygląda tak: kilka ostatnich tur zostaje w oryginale, wcześniejsze zamieniamy na zwięzłe streszczenie, a surowe wyniki wywołań narzędzi usuwamy, gdy przestają być potrzebne. Część dostawców, w tym Anthropic, udostępnia to jako gotową funkcję po swojej stronie, część zespołów pisze własną logikę. Efekt jest ten sam: koszt tury przestaje rosnąć liniowo wraz z długością rozmowy.

Kompromis jest jawny. Streszczenie gubi szczegóły, więc trzeba zdecydować, co jest w danym procesie nieutracalne, np. ustalenia z klientem albo numery spraw, i wyłączyć to spod skracania.

Pobieranie zamiast wklejania

Kiedy pytania dotyczą stałego zasobu wiedzy, wklejanie całości przestaje być opłacalne bardzo szybko. Alternatywą jest wyszukiwanie fragmentów i podawanie modelowi tylko tego, co dotyczy pytania. Zwykle nazywa się to RAG, czyli generowanie wspomagane wyszukiwaniem.

Przy kilku dokumentach nie ma o czym mówić, po prostu wklejamy. Przy kilkuset dokumentach i regularnym ruchu różnica robi się rzędu wielkości. Warto policzyć próg dla własnego przypadku, zamiast przyjmować cudzy. Zysk nie jest wyłącznie kosztowy: krótszy, trafniejszy kontekst poprawia też jakość odpowiedzi, bo model nie musi szukać igły w stogu siana.

Routing i sufit na długość odpowiedzi

Tokeny wyjściowe są zwykle kilkukrotnie droższe od wejściowych, a modele mają wyraźną skłonność do rozwlekłości, jeśli nikt nie powie im inaczej. Dwa proste ograniczenia działają natychmiast: twardy limit długości odpowiedzi ustawiony w wywołaniu oraz instrukcja opisująca oczekiwaną formę wyniku. Klasyfikacja nie potrzebuje akapitu uzasadnienia, wystarczy etykieta.

Do tego dochodzi dobór modelu. Zadania rutynowe, czyli formatowanie, klasyfikacja, krótkie ekstrakcje, nie wymagają modelu flagowego. Jeśli wynik nie jest potrzebny natychmiast, warto sprawdzić kolejkę wsadową: w API Anthropic przetwarzanie asynchroniczne kosztuje połowę ceny standardowej, a większość zleceń kończy się w ciągu godziny. Dla nocnych przeliczeń czy masowego przetwarzania dokumentów to najprostsza oszczędność, jaka istnieje.

Najpierw pomiar

Wszystkie te techniki mają wspólny warunek wstępny. Bez rozbicia kosztu na poszczególne procesy i prompty widać wyłącznie jedną liczbę na fakturze, a ona nie mówi, gdzie szukać. Minimalny zestaw wskaźników to liczba tokenów wejściowych i wyjściowych na wywołanie, udział odczytów z pamięci podręcznej, raportowany w API Anthropic osobnym polem odpowiedzi, oraz koszt w rozbiciu na przypadki użycia. Jeśli udział odczytów z pamięci podręcznej uparcie wynosi 0% mimo poprawnej konfiguracji, prawie zawsze oznacza to, że coś zmiennego wkradło się na początek promptu.

Gdzie kończy się optymalizacja

Dwie granice warto postawić świadomie. Pierwsza jest jakościowa: agresywne skracanie kontekstu obniża trafność odpowiedzi, więc każdą zmianę trzeba weryfikować na zestawie testowym, a nie na wrażeniu. Druga dotyczy danych. Treść trafiająca do pamięci podręcznej jest przechowywana po stronie dostawcy przez czas życia wpisu, co w organizacjach z sektorów regulowanych wymaga uzgodnienia z klasyfikacją informacji i z polityką retencji wynikającą z RODO.

Kolejność wdrożenia w większości przypadków wygląda tak samo: najpierw pomiar, potem pamięć podręczna, potem limity długości wyjścia i routing, na końcu przebudowa sposobu podawania wiedzy. Pierwsze dwa kroki bywają najtańsze i najczęściej dają największą część efektu.

Footnotes

  1. Anthropic, zestawienie modeli wraz z rozmiarem okna kontekstu: https://platform.claude.com/docs/en/about-claude/models/overview.

  2. Anthropic, cennik pamięci podręcznej promptu: odczyt 0,1x, zapis 1,25x przy buforze pięciominutowym i 2x przy godzinnym: https://platform.claude.com/docs/en/build-with-claude/prompt-caching.

RS Management to praktyka doradcza prowadzona przez jedną osobę. Kto za nią stoi i z jakim doświadczeniem: O mnie.

Treści na blogu mają charakter informacyjny i edukacyjny. Nie stanowią porady prawnej, podatkowej ani indywidualnego doradztwa biznesowego. Zakres naszych usług opisuje regulamin.

Ten temat prowadzimy w pakiecie Akcelerator AI: 4 h indywidualnej konsultacji + wsparcie między sesjami.

Zobacz pakiet: Akcelerator AI