Co się stało
22 września, w odstępie mniej więcej półtorej godziny, dwóch największych dostawców modeli wypuściło nowe wersje i obniżyło ceny. Anthropic wprowadził Claude Opus 5.5: cztery dolary za milion tokenów wejścia i dwadzieścia za wyjście, wobec pięciu i dwudziestu pięciu za Opus 5. OpenAI odpowiedziało serią GPT-6 — Sol kosztuje dwa dolary za wejście i dziesięć za wyjście, Luna dziesięć centów i pięćdziesiąt centów. Stawki Sol są o połowę niższe niż w poprzedniej serii 5.6, a Luna potaniała jeszcze bardziej po stronie wyjścia.
Ważniejsza zmiana stoi jednak w innej kolumnie cennika. Odczyt z cache — czyli ponowne wczytanie kontekstu, który model już przetworzył — kosztuje w Opus 5.5 dwadzieścia centów za milion tokenów zamiast pięćdziesięciu. Dokumentacja Anthropica opisuje to wprost: dotąd każdy model płacił za odczyt z cache jedną dziesiątą ceny wejścia, a Opus 5.5 płaci jedną dwudziestą. Fable 5.1 zszedł jeszcze niżej, do jednej czterdziestej. Stały mnożnik, na którym stały wszystkie kalkulacje, przestał być stały.
Po stronie OpenAI odczyt z cache w GPT-6 Sol też kosztuje dwadzieścia centów, a w Lunie jeden cent. Firma podkreśla przy tym, że poprawiła domyślny odsetek trafień w cache, a nie tylko jego cenę. Anthropic w osobnym wpisie z dnia premiery tłumaczy, dlaczego porównywanie stawek za token prowadzi na manowce, i szacuje, że typowe obciążenie na Opus 5.5 kosztuje mniej więcej o dwie piąte mniej niż na Opus 5. To deklaracja producenta, nie niezależny pomiar — sam wpis kończy się radą, żeby policzyć to na własnych zadaniach.
Nasza teza
Oznaczamy jako naszą interpretację: żaden z dostawców nie nazywa tego zmianą strategii. Czytamy to tak, że wojna cenowa przeniosła się z nagłówkowej stawki za token do kolumny, której większość zespołów w ogóle nie ogląda.
Powód jest prosty. Agent, który pracuje w wielu krokach, przy każdym kroku wysyła modelowi całą dotychczasową rozmowę jeszcze raz. W długiej sesji zdecydowana większość tokenów wejścia to ten sam kontekst wczytywany po raz kolejny. Kto płaci za niego pełną stawkę, bo cache mu się nie trafia, płaci wielokrotność tego, co wynika z cennika. Kto ma cache ustawiony dobrze, płaci głównie za wyjście.
Uproszczony rachunek, żeby to było widać. Przyjmijmy sesję agenta, która zużywa dziesięć milionów tokenów wejścia i trzysta tysięcy tokenów wyjścia, i pomińmy koszt pierwszego zapisu do cache. To przykład ilustracyjny, nie pomiar żadnego wdrożenia.
- Opus 5.5, dziewięć dziesiątych wejścia z cache: 4 USD za wejście bez cache, 1,80 USD za odczyty z cache, 6 USD za wyjście — razem 11,80 USD.
- Ta sama sesja na Opus 5.5 bez trafień w cache: 40 USD za wejście i 6 USD za wyjście — razem 46 USD.
- Ta sama sesja na Opus 5, z cache: 17 USD.
- Ta sama sesja na GPT-6 Sol, z cache: 6,80 USD.
Różnica między dwoma dostawcami przy dobrze ustawionym cache to kilka dolarów. Różnica między tym samym modelem z cache i bez niego jest prawie czterokrotna. W tym przykładzie sposób, w jaki zbudowałeś agenta, waży więcej niż to, od kogo kupujesz model.
Stąd wniosek na najbliższy przegląd kosztów. Tabela porównująca dostawców po stawce za milion tokenów wejścia i wyjścia była przybliżeniem już wcześniej, a po 22 września jest po prostu złym narzędziem. W sierpniu pisaliśmy, że premia za najdroższy model ma sufit ustalany przez kupujących. Tamta zmiana dotyczyła wyboru poziomu modelu. Ta dotyczy architektury: rachunek przestaje zależeć głównie od tego, który model wybierzesz, a zaczyna od tego, jak często Twoja aplikacja wczytuje ten sam kontekst od zera.
Dlaczego to ma znaczenie
Private Equity
Jeśli w modelu finansowym spółki portfelowej koszt AI jest liczony jako wolumen tokenów razy stawka z cennika, ta pozycja właśnie straciła sens w obie strony. Może być zawyżona, bo nie uwzględnia cache, albo zaniżona, bo zakłada trafienia, których produkcyjny agent nie osiąga. Na przeglądzie warto zapytać o jedną liczbę: jaka część tokenów wejścia w zeszłym miesiącu była rozliczona jako odczyt z cache. Spółka, która tej liczby nie zna, nie wie też, ile naprawdę kosztuje jej produkt oparty na AI.
Enterprise
Obniżki cen nie przełożą się automatycznie na fakturę. Odczyt z cache jest tani tylko wtedy, gdy początek zapytania jest identyczny między wywołaniami. Każdy znacznik czasu w prompcie systemowym, każda zmiana kolejności narzędzi i każdy dynamiczny nagłówek potrafi go unieważnić. To są decyzje zespołów aplikacyjnych, nie działu zakupów, a negocjacja rabatu z dostawcą nie zastąpi porządku w strukturze zapytań. Do tego dochodzi zmiana modelu: migracja z Opus 5 na Opus 5.5 to nie tylko nowy identyfikator, ale inny mnożnik cache, więc prognoza kosztów po migracji wymaga przeliczenia na nowych zasadach.
MŚP / średni rynek
Dla mniejszej firmy to po prostu dobra wiadomość: ten sam agent od tego tygodnia kosztuje mniej, a przy dobrze ustawionym cache wyraźnie mniej. Nie trzeba zmieniać dostawcy, żeby z tego skorzystać. Jeśli korzystasz z gotowego agenta, zapytaj wykonawcę, czy przełączył go na nowy model i czy cache jest w ogóle włączony. Przy wzorcach z naszej biblioteki produktów to jest pozycja w specyfikacji, sprawdzana przy każdej zmianie modelu, a nie ustawienie domyślne, które ktoś kiedyś zostawił.
Jeden ruch na ten tydzień
Wyciągnij z konsoli dostawcy zużycie z ostatnich trzydziestu dni i rozbij tokeny wejścia na dwie kolumny: rozliczone jako odczyt z cache i rozliczone po pełnej stawce. Jeżeli ta druga kolumna jest większa, masz lepszą okazję do oszczędności niż jakakolwiek zmiana dostawcy — i znajdziesz ją w kodzie własnej aplikacji, nie w cenniku. Potem przelicz jedno typowe zadanie na nowych stawkach, zamiast brać deklarowaną obniżkę na wiarę. Opisz swój przypadek: mailto:[email protected]?subject=Rozmowa%20z%20Aurora%20AI