BLOG · MODELE I INFRA

Wojna cenowa modeli przeniosła się do cache: licz koszt zadania, nie stawkę za token

Modele i infra
  • #modele-i-infra
  • #ceny-modeli
  • #prompt-caching
  • #koszt-inferencji
  • #finops
  • #operator-lens

22 września Anthropic i OpenAI w odstępie półtorej godziny obniżyły ceny modeli: Opus 5.5 za 4/20 USD, GPT-6 Sol za 2/10 USD. Ważniejsza zmiana stoi jednak w kolumnie odczytów z cache, gdzie Opus 5.5 płaci już jedną dwudziestą ceny wejścia zamiast jednej dziesiątej. Dlaczego rachunek za agenta zależy dziś bardziej od architektury niż od dostawcy i jedno ćwiczenie na danych z konsoli.

Adam Wszendybyłoperator-architekt AI

Co się stało

22 września, w odstępie mniej więcej półtorej godziny, dwóch największych dostawców modeli wypuściło nowe wersje i obniżyło ceny. Anthropic wprowadził Claude Opus 5.5: cztery dolary za milion tokenów wejścia i dwadzieścia za wyjście, wobec pięciu i dwudziestu pięciu za Opus 5. OpenAI odpowiedziało serią GPT-6 — Sol kosztuje dwa dolary za wejście i dziesięć za wyjście, Luna dziesięć centów i pięćdziesiąt centów. Stawki Sol są o połowę niższe niż w poprzedniej serii 5.6, a Luna potaniała jeszcze bardziej po stronie wyjścia.

Ważniejsza zmiana stoi jednak w innej kolumnie cennika. Odczyt z cache — czyli ponowne wczytanie kontekstu, który model już przetworzył — kosztuje w Opus 5.5 dwadzieścia centów za milion tokenów zamiast pięćdziesięciu. Dokumentacja Anthropica opisuje to wprost: dotąd każdy model płacił za odczyt z cache jedną dziesiątą ceny wejścia, a Opus 5.5 płaci jedną dwudziestą. Fable 5.1 zszedł jeszcze niżej, do jednej czterdziestej. Stały mnożnik, na którym stały wszystkie kalkulacje, przestał być stały.

Po stronie OpenAI odczyt z cache w GPT-6 Sol też kosztuje dwadzieścia centów, a w Lunie jeden cent. Firma podkreśla przy tym, że poprawiła domyślny odsetek trafień w cache, a nie tylko jego cenę. Anthropic w osobnym wpisie z dnia premiery tłumaczy, dlaczego porównywanie stawek za token prowadzi na manowce, i szacuje, że typowe obciążenie na Opus 5.5 kosztuje mniej więcej o dwie piąte mniej niż na Opus 5. To deklaracja producenta, nie niezależny pomiar — sam wpis kończy się radą, żeby policzyć to na własnych zadaniach.

Nasza teza

Oznaczamy jako naszą interpretację: żaden z dostawców nie nazywa tego zmianą strategii. Czytamy to tak, że wojna cenowa przeniosła się z nagłówkowej stawki za token do kolumny, której większość zespołów w ogóle nie ogląda.

Powód jest prosty. Agent, który pracuje w wielu krokach, przy każdym kroku wysyła modelowi całą dotychczasową rozmowę jeszcze raz. W długiej sesji zdecydowana większość tokenów wejścia to ten sam kontekst wczytywany po raz kolejny. Kto płaci za niego pełną stawkę, bo cache mu się nie trafia, płaci wielokrotność tego, co wynika z cennika. Kto ma cache ustawiony dobrze, płaci głównie za wyjście.

Uproszczony rachunek, żeby to było widać. Przyjmijmy sesję agenta, która zużywa dziesięć milionów tokenów wejścia i trzysta tysięcy tokenów wyjścia, i pomińmy koszt pierwszego zapisu do cache. To przykład ilustracyjny, nie pomiar żadnego wdrożenia.

  • Opus 5.5, dziewięć dziesiątych wejścia z cache: 4 USD za wejście bez cache, 1,80 USD za odczyty z cache, 6 USD za wyjście — razem 11,80 USD.
  • Ta sama sesja na Opus 5.5 bez trafień w cache: 40 USD za wejście i 6 USD za wyjście — razem 46 USD.
  • Ta sama sesja na Opus 5, z cache: 17 USD.
  • Ta sama sesja na GPT-6 Sol, z cache: 6,80 USD.

Różnica między dwoma dostawcami przy dobrze ustawionym cache to kilka dolarów. Różnica między tym samym modelem z cache i bez niego jest prawie czterokrotna. W tym przykładzie sposób, w jaki zbudowałeś agenta, waży więcej niż to, od kogo kupujesz model.

Stąd wniosek na najbliższy przegląd kosztów. Tabela porównująca dostawców po stawce za milion tokenów wejścia i wyjścia była przybliżeniem już wcześniej, a po 22 września jest po prostu złym narzędziem. W sierpniu pisaliśmy, że premia za najdroższy model ma sufit ustalany przez kupujących. Tamta zmiana dotyczyła wyboru poziomu modelu. Ta dotyczy architektury: rachunek przestaje zależeć głównie od tego, który model wybierzesz, a zaczyna od tego, jak często Twoja aplikacja wczytuje ten sam kontekst od zera.

Dlaczego to ma znaczenie

Private Equity

Jeśli w modelu finansowym spółki portfelowej koszt AI jest liczony jako wolumen tokenów razy stawka z cennika, ta pozycja właśnie straciła sens w obie strony. Może być zawyżona, bo nie uwzględnia cache, albo zaniżona, bo zakłada trafienia, których produkcyjny agent nie osiąga. Na przeglądzie warto zapytać o jedną liczbę: jaka część tokenów wejścia w zeszłym miesiącu była rozliczona jako odczyt z cache. Spółka, która tej liczby nie zna, nie wie też, ile naprawdę kosztuje jej produkt oparty na AI.

Enterprise

Obniżki cen nie przełożą się automatycznie na fakturę. Odczyt z cache jest tani tylko wtedy, gdy początek zapytania jest identyczny między wywołaniami. Każdy znacznik czasu w prompcie systemowym, każda zmiana kolejności narzędzi i każdy dynamiczny nagłówek potrafi go unieważnić. To są decyzje zespołów aplikacyjnych, nie działu zakupów, a negocjacja rabatu z dostawcą nie zastąpi porządku w strukturze zapytań. Do tego dochodzi zmiana modelu: migracja z Opus 5 na Opus 5.5 to nie tylko nowy identyfikator, ale inny mnożnik cache, więc prognoza kosztów po migracji wymaga przeliczenia na nowych zasadach.

MŚP / średni rynek

Dla mniejszej firmy to po prostu dobra wiadomość: ten sam agent od tego tygodnia kosztuje mniej, a przy dobrze ustawionym cache wyraźnie mniej. Nie trzeba zmieniać dostawcy, żeby z tego skorzystać. Jeśli korzystasz z gotowego agenta, zapytaj wykonawcę, czy przełączył go na nowy model i czy cache jest w ogóle włączony. Przy wzorcach z naszej biblioteki produktów to jest pozycja w specyfikacji, sprawdzana przy każdej zmianie modelu, a nie ustawienie domyślne, które ktoś kiedyś zostawił.

Jeden ruch na ten tydzień

Wyciągnij z konsoli dostawcy zużycie z ostatnich trzydziestu dni i rozbij tokeny wejścia na dwie kolumny: rozliczone jako odczyt z cache i rozliczone po pełnej stawce. Jeżeli ta druga kolumna jest większa, masz lepszą okazję do oszczędności niż jakakolwiek zmiana dostawcy — i znajdziesz ją w kodzie własnej aplikacji, nie w cenniku. Potem przelicz jedno typowe zadanie na nowych stawkach, zamiast brać deklarowaną obniżkę na wiarę. Opisz swój przypadek: mailto:[email protected]?subject=Rozmowa%20z%20Aurora%20AI

Czytasz nas regularnie? Ustaw nas jako preferowane źródło.

W ustawieniach wyszukiwarki Google możesz dodać aurora-ai.pl jako preferred source — nasze analizy pojawią się wtedy częściej w Twoich wynikach.

ZACZNIJMY

Przynieś proces, nie slajdy.

Jeśli czytasz nasz blog i widzisz tu obszar, w którym chcesz coś poprawić u siebie — napisz. Rozmowę zaczynamy od konkretu.