Tak, Claude Sonnet 5.5 może obniżyć koszt pracy z kodem i dokumentami, ale nie dlatego, że potaniał pojedynczy token. Anthropic utrzymał w API tę samą stawkę co dla Sonnet 5: 2 dolary za milion tokenów wejściowych i 10 dolarów za milion wyjściowych. Firma deklaruje do 30% niższy koszt typowego zadania, ponieważ nowy model ma zużywać mniej tokenów i wykonywać mniej kroków. To obietnica dotycząca kosztu ukończonej pracy, nie gwarantowany rabat dla każdego zapytania. Ten tekst jest dla programistów i pracowników wiedzy, którzy wybierają model do codziennych zadań i chcą wiedzieć, czy warto przełączyć własne procesy.

Anthropic ogłosił Sonnet 5.5 28 września 2026 r. i zapowiedział, że generuje odpowiedzi o ponad 30% szybciej od Sonnet 5. Firma kieruje go do naprawiania błędów, zadań programistycznych o jasno określonym zakresie oraz tworzenia dokumentów, prezentacji i arkuszy. Te parametry opisują stanowisko producenta; o oszczędności w konkretnym zespole rozstrzygną używane prompty, narzędzia, poziom kontroli i liczba poprawek. (Anthropic: ogłoszenie Claude Sonnet 5.5)

Cena tokena nie spadła

W API milion tokenów wejściowych Sonnet 5.5 kosztuje 2 dolary, a milion wyjściowych — 10 dolarów. Stawki są takie same jak w Sonnet 5; dla porównania tokeny Opus 5.5 kosztują dwa razy więcej. Przy tej samej liczbie tokenów rachunek za Sonnet 5.5 i Sonnet 5 będzie więc taki sam. Krótszy czas generowania poprawia czas oczekiwania, ale sam w sobie nie obniża faktury naliczanej od tokenów. (Anthropic: cennik Claude Platform)

Rachunek może spaść, jeśli model dojdzie do poprawnego wyniku mniejszą liczbą tokenów, wywoła mniej narzędzi albo wymaga mniej powtórzeń. Anthropic twierdzi, że Sonnet 5.5 jest pod tym względem wydajniejszy od Sonnet 5, a w swoich wykresach kosztu zadania pokazuje lepszy stosunek wyniku do ceny na wybranych benchmarkach. „Do 30% mniej” należy czytać jako deklarację dla typowych obciążeń producenta, nie przewidywanie każdej faktury. Koszt zależy od rzeczywistego użycia, a w narzędziach agentowych liczą się także ponawiane kroki i zawartość przekazywana między nimi. (Anthropic: ogłoszenie Claude Sonnet 5.5; dokumentacja cen API)

Co benchmarki mówią o programowaniu

W tabeli Anthropic Sonnet 5.5 uzyskał 70,6% w Terminal-Bench 4.0, teście wieloetapowych zadań wykonywanych w terminalu. Sonnet 5 zdobył w tej tabeli 10,3%. W CursorBench 4.0, który korzysta z niejednoznacznych zadań wieloplikowych z prawdziwych sesji programistycznych, wyniki wyniosły odpowiednio 55,5% i 34,1%. Anthropic podaje też, że nowy model na FrontierCode osiąga wynik o 10 punktów wyższy od Sonnet 5 przy ustawieniu High. Są to wyniki testów producenta, a nie gwarancja, że każde zadanie w konkretnym repozytorium zakończy się szybciej lub bez poprawek. (Anthropic: ogłoszenie Claude Sonnet 5.5)

Niezależny serwis Vals AI podaje 64,14% dla Sonnet 5.5 w Terminal-Bench 4.0, mniej niż wynik Anthropic. Karta Vals pokazuje ustawienie maksymalnego wysiłku obliczeniowego, więc nie należy traktować tych dwóch pomiarów jako identycznego eksperymentu ani wybierać wygodniejszej liczby. Rozsądny wniosek jest węższy: model osiąga wysoki wynik w teście programistycznym, ale wielkość przewagi zależy od konfiguracji i sposobu pomiaru. (Vals AI: benchmarki Claude Sonnet 5.5; Anthropic: tabela testów)

Dla pracy zespołu warto sprawdzić nie samą jakość wygenerowanego kodu, lecz koszt przyjętego rozwiązania: czy testy przechodzą, ile poprawek dopisuje programista, ile razy agent wraca do terminala i jaki rachunek powstał do chwili, gdy zmiana jest gotowa do przeglądu. Sonnet 5.5 wygląda obiecująco przy naprawach błędów, refaktoryzacjach z jasnym zakresem i implementacji zadań z testami. Przy niejasnej architekturze, dużej zmianie obejmującej wiele zależności lub wymagającym osądzie warto porównać go z Opus — Anthropic sam wskazuje, że Opus pozostaje mocniejszy w złożonej, otwartej pracy wymagającej długotrwałego osądu. (Anthropic: ogłoszenie Claude Sonnet 5.5)

A co z dokumentami i analizą?

Tu ważny jest benchmark GDPval-AA. Ocenia on zadania z 44 zawodów i 9 branż; modele mają tworzyć między innymi dokumenty, slajdy, diagramy i arkusze. W tabeli Anthropic Sonnet 5.5 uzyskał 1844 punkty, a Opus 5.5 — 1846, przy wyniku Sonnet 5 równym 1449. Niezależna tabela Artificial Analysis również plasuje Sonnet 5.5 w ścisłej czołówce tego benchmarku. Anthropic zaznacza, że Artificial Analysis testowało wersję przedpremierową z błędem, który mógł pogarszać odpowiedzi wymagające ustrukturyzowanych danych; producent twierdzi, że błąd naprawiono, a jego wpływ na wyniki powinien być niewielki. Zastrzeżenie to pochodzi od Anthropic. Wyniki wspierają tezę, że Sonnet 5.5 może wystarczyć do wielu zadań biurowych, ale nie dowodzą, że dorówna Opus w każdym dokumencie lub każdej analizie. (Anthropic: wyniki GDPval-AA i zastrzeżenie o wersji testowej; Artificial Analysis: tabela GDPval-AA)

Praktyczne przykłady to streszczenie materiałów źródłowych, przygotowanie pierwszej wersji raportu, uporządkowanie danych w arkuszu albo prezentacja oparta na dostarczonym szablonie. Warto policzyć czas redakcji i sprawdzić źródła, liczby oraz zgodność z formatem, zamiast uznać samą szybkość odpowiedzi za oszczędność. Benchmark ocenia jakość zadania w określonym zestawie warunków; nie uwzględni wszystkich wymagań stylu, wiedzy wewnętrznej ani procesu akceptacji w twojej organizacji. Opis AA-Briefcase, innego testu pracy wiedzy, obejmuje wieloetapowe projekty biznesowe z wynikami takimi jak arkusze, prezentacje i notatki, więc dobrze ilustruje, dlaczego testy rzeczywistych produktów pracy są bardziej użyteczne niż sam quiz wiedzy. (Artificial Analysis: opis AA-Briefcase)

Jak sprawdzić koszt we własnym workflow

Zacznij od pakietu zadań, które regularnie wracają: typowych zmian w kodzie i dokumentów lub analiz. Uruchom je na Sonnet 5 i Sonnet 5.5 przy tych samych danych, ograniczeniach i kryteriach akceptacji. Zapisz koszt tokenów, czas do gotowego wyniku, liczbę wywołań narzędzi oraz ilość pracy potrzebnej na poprawki. Oceniaj zadania równolegle, jeśli to możliwe, żeby pamięć o wcześniejszej odpowiedzi nie wpływała na ocenę.

Sprawdź też poziom wysiłku. Anthropic ustawia Medium jako domyślny poziom w Claude Code i aplikacjach, a High w Claude Platform; niższy poziom ma odpowiadać szybciej i zużywać mniej tokenów, wyższy poświęcać więcej czasu na rozumowanie i sprawdzenie odpowiedzi. Zacznij od domyślnego ustawienia, a następnie porównaj je z niższym dla prostych i wyższym dla krytycznych zadań. (Anthropic: opis poziomów wysiłku i cen)

Werdykt: Claude Sonnet 5.5 może obniżyć koszt API na ukończone zadanie, jeżeli rzeczywiście zużyje mniej tokenów i kroków przy zachowaniu potrzebnej jakości. Stawka tokenowa nie spadła. Benchmarki dają dobry powód, by przetestować nowy model jako domyślny wybór do jasno określonego kodowania i pracy z dokumentami, a rachunki i jakość własnych zadań rozstrzygną, czy obietnica producenta sprawdza się w praktyce.

Źródła

  1. Introducing Claude Sonnet 5.5anthropic.com
  2. Pricing — Claude Platform Docsplatform.claude.com
  3. Claude Sonnet 5.5 Benchmarks, Cost and Capabilitiesvals.ai
  4. GDPval-AA v2.1 Leaderboardartificialanalysis.ai
  5. AA-Briefcase v1.1: Agentic Knowledge Work Benchmarkartificialanalysis.ai

Autor The Prompt. Rozwija Czatowy, Sklepowy i TerazRobot.