LLMs i AI Generatywne

Grok 4.6 dogania GPT-5.6 Sol. Najciekawsza jest jednak cena

Grok 4.6 remisuje z GPT-5.6 Sol w zbiorczym rankingu, kosztuje od 2 USD za milion tokenów wejścia i ma lepiej radzić sobie z długą pracą agentową. Sprawdzamy, co naprawdę wynika z premiery xAI.

Autor: 8 min czytania
Stanowisko programistyczne z dwoma monitorami symbolizujące Groka 4.6 i agentów AI

Grok 4.6 nie jest premierą, którą warto sprowadzić do kolejnej poprawki w numerze modelu. Nowy system xAI wszedł do ścisłej czołówki publicznych testów, zrównał się z GPT-5.6 Sol w zbiorczym indeksie Artificial Analysis i zachował cenę znaną z Groka 4.5. Jeszcze kilka tygodni temu podobny zestaw wyników przy stawce 2 dolarów za milion tokenów wejściowych wyglądałby mało prawdopodobnie.

Najważniejsza zmiana dotyczy jednak sposobu pracy. xAI przedstawiło Groka 4.6 jako model do długich zadań agentowych: badania tematu, analizy wielu materiałów, poruszania się po repozytorium i budowania kompletnej aplikacji przez kilkadziesiąt kolejnych kroków. To nie jest więc wyłącznie chatbot, który ma udzielić lepszej odpowiedzi. Ma utrzymać cel, korzystać z narzędzi, sprawdzać własne rezultaty i wracać do problemu, gdy pierwsze rozwiązanie nie działa.

Model został wydany 12 sierpnia 2026 roku. Jest dostępny w API, Grok Build, Cursorze oraz przez partnerów, wśród których xAI wymienia OpenRouter, Vercel i Cloudflare.

Grok 4.6 w skrócie

CechaGrok 4.6
Identyfikator APIgrok-4.6
Data premiery12 sierpnia 2026
Modalnościtekst i obrazy na wejściu, tekst na wyjściu
Kontekst500 tys. tokenów
Cena do 200 tys. tokenów promptu2 USD wejście, 0,50 USD cache, 6 USD wyjście / 1 mln tokenów
Cena od 200 tys. tokenów promptu4 USD wejście, 1 USD cache, 12 USD wyjście / 1 mln tokenów
Poziomy rozumowanialow, medium, high i xhigh
Domyślny poziom rozumowaniahigh
Granica wiedzy1 lutego 2026
Główne zastosowaniakodowanie, agenci, praca wiedzy, projekty interaktywne i wizualne

Warto zwrócić uwagę na próg długiego kontekstu. Podstawowa cena 2/6 USD obowiązuje, dopóki prompt ma mniej niż 200 tys. tokenów. Po przekroczeniu tej granicy wyższa stawka obejmuje wszystkie tokeny w żądaniu, a nie tylko część ponad limit. Przy analizie bardzo dużego repozytorium albo pakietu dokumentów rachunek może więc wzrosnąć skokowo.

xAI oferuje również szybszy wariant modelu w cenie dwukrotnie wyższej od podstawowej. Sama nazwa „fast” nie oznacza jednak innej jakości. To przede wszystkim wybór dla procesów, w których czas odpowiedzi jest ważniejszy od kosztu inferencji.

Co zmieniło się względem Groka 4.5

Grok 4.5 pojawił się zaledwie miesiąc wcześniej i już wtedy przesunął ofertę xAI w stronę kodowania oraz pracy agentowej. Wersja 4.6 rozwija dokładnie ten kierunek, zamiast próbować być zupełnie innym produktem.

Według opisu procesu treningowego nowy model przeszedł dłuższy dodatkowy etap uczenia. xAI wykorzystało dane generowane przez modele do rozumowania i zaawansowanych tematów technicznych, wysokiej jakości dane inżynieryjne oraz poprawiony optymalizator. Następnie Grok 4.5 posłużył do ponownego wygenerowania trajektorii SFT dla różnych poziomów rozumowania, środowisk agentowych i dziedzin, między innymi STEM, inżynierii oprogramowania i pracy wiedzy.

W treningu ze wzmocnieniem znalazły się też zadania z optymalizacji kerneli, tworzenia stron internetowych, projektowania wspomaganego komputerowo i ogólnego kodowania. To pomaga zrozumieć, dlaczego komunikat premierowy tak mocno podkreśla nie pojedynczą odpowiedź, lecz wykonanie całego projektu.

Najbardziej praktyczna obietnica brzmi: Grok 4.6 ma częściej samodzielnie uruchamiać testy i weryfikować wynik na długiej trajektorii. To cenna cecha, ponieważ agent programistyczny nie przegrywa zwykle przez brak znajomości składni. Przegrywa, gdy po kilku zmianach zapomina o pierwotnym celu, nie sprawdza skutków ubocznych albo uznaje zadanie za zakończone zbyt wcześnie.

Benchmarki: remis z GPT-5.6 Sol, ale nie w każdym zadaniu

Najgłośniejsza liczba z premiery to 61 punktów w Artificial Analysis Intelligence Index. Taki sam rezultat ma GPT-5.6 Sol, a Fable 5 Max zdobywa 62 punkty. Axios opisał ten wynik jako wejście SpaceXAI do grupy bezpośrednio za liderem.

Zbiorczy wynik nie mówi jednak, który model najlepiej sprawdzi się w konkretnym procesie. Szczegóły są znacznie ciekawsze:

TestGrok 4.6 HighGrok 4.5 HighGPT-5.6 Sol MaxFable 5 Max
AA Intelligence Index61566162
GDPVal-AA v21753152617281741
CursorBench 3.269,9%66,7%67,2%70,5%
DeepSWE 1.165,9%54,0%73,0%70,0%
FrontierCode 1.1 Extended61,3%56,6%60,6%63,6%
APEX-Agents57,5%47,1%56,7%59,2%
Terminal-Bench 3.026,0%15,7%34,6%34,1%
AA-Briefcase1577131315021574

Tabela nie pokazuje prostego zwycięzcy. Grok 4.6 wyprzedza GPT-5.6 Sol w CursorBench, FrontierCode, APEX-Agents i długiej pracy wiedzy AA-Briefcase. Model OpenAI ma jednak dużą przewagę w DeepSWE oraz Terminal-Bench, czyli testach ważnych dla trudnego kodowania i pracy w terminalu. Fable 5 pozostaje bardzo mocny i wygrywa kilka zestawień, choć jego cena jest znacznie wyższa.

Wniosek nie powinien więc brzmieć „Grok jest lepszy od GPT”. Rozsądniej powiedzieć, że Grok 4.6 znalazł się w tej samej klasie modeli, ale ma inny profil mocnych stron i znacznie niższą cenę bazową.

Dlaczego benchmarki agentów trzeba czytać ostrożnie

W klasycznym teście model dostaje pytanie i zwraca odpowiedź. W teście agenta wynik zależy od znacznie większej liczby elementów: instrukcji systemowej, dostępnych narzędzi, zarządzania kontekstem, liczby prób, kompresji historii i reguł weryfikacji.

To szczególnie ważne w przypadku CursorBench. Grok był rozwijany przy ścisłej współpracy z Cursorem, a proces treningowy obejmował trajektorie z różnych środowisk agentowych. Dobry wynik nadal ma znaczenie, ale nie należy udawać, że mierzy wyłącznie „surową inteligencję” modelu. Mierzy jakość całego działającego układu.

xAI zaznacza również, że wyniki konkurentów pochodzą z kart systemowych producentów albo publicznych rankingów i są najlepszymi dostępnymi rezultatami. Poszczególne modele mogą działać na różnych poziomach wysiłku i z innym zestawem narzędzi. Dlatego przed migracją produkcyjnego procesu warto przygotować własny zestaw 20-50 powtarzalnych zadań i mierzyć:

  • odsetek zadań ukończonych bez ręcznej poprawki;
  • liczbę wywołań narzędzi i nawrotów;
  • całkowity koszt zadania, a nie tylko cenę miliona tokenów;
  • czas do wyniku, który przechodzi testy i przegląd;
  • stabilność odpowiedzi przy ponownym uruchomieniu.

Cena może być największą przewagą Groka 4.6

Podstawowa stawka Groka 4.6 nie zmieniła się względem wersji 4.5: 2 USD za milion tokenów wejścia i 6 USD za milion tokenów wyjścia. Dla agentów, które wielokrotnie czytają pliki i wracają do tych samych fragmentów kontekstu, ważny jest również cache wejścia kosztujący 0,50 USD.

Niska cena tokena nie gwarantuje jednak taniego zadania. Model może wykonać więcej kroków, wygenerować dłuższe rozumowanie albo kilka razy wrócić do tej samej operacji. W praktyce należy liczyć:

koszt modelu × wzrost kontekstu × liczba kroków × koszt nieudanych prób

Grok 4.6 wygląda interesująco, ponieważ publiczne wyniki sugerują nie tylko tańsze tokeny, lecz także konkurencyjną skuteczność w długich procesach. Jeśli model potrzebuje podobnej lub mniejszej liczby kroków niż drożsi rywale, oszczędność zaczyna być realna. Jeżeli trzeba po nim wielokrotnie poprawiać kod, przewaga szybko znika.

Do czego Grok 4.6 ma najwięcej sensu

Na podstawie specyfikacji i pierwszych testów model warto rozważyć przede wszystkim w czterech sytuacjach.

  1. Duże zmiany w repozytorium. Kontekst 500 tys. tokenów i nacisk na długą trajektorię pasują do zadań obejmujących wiele plików, migracje i pracę z testami.
  2. Budowanie pierwszej wersji aplikacji. xAI pokazuje Groka jako model, który potrafi przejść od ogólnego pomysłu do działającego interfejsu i później go udoskonalać.
  3. Praca wiedzy. Wysokie wyniki GDPVal-AA i AA-Briefcase sugerują, że model może być użyteczny przy raportach, analizach i przygotowywaniu złożonych materiałów.
  4. Procesy wrażliwe na koszt. Cena może pozwolić na częstsze uruchamianie agenta, dodatkową weryfikację albo obsługę większej liczby zadań w tym samym budżecie.

Nie jest to natomiast automatyczny wybór do każdego zadania terminalowego. Wynik Terminal-Bench pokazuje, że GPT-5.6 Sol i Fable 5 nadal mają wyraźną przewagę w części trudnych scenariuszy. Model nie ma też wbudowanej wiedzy o wydarzeniach po 1 lutego 2026 roku. Aktualne informacje wymagają włączenia narzędzi Web Search lub X Search, które są rozliczane osobno.

Dostępność i integracja

Grok 4.6 można wywołać w API pod identyfikatorem grok-4.6. Obsługuje wywoływanie funkcji, uporządkowane odpowiedzi i regulowany poziom rozumowania. Przyjmuje tekst oraz obrazy, ale generuje tekst.

Poza API model trafił do Grok Build i Cursora. xAI wymienia także OpenRouter, Vercel i Cloudflare. W pierwszym tygodniu firma oferuje dwukrotnie większe uwzględnione użycie w Grok Build oraz Cursorze, więc jest to promocja czasowa, a nie stały element cennika.

Dla zespołów migrujących z Groka 4.5 dobra wiadomość jest prosta: cennik bazowy pozostał bez zmian. Mimo to warto sprawdzić zachowanie na każdym poziomie reasoning_effort. high jest ustawieniem domyślnym, lecz rutynowe klasyfikacje i proste poprawki mogą działać taniej na low lub medium, a najtrudniejsze zadania skorzystać z xhigh.

Czy Grok 4.6 zmienia układ sił

Tak, choć nie dlatego, że rozstrzyga wyścig jednym rekordem. Grok 4.6 pokazuje, że model kosztujący 2/6 USD może wejść do tej samej rozmowy co GPT-5.6 Sol i Fable 5. Jeszcze ważniejsze jest to, że xAI przestało koncentrować się wyłącznie na efektownych odpowiedziach Groka i buduje model pod pracę, którą da się ocenić: kod, dokument, raport albo działającą aplikację.

Na dziś najuczciwsza ocena brzmi: Grok 4.6 jest bardzo mocnym kandydatem dla długich agentów i zespołów kontrolujących koszt, ale nie zastępuje automatycznie GPT-5.6 Sol ani Fable 5 we wszystkich zadaniach. W terminalu nadal widać słabsze miejsca. W kodowaniu wewnątrz Cursora, pracy wiedzy i cenie model ma argumenty, których nie da się już zbyć jako marketingu.

To właśnie konkurencja cenowa może okazać się najważniejszym skutkiem premiery. Gdy kilka modeli osiąga zbliżony poziom, wygrywa nie ten z najdłuższym słupkiem na jednej planszy, lecz ten, który kończy rzeczywistą pracę przy akceptowalnym koszcie i liczbie poprawek.

(Zdjęcie: Farzad Nazifi, CC0 1.0 / Wikimedia Commons. Kadrowanie: TreffikAI.)

Udostępnij: