Grok 4.6 dogania GPT-5.6 Sol. Najciekawsza jest jednak cena
Grok 4.6 remisuje z GPT-5.6 Sol w zbiorczym rankingu, kosztuje od 2 USD za milion tokenów wejścia i ma lepiej radzić sobie z długą pracą agentową. Sprawdzamy, co naprawdę wynika z premiery xAI.

Grok 4.6 nie jest premierą, którą warto sprowadzić do kolejnej poprawki w numerze modelu. Nowy system xAI wszedł do ścisłej czołówki publicznych testów, zrównał się z GPT-5.6 Sol w zbiorczym indeksie Artificial Analysis i zachował cenę znaną z Groka 4.5. Jeszcze kilka tygodni temu podobny zestaw wyników przy stawce 2 dolarów za milion tokenów wejściowych wyglądałby mało prawdopodobnie.
Najważniejsza zmiana dotyczy jednak sposobu pracy. xAI przedstawiło Groka 4.6 jako model do długich zadań agentowych: badania tematu, analizy wielu materiałów, poruszania się po repozytorium i budowania kompletnej aplikacji przez kilkadziesiąt kolejnych kroków. To nie jest więc wyłącznie chatbot, który ma udzielić lepszej odpowiedzi. Ma utrzymać cel, korzystać z narzędzi, sprawdzać własne rezultaty i wracać do problemu, gdy pierwsze rozwiązanie nie działa.
Model został wydany 12 sierpnia 2026 roku. Jest dostępny w API, Grok Build, Cursorze oraz przez partnerów, wśród których xAI wymienia OpenRouter, Vercel i Cloudflare.
Grok 4.6 w skrócie
| Cecha | Grok 4.6 |
|---|---|
| Identyfikator API | grok-4.6 |
| Data premiery | 12 sierpnia 2026 |
| Modalności | tekst i obrazy na wejściu, tekst na wyjściu |
| Kontekst | 500 tys. tokenów |
| Cena do 200 tys. tokenów promptu | 2 USD wejście, 0,50 USD cache, 6 USD wyjście / 1 mln tokenów |
| Cena od 200 tys. tokenów promptu | 4 USD wejście, 1 USD cache, 12 USD wyjście / 1 mln tokenów |
| Poziomy rozumowania | low, medium, high i xhigh |
| Domyślny poziom rozumowania | high |
| Granica wiedzy | 1 lutego 2026 |
| Główne zastosowania | kodowanie, agenci, praca wiedzy, projekty interaktywne i wizualne |
Warto zwrócić uwagę na próg długiego kontekstu. Podstawowa cena 2/6 USD obowiązuje, dopóki prompt ma mniej niż 200 tys. tokenów. Po przekroczeniu tej granicy wyższa stawka obejmuje wszystkie tokeny w żądaniu, a nie tylko część ponad limit. Przy analizie bardzo dużego repozytorium albo pakietu dokumentów rachunek może więc wzrosnąć skokowo.
xAI oferuje również szybszy wariant modelu w cenie dwukrotnie wyższej od podstawowej. Sama nazwa „fast” nie oznacza jednak innej jakości. To przede wszystkim wybór dla procesów, w których czas odpowiedzi jest ważniejszy od kosztu inferencji.
Co zmieniło się względem Groka 4.5
Grok 4.5 pojawił się zaledwie miesiąc wcześniej i już wtedy przesunął ofertę xAI w stronę kodowania oraz pracy agentowej. Wersja 4.6 rozwija dokładnie ten kierunek, zamiast próbować być zupełnie innym produktem.
Według opisu procesu treningowego nowy model przeszedł dłuższy dodatkowy etap uczenia. xAI wykorzystało dane generowane przez modele do rozumowania i zaawansowanych tematów technicznych, wysokiej jakości dane inżynieryjne oraz poprawiony optymalizator. Następnie Grok 4.5 posłużył do ponownego wygenerowania trajektorii SFT dla różnych poziomów rozumowania, środowisk agentowych i dziedzin, między innymi STEM, inżynierii oprogramowania i pracy wiedzy.
W treningu ze wzmocnieniem znalazły się też zadania z optymalizacji kerneli, tworzenia stron internetowych, projektowania wspomaganego komputerowo i ogólnego kodowania. To pomaga zrozumieć, dlaczego komunikat premierowy tak mocno podkreśla nie pojedynczą odpowiedź, lecz wykonanie całego projektu.
Najbardziej praktyczna obietnica brzmi: Grok 4.6 ma częściej samodzielnie uruchamiać testy i weryfikować wynik na długiej trajektorii. To cenna cecha, ponieważ agent programistyczny nie przegrywa zwykle przez brak znajomości składni. Przegrywa, gdy po kilku zmianach zapomina o pierwotnym celu, nie sprawdza skutków ubocznych albo uznaje zadanie za zakończone zbyt wcześnie.
Benchmarki: remis z GPT-5.6 Sol, ale nie w każdym zadaniu
Najgłośniejsza liczba z premiery to 61 punktów w Artificial Analysis Intelligence Index. Taki sam rezultat ma GPT-5.6 Sol, a Fable 5 Max zdobywa 62 punkty. Axios opisał ten wynik jako wejście SpaceXAI do grupy bezpośrednio za liderem.
Zbiorczy wynik nie mówi jednak, który model najlepiej sprawdzi się w konkretnym procesie. Szczegóły są znacznie ciekawsze:
| Test | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench 3.2 | 69,9% | 66,7% | 67,2% | 70,5% |
| DeepSWE 1.1 | 65,9% | 54,0% | 73,0% | 70,0% |
| FrontierCode 1.1 Extended | 61,3% | 56,6% | 60,6% | 63,6% |
| APEX-Agents | 57,5% | 47,1% | 56,7% | 59,2% |
| Terminal-Bench 3.0 | 26,0% | 15,7% | 34,6% | 34,1% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
Tabela nie pokazuje prostego zwycięzcy. Grok 4.6 wyprzedza GPT-5.6 Sol w CursorBench, FrontierCode, APEX-Agents i długiej pracy wiedzy AA-Briefcase. Model OpenAI ma jednak dużą przewagę w DeepSWE oraz Terminal-Bench, czyli testach ważnych dla trudnego kodowania i pracy w terminalu. Fable 5 pozostaje bardzo mocny i wygrywa kilka zestawień, choć jego cena jest znacznie wyższa.
Wniosek nie powinien więc brzmieć „Grok jest lepszy od GPT”. Rozsądniej powiedzieć, że Grok 4.6 znalazł się w tej samej klasie modeli, ale ma inny profil mocnych stron i znacznie niższą cenę bazową.
Dlaczego benchmarki agentów trzeba czytać ostrożnie
W klasycznym teście model dostaje pytanie i zwraca odpowiedź. W teście agenta wynik zależy od znacznie większej liczby elementów: instrukcji systemowej, dostępnych narzędzi, zarządzania kontekstem, liczby prób, kompresji historii i reguł weryfikacji.
To szczególnie ważne w przypadku CursorBench. Grok był rozwijany przy ścisłej współpracy z Cursorem, a proces treningowy obejmował trajektorie z różnych środowisk agentowych. Dobry wynik nadal ma znaczenie, ale nie należy udawać, że mierzy wyłącznie „surową inteligencję” modelu. Mierzy jakość całego działającego układu.
xAI zaznacza również, że wyniki konkurentów pochodzą z kart systemowych producentów albo publicznych rankingów i są najlepszymi dostępnymi rezultatami. Poszczególne modele mogą działać na różnych poziomach wysiłku i z innym zestawem narzędzi. Dlatego przed migracją produkcyjnego procesu warto przygotować własny zestaw 20-50 powtarzalnych zadań i mierzyć:
- odsetek zadań ukończonych bez ręcznej poprawki;
- liczbę wywołań narzędzi i nawrotów;
- całkowity koszt zadania, a nie tylko cenę miliona tokenów;
- czas do wyniku, który przechodzi testy i przegląd;
- stabilność odpowiedzi przy ponownym uruchomieniu.
Cena może być największą przewagą Groka 4.6
Podstawowa stawka Groka 4.6 nie zmieniła się względem wersji 4.5: 2 USD za milion tokenów wejścia i 6 USD za milion tokenów wyjścia. Dla agentów, które wielokrotnie czytają pliki i wracają do tych samych fragmentów kontekstu, ważny jest również cache wejścia kosztujący 0,50 USD.
Niska cena tokena nie gwarantuje jednak taniego zadania. Model może wykonać więcej kroków, wygenerować dłuższe rozumowanie albo kilka razy wrócić do tej samej operacji. W praktyce należy liczyć:
koszt modelu × wzrost kontekstu × liczba kroków × koszt nieudanych prób
Grok 4.6 wygląda interesująco, ponieważ publiczne wyniki sugerują nie tylko tańsze tokeny, lecz także konkurencyjną skuteczność w długich procesach. Jeśli model potrzebuje podobnej lub mniejszej liczby kroków niż drożsi rywale, oszczędność zaczyna być realna. Jeżeli trzeba po nim wielokrotnie poprawiać kod, przewaga szybko znika.
Do czego Grok 4.6 ma najwięcej sensu
Na podstawie specyfikacji i pierwszych testów model warto rozważyć przede wszystkim w czterech sytuacjach.
- Duże zmiany w repozytorium. Kontekst 500 tys. tokenów i nacisk na długą trajektorię pasują do zadań obejmujących wiele plików, migracje i pracę z testami.
- Budowanie pierwszej wersji aplikacji. xAI pokazuje Groka jako model, który potrafi przejść od ogólnego pomysłu do działającego interfejsu i później go udoskonalać.
- Praca wiedzy. Wysokie wyniki GDPVal-AA i AA-Briefcase sugerują, że model może być użyteczny przy raportach, analizach i przygotowywaniu złożonych materiałów.
- Procesy wrażliwe na koszt. Cena może pozwolić na częstsze uruchamianie agenta, dodatkową weryfikację albo obsługę większej liczby zadań w tym samym budżecie.
Nie jest to natomiast automatyczny wybór do każdego zadania terminalowego. Wynik Terminal-Bench pokazuje, że GPT-5.6 Sol i Fable 5 nadal mają wyraźną przewagę w części trudnych scenariuszy. Model nie ma też wbudowanej wiedzy o wydarzeniach po 1 lutego 2026 roku. Aktualne informacje wymagają włączenia narzędzi Web Search lub X Search, które są rozliczane osobno.
Dostępność i integracja
Grok 4.6 można wywołać w API pod identyfikatorem grok-4.6. Obsługuje wywoływanie funkcji, uporządkowane odpowiedzi i regulowany poziom rozumowania. Przyjmuje tekst oraz obrazy, ale generuje tekst.
Poza API model trafił do Grok Build i Cursora. xAI wymienia także OpenRouter, Vercel i Cloudflare. W pierwszym tygodniu firma oferuje dwukrotnie większe uwzględnione użycie w Grok Build oraz Cursorze, więc jest to promocja czasowa, a nie stały element cennika.
Dla zespołów migrujących z Groka 4.5 dobra wiadomość jest prosta: cennik bazowy pozostał bez zmian. Mimo to warto sprawdzić zachowanie na każdym poziomie reasoning_effort. high jest ustawieniem domyślnym, lecz rutynowe klasyfikacje i proste poprawki mogą działać taniej na low lub medium, a najtrudniejsze zadania skorzystać z xhigh.
Czy Grok 4.6 zmienia układ sił
Tak, choć nie dlatego, że rozstrzyga wyścig jednym rekordem. Grok 4.6 pokazuje, że model kosztujący 2/6 USD może wejść do tej samej rozmowy co GPT-5.6 Sol i Fable 5. Jeszcze ważniejsze jest to, że xAI przestało koncentrować się wyłącznie na efektownych odpowiedziach Groka i buduje model pod pracę, którą da się ocenić: kod, dokument, raport albo działającą aplikację.
Na dziś najuczciwsza ocena brzmi: Grok 4.6 jest bardzo mocnym kandydatem dla długich agentów i zespołów kontrolujących koszt, ale nie zastępuje automatycznie GPT-5.6 Sol ani Fable 5 we wszystkich zadaniach. W terminalu nadal widać słabsze miejsca. W kodowaniu wewnątrz Cursora, pracy wiedzy i cenie model ma argumenty, których nie da się już zbyć jako marketingu.
To właśnie konkurencja cenowa może okazać się najważniejszym skutkiem premiery. Gdy kilka modeli osiąga zbliżony poziom, wygrywa nie ten z najdłuższym słupkiem na jednej planszy, lecz ten, który kończy rzeczywistą pracę przy akceptowalnym koszcie i liczbie poprawek.
(Zdjęcie: Farzad Nazifi, CC0 1.0 / Wikimedia Commons. Kadrowanie: TreffikAI.)



