Premiera GPT-6 Astra: benchmarki, ceny i nowe możliwości modelu OpenAI
GPT-6 Astra ma wykonywać złożone zadania w kodzie, przeglądarce i dokumentach. Sprawdzamy benchmarki OpenAI, ceny API, dostępność i ograniczenia nowego modelu.

GPT-6 Astra to nowy flagowy model OpenAI do złożonych zadań wymagających rozumowania, programowania i obsługi komputera. Najważniejsze pytanie brzmi: czy potrafi doprowadzić trudne zlecenie do końca przy mniejszej liczbie interwencji człowieka — od pracy w aplikacji po sprawdzenie i oddanie wyniku?
Informacje w artykule zweryfikowaliśmy 5 września 2026 r. Udostępnianie modelu trwa etapami; zapowiedź premiery nie oznacza, że każde konto już ma do niego dostęp.
Kiedy GPT-6 Astra będzie dostępny?
Przegląd bezpieczeństwa OpenAI z 3 września umiejscawia premierę na początku września. Dokumentacja API opisuje początkowy dostęp dla przedsiębiorstw w Trusted Access, a następnie API oraz plany ChatGPT Plus, Pro, Business i Enterprise w kolejnych dniach.
Przed zakupem subskrypcji lub migracją aplikacji warto sprawdzić faktycznie dostępny wybór modeli na własnym koncie. Uprawnienie do nowego modelu, pojawienie się go w interfejsie i limit użycia to trzy różne sprawy. Źródła nie określają jednego wspólnego limitu wiadomości dla wszystkich użytkowników.
Kontekst poprzedniej generacji opisaliśmy w artykule o premierze GPT-5.6. Ceny podane w tamtym tekście dokumentują ówczesną premierę i nie stanowią aktualnego cennika.
Benchmarki GPT-6 Astra na wykresie
Poniższa grafika to nasze opracowanie wybranych wyników z publikacji premierowej OpenAI. Są to wyniki podane przez producenta, a nie testy przeprowadzone przez TreffikAI. Więcej oznacza lepiej w obrębie danego testu; procentów z różnych benchmarków nie należy traktować jako tej samej miary.

| Test | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| ARC-AGI-3 | 99,9% [T7] | 7,8% |
| Terminal-Bench 4.0 | 57,9% | 37,3% |
| AutomationBench | 41,4% | 18,1% |
| OSWorld 2.0 | 72,6% | 65,7% |
| ScreenSpot-Pro, bez narzędzi | 92,7% | 76,9% |
| Agents' Last Exam | 59,3% | 53,6% |
OpenAI podaje najlepsze wyniki przy różnych poziomach wysiłku, a nie porównanie przy jednakowym budżecie. OSWorld oznacza wersję v2026.08.08, zbiór offline i punktację częściową. Przy ARC-AGI-3 zachowujemy oznaczenie T7 ze źródła. Warunki badawcze i API mogą różnić się od ChatGPT.
Jak interpretować wyniki?
Największą różnicę w tym wyborze testów widać w ARC-AGI-3. To wynik wart uwagi, ale niemal pełna punktacja w benchmarku nie dowodzi, że system potrafi wykonać każde ludzkie zadanie. Test ma określone środowisko, zasady oceny i zakres problemów.
Dla firmy wybierającej asystenta bardziej użyteczne mogą być wyniki pracy w terminalu i aplikacjach. Dają powód, aby sprawdzić Astrę w zadaniach, w których kolejne kroki zależą od poprzednich. Jednocześnie punktacja wyraźnie poniżej 100% przypomina, że trzeba mierzyć także niedokończoną pracę i naprawianie błędów.
Nasza interpretacja: wykres pomaga wybrać obszary do własnego sprawdzenia. Warto zlecić obu modelom ten sam błąd w repozytorium, zadanie w arkuszu lub proces w przeglądarce, z identycznymi narzędziami i uprawnieniami. Porównujmy poprawność, czas, koszt oraz liczbę interwencji człowieka.
Okno kontekstu i obsługiwane dane
Karta modelu podaje 1 050 000 tokenów kontekstu, maksymalnie 128 000 tokenów wyjściowych i 30 kwietnia 2026 r. jako granicę wiedzy treningowej. Astra przyjmuje tekst i obrazy, a zwraca tekst. Nie obsługuje natywnie audio ani wideo; generowanie obrazu przez osobne narzędzie to inna funkcja.
Duże okno kontekstu pozwala zmieścić więcej materiałów, ale nie gwarantuje prawidłowego wykorzystania każdego szczegółu. Dobry test analizy dokumentów obejmuje pytanie z odpowiedzią ukrytą pod koniec materiału oraz pytanie, na które dokumenty nie odpowiadają.
To drugie jest równie ważne: dopracowana odpowiedź ma wartość tylko wtedy, gdy model odróżnia dowody od brakujących informacji.
Ceny API: liczy się koszt całego zadania
Stawki Standard w oficjalnej karcie modelu, w dolarach za milion tokenów:
| Rodzaj tokenów | Cena |
|---|---|
| Wejście | 10 USD |
| Odczyt wejścia z cache | 1 USD |
| Zapis cache | 12,50 USD |
| Wyjście | 50 USD |
Powyżej 272 000 tokenów wejściowych całe żądanie jest rozliczane z mnożnikiem 2 dla wejścia i cache oraz 1,5 dla wyjścia. Dochodzić mogą opłaty za narzędzia.
Uproszczony przykład: 100 000 tokenów wejścia bez cache i 10 000 rozliczanych tokenów wyjścia kosztuje 1,50 USD, przed narzędziami i innymi ewentualnymi opłatami. To obliczenie według stawek Standard, a nie zmierzony koszt konkretnego zadania Astry.
Najlepiej porównywać koszt zaakceptowanego rezultatu. Tanie wywołanie może okazać się drogie po kilku nieudanych próbach. Droższy model może z kolei niepotrzebnie zwiększać rachunek za zadanie, które mniejszy wariant już wykonuje poprawnie. Rachunek należy zestawiać ze skutecznością.
Nowe funkcje do dłuższej pracy agentów
Przewodnik dla programistów opisuje asynchroniczne wywołania narzędzi, dodatkowe instrukcje przekazywane w trakcie pracy oraz zmianę wysiłku rozumowania z zachowaniem cache prefiksu promptu. Identyfikator to gpt-6-astra; poziomy wysiłku obejmują low, medium, high, xhigh i max.
Największy sens ma to w procesach, które trwają dłużej. Przykładowo użytkownik może doprecyzować format eksportu, gdy agent nadal zbiera materiały. Aplikacja musi jednak nadal obsługiwać oczekujące narzędzia i konsekwentnie uwzględniać zmienione wymagania.
Przewodnik wymienia też dwa ograniczenia: brak poziomu rozumowania none i niedostępność Fast mode przy rezydencji danych w UE. Ten drugi warunek dotyczy konfiguracji przechowywania i przetwarzania danych w API, a nie po prostu miejsca zamieszkania użytkownika.
Bezpieczeństwo jest częścią tej premiery
W przeglądzie bezpieczeństwa OpenAI przypisuje Astrze poziom Critical w zdolnościach cyberbezpieczeństwa w ramach Preparedness Framework. To ocena zdolności według zasad firmy, a nie stwierdzenie, że każda rozmowa z wdrożonym modelem jest niebezpieczna.
Firma opisuje mocniejsze zabezpieczenia i większą odporność na prompt injection, ale również pozostałe ryzyka. Poprawa w testach nie oznacza gwarancji, że model zawsze zachowa zamierzone granice działania.
W praktycznym wdrożeniu uprawnienia warto testować obok poprawności. Asystent, który prawidłowo wypełnił formularz, nadal potrzebuje jasnej reguły określającej, czy wolno mu go wysłać. Asystenta programistycznego należy oceniać przez zmiany w kodzie i dowody, że działają.
Czy warto przejść na Astrę?
Zacznij od pracy, która dziś wymaga najwięcej sprawdzania: trudnego debugowania, researchu z wielu źródeł albo zadań łączących pliki i aplikacje. Przygotuj niewielki, powtarzalny zestaw przykładów, aby odróżnić rzeczywistą poprawę od pojedynczej efektownej demonstracji.
Przy prostej klasyfikacji czy wyciąganiu danych najpierw ustal, czy obecny model już spełnia wymagania. Sama premiera nie jest powodem do zastąpienia działającego i opłacalnego rozwiązania.
Nasz poradnik ChatGPT vs Claude vs Gemini pokazuje, jak porównywać asystentów według zastosowania. Astra jest kolejnym mocnym kandydatem; wybór nadal zależy od zadania, faktycznego dostępu i kosztu wyniku, któremu można zaufać.
Zdjęcie: Alexandre Debiève / Unsplash, na licencji Unsplash. Fotografia ilustracyjna sprzętu; nie przedstawia infrastruktury Astry. Wykres: TreffikAI na podstawie podlinkowanej wyżej ewaluacji OpenAI.



