LLMs i AI Generatywne

Kimi K3 ma 2,8 bln parametrów i rzuca wyzwanie GPT-5.6 oraz Claude

Moonshot AI pokazał Kimi K3, ogromny model z kontekstem 1 mln tokenów, natywnym widzeniem i mocnymi wynikami w kodowaniu. Sprawdzamy benchmarki, cenę API, architekturę i ograniczenia.

Autor: 8 min czytania
Płyta główna komputera ilustrująca ogromną architekturę modelu Kimi K3

Moonshot AI zaprezentował Kimi K3, swój najmocniejszy dotąd model. Premiera szybko wyszła poza środowisko osób śledzących chińskie laboratoria AI. Powód jest prosty: K3 łączy niezwykle dużą architekturę, kontekst liczący milion tokenów, natywne rozumienie obrazu i wyniki, które w części testów zbliżają model do GPT-5.6 Sol oraz Claude Fable 5.

Nie oznacza to jednak, że nowy Kimi pokonał wszystkich konkurentów. Sam Moonshot przyznaje w oficjalnym omówieniu Kimi K3, że ogólne możliwości modelu nadal ustępują najmocniejszym zamkniętym systemom OpenAI i Anthropic. K3 jest ciekawy z innego powodu: jako model zapowiedziany z otwartymi wagami potrafi już wygrywać wybrane testy kodowania i pracy agentowej, a jego API pozostaje wyraźnie tańsze od najdroższych modeli frontier.

Kimi K3 w skrócie

  • premiera: 16 lipca 2026 roku,
  • 2,8 bln parametrów w architekturze Mixture of Experts,
  • 16 aktywowanych ekspertów spośród 896,
  • kontekst do 1 048 576 tokenów,
  • natywna obsługa tekstu, obrazów i materiałów wideo,
  • dostęp przez Kimi, Kimi Work, Kimi Code i API,
  • pełne wagi zapowiedziane najpóźniej na 27 lipca 2026 roku.

Model większy niż poprzednie Kimi, ale nie 2,8 bln aktywnych parametrów

Liczba 2,8 bln parametrów robi wrażenie, ale wymaga wyjaśnienia. Kimi K3 korzysta z architektury Mixture of Experts, czyli nie uruchamia całej sieci przy każdym tokenie. Moonshot zbudował model z 896 ekspertów, z których podczas obliczeń wybieranych jest 16. Taka konstrukcja pozwala zwiększać łączną pojemność modelu bez proporcjonalnego zwiększania kosztu każdej odpowiedzi.

Nie należy więc porównywać 2,8 bln parametrów K3 wprost z liczbą parametrów gęstego modelu. To wartość opisująca pełny system, a nie część używaną jednocześnie podczas pojedynczego kroku generowania. Moonshot nie podał jeszcze kompletnej liczby aktywnych parametrów. Więcej szczegółów ma pojawić się wraz z raportem technicznym.

Pod spodem znajdują się dwie ważne zmiany architektoniczne:

  • Kimi Delta Attention (KDA) ma ograniczać koszt przetwarzania bardzo długich sekwencji,
  • Attention Residuals (AttnRes) pozwala modelowi selektywnie sięgać do reprezentacji z wcześniejszych warstw, zamiast jedynie sumować je w stały sposób.

Firma łączy te rozwiązania ze Stable LatentMoE, Gated MLA i treningiem uwzględniającym kwantyzację. Wagi są przygotowywane w formacie MXFP4, a aktywacje w MXFP8. Według Moonshot cały zestaw zmian daje około 2,5-krotnie lepszą efektywność skalowania niż Kimi K2. To deklaracja producenta, której pełna niezależna weryfikacja będzie możliwa dopiero po publikacji wag i dokumentacji technicznej.

Kimi K3 w benchmarkach kodowania

Najwięcej uwagi zebrały wyniki związane z programowaniem. W dniu premiery Kimi K3 zajmował pierwsze miejsce w Frontend Code Arena, czyli teście opartym na ślepych ocenach użytkowników. Jak opisywała Associated Press, model wyprzedził w tym zestawieniu czołowe systemy amerykańskich firm.

Moonshot opublikował również własny szeroki pakiet wyników. Poniższa tabela przedstawia kilka najważniejszych testów z materiałów premierowych:

BenchmarkKimi K3GPT-5.6 SolClaude Fable 5Claude Opus 4.8
Terminal-Bench 2.188,388,884,684,6
Program Bench77,877,676,871,9
FrontierSWE81,271,386,666,7
SWE Marathon42,039,035,040,0
DeepSWE67,573,070,059,0
Kimi Code Bench 2.072,964,876,971,7

Obraz jest mieszany, a przez to znacznie ciekawszy niż proste hasło „Kimi pokonał Claude”. K3 minimalnie wyprzedza GPT-5.6 Sol w Program Bench i prowadzi w SWE Marathon. Z kolei Sol wygrywa w DeepSWE, a Fable 5 ma dużą przewagę w FrontierSWE oraz firmowym Kimi Code Bench 2.0.

Wyniki potwierdzają, że K3 jest poważnym modelem programistycznym. Nie dowodzą jednak, że będzie najlepszym wyborem dla każdego repozytorium.

Dlaczego tych wyników nie można czytać jak tabeli ligowej

Benchmarki agentowe mierzą dziś coś więcej niż sam model. Kimi K3 był uruchamiany między innymi przez Kimi Code, modele OpenAI przez Codex, a Claude przez Claude Code lub inne środowiska wskazane w metodologii. Każdy zestaw ma własne narzędzia, instrukcje systemowe i sposób zarządzania kontekstem.

Moonshot zaznacza także, że wszystkie własne wyniki K3 uzyskano przy maksymalnym wysiłku rozumowania. Taki tryb może poprawiać skuteczność, lecz zwiększa liczbę tokenów wyjściowych, czas odpowiedzi i faktyczny koszt zadania.

Jest jeszcze kwestia pochodzenia danych. Kimi Code Bench 2.0 jest testem wewnętrznym producenta. FrontierSWE, Terminal-Bench czy niezależne oceny Arena dają szerszy kontekst, ale nawet one nie zastępują testu na konkretnym kodzie firmy. Najrozsądniej potraktować opublikowane liczby jako mocny sygnał do własnych prób, a nie gotową decyzję zakupową.

Milion tokenów kontekstu zmienia rodzaj zadań

Kimi K3 obsługuje okno kontekstowe do 1 048 576 tokenów. W teorii pozwala to przekazać modelowi duże repozytorium, zestaw dokumentacji, historię projektu i materiały wizualne w ramach jednej sesji. Dla agentów programistycznych oznacza to mniej agresywnego streszczania wcześniejszej pracy i większą szansę na zachowanie zależności między odległymi fragmentami kodu.

Długi kontekst nie jest jednak darmową pamięcią. Im więcej materiału wysyłamy, tym droższe i wolniejsze może być zapytanie. Model nadal musi odnaleźć właściwą informację w ogromnym zbiorze. W praktyce jakość indeksowania, struktura promptu i mechanizm cache pozostają równie ważne jak maksymalna liczba tokenów.

K3 ma również natywne możliwości wizualne. Potrafi analizować zrzuty ekranu i łączyć je z pracą nad kodem, co jest przydatne podczas tworzenia interfejsów, gier i projektów CAD. Moonshot pokazuje też przykłady pracy z wideo, prezentacjami i interaktywnymi raportami. Są to jednak demonstracje producenta, więc ich powtarzalność trzeba sprawdzić na własnych plikach i wymaganiach.

Nie tylko kod: raporty, arkusze i długie badania

Moonshot pozycjonuje K3 jako model do pracy wiedzy, a nie wyłącznie następcę Kimi K2.7 Code. Firma demonstruje tworzenie interaktywnych raportów, analizę literatury naukowej, obsługę rozbudowanych arkuszy oraz pracę wielu agentów nad jednym problemem.

W materiałach premierowych K3 uzyskał 34,8 punktu w SpreadsheetBench 2, nieznacznie więcej niż Fable 5 z wynikiem 34,7. Ten jeden punkt nie powinien przesłaniać ważniejszego wniosku: najlepsze modele nadal rozwiązują zaledwie około jednej trzeciej trudnych, wieloetapowych zadań arkuszowych. To narzędzia do przyspieszania pracy i przygotowania wersji roboczej, a nie samodzielni księgowi czy analitycy finansowi.

K3 prowadził też w materiałach Moonshot w AutomationBench i BrowseComp, natomiast pozostawał za Fable 5 w wielu testach ogólnej wiedzy, rozumowania i percepcji. Specjalizacja modelu jest wyraźna: długie zadania agentowe, terminal, kod, wyszukiwanie oraz przetwarzanie dużych zestawów materiałów.

Cena Kimi K3 w API

Model jest dostępny na platformie API Kimi pod identyfikatorem kimi-k3. Oficjalny cennik za milion tokenów wygląda następująco:

Rodzaj tokenówCena za 1 mln tokenów
wejście trafiające do cache0,30 USD
wejście bez trafienia do cache3,00 USD
wyjście15,00 USD

To znacznie więcej niż koszt wcześniejszych modeli Kimi, szczególnie po stronie odpowiedzi. Nadal jest to jednak poziom niższy od wielu najdroższych modeli frontier. Duże znaczenie ma cache kontekstu: Moonshot podaje, że w zadaniach programistycznych jego infrastruktura Mooncake osiąga ponad 90 proc. trafień. Jeżeli aplikacja wielokrotnie wykorzystuje to samo repozytorium lub dokumenty, różnica między 0,30 a 3 USD za wejście staje się kluczowa.

Sam cennik tokenów nie wystarcza do porównania modeli. K3 na starcie używa maksymalnego wysiłku rozumowania, więc może generować więcej tokenów niż tańszy w przeliczeniu model pracujący krócej. Najlepszą miarą pozostaje koszt ukończonego i poprawnego zadania.

Gdzie można użyć Kimi K3

K3 działa już w kilku produktach:

  1. na stronie i w aplikacji Kimi,
  2. w desktopowym środowisku Kimi Work 3.1.0 lub nowszym,
  3. w Kimi Code, gdzie model wybiera się komendą /model,
  4. w oficjalnym API jako kimi-k3.

Określenie „open-weight” wymaga obecnie dopowiedzenia. Moonshot zapowiedział pełne wagi modelu do 27 lipca 2026 roku, ale w dniu publikacji tego artykułu nie są one jeszcze publicznie dostępne. Dopiero ich wydanie pozwoli społeczności sprawdzić wymagania sprzętowe, uruchomić niezależne testy i ocenić warunki licencji.

Nie będzie to model łatwy do uruchomienia na domowym komputerze. Producent rekomenduje konfiguracje typu supernode z co najmniej 64 akceleratorami. Nawet po udostępnieniu wag K3 będzie więc przede wszystkim propozycją dla dostawców infrastruktury, dużych laboratoriów oraz firm korzystających z hostowanych wersji.

Ograniczenia, o których mówi sam Moonshot

Producent wskazuje trzy problemy, które mają bezpośrednie znaczenie dla użytkownika:

  • K3 jest wrażliwy na niepełną historię rozumowania i może działać niestabilnie po przełączeniu modelu w środku sesji,
  • trening na długich zadaniach sprawia, że model bywa nadmiernie proaktywny i podejmuje decyzje, których użytkownik nie zlecił,
  • ogólna jakość doświadczenia nadal odstaje od Claude Fable 5 i GPT-5.6 Sol.

Pierwszy punkt oznacza, że zgodność środowiska agentowego jest szczególnie ważna. Drugi wymaga jasnych ograniczeń w promptach systemowych i plikach takich jak AGENTS.md. Agent z dostępem do terminala nie powinien mieć swobody interpretowania niejasnego polecenia jako zgody na ryzykowną operację.

Czy Kimi K3 jest kolejnym „momentem DeepSeek”?

Porównanie pojawia się często, ponieważ model z Chin zbliża się do zamkniętych liderów i ma otrzymać publiczne wagi. Sytuacja nie jest jednak identyczna. K3 jest droższy od poprzednich modeli Moonshot, a jego rozmiar sprawia, że samodzielne wdrożenie będzie trudne. Nie jest to lekki model, który każdy uruchomi lokalnie.

Znaczenie premiery jest inne. Kimi K3 pokazuje, że otwarte modele nie muszą już konkurować wyłącznie ceną. Mogą walczyć o pierwsze miejsca w złożonych zadaniach programistycznych, analizować obrazy i pracować z milionem tokenów kontekstu. Jednocześnie Moonshot zachowuje uczciwy ton: K3 nie jest przedstawiany jako bezwarunkowo najlepszy model świata.

Dla programistów, zespołów badawczych i firm budujących agentów to jedna z najważniejszych premier 2026 roku. Najrozsądniejszy werdykt brzmi jednak: Kimi K3 wygląda jak model frontier w wybranych zadaniach, ale prawdziwy test rozpocznie się po publikacji wag i niezależnych pomiarach kosztu, stabilności oraz jakości na rzeczywistych projektach.

(Zdjęcie: Oleg Gospodarec / Unsplash, licencja.)

Udostępnij: