Claude Opus 5.5, GPT-6 Sol i Grok 4.7: trzy premiery w dwa dni — i który model wybrać
W dwa dni pod koniec września pojawiły się trzy duże premiery: Grok 4.7 od xAI, Claude Opus 5.5 od Anthropic oraz GPT-6 Sol i Luna od OpenAI. Oto prosty przegląd: czym się różnią, w czym każdy naprawdę błyszczy i który wybrać do swojego zadania. Cała czwórka jest już dostępna w ChatPlus.

21 września xAI udostępniło Grok 4.7. Następnego dnia Anthropic pokazało Claude Opus 5.5, a OpenAI wypuściło GPT-6 Sol i GPT-6 Luna. Trzy laboratoria, cztery modele, dwa dni. Trudno nazwać to przypadkiem: wyścig jest tak wyrównany, że nikt nie chce oddać konkurencji nagłówków nawet na tydzień.
W skrócie: Opus 5.5 to najmocniejsza z nowych premier i — według niezależnych pomiarów — obecnie najlepszy model na rynku całościowo. GPT-6 Sol prawie nie zyskał pod względem surowej inteligencji, ale kosztuje o połowę mniej i popełnia mniej błędów faktograficznych. Luna jest lekka i bardzo tania. Grok 4.7 to duży krok naprzód dla xAI, ale na razie wciąż plasuje się w drugiej lidze, choć przy atrakcyjnej cenie. Poniżej szczegóły i uczciwe zastrzeżenia do każdego z nich.
Four models at a glance
Dla porównania — najważniejsze parametry. Ceny podajemy za milion tokenów API, żeby było widać, które modele są drogie; ChatPlus nie rozlicza tokenów osobno, bo wszystko jest wliczone w subskrypcję.
| Model | Developer | Input / output, $ | Context | Best at |
|---|---|---|---|---|
| Claude Opus 5.5 | Anthropic | 4 / 20 | 1M | Długie zadania programistyczne, dokumenty, klarowne pisanie |
| GPT-6 Sol | OpenAI | 2 / 10 | 1.05M | Kod, agenci, trafność faktów |
| GPT-6 Luna | OpenAI | 0.10 / 0.50 | 1.05M | Szybkie, proste zadania |
| Grok 4.7 | xAI | 2 / 6 | 500K | Kod, inżynieria, prawo |
Claude Opus 5.5: poziom Fable bez ceny flagowca
Opus 5.5 otwiera nową rodzinę Claude 5.5. Anthropic streszcza jego główną przewagę jednym zdaniem: model działa na poziomie Claude Fable 5.1 — najmocniejszego i najdroższego modelu firmy — a kosztuje o 40% mniej niż Opus 5. Ceny tokenów spadły o 20%, a reszta wynika z wydajności: model zużywa mniej kroków i mniej tokenów na to samo zadanie. Generuje też tekst o ponad 30% szybciej niż poprzednik.
Niezależne testy to potwierdzają. W zbiorczym indeksie Artificial Analysis Opus 5.5 zdobył 58 punktów przy maksymalnych ustawieniach — najlepszy wynik, jaki kiedykolwiek tam zmierzono, z kilkupunktową przewagą. Prowadzi prawie wszędzie: w programowaniu agentowym (66,4% w Terminal-Bench 4.0 wobec 55,8% dla Fable 5.1 i 57,9% dla GPT-6 Astra), pracy biurowej i złożonych pytaniach wymagających używania narzędzi.
Same wyniki benchmarków niewiele mówią jednak o tym, jak model sprawdza się w realnej pracy. Bardziej wymowne są historie pierwszych testerów. Jeden z nich przeniósł projekt mający 680 000 linii kodu w mniej niż dzień — zadanie, które zespołowi inżynierów zajęłoby tygodnie. Inny w trzy godziny przeprowadził audyt i naprawił bazę kodu liczącą 200 000 linii, podczas gdy Opus 5 potrzebował na tę samą pracę ponad dwudziestu godzin. W innej firmie Opus 5.5 wykonał złożone zadanie, które wcześniej wymagało 38 promptów i czterech dni, w 11 promptach i trzy godziny. Anthropic przeprowadziło też wewnętrzny eksperyment: poprosiło Opus 5.5 i Fable 5.1 o przepisanie HAProxy, popularnego load balancera, z C na Rust. Oba modele dały radę, ale Opus 5.5 skończył w 9,5 godziny zamiast 12 i kosztował o połowę mniej.
Druga duża zmiana dotyczy stylu pisania. Opus 5 często krytykowano za rozwlekłość: długie wstępy, korporacyjny ton i sedno sprawy schowane w trzecim akapicie. Opus 5.5 zaczyna od najważniejszej informacji, rzadziej odpływa w żargon i pewniej trzyma się zasad stylu, które mu podasz. Jeden z testerów ujął to prosto: „Pisze tak, jak ja piszę”. Przy pracy z tekstem czuć to od razu: po modelu zostaje mniej sprzątania.
Jest jedna cecha, o której warto wiedzieć z góry: w Opus 5.5 nie da się wyłączyć rozumowania. Model zawsze najpierw myśli, potem odpowiada. Przy złożonych zadaniach to zaleta. Przy pytaniu w rodzaju „jak po angielsku jest parapet?” oznacza to dodatkowe sekundy czekania. Do takich drobiazgów lepszy będzie prostszy model.
W ChatPlus Claude Opus 5.5 jest już dostępny w czacie — w planie Max, obok innych modeli z najwyższej półki.
GPT-6 Sol: ten sam próg, za połowę ceny
Na początku września OpenAI wypuściło flagowy model GPT-6 Astra, a rodzina GPT-6 wygląda teraz tak: Astra na górze, Sol pośrodku, Luna na dole. Sol ma być modelem roboczym: bierze precyzję Astry i zdolność doprowadzania zadania do końca, ale kosztuje wyraźnie mniej.
OpenAI sprzedaje Sol nie rekordami, lecz niezawodnością. Firma wzięła prawdziwe rozmowy, w których użytkownicy oznaczali błędy modelu, i przetestowała na nich nową wersję: Sol myli się mniej więcej o połowę rzadziej niż GPT-5.6 Sol i dochodzi do poziomu niezawodności Astry. Niezależny test halucynacji to potwierdza, choć z zastrzeżeniem. Odsetek zmyślonych odpowiedzi spadł z 92% do 60%, głównie dlatego, że model częściej odmawia odpowiedzi, gdy nie jest pewien. Ogólny udział poprawnych odpowiedzi nawet lekko spadł — z 59% do 54%. W codziennej pracy to raczej dobra wiadomość niż zła: uczciwe „nie wiem” jest lepsze niż pewna siebie konfabulacja.
W programowaniu Sol dotrzymuje kroku znacznie droższym modelom. W DeepSWE, teście długich zadań inżynierskich w prawdziwych repozytoriach, uzyskuje 68,8%. Claude Fable 5 ma najlepszy wynik — 69,9% — ale kosztuje około pięć razy więcej za zadanie. W Terminal-Bench 4.0 Sol poprawił wynik z 37% do 43%.
A teraz to, czego nie ma w komunikacie prasowym. W zbiorczym indeksie inteligencji Sol prawie nie zmienił się względem poprzednika: 48 punktów wobec 47. Cofnął się nawet w pracy z dokumentami biurowymi i przegrywa zarówno z Astrą, jak i poprzednim Sol w sterowaniu komputerem. To więc nie jest wielki skok naprzód, tylko ten sam poziom możliwości za połowę ceny. Dla większości zadań dokładnie tego potrzebujesz: kodowania, researchu, korespondencji i analityki. Jeśli potrzebujesz modelu, który samodzielnie klika po interfejsach, wybierz Astrę.
GPT-6 Sol jest dostępny w naszej subskrypcji PRO, a ponieważ kosztuje o połowę mniej niż poprzedni Sol, Twój limit wystarcza zauważalnie dłużej w długich rozmowach. Otwórz czat z GPT-6 Sol.
GPT-6 Luna: mniejszy model z najświeższą wiedzą
OpenAI opisuje Luna prosto: model do zadań o dużej skali i jasno określonym celu. Streścić dokument, wyciągnąć z tekstu liczby i nazwiska, szybko odpowiedzieć na pytanie. Nie ma w tym nic skromnego: właśnie takie zadania stanowią większość tego, co ludzie robią z AI na co dzień.
Cena jest niemal symboliczna: dziesięć centów za milion tokenów wejściowych i pięćdziesiąt centów za milion tokenów wyjściowych. To połowa ceny wejścia GPT-5.6 Luna i prawie dwa i pół raza taniej na wyjściu. W zbiorczym indeksie inteligencji model pozostaje na poziomie poprzednika. Lekko osunął się w kodowaniu agentowym, ale w DeepSWE przy maksymalnych ustawieniach osiąga 66,6% za zaledwie 22 centy za zadanie. Według OpenAI to wynik porównywalny z Claude Opus 5 i Fable 5 na średnich ustawieniach, przy koszcie niższym o 93–96%.
Ciekawy szczegół: najmniejszy model w rodzinie ma najświeższą wiedzę. Luna była trenowana na danych do maja 2026 roku, podczas gdy Sol i Astra zatrzymują się na kwietniu.
W ChatPlus GPT-6 Luna jest dostępna w subskrypcji PRO i nie zużywa Twojego limitu — tego 5-godzinnego, z którego odejmowane są zapytania do drogich modeli. Możesz używać jej do woli, bez patrzenia na licznik. Nie jest najlepszym wyborem do złożonego kodu obejmującego wiele plików, ale w tej samej rozmowie możesz przełączyć się na Sol albo Opus.
Grok 4.7: duży, spóźniony i zaskakująco tani
Grok 4.7 pojawił się przed pozostałymi, choć to na niego czekano najdłużej: Elon Musk przekładał premierę co najmniej pięć razy, począwszy od końca lipca. Opóźnienie jest zrozumiałe. To nie kosmetyczna aktualizacja, tylko nowy, wyraźnie większy model bazowy: według doniesień medialnych ma około 2,1 biliona parametrów. Otrzymał dłuższy trening przez uczenie ze wzmocnieniem, z naciskiem na zadania, które ludziom zajmują godziny. xAI poprawiło też samokontrolę: model uważniej sprawdza własne odpowiedzi i lepiej radzi sobie z długim kontekstem. Przy okazji: firma w oficjalnych materiałach nazywa się teraz SpaceXAI, choć modele nadal noszą nazwę Grok.
Poprawa względem Grok 4.6 jest duża. W CursorBench 4.0, teście długich zadań programistycznych, wynik wzrósł z 40,4% do 46,3%. W Terminal-Bench 4.0 niemal się podwoił — z 20,3% do 37,6%. W wielogodzinnej pracy biurowej — raportach, arkuszach, prezentacjach — model zyskał ponad sto punktów Elo. Szczególnie zaskakujące są wyniki prawnicze: w benchmarku prawniczym Harvey Grok 4.7 osiąga 19,6%, prawie trzy razy więcej niż 6,7% Claude Fable 5.1. W benchmarku elektrotechnicznym EEBench zdobywa 64% wobec 56,4% Fable.
Jego miejsce w ogólnych rankingach jest skromniejsze. W większości porównań Grok 4.7 jest drugi: przegrywa z Fable 5.1 w pracy biurowej, z GPT-6 Astra w zadaniach inżynierskich i wciąż zostaje daleko za Opus 5.5. Niezależne testy dają mu 46 punktów w indeksie inteligencji. To wystarczyło, by xAI weszło do pierwszej czwórki laboratoriów, ale nie wyżej. Sam Musk obiecuje klasę „Astra i Fable” dopiero przy Grok 4.9. Jeszcze jedno zastrzeżenie: przy maksymalnych ustawieniach model zużywa ponad dwa razy więcej tokenów na zadanie niż Grok 4.6, więc ta sama cena tokenów nie oznacza tego samego kosztu wyniku.
Kluczową zaletą Grok 4.7 jest stosunek jakości do ceny. Kosztuje tyle samo co Grok 4.6 — dwa dolary za milion tokenów wejściowych i sześć za milion tokenów wyjściowych — a jest zauważalnie tańszy od flagowców Anthropic i OpenAI. Grok 4.7 jest dostępny w ChatPlus w subskrypcji PRO.
Więc który model wybrać?
Ujęlibyśmy to tak.
Jeśli zadanie jest duże i ważne — złożony kod, audyt projektu, raport analityczny albo długi dokument wymagający jasnego myślenia — wybierz Claude Opus 5.5. To obecnie najmocniejszy dostępny model i pisze zauważalnie lepiej niż wcześniejsze modele Claude.
Do codziennej pracy, gdy potrzebujesz równowagi, świetnie pasuje GPT-6 Sol: kod, research, maile i arkusze. Jest ostrożny, rzadziej halucynuje i zużywa mniej Twojego limitu.
Do małych zadań — streszczeń, tłumaczeń, krótkich odpowiedzi informacyjnych i szkiców — wybierz GPT-6 Luna. Jest szybka i w ogóle nie zużywa Twojego limitu.
Grok 4.7 warto sprawdzić przy pytaniach prawnych i inżynierskich, gdzie jest zaskakująco mocny, oraz jako drugą opinię, gdy chcesz porównać odpowiedź innego modelu.
Najłatwiej porównać je na własnym zadaniu. W ChatPlus możesz zmieniać modele w trakcie rozmowy: zadaj pytanie Opus, przełącz się na Sol albo Grok, wyślij ten sam prompt jeszcze raz i od razu zobacz, kto radzi sobie najlepiej. Szczegółowe strony modeli znajdziesz tutaj: Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna i Grok 4.7.
W skrócie
W dwa dni pojawiły się cztery nowe modele. Claude Opus 5.5 to nowy lider: możliwości na poziomie Fable 5.1 za 40% mniej niż Opus 5, najlepsze w klasie kodowanie agentowe i zauważalnie klarowniejsze pisanie. GPT-6 Sol prawie nie poprawił się pod względem inteligencji, ale kosztuje o połowę mniej i popełnia błędy faktograficzne dwa razy rzadziej. GPT-6 Luna to bardzo tani model do prostych zadań, z najświeższą wiedzą w rodzinie. Grok 4.7 zrobił duży skok naprzód, zwłaszcza w kodzie, prawie i inżynierii, ale na razie pozostaje w drugiej lidze — za przystępną cenę. Cała czwórka jest już dostępna w ChatPlus.
Wypróbuj najlepsze modele AI w ChatPlus
GPT, Claude, Gemini, GLM i inne modele AI w jednym oknie.