Claude Opus 5.5, GPT-6 Sol und Grok 4.7: drei Releases in zwei Tagen – und welches Modell du wählen solltest
Ende September kamen innerhalb von zwei Tagen drei große Releases: Grok 4.7 von xAI, Claude Opus 5.5 von Anthropic sowie OpenAIs GPT-6 Sol und Luna. Hier ist ein klarer Blick darauf, worin sie sich unterscheiden, wo jedes wirklich glänzt und welches du für deine Aufgabe wählen solltest. Alle vier sind bereits in ChatPlus verfügbar.

Am 21. September veröffentlichte xAI Grok 4.7. Am nächsten Tag stellte Anthropic Claude Opus 5.5 vor, während OpenAI GPT-6 Sol und GPT-6 Luna veröffentlichte. Drei Labs, vier Modelle, zwei Tage. Das lässt sich kaum als Zufall abtun: Das Rennen ist so eng, dass niemand einem Konkurrenten auch nur eine Woche lang die Schlagzeilen überlassen will.
Die Kurzfassung: Opus 5.5 ist das stärkste der neuen Releases und nach unabhängigen Messungen derzeit insgesamt das beste Modell auf dem Markt. GPT-6 Sol hat bei der reinen Intelligenz kaum zugelegt, kostet aber nur halb so viel und macht weniger sachliche Fehler. Luna ist leichtgewichtig und sehr günstig. Grok 4.7 ist ein großer Schritt nach vorn für xAI, spielt vorerst aber noch in der zweiten Liga – wenn auch zu einem attraktiven Preis. Hier kommen die Details und die ehrlichen Einschränkungen zu jedem Modell.
Vier Modelle auf einen Blick
Zur Orientierung sind hier die wichtigsten Eckdaten. Die Preise sind pro Million API-Token angegeben, damit du siehst, welche Modelle teuer sind; ChatPlus berechnet Tokens nicht separat, denn alles ist im Abo enthalten.
| Model | Developer | Input / output, $ | Context | Best at |
|---|---|---|---|---|
| Claude Opus 5.5 | Anthropic | 4 / 20 | 1M | Langes Programmieren, Dokumente, klarer Schreibstil |
| GPT-6 Sol | OpenAI | 2 / 10 | 1.05M | Code, Agents, Faktentreue |
| GPT-6 Luna | OpenAI | 0.10 / 0.50 | 1.05M | Schnelle, einfache Aufgaben |
| Grok 4.7 | xAI | 2 / 6 | 500K | Code, Engineering, Recht |
Claude Opus 5.5: Fable-Leistung ohne Flaggschiff-Preis
Opus 5.5 startet die neue Claude 5.5-Familie. Anthropic fasst den wichtigsten Vorteil in einem Satz zusammen: Das Modell liefert Leistung auf dem Niveau von Claude Fable 5.1 – dem leistungsfähigsten und teuersten Modell des Unternehmens – kostet dabei aber 40% weniger als Opus 5. Die Token-Preise sind um 20% gesunken, der Rest kommt durch Effizienz: Das Modell braucht für dieselbe Aufgabe weniger Schritte und weniger Tokens. Außerdem erzeugt es Text mehr als 30% schneller als sein Vorgänger.
Unabhängige Tests bestätigen das. Im aggregierten Index von Artificial Analysis erzielte Opus 5.5 bei maximalen Einstellungen 58 Punkte – das beste dort je gemessene Ergebnis, mit mehreren Punkten Vorsprung. Es liegt fast überall vorn: bei agentischem Programmieren (66,4% auf Terminal-Bench 4.0 gegenüber 55,8% für Fable 5.1 und 57,9% für GPT-6 Astra), bei Büroarbeit und bei komplexen Fragen zur Tool-Nutzung.
Benchmark-Zahlen sagen aber wenig darüber aus, wie sich ein Modell in echter Arbeit anfühlt. Aufschlussreicher sind die Berichte früher Tester. Einer migrierte ein Projekt mit 680.000 Codezeilen in weniger als einem Tag – eine Aufgabe, für die ein Engineering-Team sonst Wochen gebraucht hätte. Ein anderer auditierte und reparierte eine Codebasis mit 200.000 Zeilen in drei Stunden, während Opus 5 für dieselbe Arbeit mehr als zwanzig brauchte. In einem weiteren Unternehmen erledigte Opus 5.5 eine komplexe Aufgabe, die zuvor 38 Prompts und vier Tage erfordert hatte, mit 11 Prompts und drei Stunden. Anthropic führte außerdem ein internes Experiment durch: Opus 5.5 und Fable 5.1 sollten HAProxy, einen beliebten Load Balancer, von C nach Rust umschreiben. Beide schafften es, aber Opus 5.5 war nach 9,5 statt 12 Stunden fertig und kostete nur halb so viel.
Die zweite große Veränderung betrifft den Schreibstil. Opus 5 wurde oft für Weitschweifigkeit kritisiert: lange Einleitungen, Corporate-Sprech und die eigentliche Aussage im dritten Absatz vergraben. Opus 5.5 nennt den wichtigsten Punkt zuerst, rutscht seltener in Jargon ab und hält sich zuverlässiger an die Stilregeln, die du vorgibst. Ein Tester brachte es schlicht auf den Punkt: „Es schreibt so, wie ich schreibe.“ Beim Arbeiten mit Text merkst du das sofort: Nach dem Modell ist weniger Aufräumen nötig.
Eine Eigenschaft solltest du vorher kennen: Bei Opus 5.5 kannst du das Reasoning nicht abschalten. Es denkt immer zuerst nach und antwortet dann. Bei komplexen Aufgaben ist das ein Vorteil. Bei einer Frage wie „Wie heißt Fensterbank auf Englisch?“ bedeutet es ein paar zusätzliche Sekunden Wartezeit. Für solche kleinen Aufgaben ist ein einfacheres Modell die bessere Wahl.
In ChatPlus ist Claude Opus 5.5 bereits im Chat verfügbar – im Max-Tarif, zusammen mit anderen Spitzenmodellen.
GPT-6 Sol: dieselbe Messlatte, zum halben Preis
Anfang September veröffentlichte OpenAI sein Flaggschiff GPT-6 Astra, und die GPT-6-Familie sieht nun so aus: Astra oben, Sol in der Mitte, Luna unten. Sol ist als Arbeitstier gedacht: Es übernimmt Astras Präzision und die Fähigkeit, eine Aufgabe bis zum Ende durchzuziehen, kostet aber deutlich weniger.
OpenAI verkauft Sol eher über Zuverlässigkeit als über Rekorde. Das Unternehmen nahm echte Unterhaltungen, in denen Nutzer Modellfehler markiert hatten, und testete die neue Version darauf: Sol macht ungefähr halb so oft Fehler wie GPT-5.6 Sol und erreicht die Zuverlässigkeit von Astra. Ein unabhängiger Halluzinationstest bestätigt das, allerdings mit einer Einschränkung. Der Anteil erfundener Antworten sank von 92% auf 60%, vor allem weil das Modell häufiger eine Antwort verweigert, wenn es unsicher ist. Der Gesamtanteil korrekter Antworten ging sogar leicht zurück, von 59% auf 54%. Für die tägliche Arbeit ist das eher eine gute als eine schlechte Nachricht: Ein ehrliches „Ich weiß es nicht“ ist besser als eine selbstbewusste Erfindung.
Beim Programmieren hält Sol mit deutlich teureren Modellen Schritt. Auf DeepSWE, einem Test für lange Engineering-Aufgaben in echten Repositories, erreicht es 68,8%. Claude Fable 5 hat mit 69,9% den besten Wert, kostet pro Aufgabe aber ungefähr fünfmal so viel. Auf Terminal-Bench 4.0 verbesserte sich Sol von 37% auf 43%.
Nun zu dem, was in der Pressemitteilung nicht steht. Im aggregierten Intelligenzindex ist Sol gegenüber seinem Vorgänger fast unverändert: 48 Punkte gegenüber 47. Bei der Arbeit mit Office-Dokumenten hat es sogar nachgelassen, und bei der Computersteuerung liegt es sowohl hinter Astra als auch hinter dem vorherigen Sol. Das ist also kein Sprung nach vorn, sondern dieselbe Leistungsstufe zum halben Preis. Für die meisten Aufgaben ist genau das, was du brauchst: Coding, Recherche, Korrespondenz und Analysen. Wenn du ein Modell brauchst, das sich selbstständig durch Oberflächen klickt, wähle Astra.
GPT-6 Sol ist in unserem PRO-Abo verfügbar, und weil es nur halb so viel kostet wie das vorherige Sol, reicht dein Kontingent in langen Gesprächen spürbar weiter. Öffne einen Chat mit GPT-6 Sol.
GPT-6 Luna: das kleinere Modell mit dem frischesten Wissen
OpenAI beschreibt Luna ganz schlicht: ein Modell für Aufgaben mit hohem Volumen und klarem Ziel. Ein Dokument zusammenfassen, Zahlen und Namen aus Text extrahieren, eine Frage schnell beantworten. Daran ist nichts Bescheidenes: Genau solche Aufgaben machen den Großteil dessen aus, wofür Menschen KI im Alltag nutzen.
Der Preis ist fast symbolisch: zehn Cent pro Million Input-Tokens und fünfzig Cent pro Million Output-Tokens. Das ist halb so viel beim Input wie GPT-5.6 Luna und beim Output fast zweieinhalbmal günstiger. Im aggregierten Intelligenzindex bleibt das Modell auf dem Niveau seines Vorgängers. Beim agentischen Coding rutschte es leicht ab, liefert auf DeepSWE bei maximalen Einstellungen aber 66,6% für gerade einmal 22 Cent pro Aufgabe. Laut OpenAI ist das vergleichbar mit Claude Opus 5 und Fable 5 bei mittleren Einstellungen, kostet aber 93–96% weniger.
Ein interessantes Detail: Das kleinste Modell der Familie hat das frischeste Wissen. Luna wurde mit Daten bis Mai 2026 trainiert, während Sol und Astra im April enden.
In ChatPlus ist GPT-6 Luna im PRO-Abo verfügbar und verbraucht dein Kontingent nicht – also das 5-Stunden-Limit, von dem Anfragen an teure Modelle abgezogen werden. Du kannst es so oft nutzen, wie du möchtest, ohne auf den Zähler zu schauen. Für komplexen Code über mehrere Dateien hinweg ist es nicht die beste Wahl, aber du kannst im selben Gespräch zu Sol oder Opus wechseln.
Grok 4.7: groß, spät – und überraschend bezahlbar
Grok 4.7 kam vor den anderen, obwohl es am längsten erwartet worden war: Elon Musk verschob den Release seit Ende Juli mindestens fünfmal. Die Verzögerung ist nachvollziehbar. Das ist kein kosmetisches Update, sondern ein neues, deutlich größeres Basismodell: Medienberichten zufolge mit rund 2,1 Billionen Parametern. Es erhielt längeres Reinforcement-Learning-Training, mit Schwerpunkt auf Aufgaben, für die Menschen Stunden brauchen. xAI verbesserte außerdem die Selbstprüfung: Das Modell kontrolliert seine eigenen Antworten sorgfältiger und kommt besser mit langem Kontext zurecht. Nebenbei: Das Unternehmen nennt sich in offiziellen Materialien inzwischen SpaceXAI, die Modelle heißen aber weiterhin Grok.
Die Verbesserung gegenüber Grok 4.6 ist erheblich. Auf CursorBench 4.0, einem Test für lange Programmieraufgaben, stieg der Wert von 40,4% auf 46,3%. Auf Terminal-Bench 4.0 verdoppelte er sich fast, von 20,3% auf 37,6%. Bei mehrstündiger Büroarbeit – Berichte, Tabellen, Präsentationen – legte das Modell um mehr als hundert Elo-Punkte zu. Besonders überraschend ist die Leistung im Rechtsbereich: Auf dem Harvey-Benchmark für juristische Aufgaben erreicht Grok 4.7 19,6%, fast dreimal so viel wie Claude Fable 5.1 mit 6,7%. Auf dem Elektrotechnik-Benchmark EEBench kommt es auf 64% gegenüber Fables 56,4%.
Sein Platz in den Gesamtrankings ist bescheidener. In den meisten Vergleichen ist Grok 4.7 Zweiter: Es liegt bei Büroarbeit hinter Fable 5.1, bei Engineering-Aufgaben hinter GPT-6 Astra und bleibt weit hinter Opus 5.5 zurück. Unabhängige Tests sehen es bei 46 Punkten im Intelligenzindex. Das reichte für xAI, um in die Top vier der Labs aufzusteigen, aber nicht weiter. Musk selbst verspricht „Astra- und Fable-Klasse“ erst mit Grok 4.9. Noch eine Einschränkung: Bei maximalen Einstellungen nutzt das Modell pro Aufgabe mehr als doppelt so viele Tokens wie Grok 4.6, der gleiche Token-Preis bedeutet also nicht die gleichen Kosten pro Ergebnis.
Der wichtigste Vorteil von Grok 4.7 ist sein Preis-Leistungs-Verhältnis. Es kostet dasselbe wie Grok 4.6 – zwei Dollar pro Million Input-Tokens und sechs pro Million Output-Tokens – und ist spürbar günstiger als die Flaggschiffe von Anthropic und OpenAI. Grok 4.7 ist in ChatPlus mit dem PRO-Abo verfügbar.
Welches solltest du also wählen?
Wir würden es so aufteilen.
Wenn die Aufgabe groß und wichtig ist – komplexer Code, ein Projektaudit, ein analytischer Bericht oder ein langes Dokument, das klares Denken erfordert – wähle Claude Opus 5.5. Es ist derzeit das stärkste verfügbare Modell und schreibt spürbar besser als frühere Claude-Modelle.
Für Alltagsarbeit, bei der du Balance brauchst, passt GPT-6 Sol sehr gut: Code, Recherche, E-Mails und Tabellen. Es ist vorsichtig, halluziniert seltener und verbraucht weniger von deinem Kontingent.
Für kleine Aufgaben wie Zusammenfassungen, Übersetzungen, kurze Auskünfte und Entwürfe wähle GPT-6 Luna. Es ist schnell und verbraucht dein Kontingent überhaupt nicht.
Grok 4.7 lohnt sich für juristische und technische Fragen, wo es unerwartet stark ist, und als zweite Meinung, wenn du die Antwort eines anderen Modells vergleichen möchtest.
Am einfachsten vergleichst du die Modelle an deiner eigenen Aufgabe. In ChatPlus kannst du mitten im Gespräch das Modell wechseln: Stell Opus eine Frage, wechsle zu Sol oder Grok, schicke denselben Prompt noch einmal und sieh sofort, wer am besten damit umgeht. Ausführliche Modellseiten gibt es für Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna und Grok 4.7.
Kurz gesagt
Vier neue Modelle kamen in zwei Tagen. Claude Opus 5.5 ist der neue Spitzenreiter: Leistung auf Fable 5.1-Niveau für 40% weniger als Opus 5, bestes agentisches Coding seiner Klasse und ein deutlich klarerer Schreibstil. GPT-6 Sol hat bei der Intelligenz kaum zugelegt, kostet aber nur halb so viel und macht halb so oft sachliche Fehler. GPT-6 Luna ist ein sehr günstiges Modell für einfache Aufgaben mit dem frischesten Wissen der Familie. Grok 4.7 hat einen großen Sprung nach vorn gemacht, besonders bei Code, Recht und Engineering, bleibt vorerst aber in der zweiten Liga – zu einem zugänglichen Preis. Alle vier sind bereits in ChatPlus verfügbar.
Teste die besten KI-Modelle auf ChatPlus
GPT, Claude, Gemini, GLM und andere KI-Modelle in einem Fenster.