Claude Opus 5.5, GPT-6 Sol et Grok 4.7 : trois sorties en deux jours, et quel modèle choisir
En deux jours, fin septembre, trois lancements majeurs ont eu lieu : Grok 4.7 de xAI, Claude Opus 5.5 d’Anthropic, ainsi que GPT-6 Sol et Luna d’OpenAI. Voici un tour d’horizon direct de leurs différences, des domaines où chacun excelle vraiment, et du modèle à choisir selon votre tâche. Tous les quatre sont déjà disponibles dans ChatPlus.

Le 21 septembre, xAI a lancé Grok 4.7. Le lendemain, Anthropic a dévoilé Claude Opus 5.5, tandis qu’OpenAI sortait GPT-6 Sol et GPT-6 Luna. Trois laboratoires, quatre modèles, deux jours. Difficile d’y voir une simple coïncidence : la course est si serrée que personne ne veut laisser un concurrent occuper seul les gros titres, ne serait-ce qu’une semaine.
La version courte : Opus 5.5 est le plus solide de ces nouveaux modèles et, d’après des mesures indépendantes, le meilleur modèle actuellement disponible sur le marché dans l’ensemble. GPT-6 Sol n’a presque pas progressé en intelligence brute, mais coûte deux fois moins cher et commet moins d’erreurs factuelles. Luna est léger et très abordable. Grok 4.7 marque une avancée majeure pour xAI, mais reste pour l’instant dans la deuxième catégorie, à un prix toutefois attractif. Voici les détails, avec les réserves à connaître pour chacun.
Quatre modèles en un coup d’œil
À titre de référence, voici leurs caractéristiques principales. Les prix sont indiqués par million de tokens API, afin que vous puissiez repérer les modèles coûteux ; ChatPlus ne facture pas les tokens séparément, puisque tout est inclus dans l’abonnement.
| Model | Developer | Input / output, $ | Context | Best at |
|---|---|---|---|---|
| Claude Opus 5.5 | Anthropic | 4 / 20 | 1M | Programmation longue, documents, rédaction claire |
| GPT-6 Sol | OpenAI | 2 / 10 | 1.05M | Code, agents, exactitude factuelle |
| GPT-6 Luna | OpenAI | 0.10 / 0.50 | 1.05M | Tâches simples et rapides |
| Grok 4.7 | xAI | 2 / 6 | 500K | Code, ingénierie, droit |
Claude Opus 5.5 : des performances au niveau de Fable, sans le prix du fleuron
Opus 5.5 inaugure la nouvelle famille Claude 5.5. Anthropic résume son principal avantage en une phrase : le modèle atteint le niveau de Claude Fable 5.1 — le modèle le plus capable et le plus cher de l’entreprise — tout en coûtant 40% de moins qu’Opus 5. Les prix des tokens baissent de 20%, et le reste vient des gains d’efficacité : le modèle utilise moins d’étapes et moins de tokens pour une même tâche. Il génère aussi du texte plus de 30% plus vite que son prédécesseur.
Les tests indépendants le confirment. Dans l’indice agrégé d’Artificial Analysis, Opus 5.5 a obtenu 58 points aux réglages maximaux — le meilleur résultat jamais mesuré à ce jour, avec plusieurs points d’avance. Il domine presque partout : programmation agentique (66,4% sur Terminal-Bench 4.0, contre 55,8% pour Fable 5.1 et 57,9% pour GPT-6 Astra), tâches bureautiques et questions complexes impliquant l’usage d’outils.
Mais les scores de benchmark disent peu de chose sur l’expérience réelle avec un modèle. Les premiers retours de testeurs sont plus parlants. L’un d’eux a migré un projet de 680 000 lignes de code en moins d’une journée, une tâche qui aurait pris des semaines à une équipe d’ingénieurs. Un autre a audité et réparé une base de code de 200 000 lignes en trois heures, là où Opus 5 avait eu besoin de plus de vingt heures pour le même travail. Dans une autre entreprise, Opus 5.5 a terminé en 11 prompts et trois heures une tâche complexe qui nécessitait auparavant 38 prompts et quatre jours. Anthropic a aussi mené une expérience interne : demander à Opus 5.5 et Fable 5.1 de réécrire HAProxy, un équilibreur de charge populaire, de C vers Rust. Les deux ont réussi, mais Opus 5.5 a terminé en 9,5 heures au lieu de 12, pour un coût deux fois moindre.
Le deuxième grand changement concerne la façon dont le modèle écrit. Opus 5 était souvent critiqué pour sa verbosité : longues introductions, formulations corporate, idée principale enfouie au troisième paragraphe. Opus 5.5 va droit au but, se perd moins souvent dans le jargon et respecte plus fidèlement les consignes de style que vous lui donnez. Un testeur l’a résumé simplement : « Il écrit comme moi. » Cela se voit immédiatement lorsque vous travaillez du texte : il y a moins de nettoyage à faire après coup.
Une caractéristique mérite d’être connue à l’avance : vous ne pouvez pas désactiver le raisonnement dans Opus 5.5. Il réfléchit toujours d’abord, puis répond. C’est un avantage sur les tâches complexes. Pour une question comme « comment dit-on appui de fenêtre en anglais ? », cela signifie quelques secondes d’attente en plus. Pour ce type de petites tâches, mieux vaut choisir un modèle plus simple.
Sur ChatPlus, Claude Opus 5.5 est déjà disponible dans le chat — avec l’abonnement Max, aux côtés d’autres modèles haut de gamme.
GPT-6 Sol : le même niveau, à moitié prix
Début septembre, OpenAI a lancé son fleuron GPT-6 Astra, et la famille GPT-6 se présente désormais ainsi : Astra en haut, Sol au milieu, Luna en entrée de gamme. Sol est conçu comme un modèle de travail : il reprend la précision d’Astra et sa capacité à mener une tâche jusqu’au bout, mais coûte nettement moins cher.
OpenAI met en avant la fiabilité de Sol plutôt que des records. L’entreprise a repris de vraies conversations dans lesquelles les utilisateurs avaient signalé des erreurs du modèle, puis a testé la nouvelle version dessus : Sol se trompe environ deux fois moins souvent que GPT-5.6 Sol et atteint le niveau de fiabilité d’Astra. Un test indépendant sur les hallucinations le confirme, avec toutefois une nuance. La part de réponses inventées est passée de 92% à 60%, en grande partie parce que le modèle refuse plus souvent de répondre lorsqu’il est incertain. La proportion globale de bonnes réponses a même légèrement baissé, de 59% à 54%. Pour le travail quotidien, c’est plutôt une bonne nouvelle qu’une mauvaise : un « je ne sais pas » honnête vaut mieux qu’une invention débitée avec assurance.
En programmation, Sol tient tête à des modèles beaucoup plus chers. Sur DeepSWE, un test de longues tâches d’ingénierie dans de vrais dépôts, il obtient 68,8%. Claude Fable 5 signe le meilleur score, à 69,9%, mais coûte environ cinq fois plus cher par tâche. Sur Terminal-Bench 4.0, Sol est passé de 37% à 43%.
Passons maintenant à ce que le communiqué ne dit pas. Dans l’indice agrégé d’intelligence, Sol est presque inchangé par rapport à son prédécesseur : 48 points contre 47. Il a même régressé sur le travail avec des documents bureautiques, et se situe derrière Astra comme derrière le Sol précédent pour le contrôle d’ordinateur. Ce n’est donc pas un bond en avant, mais le même niveau de capacité à moitié prix. Pour la plupart des tâches, c’est précisément ce dont vous avez besoin : code, recherche, correspondance et analyse. Si vous voulez un modèle capable de cliquer tout seul dans des interfaces, choisissez Astra.
GPT-6 Sol est disponible avec notre abonnement PRO, et comme il coûte deux fois moins cher que le précédent Sol, votre quota va sensiblement plus loin dans les longues conversations. Ouvrir un chat avec GPT-6 Sol.
GPT-6 Luna : le modèle plus petit, avec les connaissances les plus fraîches
OpenAI décrit Luna simplement : un modèle pour les tâches à grand volume avec un objectif clair. Résumer un document, extraire des chiffres et des noms d’un texte, répondre rapidement à une question. Il n’y a rien de secondaire là-dedans : ces tâches représentent l’essentiel de ce que les gens font chaque jour avec l’IA.
Son prix est presque symbolique : dix cents par million de tokens en entrée et cinquante cents par million de tokens en sortie. C’est moitié moins que le prix d’entrée de GPT-5.6 Luna, et presque deux fois et demie moins cher en sortie. Dans l’indice agrégé d’intelligence, le modèle reste au niveau de son prédécesseur. Il recule légèrement en codage agentique, mais sur DeepSWE aux réglages maximaux, il atteint 66,6% pour seulement 22 cents par tâche. Selon OpenAI, c’est comparable à Claude Opus 5 et Fable 5 aux réglages moyens, pour un coût inférieur de 93–96%.
Détail intéressant : le plus petit modèle de la famille possède les connaissances les plus récentes. Luna a été entraîné sur des données allant jusqu’à mai 2026, tandis que Sol et Astra s’arrêtent à avril.
Dans ChatPlus, GPT-6 Luna est disponible avec l’abonnement PRO et n’utilise pas votre quota — la limite de 5 heures dont sont déduites les requêtes vers les modèles coûteux. Vous pouvez l’utiliser autant que vous le souhaitez, sans surveiller le compteur. Ce n’est pas le meilleur choix pour du code complexe sur plusieurs fichiers, mais vous pouvez passer à Sol ou Opus dans la même conversation.
Grok 4.7 : grand, tardif et étonnamment abordable
Grok 4.7 est arrivé avant les autres, alors même qu’il était attendu depuis le plus longtemps : Elon Musk avait repoussé sa sortie au moins cinq fois, depuis fin juillet. Le délai se comprend. Il ne s’agit pas d’une mise à jour cosmétique, mais d’un nouveau modèle de base nettement plus grand : selon des informations de presse, environ 2,1 billions de paramètres. Il a bénéficié d’un entraînement par apprentissage par renforcement plus long, avec un accent sur les tâches qui prennent des heures aux humains. xAI a aussi amélioré l’auto-vérification : le modèle relit ses propres réponses plus attentivement et gère mieux les longs contextes. Au passage, l’entreprise se désigne désormais sous le nom SpaceXAI dans ses documents officiels, même si les modèles s’appellent toujours Grok.
L’amélioration par rapport à Grok 4.6 est importante. Sur CursorBench 4.0, un test de longues tâches de programmation, le score est passé de 40,4% à 46,3%. Sur Terminal-Bench 4.0, il a presque doublé, de 20,3% à 37,6%. Dans le travail bureautique sur plusieurs heures — rapports, feuilles de calcul, présentations — le modèle a gagné plus de cent points Elo. Ses performances juridiques sont particulièrement surprenantes : sur le benchmark juridique Harvey, Grok 4.7 obtient 19,6%, soit presque trois fois les 6,7% de Claude Fable 5.1. Sur le benchmark d’ingénierie électrique EEBench, il atteint 64%, contre 56,4% pour Fable.
Sa place dans les classements globaux est plus modeste. Dans la plupart des comparaisons, Grok 4.7 est deuxième : il reste derrière Fable 5.1 pour le travail bureautique, derrière GPT-6 Astra pour les tâches d’ingénierie, et très loin derrière Opus 5.5. Les tests indépendants le placent à 46 points dans l’indice d’intelligence. C’était suffisant pour permettre à xAI d’entrer dans le top 4 des laboratoires, mais pas davantage. Musk lui-même ne promet une catégorie « Astra et Fable » qu’avec Grok 4.9. Autre réserve : aux réglages maximaux, le modèle utilise plus de deux fois plus de tokens par tâche que Grok 4.6 ; le même prix au token ne signifie donc pas le même coût par résultat.
Le principal atout de Grok 4.7 est son rapport qualité-prix. Il coûte autant que Grok 4.6 — deux dollars par million de tokens en entrée et six par million de tokens en sortie — et reste nettement moins cher que les modèles phares d’Anthropic et d’OpenAI. Grok 4.7 est disponible sur ChatPlus avec l’abonnement PRO.
Alors, lequel choisir ?
Nous résumerions les choses ainsi.
Si la tâche est vaste et importante — code complexe, audit de projet, rapport analytique ou long document nécessitant un raisonnement clair — choisissez Claude Opus 5.5. C’est actuellement le modèle disponible le plus puissant, et il écrit nettement mieux que les précédents modèles Claude.
Pour le travail du quotidien, lorsque vous cherchez l’équilibre, GPT-6 Sol convient très bien : code, recherche, e-mails et feuilles de calcul. Il est prudent, hallucine moins souvent et consomme moins votre quota.
Pour les petites tâches comme les résumés, les traductions, les réponses courtes de référence et les brouillons, choisissez GPT-6 Luna. Il est rapide et n’utilise pas du tout votre quota.
Grok 4.7 mérite d’être essayé pour les questions juridiques et d’ingénierie, où il se montre étonnamment solide, ainsi que comme deuxième avis lorsque vous voulez comparer la réponse d’un autre modèle.
Le plus simple est de comparer sur votre propre tâche. Dans ChatPlus, vous pouvez changer de modèle au milieu d’une conversation : poser une question à Opus, passer à Sol ou Grok, envoyer de nouveau le même prompt et voir immédiatement lequel s’en sort le mieux. Des pages détaillées sont disponibles pour Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna et Grok 4.7.
En bref
Quatre nouveaux modèles sont arrivés en deux jours. Claude Opus 5.5 est le nouveau leader : des capacités au niveau de Fable 5.1 pour 40% de moins qu’Opus 5, le meilleur codage agentique de sa catégorie et une rédaction nettement plus claire. GPT-6 Sol a à peine progressé en intelligence, mais coûte deux fois moins cher et commet deux fois moins d’erreurs factuelles. GPT-6 Luna est un modèle très abordable pour les tâches simples, avec les connaissances les plus fraîches de la famille. Grok 4.7 a fait un bond important, surtout en code, droit et ingénierie, mais reste pour l’instant dans la deuxième catégorie — à un prix accessible. Tous les quatre sont déjà disponibles dans ChatPlus.
Essayez les meilleurs modèles d’IA sur ChatPlus
GPT, Claude, Gemini, GLM et d’autres modèles d’IA dans une seule fenêtre.