Claude Opus 5.5, GPT-6 Sol e Grok 4.7: três lançamentos em dois dias e qual modelo escolher
Em dois dias no fim de setembro, chegaram três grandes lançamentos: Grok 4.7, da xAI, Claude Opus 5.5, da Anthropic, e GPT-6 Sol e Luna, da OpenAI. Aqui vai uma análise direta de como eles se diferenciam, onde cada um realmente se destaca e qual escolher para a sua tarefa. Os quatro já estão disponíveis no ChatPlus.

Em 21 de setembro, a xAI lançou o Grok 4.7. No dia seguinte, a Anthropic apresentou o Claude Opus 5.5, enquanto a OpenAI lançou o GPT-6 Sol e o GPT-6 Luna. Três laboratórios, quatro modelos, dois dias. É difícil chamar isso de coincidência: a disputa está tão apertada que ninguém quer deixar um concorrente sozinho nas manchetes nem por uma semana.
A versão curta: Opus 5.5 é o mais forte entre os novos lançamentos e, segundo medições independentes, atualmente o melhor modelo do mercado no geral. GPT-6 Sol quase não melhorou em inteligência bruta, mas custa metade do preço e comete menos erros factuais. Luna é leve e muito acessível. Grok 4.7 é um grande avanço para a xAI, mas por enquanto ainda fica no segundo pelotão, embora com um preço atraente. Veja os detalhes e as ressalvas honestas sobre cada um.
Quatro modelos em resumo
Para referência, aqui estão as especificações principais. Os preços estão listados por milhão de tokens de API, para você ver quais modelos são caros; o ChatPlus não cobra separadamente por tokens, já que tudo está incluído na assinatura.
| Modelo | Desenvolvedor | Entrada / saída, $ | Contexto | Melhor em |
|---|---|---|---|---|
| Claude Opus 5.5 | Anthropic | 4 / 20 | 1M | Programação longa, documentos, escrita clara |
| GPT-6 Sol | OpenAI | 2 / 10 | 1.05M | Código, agentes, precisão factual |
| GPT-6 Luna | OpenAI | 0.10 / 0.50 | 1.05M | Tarefas rápidas e simples |
| Grok 4.7 | xAI | 2 / 6 | 500K | Código, engenharia, direito |
Claude Opus 5.5: desempenho no nível do Fable sem preço de flagship
O Opus 5.5 inaugura a nova família Claude 5.5. A Anthropic resume sua principal vantagem em uma frase: o modelo entrega desempenho no nível do Claude Fable 5.1 — o modelo mais capaz e mais caro da empresa — custando 40% menos que o Opus 5. Os preços por token caíram 20%, e o restante vem de eficiência: o modelo usa menos etapas e menos tokens para a mesma tarefa. Ele também gera texto mais de 30% mais rápido que seu antecessor.
Testes independentes confirmam isso. No índice agregado da Artificial Analysis, o Opus 5.5 marcou 58 pontos nas configurações máximas — o melhor resultado já medido ali, vários pontos à frente. Ele lidera em quase tudo: programação agentiva (66,4% no Terminal-Bench 4.0 contra 55,8% do Fable 5.1 e 57,9% do GPT-6 Astra), trabalho de escritório e perguntas complexas com uso de ferramentas.
Mas números de benchmark dizem pouco sobre a sensação de usar um modelo no trabalho real. Os relatos dos primeiros testadores são mais reveladores. Um deles migrou um projeto com 680.000 linhas de código em menos de um dia, uma tarefa que teria levado semanas para uma equipe de engenharia. Outro auditou e corrigiu uma base de código de 200.000 linhas em três horas, enquanto o Opus 5 precisou de mais de vinte para o mesmo trabalho. Em outra empresa, o Opus 5.5 concluiu em 11 prompts e três horas uma tarefa complexa que antes exigia 38 prompts e quatro dias. A Anthropic também fez um experimento interno: pediu ao Opus 5.5 e ao Fable 5.1 que reescrevessem o HAProxy, um popular balanceador de carga, de C para Rust. Ambos conseguiram, mas o Opus 5.5 terminou em 9,5 horas em vez de 12 e custou metade do preço.
A segunda grande mudança está na forma como o modelo escreve. O Opus 5 era frequentemente criticado por ser prolixo: introduções longas, linguagem corporativa e a ideia principal escondida no terceiro parágrafo. O Opus 5.5 coloca o ponto principal primeiro, cai menos em jargões e segue com mais confiabilidade as regras de estilo que você dá. Um testador resumiu assim: "Ele escreve do jeito que eu escrevo." Dá para notar isso imediatamente ao trabalhar com texto: sobra menos limpeza para fazer depois.
Há uma característica que vale saber de antemão: não dá para desligar o raciocínio no Opus 5.5. Ele sempre pensa primeiro e depois responde. Isso é uma vantagem em tarefas complexas. Para uma pergunta como "qual é a palavra em inglês para peitoril?", significa alguns segundos extras de espera. Para tarefas pequenas assim, um modelo mais simples é uma escolha melhor.
No ChatPlus, Claude Opus 5.5 já está disponível no chat — no plano Max, junto com outros modelos de primeira linha.
GPT-6 Sol: o mesmo patamar, pela metade do preço
No início de setembro, a OpenAI lançou seu flagship GPT-6 Astra, e a família GPT-6 agora fica assim: Astra no topo, Sol no meio, Luna na base. O Sol foi criado como um modelo pau para toda obra: ele traz a precisão do Astra e a capacidade de levar uma tarefa até o fim, mas custa consideravelmente menos.
A OpenAI está vendendo o Sol pela confiabilidade, não por recordes. A empresa pegou conversas reais em que usuários haviam sinalizado erros do modelo e testou a nova versão nelas: o Sol erra cerca de metade das vezes em comparação com o GPT-5.6 Sol e chega ao nível de confiabilidade do Astra. Um teste independente de alucinação confirma isso, embora com uma ressalva. A parcela de respostas inventadas caiu de 92% para 60%, em grande parte porque o modelo se recusa a responder com mais frequência quando está incerto. A proporção geral de respostas corretas até caiu ligeiramente, de 59% para 54%. Para o trabalho do dia a dia, isso é mais notícia boa do que ruim: um "não sei" honesto é melhor do que uma invenção dita com confiança.
Em programação, o Sol acompanha modelos muito mais caros. No DeepSWE, um teste de tarefas longas de engenharia em repositórios reais, ele marca 68,8%. O Claude Fable 5 tem a melhor pontuação, com 69,9%, mas custa cerca de cinco vezes mais por tarefa. No Terminal-Bench 4.0, o Sol subiu de 37% para 43%.
Agora, o que o comunicado à imprensa não menciona. No índice agregado de inteligência, o Sol praticamente não mudou em relação ao antecessor: 48 pontos contra 47. Ele até regrediu em trabalho com documentos de escritório e fica atrás tanto do Astra quanto do Sol anterior no controle de computador. Portanto, isto não é um salto adiante, mas o mesmo patamar de capacidade pela metade do preço. Para a maioria das tarefas, é exatamente disso que você precisa: programação, pesquisa, correspondência e análise. Se você precisa de um modelo que clique em interfaces por conta própria, escolha o Astra.
O GPT-6 Sol está disponível na nossa assinatura PRO e, como custa metade do Sol anterior, sua franquia rende bem mais em conversas longas. Abra um chat com o GPT-6 Sol.
GPT-6 Luna: o modelo menor com o conhecimento mais atualizado
A OpenAI descreve o Luna de forma simples: um modelo para tarefas de alto volume com objetivo claro. Resumir um documento, extrair números e nomes de um texto, responder rapidamente a uma pergunta. Não há nada de modesto nisso: essas tarefas compõem a maior parte do que as pessoas fazem com IA todos os dias.
Seu preço é quase simbólico: dez centavos por milhão de tokens de entrada e cinquenta centavos por milhão de tokens de saída. Isso é metade do preço de entrada do GPT-5.6 Luna e quase duas vezes e meia mais barato na saída. No índice agregado de inteligência, o modelo permanece no nível do antecessor. Ele caiu ligeiramente em programação agentiva, mas no DeepSWE, em configurações máximas, entrega 66,6% por apenas 22 centavos por tarefa. Segundo a OpenAI, isso é comparável ao Claude Opus 5 e ao Fable 5 em configurações médias, custando 93–96% menos.
Um detalhe interessante: o menor modelo da família tem o conhecimento mais recente. O Luna foi treinado com dados até maio de 2026, enquanto o Sol e o Astra param em abril.
No ChatPlus, o GPT-6 Luna está disponível na assinatura PRO e não usa sua franquia — o limite de 5 horas do qual são descontadas as solicitações para modelos caros. Você pode usá-lo quanto quiser sem ficar de olho no contador. Ele não é a melhor escolha para código complexo em vários arquivos, mas você pode trocar para o Sol ou o Opus na mesma conversa.
Grok 4.7: grande, atrasado e inesperadamente acessível
O Grok 4.7 chegou antes dos outros, apesar de ter sido aguardado por mais tempo: Elon Musk adiou o lançamento pelo menos cinco vezes, desde o fim de julho. O atraso é compreensível. Não é uma atualização cosmética, mas um novo modelo-base substancialmente maior: segundo relatos da imprensa, cerca de 2,1 trilhões de parâmetros. Ele recebeu treinamento mais longo com aprendizagem por reforço, com ênfase em tarefas que levam horas para humanos. A xAI também melhorou a autoverificação: o modelo revisa suas próprias respostas com mais cuidado e lida melhor com contexto longo. A propósito, a empresa agora se chama SpaceXAI em materiais oficiais, embora os modelos ainda se chamem Grok.
A melhora em relação ao Grok 4.6 é substancial. No CursorBench 4.0, um teste de tarefas longas de programação, a pontuação subiu de 40,4% para 46,3%. No Terminal-Bench 4.0, quase dobrou, de 20,3% para 37,6%. Em trabalho de escritório de várias horas — relatórios, planilhas, apresentações — o modelo ganhou mais de cem pontos Elo. Seu desempenho jurídico é especialmente surpreendente: no benchmark jurídico Harvey, o Grok 4.7 marca 19,6%, quase três vezes os 6,7% do Claude Fable 5.1. No benchmark de engenharia elétrica EEBench, faz 64% contra 56,4% do Fable.
Sua posição nos rankings gerais é mais modesta. Na maioria das comparações, o Grok 4.7 fica em segundo: atrás do Fable 5.1 em trabalho de escritório, do GPT-6 Astra em tarefas de engenharia, e ainda muito distante do Opus 5.5. Testes independentes o colocam em 46 pontos no índice de inteligência. Isso bastou para a xAI entrar no grupo dos quatro principais laboratórios, mas não foi além. O próprio Musk promete uma "classe Astra e Fable" apenas com o Grok 4.9. Mais uma ressalva: nas configurações máximas, o modelo usa mais que o dobro de tokens por tarefa em comparação com o Grok 4.6, então o mesmo preço por token não significa o mesmo custo por resultado.
A principal vantagem do Grok 4.7 é sua relação entre preço e qualidade. Ele custa o mesmo que o Grok 4.6 — dois dólares por milhão de tokens de entrada e seis por milhão de tokens de saída — e é sensivelmente mais barato que os flagships da Anthropic e da OpenAI. O Grok 4.7 está disponível no ChatPlus com a assinatura PRO.
Então qual você deve escolher?
Nós dividiríamos assim.
Se a tarefa é grande e importante — código complexo, auditoria de projeto, relatório analítico ou um documento longo que exige raciocínio claro — escolha Claude Opus 5.5. Ele é atualmente o modelo mais forte disponível e escreve visivelmente melhor que os modelos Claude anteriores.
Para o trabalho do dia a dia em que você precisa de equilíbrio, GPT-6 Sol é uma ótima opção: código, pesquisa, emails e planilhas. Ele é cuidadoso, alucina com menos frequência e consome menos da sua franquia.
Para tarefas pequenas, como resumos, traduções, respostas curtas de referência e rascunhos, escolha GPT-6 Luna. Ele é rápido e não usa sua franquia de jeito nenhum.
Grok 4.7 vale o teste para perguntas jurídicas e de engenharia, nas quais é inesperadamente forte, e como segunda opinião quando você quer comparar a resposta de outro modelo.
A maneira mais fácil de comparar é na sua própria tarefa. No ChatPlus, você pode trocar de modelo no meio da conversa: faça uma pergunta ao Opus, mude para o Sol ou o Grok, envie o mesmo prompt novamente e veja imediatamente quem se sai melhor. Páginas detalhadas dos modelos estão disponíveis para Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna e Grok 4.7.
Em resumo
Quatro novos modelos chegaram em dois dias. Claude Opus 5.5 é o novo líder: capacidade no nível do Fable 5.1 por 40% menos que o Opus 5, programação agentiva líder da categoria e escrita visivelmente mais clara. GPT-6 Sol quase não avançou em inteligência, mas custa metade do preço e comete erros factuais com metade da frequência. GPT-6 Luna é um modelo muito acessível para tarefas simples, com o conhecimento mais atualizado da família. Grok 4.7 deu um grande salto, especialmente em código, direito e engenharia, mas por enquanto continua no segundo pelotão — a um preço acessível. Os quatro já estão disponíveis no ChatPlus.
Experimente os melhores modelos de IA no ChatPlus
GPT, Claude, Gemini, GLM e outros modelos de IA em uma só janela.