live
10 labs · 30 models
Todos los artículos
9 min de lecturaChatPlus Team

Claude Opus 5.5, GPT-6 Sol y Grok 4.7: tres lanzamientos en dos días y qué modelo elegir

En dos días, a finales de septiembre, llegaron tres lanzamientos importantes: Grok 4.7 de xAI, Claude Opus 5.5 de Anthropic y GPT-6 Sol y Luna de OpenAI. Aquí tienes una mirada directa a sus diferencias, en qué destaca de verdad cada uno y cuál elegir para tu tarea. Los cuatro ya están disponibles en ChatPlus.

ModelosAnthropicOpenAIxAINoticias
La mascota Max flota en el espacio exterior sobre el borde de un planeta, alcanzando tres tarjetas holográficas con los logotipos y las etiquetas "Anthropic — Claude Opus 5.5", "OpenAI — GPT-6 Sol · Luna" y "xAI — Grok 4.7". Imagen de portada para un artículo sobre nuevos modelos
Escuchar el artículo00:00

El 21 de septiembre, xAI lanzó Grok 4.7. Al día siguiente, Anthropic presentó Claude Opus 5.5, mientras que OpenAI lanzó GPT-6 Sol y GPT-6 Luna. Tres laboratorios, cuatro modelos, dos días. Cuesta llamarlo coincidencia: la carrera está tan cerrada que nadie quiere dejar a un competidor solo en los titulares ni siquiera una semana.

La versión corta: Opus 5.5 es el más potente de los nuevos lanzamientos y, según mediciones independientes, hoy es el mejor modelo del mercado en general. GPT-6 Sol apenas mejoró en inteligencia bruta, pero cuesta la mitad y comete menos errores factuales. Luna es ligero y muy económico. Grok 4.7 es un gran salto para xAI, pero por ahora sigue en la segunda categoría, aunque con un precio atractivo. Aquí van los detalles y las advertencias honestas de cada uno.

Cuatro modelos de un vistazo

Como referencia, estas son las especificaciones principales. Los precios están indicados por millón de tokens de API, para que veas qué modelos son caros; ChatPlus no cobra los tokens por separado, ya que todo está incluido en la suscripción.

ModelDeveloperInput / output, $ContextBest at
Claude Opus 5.5Anthropic4 / 201MProgramación extensa, documentos, redacción clara
GPT-6 SolOpenAI2 / 101.05MCódigo, agentes, precisión factual
GPT-6 LunaOpenAI0.10 / 0.501.05MTareas rápidas y simples
Grok 4.7xAI2 / 6500KCódigo, ingeniería, derecho

Claude Opus 5.5: rendimiento al nivel de Fable sin precio de modelo insignia

Opus 5.5 inaugura la nueva familia Claude 5.5. Anthropic resume su principal ventaja en una frase: el modelo rinde al nivel de Claude Fable 5.1 —el modelo más capaz y más caro de la compañía— pero cuesta 40% menos que Opus 5. Los precios por token bajaron 20%, y el resto viene de la eficiencia: el modelo usa menos pasos y menos tokens para la misma tarea. Además, genera texto más de 30% más rápido que su predecesor.

Las pruebas independientes lo confirman. En el índice agregado de Artificial Analysis, Opus 5.5 obtuvo 58 puntos con la configuración máxima: el mejor resultado jamás medido allí, con varios puntos de ventaja. Lidera casi en todo: programación agéntica (66.4% en Terminal-Bench 4.0 frente a 55.8% de Fable 5.1 y 57.9% de GPT-6 Astra), trabajo de oficina y preguntas complejas con uso de herramientas.

Pero los números de benchmarks dicen poco sobre cómo se siente un modelo en el trabajo real. Las historias de los primeros testers son más reveladoras. Uno migró un proyecto con 680,000 líneas de código en menos de un día, una tarea que a un equipo de ingeniería le habría tomado semanas. Otro auditó y reparó una base de código de 200,000 líneas en tres horas, mientras que Opus 5 necesitó más de veinte para el mismo trabajo. En otra empresa, Opus 5.5 completó una tarea compleja que antes había requerido 38 prompts y cuatro días en 11 prompts y tres horas. Anthropic también hizo un experimento interno: les pidió a Opus 5.5 y Fable 5.1 reescribir HAProxy, un popular balanceador de carga, de C a Rust. Ambos lo lograron, pero Opus 5.5 terminó en 9.5 horas en lugar de 12 y costó la mitad.

El segundo gran cambio es cómo escribe el modelo. Opus 5 era criticado a menudo por ser demasiado verboso: introducciones largas, frases corporativas y la idea principal enterrada en el tercer párrafo. Opus 5.5 pone el punto principal primero, se va menos al jargon y sigue con más fiabilidad las reglas de estilo que le das. Un tester lo resumió así: "Escribe como escribo yo". Esto se nota de inmediato al trabajar con texto: hay que limpiar menos después del modelo.

Hay una característica que conviene saber de antemano: no puedes desactivar el razonamiento en Opus 5.5. Siempre piensa primero y luego responde. Eso es una ventaja en tareas complejas. Para una pregunta como "¿cómo se dice alféizar en inglés?", implica esperar unos segundos extra. Para tareas pequeñas como esa, conviene elegir un modelo más simple.

En ChatPlus, Claude Opus 5.5 ya está disponible en el chat — en el plan Max, junto con otros modelos de primera línea.

GPT-6 Sol: la misma vara, a mitad de precio

A principios de septiembre, OpenAI lanzó su modelo insignia GPT-6 Astra, y la familia GPT-6 ahora queda así: Astra arriba, Sol en el medio y Luna abajo. Sol está pensado como caballo de batalla: toma la precisión de Astra y su capacidad para llevar una tarea hasta el final, pero cuesta bastante menos.

OpenAI está vendiendo Sol por confiabilidad, no por récords. La compañía tomó conversaciones reales en las que los usuarios habían marcado errores del modelo y probó la nueva versión con ellas: Sol se equivoca aproximadamente la mitad de veces que GPT-5.6 Sol y alcanza la confiabilidad de Astra. Una prueba independiente de alucinaciones lo confirma, aunque con un matiz. La proporción de respuestas inventadas bajó de 92% a 60%, en gran parte porque el modelo se niega más a menudo a responder cuando no está seguro. La proporción total de respuestas correctas incluso bajó ligeramente, de 59% a 54%. Para el trabajo diario, eso es más buena noticia que mala: un "no lo sé" honesto es mejor que una invención dicha con seguridad.

En programación, Sol se mantiene a la par de modelos mucho más caros. En DeepSWE, una prueba de tareas largas de ingeniería en repositorios reales, alcanza 68.8%. Claude Fable 5 tiene la mejor puntuación, con 69.9%, pero cuesta aproximadamente cinco veces más por tarea. En Terminal-Bench 4.0, Sol mejoró de 37% a 43%.

Ahora, lo que el comunicado de prensa no menciona. En el índice agregado de inteligencia, Sol casi no cambió respecto a su predecesor: 48 puntos frente a 47. Incluso retrocedió en trabajo con documentos de oficina y queda por detrás tanto de Astra como del Sol anterior en control de computadora. Así que no es un salto adelante, sino la misma vara de capacidad a mitad de precio. Para la mayoría de las tareas, eso es exactamente lo que necesitas: programación, investigación, correspondencia y análisis. Si necesitas un modelo que haga clic por interfaces por su cuenta, elige Astra.

GPT-6 Sol está disponible en nuestra suscripción PRO y, como cuesta la mitad que el Sol anterior, tu cupo rinde bastante más en conversaciones largas. Abre un chat con GPT-6 Sol.

GPT-6 Luna: el modelo más pequeño con el conocimiento más fresco

OpenAI describe Luna de forma simple: un modelo para tareas de alto volumen con un objetivo claro. Resumir un documento, extraer números y nombres de un texto, responder una pregunta rápido. No hay nada menor en eso: esas tareas son la mayor parte de lo que la gente hace con IA todos los días.

Su precio es casi simbólico: diez centavos por millón de tokens de entrada y cincuenta centavos por millón de tokens de salida. Eso es la mitad del precio de entrada de GPT-5.6 Luna y casi dos veces y media más barato en salida. En el índice agregado de inteligencia, el modelo se mantiene al nivel de su predecesor. Bajó ligeramente en programación agéntica, pero en DeepSWE con configuración máxima entrega 66.6% por apenas 22 centavos por tarea. Según OpenAI, eso es comparable con Claude Opus 5 y Fable 5 en configuración media, pero cuesta 93–96% menos.

Un detalle interesante: el modelo más pequeño de la familia tiene el conocimiento más actualizado. Luna fue entrenado con datos hasta mayo de 2026, mientras que Sol y Astra se detienen en abril.

En ChatPlus, GPT-6 Luna está disponible en la suscripción PRO y no usa tu cupo: el límite de 5 horas del que se descuentan las solicitudes a modelos caros. Puedes usarlo todo lo que quieras sin mirar el contador. No es la mejor opción para código complejo con muchos archivos, pero puedes cambiar a Sol u Opus en la misma conversación.

Grok 4.7: grande, tardío y sorprendentemente accesible

Grok 4.7 llegó antes que los demás, pese a que era el más esperado desde hacía más tiempo: Elon Musk pospuso el lanzamiento al menos cinco veces, desde finales de julio. La demora se entiende. No es una actualización cosmética, sino un nuevo modelo base bastante más grande: según reportes de medios, alrededor de 2.1 billones de parámetros. Recibió un entrenamiento más largo con aprendizaje por refuerzo, con énfasis en tareas que a los humanos les toman horas. xAI también mejoró la autoverificación: el modelo revisa sus propias respuestas con más cuidado y maneja mejor los contextos largos. Por cierto, la compañía ahora se llama SpaceXAI en materiales oficiales, aunque los modelos siguen llamándose Grok.

La mejora frente a Grok 4.6 es considerable. En CursorBench 4.0, una prueba de tareas largas de programación, la puntuación subió de 40.4% a 46.3%. En Terminal-Bench 4.0, casi se duplicó, de 20.3% a 37.6%. En trabajo de oficina de varias horas —informes, hojas de cálculo, presentaciones— el modelo ganó más de cien puntos Elo. Su desempeño legal sorprende en especial: en el benchmark legal Harvey, Grok 4.7 obtiene 19.6%, casi tres veces el 6.7% de Claude Fable 5.1. En el benchmark de ingeniería eléctrica EEBench, logra 64% frente al 56.4% de Fable.

Su lugar en los rankings generales es más modesto. En la mayoría de las comparaciones, Grok 4.7 queda segundo: va por detrás de Fable 5.1 en trabajo de oficina, de GPT-6 Astra en tareas de ingeniería y sigue muy lejos de Opus 5.5. Las pruebas independientes lo ubican en 46 puntos en el índice de inteligencia. Eso alcanzó para que xAI entrara en el top cuatro de laboratorios, pero no más. El propio Musk promete una "clase Astra y Fable" recién con Grok 4.9. Una advertencia más: con configuración máxima, el modelo usa más del doble de tokens por tarea que Grok 4.6, así que el mismo precio por token no significa el mismo costo por resultado.

La ventaja clave de Grok 4.7 es su relación precio-calidad. Cuesta lo mismo que Grok 4.6 —dos dólares por millón de tokens de entrada y seis por millón de tokens de salida— y es notablemente más barato que los modelos insignia de Anthropic y OpenAI. Grok 4.7 está disponible en ChatPlus con la suscripción PRO.

Entonces, ¿cuál conviene elegir?

Lo resumiríamos así.

Si la tarea es grande e importante —código complejo, una auditoría de proyecto, un informe analítico o un documento largo que necesita pensamiento claro— elige Claude Opus 5.5. Actualmente es el modelo disponible más potente y escribe notablemente mejor que los Claude anteriores.

Para el trabajo diario en el que necesitas equilibrio, GPT-6 Sol encaja muy bien: código, investigación, correos y hojas de cálculo. Es cuidadoso, alucina con menos frecuencia y consume menos de tu cupo.

Para tareas pequeñas como resúmenes, traducciones, respuestas breves de consulta y borradores, elige GPT-6 Luna. Es rápido y no usa nada de tu cupo.

Vale la pena probar Grok 4.7 para preguntas legales y de ingeniería, donde es inesperadamente fuerte, y como segunda opinión cuando quieres comparar la respuesta de otro modelo.

La forma más fácil de comparar es con tu propia tarea. En ChatPlus puedes cambiar de modelo a mitad de una conversación: hazle una pregunta a Opus, cambia a Sol o Grok, envía el mismo prompt otra vez y ve al instante quién lo resuelve mejor. Las páginas detalladas de los modelos están disponibles para Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna y Grok 4.7.

En resumen

Cuatro modelos nuevos llegaron en dos días. Claude Opus 5.5 es el nuevo líder: capacidad al nivel de Fable 5.1 por 40% menos que Opus 5, programación agéntica líder en su categoría y una escritura claramente más limpia. GPT-6 Sol apenas mejoró en inteligencia, pero cuesta la mitad y comete errores factuales la mitad de veces. GPT-6 Luna es un modelo muy económico para tareas simples, con el conocimiento más actualizado de la familia. Grok 4.7 dio un gran salto, especialmente en código, derecho e ingeniería, pero por ahora sigue en la segunda categoría, a un precio accesible. Los cuatro ya están disponibles en ChatPlus.

Prueba los mejores modelos de IA en ChatPlus

GPT, Claude, Gemini, GLM y otros modelos de IA en una sola ventana.