live
10 labs · 30 models
Tüm yazılar
9 dk okumaChatPlus Team

Claude Opus 5.5, GPT-6 Sol ve Grok 4.7: iki günde üç çıkış ve hangi modeli seçmeli?

Eylül ayının sonunda iki gün içinde üç büyük sürüm geldi: xAI’dan Grok 4.7, Anthropic’ten Claude Opus 5.5 ve OpenAI’ın GPT-6 Sol ile Luna modelleri. İşte aralarındaki farklara, her birinin gerçekten nerede öne çıktığına ve göreviniz için hangisini seçmeniz gerektiğine sade bir bakış. Dördü de ChatPlus’ta şimdiden kullanılabilir durumda.

ModellerAnthropicOpenAIxAIHaberler
Max maskotu, bir gezegenin kenarının üzerinde uzay boşluğunda süzülüyor ve üzerinde "Anthropic — Claude Opus 5.5", "OpenAI — GPT-6 Sol · Luna" ve "xAI — Grok 4.7" logoları ile etiketleri bulunan üç holografik karta uzanıyor. Yeni modeller hakkındaki bir yazı için kapak görseli
Makaleyi dinle00:00

21 Eylül’de xAI, Grok 4.7’yi yayımladı. Ertesi gün Anthropic, Claude Opus 5.5’i tanıttı; OpenAI ise GPT-6 Sol ve GPT-6 Luna’yı çıkardı. Üç laboratuvar, dört model, iki gün. Buna tesadüf demek zor: yarış o kadar yakın ki kimse rakibinin bir hafta bile manşetlerde tek başına kalmasına izin vermek istemiyor.

Kısa özet: Opus 5.5 yeni çıkanlar arasında en güçlüsü ve bağımsız ölçümlere göre şu anda genel olarak piyasadaki en iyi model. GPT-6 Sol ham zekâ açısından pek ilerlemiş değil, ancak yarı fiyatına mal oluyor ve daha az olgusal hata yapıyor. Luna hafif ve çok ekonomik. Grok 4.7, xAI için büyük bir ileri adım; fakat cazip fiyatına rağmen şimdilik hâlâ ikinci ligde. İşte her biri için ayrıntılar ve dürüst notlar.

Dört modele hızlı bakış

Referans olması için temel özellikler şöyle. Fiyatlar milyon API token’ı başına verilmiştir; böylece hangi modellerin pahalı olduğunu görebilirsiniz. ChatPlus token için ayrıca ücret almaz, çünkü her şey aboneliğe dahildir.

ModelGeliştiriciGirdi / çıktı, $BağlamEn iyi olduğu alan
Claude Opus 5.5Anthropic4 / 201MUzun biçimli kodlama, belgeler, anlaşılır yazım
GPT-6 SolOpenAI2 / 101.05MKod, ajanlar, olgusal doğruluk
GPT-6 LunaOpenAI0.10 / 0.501.05MHızlı, basit görevler
Grok 4.7xAI2 / 6500KKod, mühendislik, hukuk

Claude Opus 5.5: amiral gemisi fiyatı olmadan Fable seviyesinde performans

Opus 5.5, yeni Claude 5.5 ailesini başlatıyor. Anthropic, modelin temel avantajını tek cümlede özetliyor: Model, şirketin en yetenekli ve en pahalı modeli olan Claude Fable 5.1 seviyesinde performans gösterirken Opus 5’e göre %40 daha ucuza geliyor. Token fiyatları %20 düştü; geri kalan fark ise verimlilikten geliyor: model aynı görev için daha az adım ve daha az token kullanıyor. Ayrıca önceki modele kıyasla %30’dan fazla daha hızlı metin üretiyor.

Bağımsız testler de bunu doğruluyor. Artificial Analysis toplu endeksinde Opus 5.5, maksimum ayarlarda 58 puan aldı; bu, orada şimdiye kadar ölçülen en iyi sonuç ve en yakın rakibinin birkaç puan önünde. Neredeyse her yerde lider: ajan tabanlı programlama (Terminal-Bench 4.0’da %66,4; Fable 5.1 için %55,8 ve GPT-6 Astra için %57,9), ofis işleri ve karmaşık araç kullanımı soruları.

Ama benchmark sayıları, bir modelin gerçek işte nasıl hissettirdiğini pek anlatmaz. Erken test edenlerin hikâyeleri daha açıklayıcı. Bir kullanıcı, 680.000 satır kod içeren bir projeyi bir günden kısa sürede taşıdı; bu, bir mühendislik ekibinin haftalarını alacak bir işti. Bir başkası, 200.000 satırlık bir kod tabanını üç saatte denetleyip düzeltti; aynı iş için Opus 5’in yirmi saatten fazlasına ihtiyacı vardı. Başka bir şirkette Opus 5.5, daha önce 38 prompt ve dört gün gerektiren karmaşık bir görevi 11 prompt ve üç saatte tamamladı. Anthropic ayrıca içeride bir deney yürüttü: Opus 5.5 ve Fable 5.1’den popüler yük dengeleyici HAProxy’yi C’den Rust’a yeniden yazmasını istedi. İkisi de başardı, ancak Opus 5.5 12 saat yerine 9,5 saatte bitirdi ve maliyeti yarı yarıya oldu.

İkinci büyük değişiklik, modelin yazma biçimi. Opus 5 sık sık lafı uzatmakla eleştiriliyordu: uzun girişler, kurumsal ifadeler ve asıl noktanın üçüncü paragrafta saklı kalması. Opus 5.5 ana fikri başa koyuyor, jargona daha az kayıyor ve verdiğiniz üslup kurallarına daha güvenilir biçimde uyuyor. Bir test kullanıcısı bunu basitçe şöyle özetledi: "Benim yazdığım gibi yazıyor." Metinle çalışırken bunu hemen fark ediyorsunuz: modelden sonra daha az temizlik gerekiyor.

Önceden bilmeye değer bir özellik var: Opus 5.5’te akıl yürütmeyi kapatamazsınız. Her zaman önce düşünür, sonra yanıt verir. Karmaşık görevlerde bu bir avantaj. "Pencere pervazının İngilizcesi nedir?" gibi bir soru içinse birkaç saniye fazladan beklemek demektir. Bu tür küçük işler için daha basit bir model daha iyi seçimdir.

ChatPlus’ta Claude Opus 5.5 sohbet içinde şimdiden kullanılabilir — Max planında, diğer üst seviye modellerle birlikte.

GPT-6 Sol: aynı çıta, yarı fiyatına

Eylül başında OpenAI, amiral gemisi GPT-6 Astra’yı yayımladı ve GPT-6 ailesi artık şöyle görünüyor: en üstte Astra, ortada Sol, altta Luna. Sol bir iş gücü modeli olarak tasarlandı: Astra’nın hassasiyetini ve bir görevi sonuna kadar götürme becerisini alıyor, ama çok daha düşük maliyetle sunuyor.

OpenAI, Sol’u rekorlardan çok güvenilirlik üzerinden konumlandırıyor. Şirket, kullanıcıların model hatası olarak işaretlediği gerçek konuşmaları aldı ve yeni sürümü bunlar üzerinde test etti: Sol, GPT-5.6 Sol’a kıyasla yaklaşık yarı yarıya daha az hata yapıyor ve Astra seviyesinde güvenilirliğe ulaşıyor. Bağımsız bir halüsinasyon testi de bunu doğruluyor, ancak bir notla. Uydurma yanıtların oranı %92’den %60’a düştü; bunun büyük kısmı, modelin emin olmadığında daha sık yanıt vermeyi reddetmesinden kaynaklanıyor. Doğru yanıtların toplam oranı ise hatta biraz geriledi: %59’dan %54’e. Günlük çalışma açısından bu kötüden çok iyi haber: dürüst bir "bilmiyorum", kendinden emin bir uydurmadan daha iyidir.

Programlamada Sol, çok daha pahalı modellerle aynı tempoyu tutturuyor. Gerçek depolardaki uzun mühendislik görevlerini ölçen DeepSWE’de %68,8 alıyor. En iyi skor %69,9 ile Claude Fable 5’te, fakat görev başına yaklaşık beş kat daha pahalı. Terminal-Bench 4.0’da Sol %37’den %43’e yükseldi.

Şimdi basın bülteninin söylemediği kısma gelelim. Toplu zekâ endeksinde Sol, selefine göre neredeyse değişmedi: 47’ye karşı 48 puan. Ofis belgesi işlerinde hatta gerilemiş durumda ve bilgisayar kontrolünde hem Astra’nın hem de önceki Sol’un gerisinde. Yani bu bir sıçrama değil; yarı fiyatına aynı yetenek çıtası. Çoğu görev için tam da ihtiyacınız olan şey bu: kodlama, araştırma, yazışma ve analiz. Arayüzlerde kendi başına tıklayarak ilerleyen bir modele ihtiyacınız varsa Astra’yı seçin.

GPT-6 Sol, PRO aboneliğimizde kullanılabilir ve önceki Sol’un yarı fiyatına geldiği için uzun sohbetlerde hakkınız belirgin biçimde daha ileri gider. GPT-6 Sol ile sohbet açın.

GPT-6 Luna: en güncel bilgiye sahip daha küçük model

OpenAI, Luna’yı basitçe şöyle tanımlıyor: net hedefli, yüksek hacimli görevler için bir model. Bir belgeyi özetlemek, metinden sayı ve isim çıkarmak, bir soruyu hızlıca yanıtlamak. Bunda mütevazı bir taraf yok: Bu görevler, insanların her gün AI ile yaptığı işlerin büyük bölümünü oluşturuyor.

Fiyatı neredeyse sembolik: milyon girdi token’ı başına on sent, milyon çıktı token’ı başına elli sent. Bu, GPT-5.6 Luna’nın girdi fiyatının yarısı ve çıktı tarafında neredeyse iki buçuk kat daha ucuz. Toplu zekâ endeksinde model, selefinin seviyesinde kalıyor. Ajan tabanlı kodlamada hafif gerilemiş olsa da DeepSWE’de maksimum ayarlarda görev başına yalnızca 22 sente %66,6 sunuyor. OpenAI’a göre bu, orta ayarlardaki Claude Opus 5 ve Fable 5 ile karşılaştırılabilir; üstelik %93–96 daha düşük maliyetle.

İlginç bir ayrıntı: Ailenin en küçük modeli en güncel bilgiye sahip. Luna, Mayıs 2026’ya kadar olan verilerle eğitildi; Sol ve Astra ise Nisan’da duruyor.

ChatPlus’ta GPT-6 Luna, PRO aboneliğinde kullanılabilir ve hakkınızı kullanmaz — pahalı modellere yapılan isteklerin düşüldüğü 5 saatlik limitten eksiltmez. Sayacı takip etmeden dilediğiniz kadar kullanabilirsiniz. Karmaşık, çok dosyalı kod için en iyi seçim değildir; ama aynı konuşma içinde Sol veya Opus’a geçebilirsiniz.

Grok 4.7: büyük, gecikmiş ve beklenmedik ölçüde uygun fiyatlı

Grok 4.7, en uzun süredir beklenmesine rağmen diğerlerinden önce geldi: Elon Musk, temmuz sonundan başlayarak çıkışı en az beş kez erteledi. Gecikme anlaşılır. Bu kozmetik bir güncelleme değil; yeni ve kayda değer ölçüde daha büyük bir temel model: medya haberlerine göre yaklaşık 2,1 trilyon parametre. İnsanların saatlerini alan görevlere vurgu yapan daha uzun pekiştirmeli öğrenme eğitimi aldı. xAI ayrıca öz denetimi geliştirdi: model kendi yanıtlarını daha dikkatli gözden geçiriyor ve uzun bağlamı daha iyi yönetiyor. Bu arada şirket resmî materyallerde artık kendisine SpaceXAI diyor, ancak modeller hâlâ Grok adını taşıyor.

Grok 4.6’ya göre gelişim ciddi. Uzun programlama görevlerini ölçen CursorBench 4.0’da skor %40,4’ten %46,3’e çıktı. Terminal-Bench 4.0’da neredeyse ikiye katlandı: %20,3’ten %37,6’ya. Çok saatlik ofis işlerinde — raporlar, elektronik tablolar, sunumlar — model yüzün üzerinde Elo puanı kazandı. Hukuk performansı özellikle şaşırtıcı: Harvey hukuk benchmark’ında Grok 4.7 %19,6 alıyor; bu, Claude Fable 5.1’in %6,7’lik skorunun neredeyse üç katı. Elektrik mühendisliği benchmark’ı EEBench’te ise Fable’ın %56,4’üne karşı %64 elde ediyor.

Genel sıralamalardaki yeri daha mütevazı. Çoğu karşılaştırmada Grok 4.7 ikinci: ofis işlerinde Fable 5.1’in, mühendislik görevlerinde GPT-6 Astra’nın gerisinde kalıyor ve Opus 5.5’in oldukça uzağında. Bağımsız testler onu zekâ endeksinde 46 puana koyuyor. Bu, xAI’ın ilk dört laboratuvar arasına girmesine yetti, ama daha fazlasına değil. Musk’ın kendisi "Astra ve Fable sınıfı" seviyeyi ancak Grok 4.9 için vaat ediyor. Bir not daha: maksimum ayarlarda model, görev başına Grok 4.6’nın iki katından fazla token kullanıyor; dolayısıyla aynı token fiyatı, sonuç başına aynı maliyet anlamına gelmiyor.

Grok 4.7’nin temel avantajı fiyat-performans oranı. Grok 4.6 ile aynı fiyatta — milyon girdi token’ı başına iki dolar ve milyon çıktı token’ı başına altı dolar — ve Anthropic ile OpenAI amiral gemilerinden belirgin biçimde daha ucuz. Grok 4.7, ChatPlus’ta PRO aboneliğiyle kullanılabilir.

Peki hangisini seçmelisiniz?

Biz şöyle ayırırdık.

Görev büyük ve önemliyse — karmaşık kod, proje denetimi, analitik rapor veya net düşünme gerektiren uzun bir belge — Claude Opus 5.5 seçin. Şu anda mevcut en güçlü model ve önceki Claude modellerine göre belirgin biçimde daha iyi yazıyor.

Dengeye ihtiyaç duyduğunuz günlük işler için GPT-6 Sol çok iyi uyar: kod, araştırma, e-postalar ve elektronik tablolar. Dikkatli, daha az halüsinasyon görüyor ve hakkınızı daha az tüketiyor.

Özetler, çeviriler, kısa referans yanıtları ve taslaklar gibi küçük görevler için GPT-6 Luna seçin. Hızlıdır ve hakkınızı hiç kullanmaz.

Grok 4.7, beklenmedik şekilde güçlü olduğu hukuk ve mühendislik sorularında denemeye değer; ayrıca başka bir modelin yanıtını karşılaştırmak istediğinizde ikinci görüş olarak iyi bir seçenek.

Karşılaştırmanın en kolay yolu, bunu kendi görevinizde yapmaktır. ChatPlus’ta konuşma ortasında model değiştirebilirsiniz: Opus’a bir soru sorun, Sol veya Grok’a geçin, aynı prompt’u tekrar gönderin ve kimin daha iyi başa çıktığını hemen görün. Ayrıntılı model sayfaları Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna ve Grok 4.7 için kullanılabilir.

Kısaca

İki gün içinde dört yeni model geldi. Claude Opus 5.5 yeni lider: Opus 5’ten %40 daha ucuza Fable 5.1 seviyesinde yetenek, sınıfının en iyi ajan tabanlı kodlama performansı ve belirgin biçimde daha net yazım. GPT-6 Sol zekâ açısından pek ilerlemedi, ama yarı fiyatına geliyor ve olgusal hataları yarı yarıya daha az yapıyor. GPT-6 Luna, ailenin en güncel bilgisine sahip, basit görevler için çok uygun fiyatlı bir model. Grok 4.7 özellikle kod, hukuk ve mühendislikte büyük bir sıçrama yaptı; ancak şimdilik erişilebilir fiyatıyla ikinci ligde kalıyor. Dördü de ChatPlus’ta şimdiden kullanılabilir durumda.

En iyi yapay zekâ modellerini ChatPlus’ta deneyin

GPT, Claude, Gemini, GLM ve diğer yapay zekâ modelleri tek pencerede.