Claude Opus 5.5, GPT-6 Sol, dan Grok 4.7: tiga rilis dalam dua hari, dan model mana yang sebaiknya dipilih
Dalam dua hari di akhir September, tiga rilis besar hadir sekaligus: Grok 4.7 dari xAI, Claude Opus 5.5 dari Anthropic, serta GPT-6 Sol dan Luna dari OpenAI. Berikut ulasan lugas tentang perbedaannya, keunggulan nyata masing-masing, dan mana yang paling tepat untuk tugas Anda. Keempatnya sudah tersedia di ChatPlus.

Pada 21 September, xAI merilis Grok 4.7. Keesokan harinya, Anthropic memperkenalkan Claude Opus 5.5, sementara OpenAI merilis GPT-6 Sol dan GPT-6 Luna. Tiga lab, empat model, dua hari. Sulit menyebutnya kebetulan: persaingannya begitu ketat sampai tidak ada yang mau membiarkan kompetitor sendirian menguasai pemberitaan bahkan selama seminggu.
Versi singkatnya: Opus 5.5 adalah yang paling kuat di antara rilis baru ini dan, menurut pengukuran independen, saat ini merupakan model terbaik di pasar secara keseluruhan. GPT-6 Sol nyaris tidak meningkat dalam kecerdasan mentah, tetapi biayanya separuh lebih murah dan lebih jarang membuat kesalahan faktual. Luna ringan dan sangat terjangkau. Grok 4.7 adalah lompatan besar bagi xAI, tetapi untuk saat ini masih berada di lapis kedua, meski dengan harga yang menarik. Berikut detailnya, termasuk catatan jujur untuk masing-masing.
Sekilas tentang empat model
Sebagai acuan, berikut spesifikasi intinya. Harga dicantumkan per juta token API, sehingga Anda bisa melihat model mana yang mahal; ChatPlus tidak mengenakan biaya token secara terpisah, karena semuanya sudah termasuk dalam langganan.
| Model | Pengembang | Input / output, $ | Konteks | Terbaik untuk |
|---|---|---|---|---|
| Claude Opus 5.5 | Anthropic | 4 / 20 | 1M | Coding panjang, dokumen, penulisan yang jelas |
| GPT-6 Sol | OpenAI | 2 / 10 | 1.05M | Kode, agen, akurasi faktual |
| GPT-6 Luna | OpenAI | 0.10 / 0.50 | 1.05M | Tugas cepat dan sederhana |
| Grok 4.7 | xAI | 2 / 6 | 500K | Kode, engineering, hukum |
Claude Opus 5.5: performa setara Fable tanpa harga flagship
Opus 5.5 membuka keluarga baru Claude 5.5. Anthropic merangkum keunggulan utamanya dalam satu kalimat: model ini bekerja di level Claude Fable 5.1 — model perusahaan yang paling mumpuni sekaligus paling mahal — dengan biaya 40% lebih rendah daripada Opus 5. Harga token turun 20%, sementara sisanya berasal dari efisiensi: model ini memakai lebih sedikit langkah dan lebih sedikit token untuk tugas yang sama. Ia juga menghasilkan teks lebih dari 30% lebih cepat dibanding pendahulunya.
Pengujian independen mengonfirmasi hal ini. Dalam indeks agregat Artificial Analysis, Opus 5.5 meraih 58 poin pada pengaturan maksimum — hasil terbaik yang pernah diukur di sana, unggul beberapa poin. Ia memimpin hampir di semua area: pemrograman agentic (66.4% di Terminal-Bench 4.0, dibanding 55.8% untuk Fable 5.1 dan 57.9% untuk GPT-6 Astra), pekerjaan kantor, dan pertanyaan kompleks yang melibatkan penggunaan tool.
Namun angka benchmark tidak banyak bercerita tentang bagaimana rasanya memakai sebuah model dalam pekerjaan nyata. Kisah para penguji awal lebih berbicara. Salah satunya memigrasikan proyek berisi 680,000 baris kode dalam waktu kurang dari sehari, tugas yang biasanya akan memakan waktu berminggu-minggu bagi tim engineering. Penguji lain mengaudit dan memperbaiki codebase 200,000 baris dalam tiga jam, sementara Opus 5 membutuhkan lebih dari dua puluh jam untuk pekerjaan yang sama. Di perusahaan lain, Opus 5.5 menyelesaikan tugas kompleks yang sebelumnya membutuhkan 38 prompt dan empat hari menjadi 11 prompt dan tiga jam. Anthropic juga menjalankan eksperimen internal: mereka meminta Opus 5.5 dan Fable 5.1 menulis ulang HAProxy, load balancer populer, dari C ke Rust. Keduanya berhasil, tetapi Opus 5.5 selesai dalam 9.5 jam, bukan 12 jam, dan biayanya separuh lebih murah.
Perubahan besar kedua ada pada cara model ini menulis. Opus 5 kerap dikritik karena terlalu bertele-tele: pembuka yang panjang, gaya bahasa korporat, dan inti pesan yang baru muncul di paragraf ketiga. Opus 5.5 menaruh poin utama di awal, lebih jarang tergelincir ke jargon, dan lebih konsisten mengikuti aturan gaya yang Anda berikan. Seorang penguji merangkumnya sederhana: "Ia menulis seperti saya menulis." Anda langsung merasakannya saat bekerja dengan teks: jauh lebih sedikit pembersihan setelah model selesai.
Ada satu karakteristik yang perlu diketahui sejak awal: reasoning di Opus 5.5 tidak bisa dimatikan. Model ini selalu berpikir dulu, baru menjawab. Itu menguntungkan untuk tugas kompleks. Untuk pertanyaan seperti "apa kata bahasa Inggris untuk ambang jendela?" artinya ada beberapa detik tambahan untuk menunggu. Untuk tugas kecil seperti itu, model yang lebih sederhana adalah pilihan yang lebih baik.
Di ChatPlus, Claude Opus 5.5 sudah tersedia di chat — pada paket Max, bersama model-model papan atas lainnya.
GPT-6 Sol: standar yang sama, dengan separuh harga
Pada awal September, OpenAI merilis flagship GPT-6 Astra, dan keluarga GPT-6 kini terlihat seperti ini: Astra di posisi teratas, Sol di tengah, Luna di bawah. Sol dirancang sebagai pekerja andalan: ia mengambil presisi Astra dan kemampuannya menyelesaikan tugas sampai tuntas, tetapi dengan biaya yang jauh lebih rendah.
OpenAI menjual Sol lewat keandalan, bukan rekor. Perusahaan ini mengambil percakapan nyata ketika pengguna menandai kesalahan model, lalu menguji versi baru pada percakapan tersebut: Sol membuat kesalahan kira-kira separuh lebih jarang daripada GPT-5.6 Sol dan mencapai keandalan setara Astra. Uji halusinasi independen mengonfirmasi ini, meski dengan catatan. Porsi jawaban karangan turun dari 92% menjadi 60%, terutama karena model lebih sering menolak menjawab saat tidak yakin. Porsi jawaban benar secara keseluruhan bahkan turun sedikit, dari 59% menjadi 54%. Untuk pekerjaan sehari-hari, ini lebih banyak kabar baik daripada buruk: "saya tidak tahu" yang jujur lebih baik daripada karangan yang terdengar yakin.
Dalam pemrograman, Sol mampu mengimbangi model yang jauh lebih mahal. Di DeepSWE, tes untuk tugas engineering panjang di repositori nyata, skornya 68.8%. Claude Fable 5 mencatat skor terbaik di 69.9%, tetapi biayanya kira-kira lima kali lebih mahal per tugas. Di Terminal-Bench 4.0, Sol meningkat dari 37% menjadi 43%.
Sekarang bagian yang tidak disebutkan dalam siaran pers. Dalam indeks kecerdasan agregat, Sol nyaris tidak berubah dari pendahulunya: 48 poin versus 47. Ia bahkan mundur dalam pekerjaan dokumen kantor, dan tertinggal dari Astra maupun Sol sebelumnya dalam kontrol komputer. Jadi ini bukan lompatan besar, melainkan standar kemampuan yang sama dengan separuh harga. Untuk sebagian besar tugas, itu justru yang Anda butuhkan: coding, riset, korespondensi, dan analitik. Jika Anda membutuhkan model yang bisa mengklik antarmuka sendiri, pilih Astra.
GPT-6 Sol tersedia di langganan PRO kami, dan karena biayanya separuh dari Sol sebelumnya, jatah Anda terasa jauh lebih awet dalam percakapan panjang. Buka chat dengan GPT-6 Sol.
GPT-6 Luna: model yang lebih kecil dengan pengetahuan paling baru
OpenAI menggambarkan Luna secara sederhana: model untuk tugas bervolume tinggi dengan tujuan yang jelas. Merangkum dokumen, mengekstrak angka dan nama dari teks, menjawab pertanyaan dengan cepat. Tidak ada yang remeh dari itu: tugas-tugas seperti inilah yang paling sering dilakukan orang dengan AI setiap hari.
Harganya hampir simbolis: sepuluh sen per juta token input dan lima puluh sen per juta token output. Itu separuh harga input GPT-5.6 Luna dan hampir dua setengah kali lebih murah untuk output. Dalam indeks kecerdasan agregat, model ini tetap berada di level pendahulunya. Ia sedikit turun dalam agentic coding, tetapi di DeepSWE pada pengaturan maksimum menghasilkan 66.6% hanya dengan 22 sen per tugas. Menurut OpenAI, itu sebanding dengan Claude Opus 5 dan Fable 5 pada pengaturan medium, dengan biaya 93–96% lebih rendah.
Satu detail menarik: model terkecil dalam keluarga ini justru punya pengetahuan paling segar. Luna dilatih dengan data hingga Mei 2026, sementara Sol dan Astra berhenti di April.
Di ChatPlus, GPT-6 Luna tersedia pada langganan PRO dan tidak memakai jatah Anda — batas 5 jam yang menjadi sumber pengurangan untuk permintaan ke model mahal. Anda bisa menggunakannya sesering mungkin tanpa memantau penghitung. Ini bukan pilihan terbaik untuk kode multi-file yang kompleks, tetapi Anda bisa beralih ke Sol atau Opus dalam percakapan yang sama.
Grok 4.7: besar, terlambat, dan ternyata terjangkau
Grok 4.7 hadir lebih dulu dibanding yang lain, meski sudah paling lama dinanti: Elon Musk menunda rilisnya setidaknya lima kali, dimulai sejak akhir Juli. Penundaan itu masuk akal. Ini bukan pembaruan kosmetik, melainkan model dasar baru yang jauh lebih besar: menurut laporan media, sekitar 2.1 triliun parameter. Model ini mendapat pelatihan reinforcement learning yang lebih panjang, dengan penekanan pada tugas yang membutuhkan berjam-jam bagi manusia. xAI juga meningkatkan self-checking: model meninjau jawabannya sendiri dengan lebih saksama dan menangani konteks panjang dengan lebih baik. Menariknya, perusahaan kini menyebut dirinya SpaceXAI dalam materi resmi, meski modelnya tetap bernama Grok.
Peningkatannya dibanding Grok 4.6 cukup besar. Di CursorBench 4.0, tes untuk tugas pemrograman panjang, skornya naik dari 40.4% menjadi 46.3%. Di Terminal-Bench 4.0, nilainya nyaris dua kali lipat, dari 20.3% menjadi 37.6%. Dalam pekerjaan kantor multi-jam — laporan, spreadsheet, presentasi — model ini memperoleh lebih dari seratus poin Elo. Performa hukumnya sangat mengejutkan: di benchmark hukum Harvey, Grok 4.7 mencetak 19.6%, hampir tiga kali Claude Fable 5.1 yang 6.7%. Di benchmark teknik elektro EEBench, skornya 64% dibanding 56.4% milik Fable.
Posisinya dalam peringkat keseluruhan lebih sederhana. Dalam sebagian besar perbandingan, Grok 4.7 berada di urutan kedua: tertinggal dari Fable 5.1 dalam pekerjaan kantor, dari GPT-6 Astra dalam tugas engineering, dan masih jauh di belakang Opus 5.5. Pengujian independen menempatkannya di 46 poin pada indeks kecerdasan. Itu cukup untuk membawa xAI masuk ke empat lab teratas, tetapi belum lebih jauh. Musk sendiri menjanjikan kelas "Astra dan Fable" baru dengan Grok 4.9. Satu catatan lagi: pada pengaturan maksimum, model ini memakai lebih dari dua kali lipat token per tugas dibanding Grok 4.6, jadi harga token yang sama tidak berarti biaya per hasil yang sama.
Keunggulan utama Grok 4.7 adalah rasio harga terhadap kualitasnya. Biayanya sama dengan Grok 4.6 — dua dolar per juta token input dan enam dolar per juta token output — dan terasa lebih murah dibanding flagship Anthropic dan OpenAI. Grok 4.7 tersedia di ChatPlus dengan langganan PRO.
Jadi, mana yang sebaiknya Anda pilih?
Kami akan membaginya seperti ini.
Jika tugasnya besar dan penting — kode kompleks, audit proyek, laporan analitis, atau dokumen panjang yang membutuhkan pemikiran jernih — pilih Claude Opus 5.5. Saat ini ia adalah model terkuat yang tersedia, dan tulisannya terasa jauh lebih baik dibanding model Claude sebelumnya.
Untuk pekerjaan sehari-hari yang membutuhkan keseimbangan, GPT-6 Sol sangat cocok: kode, riset, email, dan spreadsheet. Ia hati-hati, lebih jarang berhalusinasi, dan memakai lebih sedikit jatah Anda.
Untuk tugas kecil seperti ringkasan, terjemahan, jawaban referensi singkat, dan draf, pilih GPT-6 Luna. Ia cepat dan sama sekali tidak memakai jatah Anda.
Grok 4.7 layak dicoba untuk pertanyaan hukum dan engineering, area tempat ia secara tak terduga kuat, serta sebagai opini kedua saat Anda ingin membandingkan jawaban model lain.
Cara paling mudah membandingkannya adalah dengan tugas Anda sendiri. Di ChatPlus, Anda bisa berganti model di tengah percakapan: ajukan pertanyaan ke Opus, beralih ke Sol atau Grok, kirim prompt yang sama lagi, dan langsung lihat siapa yang menanganinya paling baik. Halaman model terperinci tersedia untuk Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, dan Grok 4.7.
Singkatnya
Empat model baru hadir dalam dua hari. Claude Opus 5.5 adalah pemimpin baru: kemampuan setara Fable 5.1 dengan biaya 40% lebih rendah daripada Opus 5, agentic coding terbaik di kelasnya, dan tulisan yang terasa jauh lebih jelas. GPT-6 Sol nyaris tidak meningkat dalam kecerdasan, tetapi biayanya separuh lebih murah dan kesalahan faktualnya separuh lebih jarang. GPT-6 Luna adalah model yang sangat terjangkau untuk tugas sederhana dengan pengetahuan paling segar dalam keluarganya. Grok 4.7 membuat lompatan besar, terutama dalam kode, hukum, dan engineering, tetapi untuk saat ini masih berada di lapis kedua — dengan harga yang mudah dijangkau. Keempatnya sudah tersedia di ChatPlus.