live
10 labs · 30 models
すべての記事
約9分で読めますChatPlus Team

Claude Opus 5.5、GPT-6 Sol、Grok 4.7:2日間で3つのリリース、どのモデルを選ぶべきか

9月末の2日間で、xAIのGrok 4.7、AnthropicのClaude Opus 5.5、そしてOpenAIのGPT-6 SolとLunaという大型リリースが相次ぎました。それぞれ何が違い、どこで本当に力を発揮し、どのタスクにどれを選ぶべきかを、わかりやすく整理します。4つともすでにChatPlusで利用できます。

モデルAnthropicOpenAIxAIニュース
惑星の縁の上、宇宙空間に浮かぶMaxのマスコットが、「Anthropic — Claude Opus 5.5」「OpenAI — GPT-6 Sol · Luna」「xAI — Grok 4.7」のロゴとラベルが入った3枚のホログラムカードに手を伸ばしている。新モデルに関する記事のカバー画像
記事を聴く00:00

9月21日、xAIがGrok 4.7をリリースしました。翌日にはAnthropicがClaude Opus 5.5を発表し、OpenAIもGPT-6 SolとGPT-6 Lunaを公開しました。3つの研究所、4つのモデル、わずか2日間。これを偶然と呼ぶのは難しいでしょう。競争はそれほど接近しており、どの社も競合に1週間たりとも話題を独占させたくないのです。

要点を先に言うと、Opus 5.5は今回の新リリースの中で最も強力で、独立した測定によれば、現時点で市場全体でも最高のモデルです。GPT-6 Solは生の知能面ではほとんど向上していませんが、価格は半分になり、事実誤認も減っています。Lunaは軽量で、非常に手頃です。Grok 4.7はxAIにとって大きな前進ですが、現時点ではまだ第2グループに位置します。ただし価格は魅力的です。以下、それぞれの詳細と、率直な注意点を見ていきます。

4つのモデル早見表

参考までに、主要スペックをまとめました。価格はAPIトークン100万件あたりで示しているため、どのモデルが高価かを確認できます。なお、ChatPlusではトークンごとの追加課金はありません。すべてサブスクリプションに含まれています。

ModelDeveloperInput / output, $ContextBest at
Claude Opus 5.5Anthropic4 / 201M長文コーディング、文書、明快な文章作成
GPT-6 SolOpenAI2 / 101.05Mコード、エージェント、事実精度
GPT-6 LunaOpenAI0.10 / 0.501.05M高速でシンプルなタスク
Grok 4.7xAI2 / 6500Kコード、エンジニアリング、法律

Claude Opus 5.5:フラッグシップ価格なしでFable級の性能

Opus 5.5は、新しいClaude 5.5ファミリーの幕開けとなるモデルです。Anthropicはその最大の強みを一文でこう説明しています。このモデルは、同社で最も高性能かつ最も高価なClaude Fable 5.1と同等の性能を発揮しながら、Opus 5より40%低いコストで使える、というものです。トークン価格は20%下がり、残りは効率化によるものです。同じタスクに対して、モデルが使うステップ数とトークン数が少なくなっています。さらに、前世代より30%以上高速にテキストを生成します。

独立テストもこれを裏付けています。Artificial Analysisの総合インデックスでは、Opus 5.5は最大設定で58点を記録しました。同指標でこれまで測定された中で最高の結果で、数ポイント差をつけています。ほぼあらゆる領域で首位です。エージェント型プログラミングではTerminal-Bench 4.0で66.4%(Fable 5.1は55.8%、GPT-6 Astraは57.9%)、オフィス作業、複雑なツール利用を伴う質問でもリードしています。

ただし、ベンチマークの数字だけでは、実務でそのモデルがどのように感じられるかはわかりません。初期テスターの事例のほうが、むしろ多くを物語っています。あるテスターは、68万行のコードを持つプロジェクトを1日未満で移行しました。通常ならエンジニアリングチームが数週間かける作業です。別の事例では、20万行のコードベースを3時間で監査・修復しました。同じ作業にOpus 5は20時間以上かかっていました。さらに別の企業では、以前は38回のプロンプトと4日間を要した複雑なタスクを、Opus 5.5が11回のプロンプトと3時間で完了しました。Anthropicは社内実験も行っています。人気のロードバランサーであるHAProxyをCからRustへ書き換えるよう、Opus 5.5とFable 5.1に依頼しました。どちらも成功しましたが、Opus 5.5は12時間ではなく9.5時間で完了し、コストは半分でした。

2つ目の大きな変化は、文章の書き方です。Opus 5は冗長だとよく批判されていました。長い導入、いかにも企業的な言い回し、要点が3段落目に埋もれる、といった具合です。Opus 5.5は要点を先に示し、専門用語に流れにくく、与えたスタイルルールにもより確実に従います。あるテスターは簡潔にこう表現しました。「自分が書くように書いてくれる」。文章を扱う作業では、すぐに違いがわかります。モデルの出力後に手直しする量が少ないのです。

事前に知っておきたい特徴が1つあります。Opus 5.5では推論をオフにできません。常にまず考えてから回答します。複雑なタスクではこれは利点です。一方で、「窓台は英語で何と言う?」のような質問では、数秒余計に待つことになります。そうした小さなタスクには、よりシンプルなモデルを選ぶほうが適しています。

ChatPlusでは、Claude Opus 5.5をすでにチャットで利用できます。Maxプランで、ほかの最上位モデルと並んで利用可能です。

GPT-6 Sol:同じ到達点を、半額で

9月初め、OpenAIはフラッグシップのGPT-6 Astraをリリースしました。これによりGPT-6ファミリーは、最上位にAstra、中位にSol、下位にLunaという構成になりました。Solは実務の主力として設計されています。Astraの精密さとタスクを最後まで遂行する能力を受け継ぎながら、コストは大幅に抑えられています。

OpenAIは、Solを記録更新ではなく信頼性で売り出しています。同社は、ユーザーがモデルの誤りを指摘した実際の会話を使い、新バージョンをテストしました。その結果、Solの誤りはGPT-5.6 Solのおよそ半分となり、Astra級の信頼性に達しています。独立したハルシネーションテストもこれを確認していますが、注意点もあります。捏造回答の割合は92%から60%に下がりましたが、その主な理由は、モデルが不確かなときに回答を拒否する頻度が増えたことです。正答全体の割合は、59%から54%へわずかに低下すらしています。日常的な作業では、これは悪いニュースというより良いニュースです。自信満々の作り話より、正直な「わかりません」のほうが有用だからです。

プログラミングでは、Solははるかに高価なモデルに引けを取りません。実際のリポジトリにおける長時間のエンジニアリングタスクを測るDeepSWEでは、68.8%を記録しています。Claude Fable 5が69.9%で最高スコアですが、タスクあたりのコストはおよそ5倍です。Terminal-Bench 4.0では、Solは37%から43%へ改善しました。

ここからは、プレスリリースが触れていない点です。総合知能インデックスでは、Solは前世代からほぼ変わっていません。48点対47点です。オフィス文書作業ではむしろ後退しており、コンピューター操作でもAstraと従来のSolの両方に及びません。つまり、これは飛躍的進化ではなく、同じ能力水準を半額で提供するモデルです。多くのタスクにとっては、それこそが必要なものです。コーディング、リサーチ、メール、分析にはよく合います。インターフェースを自律的にクリックして進めるモデルが必要なら、Astraを選んでください。

GPT-6 SolはPROサブスクリプションで利用できます。前のSolの半額になったため、長い会話でも利用枠が目に見えて長持ちします。GPT-6 Solでチャットを開く。

GPT-6 Luna:最新の知識を持つ小型モデル

OpenAIはLunaをシンプルに説明しています。明確な目的を持つ大量タスク向けのモデルです。文書を要約する、テキストから数字や名前を抽出する、質問に素早く答える。控えめに聞こえるかもしれませんが、実際には、これらは人々が毎日AIで行っている作業の大半を占めています。

価格はほとんど象徴的です。入力100万トークンあたり10セント、出力100万トークンあたり50セント。GPT-5.6 Lunaと比べると入力価格は半分、出力はほぼ2.5分の1です。総合知能インデックスでは、モデルは前世代と同水準にとどまっています。エージェント型コーディングではわずかに低下しましたが、最大設定のDeepSWEでは、タスクあたりわずか22セントで66.6%を出しています。OpenAIによれば、これは中設定のClaude Opus 5およびFable 5に匹敵しながら、コストは93〜96%低いとのことです。

興味深い点が1つあります。ファミリー内で最小のモデルが、最も新しい知識を持っています。Lunaは2026年5月までのデータで学習されており、SolとAstraは4月までです。

ChatPlusでは、GPT-6 LunaはPROサブスクリプションで利用でき、利用枠を消費しません。高価なモデルへのリクエストが差し引かれる5時間制限の対象外です。カウンターを気にせず、好きなだけ使えます。複雑な複数ファイルのコードには最適とは言えませんが、同じ会話の中でSolやOpusに切り替えられます。

Grok 4.7:大きく、遅れて登場し、意外なほど手頃

Grok 4.7は他のモデルより先に登場しましたが、最も長く待たれていたモデルでもあります。Elon Muskは7月下旬から、リリースを少なくとも5回延期していました。遅れた理由は理解できます。これは見た目だけのアップデートではなく、新しい、かなり大規模なベースモデルです。報道によれば、パラメータ数は約2.1兆。強化学習の期間も長くなり、人間なら何時間もかかるタスクに重点が置かれました。xAIは自己チェックも改善しました。モデルは自分の回答をより慎重に見直し、長いコンテキストもよりうまく扱います。ちなみに同社は公式資料で自らをSpaceXAIと呼ぶようになりましたが、モデル名は引き続きGrokです。

Grok 4.6からの改善は大きなものです。長いプログラミングタスクを測るCursorBench 4.0では、スコアが40.4%から46.3%に上がりました。Terminal-Bench 4.0では、20.3%から37.6%へとほぼ倍増しました。レポート、スプレッドシート、プレゼンテーションといった数時間規模のオフィス作業では、100 Eloポイント以上を獲得しています。特に意外なのが法律分野の性能です。Harveyの法律ベンチマークで、Grok 4.7は19.6%を記録し、Claude Fable 5.1の6.7%のほぼ3倍でした。電気工学ベンチマークのEEBenchでは、Fableの56.4%に対して64%です。

総合ランキングでの位置づけは、もう少し控えめです。多くの比較で、Grok 4.7は2番手です。オフィス作業ではFable 5.1に、エンジニアリングタスクではGPT-6 Astraに遅れ、Opus 5.5にはなお大きく水をあけられています。独立テストでは、知能インデックスは46点でした。xAIがトップ4の研究所に入るには十分でしたが、それ以上ではありません。Musk自身も、「AstraおよびFable級」になるのはGrok 4.9だと約束しています。もう1つ注意点があります。最大設定では、モデルがタスクあたりに使うトークン数がGrok 4.6の2倍以上です。つまり、トークン単価が同じでも、結果あたりのコストが同じとは限りません。

Grok 4.7の主な強みは、価格と品質のバランスです。価格はGrok 4.6と同じで、入力100万トークンあたり2ドル、出力100万トークンあたり6ドルです。AnthropicやOpenAIのフラッグシップより明らかに安価です。Grok 4.7は、ChatPlusのPROサブスクリプションで利用できます。

では、どれを選ぶべきか?

私たちなら、次のように整理します。

タスクが大きく重要な場合、たとえば複雑なコード、プロジェクト監査、分析レポート、明確な思考が必要な長文書なら、Claude Opus 5.5を選んでください。現在利用できる中で最も強力なモデルであり、以前のClaudeモデルより文章も明らかに優れています。

日常業務でバランスが必要なら、GPT-6 Solが非常によく合います。コード、調査、メール、スプレッドシートに向いています。慎重で、ハルシネーションが少なく、利用枠の消費も抑えられます。

要約、翻訳、短い参照回答、下書きといった小さなタスクには、GPT-6 Lunaを選びましょう。高速で、利用枠をまったく消費しません。

Grok 4.7は、意外なほど強い法律・エンジニアリング分野の質問で試す価値があります。また、別のモデルの回答と比べたいときのセカンドオピニオンとしても有用です。

最も簡単な比較方法は、自分のタスクで試すことです。ChatPlusでは、会話の途中でモデルを切り替えられます。Opusに質問し、SolやGrokに切り替えて同じプロンプトをもう一度送り、どれが最もうまく処理するかをすぐに確認できます。詳細なモデルページは、Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna、Grok 4.7で確認できます。

まとめ

2日間で4つの新モデルが登場しました。Claude Opus 5.5は新たなリーダーです。Opus 5より40%低いコストでFable 5.1級の能力を持ち、エージェント型コーディングはクラス最高、文章も明らかに明快です。GPT-6 Solは知能面ではほとんど向上していませんが、コストは半分になり、事実誤認は半分に減っています。GPT-6 Lunaは、ファミリー内で最も新しい知識を持つ、シンプルなタスク向けの非常に手頃なモデルです。Grok 4.7は、特にコード、法律、エンジニアリングで大きく飛躍しましたが、現時点ではまだ第2グループにとどまります。ただし、利用しやすい価格です。4つとも、すでにChatPlusで利用できます。

ChatPlusで最高クラスのAIモデルを試す

GPT、Claude、Gemini、GLMなどのAIモデルをひとつの画面で使えます。