live
10 labs · 30 models
전체 글
9분 읽기ChatPlus Team

Claude Opus 5.5, GPT-6 Sol, Grok 4.7: 이틀 사이 세 가지 출시, 어떤 모델을 골라야 할까요

9월 말 이틀 동안 굵직한 출시가 세 건 이어졌어요. xAI의 Grok 4.7, Anthropic의 Claude Opus 5.5, 그리고 OpenAI의 GPT-6 Sol과 Luna입니다. 각각 무엇이 다른지, 어디에서 진짜 강점을 보이는지, 작업별로 어떤 모델을 고르면 좋을지 차분히 살펴봅니다. 네 모델 모두 이미 ChatPlus에서 사용할 수 있어요.

모델AnthropicOpenAIxAI뉴스
Max 마스코트가 행성 가장자리 위 우주 공간에 떠 있으며, "Anthropic — Claude Opus 5.5", "OpenAI — GPT-6 Sol · Luna", "xAI — Grok 4.7" 로고와 라벨이 들어간 홀로그램 카드 세 장을 향해 손을 뻗고 있다. 새 모델을 다룬 기사 표지 이미지
글 듣기00:00

9월 21일, xAI가 Grok 4.7을 공개했어요. 다음 날에는 Anthropic이 Claude Opus 5.5를 선보였고, OpenAI는 GPT-6 Sol과 GPT-6 Luna를 출시했습니다. 세 연구소, 네 모델, 이틀. 우연이라고 보기 어렵죠. 경쟁이 워낙 치열해져서, 어느 회사도 경쟁사가 일주일이라도 헤드라인을 독차지하게 두고 싶지 않은 상황입니다.

짧게 말하면 이렇습니다. Opus 5.5는 이번 신제품 가운데 가장 강력하며, 독립 측정 기준으로는 현재 시장 전체에서 가장 뛰어난 모델입니다. GPT-6 Sol은 순수 지능 면에서는 거의 나아지지 않았지만, 비용이 절반으로 줄었고 사실 오류도 더 적습니다. Luna는 가볍고 매우 저렴한 모델입니다. Grok 4.7은 xAI에 큰 진전이지만, 아직은 매력적인 가격에도 불구하고 2군에 머물러 있습니다. 이제 각 모델의 세부 내용과 솔직한 단점을 살펴볼게요.

네 모델 한눈에 보기

참고용으로 핵심 사양을 정리했습니다. 가격은 API 토큰 100만 개당 기준이므로 어떤 모델이 비싼지 가늠할 수 있어요. ChatPlus에서는 토큰 비용을 별도로 청구하지 않고, 모든 것이 구독에 포함됩니다.

ModelDeveloperInput / output, $ContextBest at
Claude Opus 5.5Anthropic4 / 201M장문 코딩, 문서, 명료한 글쓰기
GPT-6 SolOpenAI2 / 101.05M코드, 에이전트, 사실 정확도
GPT-6 LunaOpenAI0.10 / 0.501.05M빠르고 단순한 작업
Grok 4.7xAI2 / 6500K코드, 엔지니어링, 법률

Claude Opus 5.5: 플래그십 가격 없이 Fable급 성능

Opus 5.5는 새로운 Claude 5.5 제품군의 출발점입니다. Anthropic은 이 모델의 핵심 장점을 한 문장으로 요약합니다. Claude Fable 5.1, 즉 회사에서 가장 강력하고 가장 비싼 모델 수준의 성능을 내면서도 Opus 5보다 비용은 40% 낮다는 것입니다. 토큰 가격은 20% 내려갔고, 나머지는 효율 개선에서 나옵니다. 같은 작업을 하는 데 필요한 단계와 토큰 수가 줄었기 때문이죠. 텍스트 생성 속도도 이전 모델보다 30% 이상 빨라졌습니다.

독립 테스트도 이를 확인해 줍니다. Artificial Analysis 종합 지표에서 Opus 5.5는 최대 설정 기준 58점을 기록했습니다. 이 지표에서 측정된 역대 최고 결과이며, 몇 점 차이로 앞서 있습니다. 거의 모든 영역에서 선두입니다. 에이전트형 프로그래밍에서는 Terminal-Bench 4.0 기준 66.4%를 기록해 Fable 5.1의 55.8%, GPT-6 Astra의 57.9%를 앞섰고, 사무 작업과 복잡한 도구 사용 질문에서도 강합니다.

하지만 벤치마크 숫자만으로는 실제 업무에서 모델이 어떤 느낌인지 잘 드러나지 않습니다. 초기 테스터들의 사례가 더 많은 것을 말해줍니다. 한 사용자는 68만 줄 규모의 코드 프로젝트를 하루도 안 되어 마이그레이션했는데, 엔지니어링 팀이라면 몇 주가 걸렸을 작업이었습니다. 또 다른 사용자는 20만 줄 코드베이스를 3시간 만에 감사하고 수정했습니다. 같은 작업에 Opus 5는 20시간 넘게 걸렸습니다. 다른 회사에서는 이전에 38개의 프롬프트와 4일이 필요했던 복잡한 작업을 Opus 5.5가 11개의 프롬프트와 3시간 만에 끝냈습니다. Anthropic은 내부 실험도 진행했습니다. 인기 로드 밸런서인 HAProxy를 C에서 Rust로 다시 작성하도록 Opus 5.5와 Fable 5.1에 요청한 것입니다. 둘 다 성공했지만, Opus 5.5는 12시간이 아니라 9.5시간 만에 끝냈고 비용도 절반이었습니다.

두 번째 큰 변화는 글쓰기 방식입니다. Opus 5는 장황하다는 비판을 자주 받았습니다. 긴 도입부, 기업식 표현, 세 번째 문단에야 나오는 핵심 같은 것들이죠. Opus 5.5는 핵심을 먼저 말하고, 전문용어로 흐르는 일이 줄었으며, 사용자가 지정한 스타일 규칙을 더 안정적으로 따릅니다. 한 테스터는 간단히 이렇게 말했습니다. "제가 쓰는 방식대로 써요." 텍스트 작업을 해보면 바로 느낄 수 있습니다. 모델이 쓴 뒤에 손봐야 할 부분이 줄어듭니다.

미리 알아둘 특징이 하나 있습니다. Opus 5.5에서는 추론을 끌 수 없습니다. 항상 먼저 생각한 뒤 답합니다. 복잡한 작업에서는 장점입니다. 하지만 "창틀을 영어로 뭐라고 해요?" 같은 질문에는 몇 초를 더 기다린다는 뜻이기도 합니다. 이런 작은 작업에는 더 단순한 모델이 낫습니다.

ChatPlus에서는 Claude Opus 5.5를 이미 채팅에서 사용할 수 있습니다. Max 플랜에서 다른 최상위 모델들과 함께 제공됩니다.

GPT-6 Sol: 같은 기준을 절반 가격에

9월 초 OpenAI는 플래그십 모델 GPT-6 Astra를 출시했고, 이제 GPT-6 제품군은 이렇게 구성됩니다. 맨 위에 Astra, 중간에 Sol, 아래에 Luna가 있습니다. Sol은 일꾼형 모델로 설계됐습니다. Astra의 정밀함과 작업을 끝까지 밀고 가는 능력을 가져오되, 비용은 훨씬 낮췄습니다.

OpenAI는 Sol을 기록 경신보다 신뢰성으로 내세우고 있습니다. 회사는 사용자가 모델 오류로 표시했던 실제 대화를 가져와 새 버전으로 테스트했습니다. Sol은 GPT-5.6 Sol보다 실수를 대략 절반 정도 덜 하며, Astra 수준의 신뢰성에 도달합니다. 독립 환각 테스트도 이를 확인하지만, 단서가 있습니다. 지어낸 답변의 비율은 92%에서 60%로 떨어졌는데, 이는 모델이 확신이 없을 때 답변을 거부하는 경우가 늘었기 때문입니다. 정답 비율 전체는 오히려 59%에서 54%로 조금 내려갔습니다. 일상 업무에서는 나쁜 소식보다 좋은 소식에 가깝습니다. 자신 있게 꾸며내는 답보다 솔직한 "모르겠습니다"가 낫기 때문입니다.

프로그래밍에서는 Sol이 훨씬 비싼 모델들과 보조를 맞춥니다. 실제 저장소에서 긴 엔지니어링 작업을 수행하는 테스트인 DeepSWE에서 68.8%를 기록했습니다. Claude Fable 5가 69.9%로 최고 점수이지만, 작업당 비용은 대략 다섯 배 더 비쌉니다. Terminal-Bench 4.0에서는 Sol이 37%에서 43%로 향상됐습니다.

이제 보도자료가 말하지 않는 부분을 보죠. 종합 지능 지표에서 Sol은 이전 모델과 거의 달라지지 않았습니다. 47점에서 48점으로 올랐을 뿐입니다. 사무 문서 작업에서는 오히려 퇴보했고, 컴퓨터 제어에서는 Astra뿐 아니라 이전 Sol에도 뒤처집니다. 그러니 이것은 큰 도약이 아니라, 같은 능력 기준을 절반 가격에 제공하는 변화입니다. 대부분의 작업에는 바로 그 점이 필요합니다. 코딩, 리서치, 서신, 분석에 잘 맞습니다. 인터페이스를 스스로 클릭해가며 다루는 모델이 필요하다면 Astra를 고르세요.

GPT-6 Sol은 ChatPlus의 PRO 구독에서 사용할 수 있으며, 이전 Sol보다 비용이 절반인 만큼 긴 대화에서 사용 가능량이 눈에 띄게 더 오래갑니다. GPT-6 Sol로 채팅 열기.

GPT-6 Luna: 가장 신선한 지식을 가진 소형 모델

OpenAI는 Luna를 간단히 설명합니다. 목표가 명확한 대량 작업을 위한 모델이라고요. 문서를 요약하고, 텍스트에서 숫자와 이름을 추출하고, 질문에 빠르게 답하는 일입니다. 결코 사소한 작업이 아닙니다. 사람들이 매일 AI로 하는 일의 대부분이 바로 이런 작업이니까요.

가격은 거의 상징적입니다. 입력 토큰 100만 개당 10센트, 출력 토큰 100만 개당 50센트입니다. GPT-5.6 Luna와 비교하면 입력 가격은 절반이고, 출력은 거의 2.5배 저렴합니다. 종합 지능 지표에서는 이전 모델 수준을 유지합니다. 에이전트형 코딩에서는 약간 내려갔지만, 최대 설정의 DeepSWE에서는 작업당 단 22센트로 66.6%를 냅니다. OpenAI에 따르면 이는 중간 설정의 Claude Opus 5와 Fable 5에 비견되는 수준이면서 비용은 93–96% 낮습니다.

흥미로운 세부사항도 있습니다. 제품군에서 가장 작은 모델이 가장 최신 지식을 갖고 있습니다. Luna는 2026년 5월까지의 데이터로 훈련됐고, Sol과 Astra는 4월에서 멈춥니다.

ChatPlus에서 GPT-6 Luna는 PRO 구독으로 사용할 수 있으며, 사용 가능량을 차감하지 않습니다. 비싼 모델 요청이 차감되는 5시간 한도와 별개라는 뜻입니다. 카운터를 신경 쓰지 않고 원하는 만큼 사용할 수 있어요. 복잡한 다중 파일 코드에는 최선의 선택이 아니지만, 같은 대화 안에서 Sol이나 Opus로 전환할 수 있습니다.

Grok 4.7: 크고, 늦었고, 뜻밖에 저렴한 모델

Grok 4.7은 다른 모델들보다 먼저 나왔지만, 사실 가장 오래 기다려온 모델이기도 합니다. Elon Musk가 7월 말부터 출시를 최소 다섯 차례 연기했기 때문입니다. 지연은 이해할 만합니다. 이것은 겉만 바꾼 업데이트가 아니라 훨씬 더 큰 새 기반 모델입니다. 언론 보도에 따르면 약 2.1조 개 파라미터 규모입니다. 사람에게 몇 시간이 걸리는 작업에 중점을 두고 더 긴 강화학습 훈련을 받았습니다. xAI는 자체 검증도 개선했습니다. 모델이 자신의 답을 더 꼼꼼히 검토하고 긴 컨텍스트를 더 잘 다룹니다. 참고로 회사는 공식 자료에서 이제 자신을 SpaceXAI라고 부르지만, 모델 이름은 여전히 Grok입니다.

Grok 4.6 대비 향상 폭은 큽니다. 장기 프로그래밍 작업 테스트인 CursorBench 4.0에서 점수가 40.4%에서 46.3%로 올랐습니다. Terminal-Bench 4.0에서는 20.3%에서 37.6%로 거의 두 배가 됐습니다. 보고서, 스프레드시트, 프레젠테이션 같은 여러 시간짜리 사무 작업에서는 100 Elo점 이상을 얻었습니다. 특히 법률 성능이 놀랍습니다. Harvey 법률 벤치마크에서 Grok 4.7은 19.6%를 기록해 Claude Fable 5.1의 6.7%보다 거의 세 배 높습니다. 전기공학 벤치마크 EEBench에서는 Fable의 56.4%에 비해 64%를 기록했습니다.

전체 순위에서의 위치는 더 소박합니다. 대부분의 비교에서 Grok 4.7은 2위입니다. 사무 작업에서는 Fable 5.1에, 엔지니어링 작업에서는 GPT-6 Astra에 뒤처지고, Opus 5.5와는 여전히 큰 격차가 있습니다. 독립 테스트에서는 지능 지표 46점을 받았습니다. xAI가 상위 네 개 연구소에 들어가기에는 충분했지만, 그 이상은 아니었습니다. Musk 본인도 "Astra와 Fable급"은 Grok 4.9에서야 가능하다고 약속합니다. 한 가지 더 유의할 점이 있습니다. 최대 설정에서 이 모델은 Grok 4.6보다 작업당 토큰을 두 배 넘게 사용합니다. 따라서 토큰 가격이 같다고 해서 결과당 비용도 같다는 뜻은 아닙니다.

Grok 4.7의 핵심 장점은 가격 대비 품질입니다. Grok 4.6과 같은 가격, 즉 입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $6이며 Anthropic과 OpenAI의 플래그십보다 눈에 띄게 저렴합니다. Grok 4.7은 ChatPlus에서 PRO 구독으로 사용할 수 있습니다.

그래서 어떤 모델을 골라야 할까요?

저희라면 이렇게 나누겠습니다.

작업이 크고 중요하다면, 예를 들어 복잡한 코드, 프로젝트 감사, 분석 보고서, 명확한 사고가 필요한 긴 문서라면 Claude Opus 5.5를 고르세요. 현재 사용할 수 있는 가장 강력한 모델이며, 이전 Claude 모델보다 글도 확실히 더 잘 씁니다.

균형이 필요한 일상 업무라면 GPT-6 Sol이 잘 맞습니다. 코드, 리서치, 이메일, 스프레드시트에 좋습니다. 신중하고, 환각이 더 적고, 사용 가능량도 덜 씁니다.

요약, 번역, 짧은 참고 답변, 초안 같은 작은 작업에는 GPT-6 Luna를 고르세요. 빠르고 사용 가능량을 전혀 차감하지 않습니다.

Grok 4.7은 예상외로 강한 법률 및 엔지니어링 질문에 써볼 만하고, 다른 모델의 답과 비교하고 싶을 때 두 번째 의견으로도 좋습니다.

가장 쉬운 비교 방법은 본인의 작업으로 직접 시험해 보는 것입니다. ChatPlus에서는 대화 중간에 모델을 바꿀 수 있습니다. Opus에 질문하고, Sol이나 Grok으로 전환한 뒤 같은 프롬프트를 다시 보내면 누가 가장 잘 처리하는지 바로 확인할 수 있어요. 자세한 모델 페이지는 Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, Grok 4.7에서 볼 수 있습니다.

한마디로

이틀 사이 네 개의 새 모델이 등장했습니다. Claude Opus 5.5는 새로운 선두입니다. Opus 5보다 40% 낮은 비용으로 Fable 5.1급 능력을 제공하고, 동급 최고 수준의 에이전트형 코딩 성능과 눈에 띄게 더 명료한 글쓰기를 보여줍니다. GPT-6 Sol은 지능 면에서는 거의 나아지지 않았지만, 비용이 절반이고 사실 오류도 절반으로 줄었습니다. GPT-6 Luna는 단순 작업을 위한 매우 저렴한 모델이며 제품군에서 가장 최신 지식을 갖고 있습니다. Grok 4.7은 특히 코드, 법률, 엔지니어링에서 크게 도약했지만, 아직은 2군에 머물러 있습니다. 대신 가격은 접근하기 쉽습니다. 네 모델 모두 이미 ChatPlus에서 사용할 수 있습니다.

ChatPlus에서 최고의 AI 모델을 사용해 보세요

GPT, Claude, Gemini, GLM 등 다양한 AI 모델을 한 창에서 만나보세요.