2026년 AI 모델 대비교: GPT-5.6 vs Claude Sonnet 5 vs Gemini 3.5 (7월 업데이트)
AI 모델이 너무 빨리 바뀌어서 어떤 걸 써야 할지 모르겠다는 분들 많으시죠? 저도 매달 새 모델이 나올 때마다 비교하느라 정신없어요.
이 글은 2월에 처음 썼는데, 다섯 달 만에 표의 모델이 전부 바뀌었어요. GPT-5.2는 5.6이 됐고, Claude Sonnet 4.6은 Sonnet 5가 됐고, Gemini 2.0은 3.5가 됐어요. 그래서 7월 15일 기준으로 전면 갱신했고, 7월 27일 Claude Opus 5 출시(Opus 4.8과 같은 $5/$25에 Fable 5 근접 성능·1M 컨텍스트 표준)를 반영했습니다. 상반기를 한 줄로 요약하면 이래요 — 세대는 두 번 바뀌었고, 가격은 아래로 무너졌어요.
한눈에 보는 모델 지도 (2026년 7월)
API 가격은 2026-07-15에 각 사 공식 가격 문서에서 직접 확인한 값이에요 (1M 토큰당 입력/출력).
| 모델 | 회사 | API 가격 (입/출력) | 포지션 |
|---|---|---|---|
| GPT-5.6 Sol | OpenAI | $5 / $30 | 플래그십 |
| GPT-5.6 Terra | OpenAI | $2.50 / $15 | 엔터프라이즈 중형 |
| GPT-5.6 Luna | OpenAI | $1 / $6 | 대량 처리용 |
| Claude Fable 5 | Anthropic | $10 / $50 | 프론티어 (안전 계층 분리 설계) |
| Claude Opus 5 | Anthropic | $5 / $25 | 최상위 추론·에이전틱 (Fable 5 근접, 1M 컨텍스트 표준) |
| Claude Sonnet 5 | Anthropic | $2 / $10 (8/31까지), 정가 $3 / $15 | 기본값 자리 |
| Claude Haiku 4.5 | Anthropic | $1 / $5 | 경량 |
| Gemini 3.5 Flash | $1.50 / $9 | 에이전트 실행 특화 | |
| Gemini 3.1 Flash-Lite | $0.25 / $1.50 | 초저가 |
주의 두 가지. 첫째, Sonnet 5의 $2/$10은 8월 31일까지의 프로모션이고 9월 1일부터 $3/$15 정가로 돌아가요. 둘째, Anthropic 신형 모델(Sonnet 5, Opus 4.7/4.8, Fable 5)은 새 토크나이저를 써서 같은 텍스트가 약 30% 더 많은 토큰으로 집계된다고 공식 문서에 명시돼 있어요. 표의 단가만 보고 비교하면 실효 비용을 놓칩니다.
작업별 비교
코딩 — Claude 우위는 유지, 기준선이 내려왔다
코딩에서 Claude가 앞선다는 평가는 2월과 달라지지 않았어요. 저는 매일 Claude Code로 이 블로그를 만들며 일하고 있어서, 이 항목만큼은 계속 확신을 갖고 쓰고 있어요. 달라진 건 그 품질의 가격이에요. Sonnet 5가 Opus 4.8에 근접한 성능을 프로모션 $2/$10에 내놓으면서, "Opus급 코딩 지능"이 사실상 중급 모델 가격이 됐어요.
Claude의 코딩 강점 (여전히 유효):- 여러 파일에 걸친 리팩토링에서 맥락을 잘 유지
- 타입스크립트/React 코드 품질이 높음
- 모호한 지시를 잘 해석하고 기존 코드 스타일에 맞춤
- GPT-5.6은 발표 기준 "토큰당 더 많은 유효 작업"을 내세워요 — Microsoft 365 Copilot의 기본 라우팅 모델로 채택됐을 정도로 실무형 포지션이에요
- Gemini 3.5 Flash는 Terminal-Bench 76.2%로 에이전트 실행력에 무게중심을 둔 모델이에요
정리: 일상 코딩의 기본값 = Sonnet 5. 아주 어려운 문제만 Opus 4.8로 올려 쓰는 이원 구성이 지금 가장 합리적이에요.
한국어 — Claude 우위 지속
한국어 자연스러움, 존댓말 일관성에서 Claude가 앞선다는 평가는 세대가 바뀌어도 유지되고 있어요. 이 블로그의 포스트도 Claude로 작성 보조를 받는데, "~예요/해요" 대화체 처리와 맞춤법은 여전히 Claude 쪽이 안정적이에요. GPT 계열은 격식체와 대화체가 섞이는 버릇이 남아 있고, Gemini는 전문 용어 번역이 가끔 어색해요.
수학/과학 — GPT 계열 강세, 단 '연구급'은 아직
2월에 "GPT-5.2의 독무대"라고 썼던 영역인데, 방향은 유지되고 결이 좀 더 정확해졌어요. OpenAI는 상반기에 GPT 계열로 기하학 추측을 반증하는 등 수학 쪽 성과를 계속 냈어요. 다만 벤치마크가 하나 나오면서 냉정한 기준점도 생겼어요 — 유전체학 벤치마크 GeneBench-Pro에서 최고 성적이 GPT-5.6 계열의 31.5%였어요. 수학·과학 보조로는 GPT가 첫 선택이지만, "연구를 대신한다"는 아직 과장이에요.
멀티모달 — Gemini의 영역, 이제 영상 생성까지
멀티모달의 왕좌는 여전히 Gemini예요. 달라진 건 폭이에요. I/O 2026에서 공개된 Gemini Omni는 어떤 입력이든 영상으로 만들고 대화형 편집까지 지원하는 방향을 보여줬고, 영상 생성 API(Veo 3.1)는 초당 $0.40(720p/1080p) 종량제로 공식 가격표에 올라와 있어요. 이미지 이해·문서 분석 같은 입력 멀티모달은 Gemini와 GPT가 모두 잘하지만, 생성까지 묶은 파이프라인은 Google 생태계가 가장 넓어요.
긴 문서 분석 — 스펙 표보다 중요한 것
2월 버전에는 모델별 컨텍스트 크기 표가 있었는데, 세대가 바뀔 때마다 숫자가 변해서 이번 갱신에서는 뺐어요 (최신 스펙은 각 사 모델 문서에서 확인하는 게 정확해요). 대신 변하지 않는 조언만 남길게요. 컨텍스트가 크다고 다 넣지 마세요. 긴 입력은 비용이 커지고, 중간 내용을 놓치는 "lost in the middle" 현상은 세대가 바뀌어도 완전히 사라지지 않았어요. 필요한 부분을 발췌해서 넣는 쪽이 대부분 더 정확하고 쌉니다.
가성비 — 초저가 전쟁의 승자들
2월에 "GPT-4o는 아직 현역"이라고 썼는데, 이제 가성비 지도가 완전히 달라졌어요. 검증된 가격 기준으로 현재의 저가 라인업은 이래요:
| 작업 | 추천 모델 | 이유 |
|---|---|---|
| 단순 질의응답·요약 | Gemini 3.1 Flash-Lite | $0.25/$1.50 — 최저가급인데 품질 준수 |
| 대량 배치 처리 | GPT-5.6 Luna | $1/$6 + 캐시 입력 $0.10 |
| 코드 리뷰 | Claude Sonnet 5 | 프로모션 $2/$10에 Opus급 코딩 |
| 에이전트 실행 | Gemini 3.5 Flash | $1.50/$9 + 실행력 특화 |
| 경량 에이전트·분류 | Claude Haiku 4.5 | $1/$5, Batch 시 절반 |
비용 최적화 팁: 하나의 모델만 쓰지 마세요. 작업 복잡도에 따라 모델을 라우팅하면 비용을 크게 줄일 수 있어요. Oh My OpenCode 같은 도구가 이걸 자동으로 해줍니다. Batch API(대부분 반값)와 캐시 읽기 단가도 대량 작업에서는 승부처예요.
제가 실제로 쓰는 조합 (7월 기준)
솔직하게 공개할게요. Claude Code의 기본 모델이 Sonnet 5로 바뀌면서 제 구성도 자연스럽게 따라 올라갔어요:
| 작업 | 모델 | 도구 |
|---|---|---|
| 블로그 코드 작성/수정 | Claude Sonnet 5 | Claude Code |
| 복잡한 아키텍처 결정 | Claude Opus 5 | Claude Code (Oracle) |
| 블로그 포스트 보조 | Claude Sonnet 5 | Claude Code |
| 빠른 질문/검색 | GPT-5.6 | ChatGPT |
| 이미지/문서 분석 | Gemini 3.5 Flash | Google AI Studio |
솔직한 고백: Claude 편향이 있는 건 사실이에요. Claude Code를 매일 쓰다 보니 Claude에 익숙해진 면이 있어요. 하지만 코딩과 한국어에서 Claude가 우위인 건 객관적이라고 생각해요.
2026년 하반기 전망
1. "중급이 기본값" 시대
상반기의 가장 큰 구조 변화는 중급 모델이 플래그십 단가를 무너뜨린 거예요. Sonnet 5가 그 신호탄이었고, GPT-5.6이 Terra/Luna로 가격대를 쪼갠 것도 같은 흐름이에요. 이제 "제일 좋은 모델"이 아니라 "기본으로 켜 둘 모델"을 고르는 게 실질적인 의사결정이 됐어요.
2. 프론티어의 분리
최상위 능력은 별도 트랙으로 갈라지고 있어요. Claude Fable 5/Mythos 5처럼 같은 모델을 안전장치 유무로 나눠 배포하는 설계가 등장했고, 가격도 $10/$50으로 일반 라인과 뚜렷하게 구분돼요. 프론티어는 일상용이 아니라 특수 작업용이라는 게 가격표에서부터 읽혀요.
3. 에이전트 능력이 핵심 차별화 — 그리고 '정지 능력'
2월에 "차별화는 에이전트로서 얼마나 잘 동작하는가로 넘어간다"고 썼는데, 반년 만에 현실이 됐어요. 한 걸음 더 나아가서, 이제는 자율 실행이 기본값이 되면서 '멈추는 능력'이 경쟁축이 되고 있어요. 모델 선택에서도 "얼마나 똑똑한가"만큼 "폭주하지 않고 예산 안에서 도는가"를 보게 될 거예요.
총평
2026년 7월 AI 모델 판도를 한 줄로 요약하면:
"코딩·한국어는 Claude(기본값은 Sonnet 5), 수학·과학은 GPT-5.6, 멀티모달은 Gemini, 초저가는 Flash-Lite"
하나의 "최고" 모델은 없어요. 중요한 건 자기 작업에 맞는 모델을 고르는 눈, 그리고 이제는 기본값으로 켜 둘 모델과 아껴 쓸 모델을 나누는 운영 감각이에요.
- 개발자라면: Claude Sonnet 5부터 시작 (프로모션 기간이 특히 유리)
- 연구·데이터 분석이라면: GPT-5.6 (Sol은 아껴 쓰고 Terra를 기본으로)
- 콘텐츠 크리에이터라면: Gemini 3.5 Flash + Omni 생태계
- 예산이 한정적이라면: Gemini Flash-Lite + Haiku 4.5 조합
가격표는 계속 바뀌니, 결제 전엔 각 사 공식 가격 페이지를 꼭 확인하세요. 다음 큰 변화가 오면 또 갱신할게요.
광고
Claude Code, OpenCode 같은 AI 코딩 도구를 직접 쓰면서 AI 업계의 변화를 개발자 관점에서 기록합니다. 단순 번역이 아니라 써본 경험과 해석을 함께 남기려고 해요.
관련 글
Claude Code 한 달 추적기: v2.1.16에서 v2.1.47까지, 어떻게 변했나
Claude Code를 한 달간 매 버전 추적하며 사용한 기록입니다. 7번의 릴리스, 100개 이상의 버그 수정, 그리고 도구가 성숙해가는 과정을 정리했어요.
개발자를 위한 Gemini 생태계 완전 가이드 2026
Gemini 2.0 Pro, Gemini Flash, Gemma, AI Studio, Vertex AI — Google의 AI 생태계가 복잡해졌어요. 개발자 관점에서 뭘 써야 하는지 정리했습니다.
AI가 바꾸는 과학 연구: 2026년, 실험실의 혁명
AlphaFold에서 시작된 AI+과학의 혁명이 2026년에는 어디까지 왔을까요? 단백질 구조 예측부터 신약 개발, 기후 모델링까지 AI가 과학을 바꾸는 현장을 정리했어요.