2026년 AI 모델 대비교: GPT-5.6 vs Claude Sonnet 5 vs Gemini 3.5 (7월 업데이트)

2026년 AI 모델 대비교: GPT-5.6 vs Claude Sonnet 5 vs Gemini 3.5 (7월 업데이트)

12분 읽기

AI 모델이 너무 빨리 바뀌어서 어떤 걸 써야 할지 모르겠다는 분들 많으시죠? 저도 매달 새 모델이 나올 때마다 비교하느라 정신없어요.

이 글은 2월에 처음 썼는데, 다섯 달 만에 표의 모델이 전부 바뀌었어요. GPT-5.2는 5.6이 됐고, Claude Sonnet 4.6은 Sonnet 5가 됐고, Gemini 2.0은 3.5가 됐어요. 그래서 7월 15일 기준으로 전면 갱신했고, 7월 27일 Claude Opus 5 출시(Opus 4.8과 같은 $5/$25에 Fable 5 근접 성능·1M 컨텍스트 표준)를 반영했습니다. 상반기를 한 줄로 요약하면 이래요 — 세대는 두 번 바뀌었고, 가격은 아래로 무너졌어요.

한눈에 보는 모델 지도 (2026년 7월)

API 가격은 2026-07-15에 각 사 공식 가격 문서에서 직접 확인한 값이에요 (1M 토큰당 입력/출력).

모델회사API 가격 (입/출력)포지션
GPT-5.6 SolOpenAI$5 / $30플래그십
GPT-5.6 TerraOpenAI$2.50 / $15엔터프라이즈 중형
GPT-5.6 LunaOpenAI$1 / $6대량 처리용
Claude Fable 5Anthropic$10 / $50프론티어 (안전 계층 분리 설계)
Claude Opus 5Anthropic$5 / $25최상위 추론·에이전틱 (Fable 5 근접, 1M 컨텍스트 표준)
Claude Sonnet 5Anthropic$2 / $10 (8/31까지), 정가 $3 / $15기본값 자리
Claude Haiku 4.5Anthropic$1 / $5경량
Gemini 3.5 FlashGoogle$1.50 / $9에이전트 실행 특화
Gemini 3.1 Flash-LiteGoogle$0.25 / $1.50초저가

주의 두 가지. 첫째, Sonnet 5의 $2/$10은 8월 31일까지의 프로모션이고 9월 1일부터 $3/$15 정가로 돌아가요. 둘째, Anthropic 신형 모델(Sonnet 5, Opus 4.7/4.8, Fable 5)은 새 토크나이저를 써서 같은 텍스트가 약 30% 더 많은 토큰으로 집계된다고 공식 문서에 명시돼 있어요. 표의 단가만 보고 비교하면 실효 비용을 놓칩니다.

작업별 비교

코딩 — Claude 우위는 유지, 기준선이 내려왔다

코딩에서 Claude가 앞선다는 평가는 2월과 달라지지 않았어요. 저는 매일 Claude Code로 이 블로그를 만들며 일하고 있어서, 이 항목만큼은 계속 확신을 갖고 쓰고 있어요. 달라진 건 그 품질의 가격이에요. Sonnet 5가 Opus 4.8에 근접한 성능을 프로모션 $2/$10에 내놓으면서, "Opus급 코딩 지능"이 사실상 중급 모델 가격이 됐어요.

Claude의 코딩 강점 (여전히 유효):
  • 여러 파일에 걸친 리팩토링에서 맥락을 잘 유지
  • 타입스크립트/React 코드 품질이 높음
  • 모호한 지시를 잘 해석하고 기존 코드 스타일에 맞춤
추격도 만만치 않아요:
  • GPT-5.6은 발표 기준 "토큰당 더 많은 유효 작업"을 내세워요 — Microsoft 365 Copilot의 기본 라우팅 모델로 채택됐을 정도로 실무형 포지션이에요
  • Gemini 3.5 Flash는 Terminal-Bench 76.2%로 에이전트 실행력에 무게중심을 둔 모델이에요

정리: 일상 코딩의 기본값 = Sonnet 5. 아주 어려운 문제만 Opus 4.8로 올려 쓰는 이원 구성이 지금 가장 합리적이에요.

한국어 — Claude 우위 지속

한국어 자연스러움, 존댓말 일관성에서 Claude가 앞선다는 평가는 세대가 바뀌어도 유지되고 있어요. 이 블로그의 포스트도 Claude로 작성 보조를 받는데, "~예요/해요" 대화체 처리와 맞춤법은 여전히 Claude 쪽이 안정적이에요. GPT 계열은 격식체와 대화체가 섞이는 버릇이 남아 있고, Gemini는 전문 용어 번역이 가끔 어색해요.

수학/과학 — GPT 계열 강세, 단 '연구급'은 아직

2월에 "GPT-5.2의 독무대"라고 썼던 영역인데, 방향은 유지되고 결이 좀 더 정확해졌어요. OpenAI는 상반기에 GPT 계열로 기하학 추측을 반증하는 등 수학 쪽 성과를 계속 냈어요. 다만 벤치마크가 하나 나오면서 냉정한 기준점도 생겼어요 — 유전체학 벤치마크 GeneBench-Pro에서 최고 성적이 GPT-5.6 계열의 31.5%였어요. 수학·과학 보조로는 GPT가 첫 선택이지만, "연구를 대신한다"는 아직 과장이에요.

멀티모달 — Gemini의 영역, 이제 영상 생성까지

멀티모달의 왕좌는 여전히 Gemini예요. 달라진 건 폭이에요. I/O 2026에서 공개된 Gemini Omni는 어떤 입력이든 영상으로 만들고 대화형 편집까지 지원하는 방향을 보여줬고, 영상 생성 API(Veo 3.1)는 초당 $0.40(720p/1080p) 종량제로 공식 가격표에 올라와 있어요. 이미지 이해·문서 분석 같은 입력 멀티모달은 Gemini와 GPT가 모두 잘하지만, 생성까지 묶은 파이프라인은 Google 생태계가 가장 넓어요.

긴 문서 분석 — 스펙 표보다 중요한 것

2월 버전에는 모델별 컨텍스트 크기 표가 있었는데, 세대가 바뀔 때마다 숫자가 변해서 이번 갱신에서는 뺐어요 (최신 스펙은 각 사 모델 문서에서 확인하는 게 정확해요). 대신 변하지 않는 조언만 남길게요. 컨텍스트가 크다고 다 넣지 마세요. 긴 입력은 비용이 커지고, 중간 내용을 놓치는 "lost in the middle" 현상은 세대가 바뀌어도 완전히 사라지지 않았어요. 필요한 부분을 발췌해서 넣는 쪽이 대부분 더 정확하고 쌉니다.

가성비 — 초저가 전쟁의 승자들

2월에 "GPT-4o는 아직 현역"이라고 썼는데, 이제 가성비 지도가 완전히 달라졌어요. 검증된 가격 기준으로 현재의 저가 라인업은 이래요:

작업추천 모델이유
단순 질의응답·요약Gemini 3.1 Flash-Lite$0.25/$1.50 — 최저가급인데 품질 준수
대량 배치 처리GPT-5.6 Luna$1/$6 + 캐시 입력 $0.10
코드 리뷰Claude Sonnet 5프로모션 $2/$10에 Opus급 코딩
에이전트 실행Gemini 3.5 Flash$1.50/$9 + 실행력 특화
경량 에이전트·분류Claude Haiku 4.5$1/$5, Batch 시 절반

비용 최적화 팁: 하나의 모델만 쓰지 마세요. 작업 복잡도에 따라 모델을 라우팅하면 비용을 크게 줄일 수 있어요. Oh My OpenCode 같은 도구가 이걸 자동으로 해줍니다. Batch API(대부분 반값)와 캐시 읽기 단가도 대량 작업에서는 승부처예요.

제가 실제로 쓰는 조합 (7월 기준)

솔직하게 공개할게요. Claude Code의 기본 모델이 Sonnet 5로 바뀌면서 제 구성도 자연스럽게 따라 올라갔어요:

작업모델도구
블로그 코드 작성/수정Claude Sonnet 5Claude Code
복잡한 아키텍처 결정Claude Opus 5Claude Code (Oracle)
블로그 포스트 보조Claude Sonnet 5Claude Code
빠른 질문/검색GPT-5.6ChatGPT
이미지/문서 분석Gemini 3.5 FlashGoogle AI Studio

솔직한 고백: Claude 편향이 있는 건 사실이에요. Claude Code를 매일 쓰다 보니 Claude에 익숙해진 면이 있어요. 하지만 코딩과 한국어에서 Claude가 우위인 건 객관적이라고 생각해요.

2026년 하반기 전망

1. "중급이 기본값" 시대

상반기의 가장 큰 구조 변화는 중급 모델이 플래그십 단가를 무너뜨린 거예요. Sonnet 5가 그 신호탄이었고, GPT-5.6이 Terra/Luna로 가격대를 쪼갠 것도 같은 흐름이에요. 이제 "제일 좋은 모델"이 아니라 "기본으로 켜 둘 모델"을 고르는 게 실질적인 의사결정이 됐어요.

2. 프론티어의 분리

최상위 능력은 별도 트랙으로 갈라지고 있어요. Claude Fable 5/Mythos 5처럼 같은 모델을 안전장치 유무로 나눠 배포하는 설계가 등장했고, 가격도 $10/$50으로 일반 라인과 뚜렷하게 구분돼요. 프론티어는 일상용이 아니라 특수 작업용이라는 게 가격표에서부터 읽혀요.

3. 에이전트 능력이 핵심 차별화 — 그리고 '정지 능력'

2월에 "차별화는 에이전트로서 얼마나 잘 동작하는가로 넘어간다"고 썼는데, 반년 만에 현실이 됐어요. 한 걸음 더 나아가서, 이제는 자율 실행이 기본값이 되면서 '멈추는 능력'이 경쟁축이 되고 있어요. 모델 선택에서도 "얼마나 똑똑한가"만큼 "폭주하지 않고 예산 안에서 도는가"를 보게 될 거예요.

총평

2026년 7월 AI 모델 판도를 한 줄로 요약하면:

"코딩·한국어는 Claude(기본값은 Sonnet 5), 수학·과학은 GPT-5.6, 멀티모달은 Gemini, 초저가는 Flash-Lite"

하나의 "최고" 모델은 없어요. 중요한 건 자기 작업에 맞는 모델을 고르는 눈, 그리고 이제는 기본값으로 켜 둘 모델과 아껴 쓸 모델을 나누는 운영 감각이에요.

  • 개발자라면: Claude Sonnet 5부터 시작 (프로모션 기간이 특히 유리)
  • 연구·데이터 분석이라면: GPT-5.6 (Sol은 아껴 쓰고 Terra를 기본으로)
  • 콘텐츠 크리에이터라면: Gemini 3.5 Flash + Omni 생태계
  • 예산이 한정적이라면: Gemini Flash-Lite + Haiku 4.5 조합

가격표는 계속 바뀌니, 결제 전엔 각 사 공식 가격 페이지를 꼭 확인하세요. 다음 큰 변화가 오면 또 갱신할게요.

광고

T
TomAI 코딩 도구를 매일 쓰는 개발자

Claude Code, OpenCode 같은 AI 코딩 도구를 직접 쓰면서 AI 업계의 변화를 개발자 관점에서 기록합니다. 단순 번역이 아니라 써본 경험과 해석을 함께 남기려고 해요.