"4B 모델이 검색에서 GPT-5.6을 100배 싸게 이겼다"는 주장, 뜯어봤습니다
4B 오픈 모델이 에이전트 검색에서 GPT-5.6 Sol급 정확도를 1/100 비용에 냈다는 화제의 주장을 문답 형식으로 검증했어요. 결론부터 말하면 절반은 진짜고 절반은 마케팅이에요 — 어디까지가 사실이고 어디부터 함정인지, 원 자료(Castform·Neon)를 직접 확인해서 정리했습니다.
Tag
가이드 태그가 포함된 글 7개를 한곳에서 볼 수 있습니다.
4B 오픈 모델이 에이전트 검색에서 GPT-5.6 Sol급 정확도를 1/100 비용에 냈다는 화제의 주장을 문답 형식으로 검증했어요. 결론부터 말하면 절반은 진짜고 절반은 마케팅이에요 — 어디까지가 사실이고 어디부터 함정인지, 원 자료(Castform·Neon)를 직접 확인해서 정리했습니다.
기업에서 Codex를 도입할 때 실제로 부딪히는 질문들을 공식 문서 기준으로 정리했어요. Business와 Enterprise의 차이, 4월에 바뀐 크레딧 과금의 구조와 자동 충전 함정, requirements.toml 관리형 통제, 삼성·삼성SDS로 이어지는 국내 도입 지형까지 — 도입 품의에 바로 쓸 수 있는 수준으로요.
Auto 모드는 권한 프롬프트 없이 작업하되 별도 분류기가 모든 액션을 사전 검토하는 모드예요. CLAUDE_CODE_ENABLE_AUTO_MODE 환경변수는 이제 no-op이고, 저장소 설정으로는 켤 수 없고, 3연속/누적 20회 차단 시 자동 해제됩니다. 공식 문서 기준으로 활성화 조건, 기본 차단 목록, 커스텀 규칙, 관리자 통제까지 전부 정리했어요.
Codex의 메모리는 기본 꺼짐이고, 로컬 클라이언트와 ChatGPT 웹의 메모리는 서로 다른 저장소예요. 이미지는 입력뿐 아니라 생성(gpt-image-2)까지 되고요. 공식 문서 기준으로 메모리 3계층 구조, config.toml 설정, 이미지 생성 사용법과 검열(moderation) 동작까지 실무자용으로 정리했어요.
Gemini 2.0 Pro, Gemini Flash, Gemma, AI Studio, Vertex AI — Google의 AI 생태계가 복잡해졌어요. 개발자 관점에서 뭘 써야 하는지 정리했습니다.
프롬프트 인젝션이 뭔지, 어떤 유형이 있는지, 그리고 어떻게 방어하는지 실제 사례와 함께 정리했어요. AI를 활용하는 개발자라면 꼭 알아야 할 보안 지식입니다.
Claude Code, Cursor, GitHub Copilot, Devin(구 Windsurf), OpenCode 등 주요 AI 코딩 도구의 2026년 7월 기준 가격과 기능을 공식 가격 페이지 기준으로 비교했어요. 개인 개발자부터 팀까지, 예산별 추천을 정리했습니다.