SWE-bench는 끝났다: AI 코딩 벤치마크의 구조적 한계
OpenAI도 SWE-bench Verified 점수 보고를 중단했습니다. 138개 문제 중 59.4%에 결함이 있고, 데이터 오염까지. AI 코딩 평가의 다음 단계를 살펴봤어요.
Archive
발행된 글 123개를 최신순으로 모아봅니다. (4/7 페이지)
OpenAI도 SWE-bench Verified 점수 보고를 중단했습니다. 138개 문제 중 59.4%에 결함이 있고, 데이터 오염까지. AI 코딩 평가의 다음 단계를 살펴봤어요.
Anthropic Labs에서 Claude Design을 리서치 프리뷰로 공개했습니다. 디자인 시스템 통합부터 Claude Code 핸드오프까지, 개발자에게도 의미 있는 도구예요.
Anthropic이 Opus 4.7을 출시했습니다. 비전 해상도 3배 증가, 코딩 성능 13% 향상과 함께, 시스템 프롬프트 변경 사항을 분석해봤어요.
OpenAI Codex가 컴퓨터 직접 조작, 이미지 생성, 메모리, 자동 스케줄링까지 추가했습니다. 코딩 도구를 넘어서 범용 에이전트로 진화 중이에요.
Google Cloud AI 디렉터 Addy Osmani가 JS Nation US에서 밝힌 AI 시대 시니어 개발자의 역할 변화. '이해도 부채' 개념이 인상적이었어요.
Andrej Karpathy가 제안한 LLM Wiki 패턴을 소개하고, 실제로 이 블로그에 적용한 과정과 구조를 공유합니다.
SEO만으로는 AI 에이전트 트래픽을 잡을 수 없어요. Addy Osmani가 제안한 에이전틱 엔진 최적화(AEO)가 무엇이고, 왜 지금 신경 써야 하는지 정리해 봤어요.
Google이 텍스트-음성 변환 모델 Gemini 3.1 Flash TTS를 공개했어요. 오디오 태그로 음색, 속도, 감정까지 세밀하게 조절할 수 있고, 70개 이상 언어를 지원해요.
Anthropic의 비공개 LLM Mythos가 32단계 기업 네트워크 공격 시뮬레이션을 완주했어요. 보안이 토큰 투입량 경쟁, 즉 작업증명(Proof of Work) 구조로 변하고 있다는 분석이에요.
OpenAI가 Agents SDK의 대규모 업데이트를 발표했어요. 샌드박스 실행 환경 분리, 오픈소스 하네스, 그리고 유연한 메모리 관리까지 에이전트 개발의 판이 바뀌는 변화예요.
Claude Code v2.1.94에서 Amazon Bedrock Mantle 지원과 CJK 텍스트 깨짐 수정이 들어왔고, v2.1.97은 NO_FLICKER 포커스 뷰와 MCP 메모리 누수 수정, v2.1.101은 /team-onboarding과 OS CA 인증서 자동 신뢰까지 추가됐어요.
GitHub 공동창업자이자 Pro Git 저자인 Scott Chacon이 AI 시대에 맞는 새로운 Git 클라이언트를 만들었어요. a16z로부터 $1,700만 투자까지 유치한 GitButler, 뭐가 다른지 정리해 봤어요.
Meta가 Scale AI 인수 후 Alexandr Wang 주도로 개발 중인 새 AI 모델 패밀리를 공개할 예정이에요. Llama와는 다른 '부분 오픈소스' 전략이 무엇을 의미하는지 정리해 봤어요.
1월에 시작한 Tom's Blog가 3개월 만에 101개 포스트를 넘었어요. AI로 뉴스를 수집하고 발행하면서 실제로 겪은 일들, SEO 삽질, 그리고 솔직한 후기를 정리해 봤어요.
AI가 너무 빠르게 발전하면서 개발자들 사이에 퍼진 불안과 우울감, '클로드 블루'라는 신조어에 대해 이야기해요. 두렵다면, 그건 아마 자연스러운 감정이에요.
ChatGPT에 글을 쓰기 전, Cloudflare Turnstile이 브라우저 지문 28개, 네트워크 정보 5개, React 앱 상태 3개까지 총 55개 속성을 수집하고 있었어요. 보안 연구자가 377개 프로그램을 복호화해서 밝혀낸 내용을 정리했어요.
삼체 문제의 '암흑의 숲' 이론을 AI 시대에 적용한 에세이를 소개해요. 아이디어를 공유하는 게 오히려 불리해지는 구조, 그리고 우리는 어떻게 대응해야 할지 생각해 봤어요.
MCP, A2A, UCP, AP2, A2UI, AG-UI 등 6가지 AI 에이전트 프로토콜을 레스토랑 공급망 시나리오로 쉽게 이해할 수 있는 가이드예요.
Claude Code에서 Skills는 단순 마크다운이 아니라 폴더 구조의 강력한 확장 포인트예요. Anthropic 내부에서 수백 개의 스킬을 운용하며 축적한 실전 노하우를 정리했어요.
Claude Code 세 버전을 한 번에 정리해요. Opus 4.6 기본 토큰 64k 확대, 메모리 최적화, Console 인증 플래그 등 알찬 업데이트가 가득해요.