같은 주에 '과학용 작업대'와 '과학 시험지'가 나왔다 — 그리고 시험지는 아직 못 푼다고 답했다
Anthropic은 과학자용 워크벤치 Claude Science를, OpenAI는 유전체학 벤치마크 GeneBench-Pro를 거의 같은 시점에 내놨어요. 한쪽은 'AI로 과학하는 도구'를, 다른 쪽은 'AI가 과학을 하는가'를 측정해요. 그리고 그 측정값(최고 31.5%)이 지금 우리가 어디쯤 있는지 냉정하게 말해줘요.
AnthropicOpenAI