뉴스 목록Anthropic의 Claude Opus 4.8가 출시되었습니다: 더 나은 AI 코딩, 더 똑똑한 안전성—동일한 높은 가격
Decrypt2026-05-28 17:45:39

Anthropic의 Claude Opus 4.8가 출시되었습니다: 더 나은 AI 코딩, 더 똑똑한 안전성—동일한 높은 가격

ORIGINALAnthropic's Claude Opus 4.8 Is Here: Better AI Coding, Smarter Safety—Same Huge Price
AI 영향 분석Grok 분석 중...
📄전체 원문· trafilatura에 의해 자동 추출됨Gemini 翻譯7329 자
간략히 - Anthropic은 목요일에 Claude Opus 4.8을 출시했으며, 이는 Opus 4.7 출시 후 단 6주 만이다. - 이번 업데이트는 소프트웨어 엔지니어링, 추론, 컴퓨터 사용 벤치마크 전반에서 성능 향상을 보였으며, 입력/출력 토큰 백만 개당 $5/$25라는 동일한 가격을 유지한다. - Opus 4.8의 정렬(alignment) 점수는 이제 Anthropic의 제한된 프론티어 모델인 Claude Mythos Preview와 비슷한 수준이며, 기만적이거나 오용에 협조적인 행동의 비율이 이전 모델보다 현저히 낮아졌다. 6주. Anthropic이 Opus 4.7에서 Opus 4.8로 넘어가는 데 걸린 시간이다. 새 모델은 벤치마크 테스트에서 더 빠르고 더 똑똑하며, 다양한 신규 기능과 함께 출시되었다. 하지만 가격은 그대로다. 입력 토큰 백만 개당 $5, 출력 토큰 백만 개당 $25로 이전과 동일하다. 또한 동일한 모델을 2.5배 빠른 속도로 실행하는 fast mode도 있는데, 백만 토큰당 입력 $10, 출력은 무려 $50에 달한다. Anthropic은 이 요금이 이전 모델의 fast mode 비용보다 이제 3배 더 저렴해졌다고 말하는데, 이는 예전에는 훨씬 더 비쌌다는 것을 좋게 표현한 방식이다. SWE-bench Pro는 아마도 이 모델이 얼마나 좋은지 가늠하기 위해 주목해야 할 가장 중요한 벤치마크일 것이다. 이는 AI가 실제 프로덕션 코드베이스에서 가져온 어렵고 다중 언어로 된 소프트웨어 엔지니어링 문제를 실제로 해결할 수 있는지 측정하며, 통과한 문제의 비율로 점수가 매겨진다. 이 테스트에서 Opus 4.8은 69.2%를 기록했으며, 이는 Opus 4.7의 64.3%에서 상승한 수치다. OpenAI의 GPT-5.5는 58.6%를 기록했고, Google의 Gemini 3.1 Pro는 54.2%로 뒤처졌다. 동일한 가격대의 모델로서는 의미 있는 도약이다. 수십 개 학문 분야에 걸친 전문가 수준의 질문을 정답률 기준으로 채점하는 Humanity's Last Exam에서, Opus 4.8은 도구 없이 49.8%, 도구를 사용해 57.9%를 기록하며 세 경쟁 모델 모두를 앞섰다. 소프트웨어 UI 탐색 같은 실제 컴퓨터 사용 작업을 테스트하는 OSWorld-Verified에서는 83.4%를 기록해 Opus 4.7의 82.8%를 약간 넘어섰다. 유일한 패배는 명령줄 작업에서 AI 성능을 측정하는 Terminal-Bench 2.1이다. GPT-5.5가 78.2%로 선두를 차지했고, Opus 4.8은 74.6%로 Opus 4.7의 66.1%보다 좋고 Gemini의 70.3%보다 앞섰지만, 결국 2위는 패배일 뿐이다. 다섯 가지 사고 방식 Anthropic은 이제 사용자가 모델이 얼마나 깊이 생각할지 제어할 수 있게 했다. "High"가 기본값으로 대부분의 작업을 잘 처리하며, Claude Code 내부에서 "xhigh"라고 불리는 "Extra"는 더 어려운 문제에 더 많은 컴퓨팅을 투입한다. "Max"는 가장 깊은 수준이다. "Low"와 "Medium"은 동일한 작업에 더 적은 토큰을 할애해 정확도를 일부 포기하는 대신 시간을 절약한다. 이 노력(effort) 제어는 claude.ai와 Cowork에서 모델 선택기 옆에 위치하며, 모든 요금제에서 사용 가능하다. Anthropic은 기본 high가 Opus 4.7의 기본값과 거의 동일한 토큰을 사용하면서도 더 나은 결과를 낸다고 말하는데, 이는 인상적인 엔지니어링이거나 좋은 마케팅이거나, 아마도 둘 다일 것이다. 또한 Anthropic의 Opus용 새 토크나이저가 작업당 더 많은 토큰을 사용한다는 점도 기억해야 한다. 그래서 Claude 사용자들은 Claude Sonnet 대신 Opus를 선택할 경우 일을 처리하는 데 필연적으로 훨씬 더 많은 돈을 태우게 될 것이다. Sonnet은 덜 강력한 모델이지만, 일상적인 작업과 프론티어 과학이나 코딩 수준에 도달하지 않는 복잡한 문제에는 충분히 좋을 것이다. Extra 및 Max 설정으로 발생하는 더 높은 토큰 소비를 흡수하기 위해 Claude Code의 레이트 리밋도 상향 조정되었다. 거의 Claude Mythos만큼 안전 Anthropic의 정렬 팀은 Opus 4.8이 "사용자의 자율성 지원 및 사용자의 최선의 이익에 따라 행동하는 것과 같은 친사회적 특성에 대한 측정에서 새로운 최고치에 도달했다"고 말했다. 더 구체적으로 말하면, 기만 비율과 오용 협조 비율이 Opus 4.7보다 현저히 낮으며, Anthropic에서 가장 잠금이 강한 모델인 Claude Mythos Preview와 비슷한 수준을 보였다. Opus 4.8은 또한 자신의 코드에 있는 버그를 표시하지 않고 그냥 지나칠 가능성이 4.7보다 4배 더 낮다. 이 Mythos 비교는 맥락이 필요하다. Mythos는 Opus보다 한 단계 위에 있는 모델로, Anthropic은 이를 "우리의 Opus 모델보다 더 크고 더 지능적"이라고 설명한다. 현재는 프리뷰 형태로만 존재하며, Project Glasswing을 통해 사이버보안 작업을 하는 소수의 검증된 조직만 접근할 수 있다. 영국의 AI Security Institute는 이 모델이 일반적으로 인간 레드 팀이 20시간이 걸리는 32단계 기업 네트워크 공격 시뮬레이션인 "The Last Ones"를 자율적으로 완료할 수 있음을 발견했다. 그렇기에 아직 판매되지 않는 것이다. Anthropic은 더 강력한 사이버 안전장치가 진행 중이며, "앞으로 몇 주 안에" Mythos 등급 모델을 모든 사람에게 제공할 것으로 예상한다고 말했다. 오늘 또한 출시되는 것: Claude Code의 dynamic workflows, 리서치 프리뷰 형태다. 이 기능은 Claude가 자체 오케스트레이션 스크립트를 작성하고 단일 세션에서 병렬 서브에이전트를 가동하고, 출력을 검증하고, 다시 보고할 수 있게 한다. 마치 Hermes가 한동안 해왔던 것처럼 말이다. Dynamic workflows는 Enterprise, Team, Max 요금제 사용자에게 제공되며, Anthropic은 표준 Claude Code 세션보다 훨씬 더 많은 토큰을 소비한다는 점을 솔직히 밝히고 있다. 벌어지는 가격 격차 Anthropic의 $5/$25 가격 정책은 최근 중국에서 진행되고 있는 것과 비교하면 매우 다르게 보인다. DeepSeek V4 Pro는 지난주 75% 할인을 영구화했다. 입력 토큰 백만 개당 $0.435, 출력 토큰 백만 개당 $0.87이다. Xiaomi MiMo V2.5 Pro도 OpenRouter 같은 제공업체를 통해 동일한 요금으로 제공된다. Anthropic의 fast mode는 백만 토큰당 입력 $10, 출력 $50의 비용이 드는데, 이는 표준 Opus 4.8 자체보다도 비싸며, 출력 토큰당 DeepSeek V4 Pro의 약 57배에 달한다. 기업들은 이미 미국 모델에 대한 추론에 수백만 달러를 지출해왔다. Opus를 마음껏 사용한다면, 당신의 기업은 꽤 빨리 수백만 달러에 도달할지도 모른다. 가격 격차에 대한 Anthropic의 답은 품질과 안전성이다. SWE-bench Pro에서 Opus 4.8은 두 중국 모델 모두를 능가한다. 정렬 측면에서는 어느 쪽도 Anthropic이 발표한 벤치마크에 근접하지 못한다. 이러한 점들은 모델이 조용히 나쁜 입력에 협조하는 것이 실제 위험인 프로덕션 환경, 즉 규제 산업, 법률 업무, 그리고 "괜찮아 보였다"가 사후 사고 보고서로 받아들여질 수 없는 모든 분야에서 중요하다. 그 외의 모든 사람에게는, 그 격차는 무시하기 어렵다. 우리가 테스트해봤다 우리는 Claude Opus 4.8이 미국과 중국에서 가장 인기 있는 경쟁자들이라고 할 수 있는 ChatGPT 및 DeepSeek과 어떻게 비교되는지 보기 위해 3D 좀비 게임을 만드는 간단한 코딩 테스트를 실행했다. Opus 4.8은 기본 high, GPT-5.5는 high effort, DeepSeek V4 Pro는 high effort로 설정했다. 세 개의 모델, 하나의 프롬프트, 재시도 없음. GPT-5.5가 먼저 완료되었다. 그 게임에는 좀비 시각 요소도 없고 효과음도 없었다. 빠르긴 했지만, 요구사항을 완전히 놓쳤다. DeepSeek V4 Pro는 마우스 움직임, 실제 좀비 캐릭터, 효과음, 견고한 메커니즘, 깔끔한 미학으로 2위를 차지했다. 불만은 없다. Opus 4.8은 GPT-5.5보다 약 3배 더 오래 걸렸지만, 최고의 스플래시 화면, 최고의 좀비 디자인, 최고의 게임 메커니즘, 그리고 괜찮은 효과음을 제공했다. 가장 느렸지만, 가장 좋은 결과물이었다. 그래도 비용 격차를 고려하면, DeepSeek 대신 그것을 사용할 정당성을 부여하기에는 아마 충분하지 않을 것이다. 모든 게임은 우리의 Itch.io Profile에서 이용할 수 있다. GPT-5.5는 Zombie Typing을, Opus는 Typing Dead를 생성했고, DeepSeek v4 Pro는 이름 없이 바로 액션으로 들어가는 게임을 생성했다. 이를 TypeSeek이라고 부르자. 전체 비교 리뷰가 곧 나올 예정이다. 지금으로서는, Claude Opus 4.8은 이런 종류의 작업에서 GPT-5.5 및 Opus 4.7보다 더 잘 코딩하며, Anthropic이 4.7 이후로 부과해온 동일한 가격으로 제공된다. 이미 백만 토큰당 $5를 지불하고 있던 개발자들은 방금 무료로 더 나은 모델을 얻은 셈이다.
데이터 상태✓ 전체 내용 추출 완료원문 읽기 (Decrypt)
🔍과거 유사 사건· 키워드 + 종목 매칭6 건
💡 현재 키워드 + 종목 매칭(MVP) 사용 중 · 추후 embedding 의미론적 검색으로 업그레이드 예정
원본 정보
ID:cc5111ed9a
출처:Decrypt
발행:2026-05-28 17:45:39
분류:일반 · 도출된 분류 neutral
종목:지정되지 않음
커뮤니티 투표:+0 /0 · ⭐ 0 중요 · 💬 0 댓글