ニュース一覧Anthropic の Claude Opus 4.8 が登場:より優れた AI コーディング、よりスマートな安全性——変わらぬ高価格
Decrypt2026-05-28 17:45:39

Anthropic の Claude Opus 4.8 が登場:より優れた AI コーディング、よりスマートな安全性——変わらぬ高価格

ORIGINALAnthropic's Claude Opus 4.8 Is Here: Better AI Coding, Smarter Safety—Same Huge Price
AI 影響分析Grok が分析中...
📄原文全文· trafilatura により自動抽出Gemini 翻譯7329 文字
概要 - AnthropicはOpus 4.7のわずか6週間後となる木曜日に、Claude Opus 4.8をリリースした。 - 今回のアップデートでは、ソフトウェアエンジニアリング、推論、コンピュータ使用のベンチマークで向上が見られ、価格は入力/出力100万トークンあたり$5/$25と据え置きとなっている。 - Opus 4.8のアライメントスコアは、Anthropicの制限付きフロンティアモデルであるClaude Mythos Previewに匹敵する水準に達しており、欺瞞的または悪用に協力的な振る舞いの発生率は前モデルを大幅に下回っている。 6週間。これがAnthropicがOpus 4.7からOpus 4.8へ移行するのに要した時間である。 新モデルはベンチマークテストにおいて高速かつ高性能で、新機能群も搭載されているが、価格は変わらない。入力100万トークンあたり$5、出力100万トークンあたり$25と従来通りだ。 さらに、同モデルを2.5倍の速度で実行するファストモードもあり、入力$10、出力は100万トークンあたり$50となっている。Anthropicによれば、この料金は従来モデルのファストモードと比べて3倍安いとのことで、これは「以前は遥かに高額だった」ということを婉曲的に言ったものだ。 SWE-bench Proは、このモデルの実力を測るうえで最も重要なベンチマークだろう。これは、AIが実際の本番コードベースから抽出された困難なマルチ言語のソフトウェアエンジニアリング問題を実際に解決できるかを測定するもので、問題通過率のパーセンテージで採点される。 このテストでOpus 4.8は69.2%を達成し、Opus 4.7の64.3%から上昇した。OpenAIのGPT-5.5は58.6%、GoogleのGemini 3.1 Proは54.2%で後れを取った。同価格帯のモデルとしては意味のある飛躍である。 数十の学術分野にまたがる専門家レベルの質問で構成され、正答率パーセンテージで採点されるHumanity's Last Examでは、Opus 4.8はツールなしで49.8%、ツールありで57.9%に達し、3つの競合すべてを上回った。ソフトウェアUIのナビゲートなど実世界のコンピュータ使用タスクをテストするOSWorld-Verifiedでは83.4%を記録し、Opus 4.7のスコア82.8%をわずかに上回った。 唯一の敗北は、コマンドラインタスクにおけるAI性能を測定するTerminal-Bench 2.1である。GPT-5.5が78.2%でリードし、Opus 4.8は74.6%と、Opus 4.7の66.1%を上回りGeminiの70.3%にも勝ったものの、2位は最終的に敗北に変わりない。 5つの思考方法 Anthropicは、モデルがどれだけ深く考えるかをユーザーが制御できるようにした。デフォルトは「High」でほとんどのタスクをうまく処理し、Claude Code内では「xhigh」と呼ばれる「Extra」はより難しい問題のために多くの計算リソースを費やす。「Max」は最深部にあたる。「Low」と「Medium」は同じタスクに割り当てるトークンを減らし、精度と引き換えに時間を節約する。 このエフォート制御はclaude.aiとCoworkでモデル選択の隣に配置されており、全プランで利用可能だ。AnthropicによればデフォルトのHighはOpus 4.7のデフォルトとほぼ同じトークン量でより良い結果を出すといい、これは見事なエンジニアリングか巧みなメッセージングか、おそらくその両方である。 また重要なのは、AnthropicのOpus用新トークナイザーがタスクあたりより多くのトークンを使用する点だ。したがってClaudeユーザーは、フロンティアサイエンスやコーディングのレベルに達しない日常タスクや複雑な問題には十分とされる、性能の劣るClaude Sonnetではなく、Opusを選択した場合、必然的により多くの費用を消費することになる。 Claude Codeのレート制限も、ExtraおよびMax設定が生み出すより高いトークン消費を吸収できるよう引き上げられた。 Claude Mythosに迫る安全性 AnthropicのアライメントチームはOpus 4.8について、「ユーザーの自律性の支援やユーザーの最善の利益のための行動といった、向社会的特性に関する我々の測定で新たな高みに到達した」と述べた。より具体的には、欺瞞率と悪用協力率がOpus 4.7を大幅に下回り、Anthropicの最も厳しく制限されたモデルであるClaude Mythos Previewと同等となった。 またOpus 4.8は、自身のコード内のバグを指摘せず見過ごす可能性が4.7と比較して4分の1である。 このMythosとの比較には文脈が必要だ。MythosはOpusの完全に一つ上の階層に位置し、Anthropicは「我々のOpusモデルよりも大規模かつ知的」と表現している。現在はプレビューとしてのみ存在し、Project Glasswingを通じてサイバーセキュリティ業務を行う一部の審査済み組織のみがアクセス可能だ。 英国のAI Security Instituteは、通常人間のレッドチームが20時間を要する32ステップの企業ネットワーク攻撃シミュレーション「The Last Ones」を、Mythosが自律的に完遂できることを発見した。これが販売されていない理由である。Anthropicはより強力なサイバー安全策を準備中であり、「今後数週間以内」にMythosクラスのモデルを全ユーザーに提供する予定だとしている。 本日同時にリリースされたのが、リサーチプレビュー版のClaude Codeのdynamic workflowsである。この機能により、Claudeは自身のオーケストレーションスクリプトを記述し、単一セッション内で並列サブエージェントを起動し、その出力を検証して報告できるようになる。Hermesがしばらく前から行ってきたのと同じことだ。 Dynamic workflowsはEnterprise、Team、Maxプランのユーザーが利用可能で、Anthropicは標準のClaude Codeセッションよりも大幅に多くのトークンを消費することを率直に認めている。 拡大する価格差 Anthropicの$5/$25という価格設定は、最近の中国勢の動きと比べると非常に異なって見える。 DeepSeek V4 Proは先週、75%割引を恒久化した。入力100万トークンあたり$0.435、出力100万トークンあたり$0.87である。Xiaomi MiMo V2.5 ProもOpenRouterのようなプロバイダー経由で同じレートで動作する。 Anthropicのファストモードは入力$10、出力100万あたり$50で、標準のOpus 4.8本体よりも高く、出力トークンあたりではDeepSeek V4 Proの約57倍高い。企業はすでにアメリカ製モデルの推論に数百万ドルを費やしている。Opusを派手に使えば、企業はかなり迅速に数百万ドルに達するかもしれない。 価格差に対するAnthropicの答えは、品質と安全性だ。SWE-bench Proでは、Opus 4.8は中国の両モデルを上回る。アライメントに関しては、どちらもAnthropicが公表しているベンチマークには遠く及ばない。 これらは、悪意のある入力に静かに協力するモデルが実際のリスクとなる本番環境—規制業界、法務業務、事後報告書に「問題ないように見えた」が許されない領域—において重要となる。それ以外のユーザーにとって、この差は無視しがたい。 実際に試してみた Claude Opus 4.8が、アメリカと中国における最も人気の競合と言えるChatGPTおよびDeepSeekに対してどう対抗するかを見るために、3Dゾンビゲームを作成する簡単なコーディングテストを実施した。Opus 4.8はデフォルトのHigh、GPT-5.5はHighエフォート、DeepSeek V4 ProもHighエフォートに設定し、3モデル、1プロンプト、再試行なしで臨んだ。 GPT-5.5が最初に完成した。そのゲームにはゾンビのビジュアルも音響効果もなかった。確かに高速だったが、要件を完全に外していた。 DeepSeek V4 Proが2番目で、マウス操作、実際のゾンビキャラクター、音響効果、堅実なメカニクス、そして洗練された美的センスを備えていた。文句のつけようがなかった。 Opus 4.8はGPT-5.5の約3倍の時間を要したが、最高のスプラッシュ画面、最高のゾンビデザイン、最高のゲームメカニクス、そしてまずまずの音響効果を提供した。最も遅かったが、最高の出力だった。それでも、コスト差を考えればDeepSeekではなくこちらを使う正当な理由としては不十分だろう。 すべてのゲームは我々のItch.ioプロフィールで利用可能だ。GPT-5.5はZombie Typingを、OpusはTyping Deadを生成し、DeepSeek v4 Proはあなたを即座にアクションへ突入させる無名のゲームを生成した。これをTypeSeekと呼ぼう。 完全な比較レビューは今後公開予定だ。現時点では、Claude Opus 4.8はこの種のタスクにおいてGPT-5.5およびOpus 4.7よりもうまくコーディングし、しかも4.7以来Anthropicが請求してきたのと同じ価格である。すでに100万トークンあたり$5を支払っていた開発者は、ちょうどより良いモデルを無料で手に入れたことになる。
データステータス✓ 全文抽出済み原文を読む(Decrypt)
🔍過去の類似イベント· キーワード + 銘柄照合6 件
💡 現在はキーワード + 銘柄照合(MVP)を使用しています · 今後 embedding セマンティック検索へアップグレード予定
原始情報
ID:cc5111ed9a
ソース:Decrypt
公開:2026-05-28 17:45:39
カテゴリ:一般 · エクスポートカテゴリ neutral
銘柄:未指定
コミュニティ投票:+0 /0 · ⭐ 0 重要 · 💬 0 コメント