要聞列表Anthropic 的 Claude Opus 4.8 來了:更強的 AI 程式編寫能力、更聰明的安全機制——價格依然高昂
Decrypt2026-05-28 17:45:39

Anthropic 的 Claude Opus 4.8 來了:更強的 AI 程式編寫能力、更聰明的安全機制——價格依然高昂

ORIGINALAnthropic's Claude Opus 4.8 Is Here: Better AI Coding, Smarter Safety—Same Huge Price
AI 影響分析Grok 分析中...
📄完整原文· 由 trafilatura 自動擷取Gemini 翻譯7329 字
簡述 - Anthropic 於週四發布 Claude Opus 4.8,距離 Opus 4.7 僅六週。 - 此次更新在軟體工程、推理及電腦使用基準測試上均有所提升,價格維持每百萬輸入/輸出 token $5/$25 不變。 - Opus 4.8 的對齊分數現已可與 Anthropic 的受限前沿模型 Claude Mythos Preview 相提並論,欺騙性或助長濫用的行為比例較前代大幅降低。 六週。這就是 Anthropic 從 Opus 4.7 推進到 Opus 4.8 所花的時間。 新模型在基準測試上更快、更聰明,並推出一系列新功能——但價格並未變動:每百萬輸入 token $5、每百萬輸出 token $25,與先前相同。 另外還有一個快速模式(fast mode),以 2.5 倍的速度運行同一個模型,價格為每百萬輸入 $10、輸出更高達 $50。Anthropic 表示這個費率現在比先前模型的 fast mode 便宜了三倍,換句話說就是以前貴得多。 SWE-bench Pro 大概是最值得關注的基準,能讓人了解這個模型究竟有多強。它衡量 AI 是否能真正解決取自實際生產環境程式碼庫的高難度、跨語言軟體工程問題——以通過題目的百分比計分。 在這項測試中,Opus 4.8 達到 69.2%,高於 Opus 4.7 的 64.3%。OpenAI 的 GPT-5.5 得分為 58.6%,Google 的 Gemini 3.1 Pro 落後於 54.2%。對於相同價位的模型來說,這是一個有意義的躍進。 在 Humanity's Last Exam——涵蓋數十個學術領域的專家級問題,以答對百分比計分——Opus 4.8 在不使用工具時達到 49.8%,使用工具時達到 57.9%,領先三個競爭對手。OSWorld-Verified 測試實際電腦使用任務(如操作軟體 UI),得分 83.4%,略微超越 Opus 4.7 的 82.8%。 唯一的失利:Terminal-Bench 2.1,衡量 AI 在命令列任務上的表現。GPT-5.5 以 78.2% 領先,而 Opus 4.8 得分 74.6%——優於 Opus 4.7 的 66.1%,也領先 Gemini 的 70.3%,但第二名終究還是輸了。 五種思考方式 Anthropic 現在讓使用者控制模型思考的強度。「High」是預設,能良好處理大部分任務;而「Extra」——在 Claude Code 內稱為「xhigh」——會花費更多運算資源處理更難的問題。「Max」則是極限模式。「Low」與「Medium」則為相同任務投入較少 token,以準確度換取一些時間。 此努力等級控制位於 claude.ai 與 Cowork 中模型選擇器旁,所有方案皆可使用。Anthropic 表示,預設的 high 模式所用 token 數與 Opus 4.7 預設大致相同,但成果更佳——這要麼是出色的工程,要麼是高明的行銷,或許兩者皆是。 同樣重要的是要記住,Anthropic 為 Opus 推出的新分詞器(tokenizer)在每項任務上會使用更多 token。所以 Claude 使用者若選擇 Opus 而非 Claude Sonnet——一個能力較弱但對日常任務以及未達前沿科學或程式設計層級的複雜問題而言已綽綽有餘的模型——不可避免地會花費更多錢來完成事情。 Claude Code 中的速率限制也已提高,以吸收 Extra 與 Max 設定所產生的更高 token 消耗。 幾乎與 Claude Mythos 一樣安全 Anthropic 的對齊團隊表示,Opus 4.8「在我們衡量親社會特質(如支持使用者自主、為使用者最大利益行事)的指標上創下新高。」更具體地說:欺騙率與配合濫用率均比 Opus 4.7 大幅降低,並與 Claude Mythos Preview——Anthropic 最為嚴密管控的模型——相當。 Opus 4.8 在自身程式碼中讓 bug 未經標示就溜過的可能性,也比 4.7 低了四倍。 這個與 Mythos 的比較需要一些背景脈絡。Mythos 整體上比 Opus 高一個層級——Anthropic 將其描述為「比我們的 Opus 模型更大、更聰明」。它目前僅以預覽形式存在,透過 Project Glasswing 開放給少數經過審核、從事網路安全工作的組織使用。 英國 AI Security Institute 發現,它能自主完成「The Last Ones」——一項通常需要人類紅隊耗時 20 小時的 32 步驟企業網路攻擊模擬。這就是它尚未開放販售的原因。Anthropic 表示更強的網路安全防護正在進行中,預計在「未來幾週」將 Mythos 等級的模型推廣給所有人。 今日也推出:Claude Code 中的動態工作流(dynamic workflows),目前處於研究預覽階段。此功能讓 Claude 在單一工作階段中能撰寫自己的協調腳本,並行啟動子代理(subagents)、驗證其輸出並回報結果——就像 Hermes 一段時間以來在做的事情。 動態工作流可供 Enterprise、Team 與 Max 方案使用者使用,Anthropic 也坦率指出,它們所消耗的 token 遠多於標準 Claude Code 工作階段。 不斷擴大的價格差距 Anthropic 的 $5/$25 定價,與中國近期所做的相比,呈現截然不同的面貌。 DeepSeek V4 Pro 上週將其 75% 折扣永久化:每百萬輸入 token $0.435、輸出 token $0.87。Xiaomi MiMo V2.5 Pro 透過 OpenRouter 等供應商以相同價格提供服務。 Anthropic 的快速模式每百萬輸入 $10、輸出 $50——比標準 Opus 4.8 本身還貴,每輸出 token 約為 DeepSeek V4 Pro 的 57 倍。企業在美國模型的推論服務上已經花了數百萬美元。若放手使用 Opus,你的企業可能很快就會花到數百萬美元。 Anthropic 對價格差距的答案是品質與安全。在 SWE-bench Pro 上,Opus 4.8 擊敗兩款中國模型。在對齊方面,兩者都遠不及 Anthropic 公布的基準。 這些事情在生產環境中很重要——在那裡,模型悄悄配合不良輸入是實際存在的風險——受監管產業、法律工作,以及任何「看起來沒問題」並不是可接受的事後檢討報告的場合。對其他人而言,這個差距難以忽視。 我們實際測試了 我們進行了一個快速的程式設計測試,建立一款 3D 殭屍遊戲,看看 Claude Opus 4.8 與來自美國和中國最受歡迎的競爭對手 ChatGPT 及 DeepSeek 相比表現如何。我們將 Opus 4.8 設為預設 high、GPT-5.5 設為 high effort,DeepSeek V4 Pro 設為 high effort——三個模型、一個提示、不允許重試。 GPT-5.5 最先完成。它的遊戲沒有殭屍視覺、也沒有音效。確實很快,但完全偏離了任務簡介。 DeepSeek V4 Pro 名列第二,具備滑鼠操控、真正的殭屍角色、音效、扎實的遊戲機制與乾淨的美學。沒什麼好挑剔的。 Opus 4.8 花費的時間約為 GPT-5.5 的三倍,但呈現了最棒的開場畫面、最佳的殭屍設計、最佳的遊戲機制和不錯的音效。它最慢,但成果最好。儘管如此,考量到價格差距,這大概還不足以證明捨棄 DeepSeek 而選擇它是值得的。 所有遊戲都可在我們的 Itch.io Profile 上找到。GPT-5.5 生成了 Zombie Typing,Opus 生成了 Typing Dead,DeepSeek v4 Pro 則生成了一款沒有名稱、直接帶你進入動作場面的遊戲。就叫它 TypeSeek 吧。 完整的比較評測即將推出。目前而言:對於這類任務,Claude Opus 4.8 的程式設計能力勝過 GPT-5.5 與 Opus 4.7,價格仍維持 Anthropic 從 4.7 以來收取的同樣費率。原本就在支付每百萬 token $5 的開發者,等於免費獲得了一個更好的模型。
資料狀態✓ 已擷取全文閱讀原文(Decrypt)
🔍歷史類似事件· 關鍵字 + 標的比對6 則
💡 目前用關鍵字 + 標的比對(MVP)· 之後會升級為 embedding 語意搜尋
原始資訊
ID:cc5111ed9a
來源:Decrypt
發佈:2026-05-28 17:45:39
分類:一般 · 導出分類 neutral
標的:未指定
社群投票:+0 /0 · ⭐ 0 重要 · 💬 0 留言