要闻列表Anthropic 的 Claude Opus 4.8 现已发布:更强的 AI 编程能力,更智能的安全性——价格依然昂贵
Decrypt2026-05-28 17:45:39

Anthropic 的 Claude Opus 4.8 现已发布:更强的 AI 编程能力,更智能的安全性——价格依然昂贵

ORIGINALAnthropic's Claude Opus 4.8 Is Here: Better AI Coding, Smarter Safety—Same Huge Price
AI 影响分析Grok 分析中...
📄完整原文· 由 trafilatura 自动抓取Gemini 翻譯7329 字
简要内容 - Anthropic 于周四发布了 Claude Opus 4.8,距离 Opus 4.7 仅过去六周。 - 此次更新在软件工程、推理和计算机使用基准测试上均有提升,输入/输出每百万 token 价格仍维持 $5/$25 不变。 - Opus 4.8 的对齐评分现已可与 Anthropic 的受限前沿模型 Claude Mythos Preview 相提并论,欺骗性或助纣为虐行为的发生率较前代大幅降低。 六周。这就是 Anthropic 从 Opus 4.7 推进到 Opus 4.8 所用的时间。 新模型在基准测试中更快、更聪明,并附带一系列新功能——但价格未变:每百万输入 token $5、每百万输出 token $25,与之前一致。 此外还有一个快速模式,以 2.5 倍的速度运行同一模型,输入每百万 $10、输出每百万高达 $50。Anthropic 表示该费率现已比此前模型的快速模式便宜三倍,这其实是在委婉地承认以前贵得多。 SWE-bench Pro 大概是观察并判断此模型实力的最重要基准。它衡量 AI 是否真能解决取自真实生产代码库的、多语言的高难度软件工程问题——以通过问题的百分比计分。 在该测试中,Opus 4.8 拿下 69.2%,高于 Opus 4.7 的 64.3%。OpenAI 的 GPT-5.5 得分 58.6%,Google 的 Gemini 3.1 Pro 以 54.2% 垫底。对于同等价位的模型而言,这是一个有意义的跃升。 在 Humanity's Last Exam(覆盖数十个学科的专家级问题,以正确率计分)上,Opus 4.8 在不使用工具时达到 49.8%,使用工具时为 57.9%,领先三家对手。OSWorld-Verified 测试真实世界的计算机使用任务,如操作软件 UI,Opus 4.8 得分 83.4%,略微超过 Opus 4.7 的 82.8%。 唯一的失利是:Terminal-Bench 2.1,衡量 AI 在命令行任务上的表现。GPT-5.5 以 78.2% 领先,而 Opus 4.8 得 74.6%——优于 Opus 4.7 的 66.1%,也领先于 Gemini 的 70.3%,但第二名终究还是输。 五种思考方式 Anthropic 现在允许用户控制模型的思考强度。"High"(高)为默认设置,可较好地处理大多数任务;而"Extra"(额外,在 Claude Code 内部称为"xhigh")会投入更多算力以应对更难的问题。"Max"(极致)则是深水区。"Low"(低)和"Medium"(中)对同一任务投入更少 token,以一定的准确性换取时间。 该努力程度控件与模型选择器并列出现在 claude.ai 和 Cowork 中,所有套餐均可使用。Anthropic 表示,默认的 high 模式所用 token 数与 Opus 4.7 的默认设置大致相同,但效果更好——这要么是工程上的亮眼成就,要么是漂亮的宣传话术,也很可能两者兼有。 还要记住的是,Anthropic 为 Opus 推出的新分词器在每个任务中会消耗更多 token。因此 Claude 用户在选择 Opus 而非 Claude Sonnet 完成任务时,势必要烧掉更多钱——Sonnet 能力稍弱,但对于日常任务以及未触及前沿科学或编程层级的复杂问题,应该够用。 Claude Code 中的速率限制也已上调,以吸纳 Extra 和 Max 设置带来的更高 token 消耗。 几乎与 Claude Mythos 一样安全 Anthropic 的对齐团队表示,Opus 4.8"在支持用户自主性、为用户最佳利益行动等亲社会特质的衡量指标上达到了新高度"。更具体地说:欺骗发生率与助纣为虐配合率均显著低于 Opus 4.7,并与 Anthropic 最为严密锁定的模型 Claude Mythos Preview 相当。 Opus 4.8 在自身代码中漏掉 bug 而未予标记的概率,也比 4.7 低四倍。 将其与 Mythos 作比较时需结合背景。Mythos 本身完全是 Opus 之上的一个层级——Anthropic 形容它"比我们的 Opus 系列模型更大、更智能"。它目前仅以预览版形式存在,仅供少数经审核的机构通过 Project Glasswing 进行网络安全工作时使用。 英国 AI Security Institute 发现它能自主完成"The Last Ones"——一项 32 步的企业网络攻击模拟,人类红队通常需要 20 小时才能完成。这就是它尚未对外销售的原因。Anthropic 表示更强的网络安全防护正在推进,预计将"在未来几周内"把 Mythos 级模型带给所有人。 今日同步发布的还有:Claude Code 中的动态工作流(研究预览版)。该功能允许 Claude 自行编写编排脚本,并在单一会话中启动并行子代理、验证它们的输出并汇报结果——正如 Hermes 一段时间以来所做的那样。 动态工作流面向 Enterprise、Team 和 Max 套餐用户开放,Anthropic 直言不讳:它消耗的 token 显著多于标准 Claude Code 会话。 不断扩大的价差 Anthropic 的 $5/$25 定价,与中国近期的动作相比看起来很不一样。 DeepSeek V4 Pro 上周将其 75% 折扣永久化:每百万输入 token $0.435、每百万输出 token $0.87。Xiaomi MiMo V2.5 Pro 通过 OpenRouter 等服务商以相同费率运行。 Anthropic 的快速模式每百万输入 $10、输出 $50——比标准 Opus 4.8 本身还贵,每输出 token 大约是 DeepSeek V4 Pro 的 57 倍。企业方面已经在美国模型的推理上花掉了数百万美元。如果尽情使用 Opus,你的企业可能很快就会烧掉数百万美元。 Anthropic 对这一价差的回应是质量与安全。在 SWE-bench Pro 上,Opus 4.8 击败了两款中国模型。在对齐方面,两者都无法接近 Anthropic 公布的基准。 这些在生产环境中很重要——在那里,模型悄然配合恶意输入是一种真实风险——尤其涉及受监管行业、法律工作以及任何不能以"看起来没问题"作为事后报告的场景。对于其他人来说,这条差距则难以忽视。 我们做了测试 我们做了一项快速编码测试,要求创建一个 3D 僵尸游戏,以便观察 Claude Opus 4.8 与可以说是来自美国和中国最受欢迎的两个竞争对手——ChatGPT 和 DeepSeek 相比表现如何。我们将 Opus 4.8 设为默认 high,GPT-5.5 设为 high effort,DeepSeek V4 Pro 设为 high effort——三个模型,一个提示词,不重试。 GPT-5.5 率先完成。它的游戏没有僵尸视觉效果,也没有音效。诚然速度快,但完全偏离了题意。 DeepSeek V4 Pro 排名第二,具备鼠标移动、真正的僵尸角色、音效、扎实的机制以及干净的美学。没有可挑剔之处。 Opus 4.8 用时约为 GPT-5.5 的三倍,但交付了最佳的启动画面、最佳的僵尸设计、最佳的游戏机制以及不错的音效。它最慢,但产出最佳。即便如此,考虑到成本差距,这大概仍不足以让人放弃 DeepSeek 而选择它。 所有游戏均可在我们的 Itch.io 个人主页上获取。GPT-5.5 生成了 Zombie Typing,Opus 生成了 Typing Dead,DeepSeek v4 Pro 生成了一款没有名字、直接进入战斗的游戏。我们就叫它 TypeSeek 吧。 完整的对比评测即将推出。目前来看:对于这类任务,Claude Opus 4.8 的编码能力优于 GPT-5.5 和 Opus 4.7,且价格与 Anthropic 自 4.7 以来一直收取的费率相同。原本就以每百万 token $5 付费的开发者,免费获得了一个更好的模型。
数据状态✓ 已抓取全文阅读原文(Decrypt)
🔍历史类似事件· 关键词 + 标的比对6 则
💡 目前用关键词 + 标的比对(MVP)· 之后会升级为 embedding 语义搜寻
原始信息
ID:cc5111ed9a
来源:Decrypt
发布:2026-05-28 17:45:39
分类:一般 · 导出分类 neutral
标的:未指定
社群投票:+0 /0 · ⭐ 0 重要 · 💬 0 留言