Daftar beritaClaude Opus 4.8 dari Anthropic Telah Hadir: AI Coding Lebih Baik, Keamanan Lebih Cerdas—Harga Tetap Sama Mahalnya
Decrypt2026-05-28 17:45:39

Claude Opus 4.8 dari Anthropic Telah Hadir: AI Coding Lebih Baik, Keamanan Lebih Cerdas—Harga Tetap Sama Mahalnya

ORIGINALAnthropic's Claude Opus 4.8 Is Here: Better AI Coding, Smarter Safety—Same Huge Price
Analisis Dampak AIGrok sedang menganalisis...
📄Artikel lengkap· Diambil secara otomatis oleh trafilaturaGemini 翻譯7329 kata
Singkat - Anthropic merilis Claude Opus 4.8 pada hari Kamis, hanya enam minggu setelah Opus 4.7. - Pembaruan ini hadir dengan peningkatan di seluruh benchmark software engineering, penalaran, dan penggunaan komputer dengan harga yang sama yaitu $5/$25 per juta token input/output. - Skor alignment Opus 4.8 kini sebanding dengan Claude Mythos Preview, model frontier terbatas milik Anthropic, dengan tingkat perilaku menipu atau ramah penyalahgunaan yang secara substansial lebih rendah dibandingkan pendahulunya. Enam minggu. Itulah waktu yang dibutuhkan Anthropic untuk beralih dari Opus 4.7 ke Opus 4.8. Model baru ini lebih cepat dan lebih cerdas dalam pengujian benchmark, dan hadir dengan serangkaian fitur baru—tetapi harganya tidak berubah: $5 per juta token input dan $25 per juta token output, sama seperti sebelumnya. Ada juga fast mode yang menjalankan model yang sama dengan kecepatan 2,5 kali lipat seharga $10 input dan $50 output per juta. Anthropic mengatakan tarif tersebut kini tiga kali lebih murah dibandingkan biaya fast mode pada model sebelumnya, yang merupakan cara halus untuk mengatakan bahwa sebelumnya jauh lebih mahal. SWE-bench Pro mungkin merupakan benchmark terpenting untuk diperhatikan dan untuk mendapatkan gambaran seberapa bagus model ini. Benchmark ini mengukur apakah AI benar-benar dapat menyelesaikan masalah software engineering multi-bahasa yang sulit yang diambil dari basis kode produksi nyata—dinilai sebagai persentase masalah yang berhasil diselesaikan. Pada pengujian tersebut, Opus 4.8 mencapai 69,2%, naik dari 64,3% untuk Opus 4.7. GPT-5.5 milik OpenAI mencetak 58,6%, dan Gemini 3.1 Pro milik Google tertinggal di 54,2%. Untuk model pada titik harga yang sama, itu adalah lompatan yang berarti. Pada Humanity's Last Exam—pertanyaan tingkat ahli di puluhan disiplin akademis, dinilai sebagai persentase jawaban benar—Opus 4.8 mencapai 49,8% tanpa alat dan 57,9% dengan alat, mengungguli ketiga rivalnya. OSWorld-Verified, yang menguji tugas penggunaan komputer dunia nyata seperti menavigasi UI perangkat lunak, mencapai 83,4%, sedikit melewati skor Opus 4.7 sebesar 82,8%. Satu kekalahan: Terminal-Bench 2.1, yang mengukur kinerja AI pada tugas command-line. GPT-5.5 memimpin dengan 78,2%, sementara Opus 4.8 mencetak 74,6%—lebih baik dari 66,1% milik Opus 4.7 dan unggul atas 70,3% milik Gemini, tetapi tempat kedua pada akhirnya tetaplah kekalahan. Lima cara berpikir Anthropic kini memungkinkan pengguna untuk mengontrol seberapa keras model berpikir. "High" adalah default dan menangani sebagian besar tugas dengan baik, sementara "Extra"—disebut "xhigh" di dalam Claude Code—menghabiskan lebih banyak komputasi untuk masalah yang lebih sulit. "Max" adalah ujung terdalam. "Low" dan "Medium" mendedikasikan lebih sedikit token untuk tugas yang sama, menghemat waktu dengan imbalan akurasi. Kontrol upaya ini berada di samping pemilih model di claude.ai dan Cowork, tersedia di semua paket. Anthropic mengatakan default high menggunakan token yang kira-kira sama dengan default Opus 4.7 dengan hasil yang lebih baik—yang merupakan teknik yang mengesankan atau pesan pemasaran yang baik, dan mungkin keduanya. Penting juga untuk diingat bahwa tokenizer baru Anthropic untuk Opus menggunakan lebih banyak token per tugas. Jadi pengguna Claude mau tidak mau akan terpaksa membakar lebih banyak uang untuk menyelesaikan sesuatu, jika mereka memilih Opus alih-alih Claude Sonnet—model yang kurang mumpuni, tetapi mungkin cukup baik untuk tugas sehari-hari dan masalah kompleks yang tidak mencapai tingkat sains frontier atau coding. Rate limits di Claude Code juga dinaikkan untuk menyerap pengeluaran token yang lebih tinggi yang dihasilkan oleh pengaturan Extra dan Max. Hampir seaman Claude Mythos Tim alignment Anthropic mengatakan Opus 4.8 "mencapai titik tertinggi baru pada ukuran kami terhadap sifat-sifat prososial seperti mendukung otonomi pengguna dan bertindak demi kepentingan terbaik pengguna." Secara lebih konkret: tingkat penipuan dan tingkat kerja sama penyalahgunaan turun secara substansial lebih rendah daripada Opus 4.7, dan sebanding dengan Claude Mythos Preview—model paling terkunci milik Anthropic. Opus 4.8 juga empat kali lebih kecil kemungkinannya dibandingkan 4.7 untuk membiarkan bug dalam kodenya sendiri lolos tanpa menandainya. Perbandingan Mythos itu perlu konteks. Mythos berada di tingkat yang sepenuhnya di atas Opus—Anthropic menggambarkannya sebagai "lebih besar dan lebih cerdas dari model Opus kami." Saat ini hanya ada sebagai preview, dapat diakses oleh segelintir organisasi yang telah diverifikasi yang melakukan pekerjaan cybersecurity melalui Project Glasswing. AI Security Institute U.K. menemukan bahwa model tersebut dapat secara otonom menyelesaikan "The Last Ones," simulasi serangan jaringan korporat 32 langkah yang biasanya membutuhkan waktu 20 jam bagi tim red team manusia. Itulah sebabnya belum dijual. Anthropic mengatakan pengamanan cyber yang lebih kuat sedang dalam proses, dan berharap dapat membawa model kelas Mythos kepada semua orang "dalam beberapa minggu mendatang." Juga dirilis hari ini: dynamic workflows di Claude Code, dalam research preview. Fitur ini memungkinkan Claude menulis skrip orkestrasi miliknya sendiri dan menjalankan subagent paralel dalam satu sesi, memverifikasi outputnya, dan melaporkan kembali—persis seperti yang telah dilakukan Hermes selama beberapa waktu sekarang. Dynamic workflows tersedia untuk pengguna paket Enterprise, Team, dan Max, dan Anthropic terus terang bahwa fitur ini membakar token yang secara signifikan lebih banyak daripada sesi Claude Code standar. Jurang harga yang semakin melebar Harga $5/$25 milik Anthropic terlihat sangat berbeda jika dibandingkan dengan apa yang telah dilakukan China belakangan ini. DeepSeek V4 Pro menjadikan diskon 75%-nya permanen minggu lalu: $0,435 per juta token input dan $0,87 per juta token output. Xiaomi MiMo V2.5 Pro berjalan dengan tarif yang sama melalui penyedia seperti OpenRouter. Fast mode Anthropic berharga $10 input dan $50 output per juta—lebih mahal daripada Opus 4.8 standar itu sendiri, dan kira-kira 57 kali lebih mahal per token output daripada DeepSeek V4 Pro. Korporasi telah menghabiskan jutaan dolar untuk inferensi pada model-model Amerika. Bermain bebas dengan Opus dan enterprise Anda mungkin mencapai jutaan dolar dengan cukup cepat. Jawaban Anthropic untuk jurang harga adalah kualitas dan keamanan. Pada SWE-bench Pro, Opus 4.8 mengalahkan kedua model China tersebut. Pada alignment, tidak satu pun yang mendekati benchmark yang dipublikasikan Anthropic. Hal-hal itu penting di lingkungan produksi di mana model yang diam-diam bekerja sama dengan input buruk adalah risiko nyata—industri yang teregulasi, pekerjaan hukum, dan apa pun di mana "tampaknya baik-baik saja" bukanlah laporan pasca-insiden yang dapat diterima. Bagi semua orang lain, jurangnya sulit untuk diabaikan. Kami mengujinya Kami menjalankan uji coding cepat untuk membuat game zombie 3D guna melihat bagaimana Claude Opus 4.8 dibandingkan dengan ChatGPT dan DeepSeek, yang bisa dibilang merupakan pesaing paling populernya dari AS dan China. Kami menyetel Opus 4.8 pada default high, GPT-5.5 pada high effort, dan DeepSeek V4 Pro pada high effort—tiga model, satu prompt, tanpa percobaan ulang. GPT-5.5 selesai pertama. Gamenya tidak memiliki visual zombie dan tidak ada efek suara. Memang cepat, tentu saja, tetapi sepenuhnya meleset dari brief. DeepSeek V4 Pro berada di posisi kedua dengan gerakan mouse, karakter zombie yang sebenarnya, efek suara, mekanik yang solid, dan estetika yang bersih. Tidak ada keluhan di sana. Opus 4.8 membutuhkan waktu kira-kira tiga kali lebih lama dari GPT-5.5, tetapi menghasilkan splash screen terbaik, desain zombie terbaik, mekanik game terbaik, dan efek suara yang layak. Itu adalah yang paling lambat, tetapi outputnya yang terbaik. Tetap saja, itu mungkin tidak cukup untuk membenarkan penggunaannya dibandingkan DeepSeek, mengingat jurang biaya. Semua game tersedia di Profil Itch.io kami. GPT-5.5 menghasilkan Zombie Typing, Opus menghasilkan Typing Dead, dan DeepSeek v4 Pro menghasilkan game tanpa nama yang langsung membawa Anda ke dalam aksi. Mari kita sebut TypeSeek. Ulasan komparatif lengkap akan segera hadir. Untuk saat ini: Claude Opus 4.8 melakukan coding lebih baik daripada GPT-5.5 dan Opus 4.7 untuk jenis tugas seperti ini, dengan harga yang sama yang telah dikenakan Anthropic sejak 4.7. Developer yang sudah membayar $5 per juta token baru saja mendapatkan model yang lebih baik secara gratis.
Status data✓ Teks lengkap telah diambilBaca artikel asli (Decrypt)
🔍Peristiwa serupa dalam sejarah· Pencocokan kata kunci + aset6 berita
💡 Saat ini menggunakan pencocokan kata kunci + aset (MVP) · Akan ditingkatkan ke pencarian semantik embedding di masa mendatang
Informasi mentah
ID:cc5111ed9a
Sumber:Decrypt
Diterbitkan:2026-05-28 17:45:39
Kategori:Umum · Kategori ekspor neutral
Aset:Tidak ditentukan
Voting komunitas:+0 /0 · ⭐ 0 Penting · 💬 0 Komentar