Anthropic Luncurkan Claude Opus 4.8 dengan Fitur Alur Kerja Dinamis

Smallest Font
Largest Font

Anthropic meluncurkan model kecerdasan buatan terbarunya, Claude Opus 4.8, pada Kamis, 28 Mei 2026, untuk menghadirkan pembaruan sistem yang lebih jujur, andal, dan efisien dalam berkolaborasi.

Model baru ini dirilis hanya 41 hari setelah versi terdahulu guna menghadapi persaingan ketat dari OpenAI dan Google. Peluncuran ini juga disertai dengan fitur baru bernama alur kerja dinamis atau dynamic workflows.

Sistem baru tersebut dirancang untuk membantu model besar mengelola tugas-tugas rumit melalui ratusan sub-agen paralel dalam satu sesi tunggal. Pembaruan ini sekaligus meningkatkan kemampuan penalaran agen untuk menyelesaikan masalah berskala besar.

Selain tersedia di platform mandiri, Claude Opus 4.8 juga langsung diintegrasikan ke dalam GitHub Copilot untuk membantu para pengembang memahami dan membuat kode pemrograman secara lebih efektif dalam lingkungan kerja nyata.

Model ini juga diterapkan oleh TrendAI dari Trend Micro Incorporated guna mendeteksi kerentanan keamanan siber dengan lebih cepat serta mempercepat mitigasi risiko di lingkungan perangkat lunak yang kompleks.

Pihak Anthropic menyatakan bahwa fokus utama dari pengembangan versi terbaru ini adalah meningkatkan kejujuran model saat menghadapi ketidakpastian data atau kesalahan dalam penyusunan kode.

"Claude Opus 4.8 has noticeably better judgment. In Claude Code, it asks the right questions, catches its own mistakes, pushes back when a plan isn’t sound, and builds up confidence around complex, multi-service explorations before making big changes. It’s a great model to build with." kata penguji awal Anthropic.

Evaluasi internal menunjukkan model ini empat kali lebih jarang meloloskan cacat kode tanpa pemberitahuan jika dibandingkan dengan versi pendahulunya.

"On our Super-Agent benchmark, Claude Opus 4.8 is the only model to complete every case end-to-end, beating prior Opus models and GPT-5.5 at parity on cost. For agent products in translation, deep research, slide-building, and analysis, it delivers powerful reliability." ujar penguji lainnya.

Para penguji dari sektor hukum dan analisis data juga mencatatkan adanya peningkatan akurasi dan efisiensi penarikan data yang signifikan.

"On CursorBench, Claude Opus 4.8 exceeds prior Opus models across every effort level. Tool calling is meaningfully more efficient, using fewer steps for the same intelligence, and it carries end-to-end tasks through." kata perwakilan penguji.

Kemampuan multitugas model ini dinilai memberikan efisiensi biaya token yang lebih baik untuk penanganan dokumen yang padat.

"Claude Opus 4.8 delivers the highest score recorded on our Legal Agent Benchmark, and is the first model to break 10% overall on the all-pass standard. For substantive legal work, that’s the kind of accuracy lift that translates directly into how much real attorney work our customers can hand off with confidence." jelas penguji dari sektor hukum.

Selain itu, aspek gaya penulisan dan konsistensi konteks yang panjang menjadi keunggulan lain yang dirasakan oleh pengguna.

"Claude Opus 4.8 feels like a major quality-of-life update over Opus 4.7: faster, easier to collaborate with, and better at carrying context and style direction across a long session. Opus 4.8 is the model I kept trusting for work where voice, taste, and technical execution all have to happen side-by-side." ungkap penguji profesional.

Model ini juga menunjukkan performa kuat dalam pengujian penggunaan komputer dan penjelajahan peramban.

"Claude Opus 4.8 is the strongest computer-use and browser-agent model we’ve tested, scoring 84% on Online-Mind2Web, which is a meaningful jump over both Opus 4.7 and GPT-5.5. It stays reflective and on-task in the way our customers’ agent workloads need to be reliable end-to-end." tambah penguji sistem agen.

Dalam beban kerja rekayasa otonom, konsistensi instruksi dinilai berjalan lebih bersih tanpa gangguan komentar yang berlebihan.

"Claude Opus 4.8 uses tools cleanly and follows instructions with the consistency our autonomous engineering workloads need to keep running unattended. It improves on Opus 4.6 and fixes the comment-verbosity and tool-calling issues we saw with Opus 4.7. This release from Anthropic translates directly into faster capability gains for engineers building on Devin." papar penguji dari platform teknik.

Hasil analisis jangka panjang menunjukkan bahwa model ini mampu memproduksi keluaran yang lebih padat informasi dengan rasio gangguan yang rendah.

"On our long-running evals, Claude Opus 4.8’s analysis was consistently higher quality than prior Opus models. It finished faster and produced richer, more information dense outputs. Overall, a noticeably better signal to noise ratio. The biggest differentiator was Opus 4.8’s tendency to proactively flag issues with the inputs and outputs of an analysis, something other models routinely missed and left to the users to catch." kata perwakilan dari Bridgewater Associates.

Keandalan penalaran dalam alur kerja profesional berisiko tinggi juga menjadi catatan penting bagi penyedia sistem keuangan dan hukum.

"Across CoCounsel Legal, Claude Opus 4.8 delivered meaningful improvements in consistency and reasoning quality compared to prior Opus models. For the high-stakes professional workflows our customers depend on, that reliability matters. As we build fiduciary-grade AI systems for legal and tax professionals, advances like these help raise the standard for trusted AI performance in real-world workflows." kata penguji dari CoCounsel Legal.

Integrasi pada sistem agen kecerdasan buatan berskala perusahaan juga membuka peluang penyelesaian pertanyaan multitahap secara lebih cepat.

"Claude Opus 4.8 sets a new bar for enterprise AI. In Genie, Databricks’ AI agent for data and knowledge work, the new Opus model unlocks a step change in agentic reasoning, tackling deeper, multistep questions faster than any prior Opus. Its multimodal strength also lets Genie reason directly over PDFs, diagrams, and other unstructured content at 61% cheaper token cost than Opus 4.7." kata pihak Databricks.

Sementara itu, akurasi sitasi dokumen finansial yang padat mengalami peningkatan efisiensi pengambilan data.

"For financial-document workflows in Hebbia’s orchestrator, Claude Opus 4.8 delivers the same strong quality as Opus 4.7 with noticeably better citation precision and more token efficiency on retrieval, which works incredibly well for the kinds of dense filings our customers run every day." tutur pihak Hebbia.

Terkait pengembangan model lain, Anthropic menyatakan sedang menyelesaikan langkah pengamanan untuk model Mythos mereka yang sempat tertunda.

"We’re making swift progress on developing these safeguards and expect to be able to bring Mythos-class models to all our customers in the coming weeks," tulis Anthropic dalam pengumuman resminya.

Di sisi lain, penerapan model ini pada sektor keamanan siber terus dioptimalkan oleh para mitra pengembang.

"AI is rapidly reshaping vulnerability management, and TrendAI™ is at the forefront. By leveraging frontier models and virtual patching, we're building the future where advanced AI empowers security teams to better understand complex risks, prioritize what matters based on exploitability and business impact, and respond faster. The result is greater speed and proactive risk reduction across the entire security cycle for TrendAI™ customers." kata Rachel Jin, Chief Platform and Business Officer sekaligus Head of TrendAI™.

Follow pdiperjuanganbali.id Add to preferred sources on Google
Editors Team
Daisy Floren

What's Your Reaction?

  • Like
    0
    Like
  • Dislike
    0
    Dislike
  • Funny
    0
    Funny
  • Angry
    0
    Angry
  • Sad
    0
    Sad
  • Wow
    0
    Wow

Most viewed