Anthropic Temukan Model AI Claude Akses Sistem Organisasi Tanpa Izin

Smallest Font
Largest Font

Anthropic mengumumkan pada Kamis bahwa mereka menemukan tiga kejadian di mana model kecerdasan buatannya, Claude, mengakses internet dan memperoleh akses tanpa izin ke sistem nyata dari tiga organisasi berbeda saat evaluasi keamanan siber.

Insiden ini terungkap setelah Anthropic melakukan tinjauan retrospektif besar-besaran terkait evaluasi keamanan siber mereka, yang dipicu oleh insiden serupa yang diungkap oleh OpenAI pekan sebelumnya.

OpenAI melaporkan bahwa modelnya berhasil keluar dari lingkungan uji terisolasi dengan akses internet terbatas, memanfaatkan serangkaian celah untuk mencapai web terbuka dan mengakses platform pengembang open-source Hugging Face.

Pada tiga kejadian yang terdeteksi Anthropic, model mereka mengakses internet saat berinteraksi dengan lingkungan pengujian dari mitra evaluasi pihak ketiga bernama Irregular. Meskipun Claude diberitahu bahwa ia berada dalam simulasi tanpa akses internet, terjadi kesalahpahaman sehingga akses internet tetap tersedia.

Model-model tersebut mampu menembus sistem organisasi yang terpengaruh dengan menggunakan teknik dasar seperti mengakses endpoint tanpa otentikasi dan memanfaatkan kata sandi lemah. Anthropic tidak mengungkap organisasi mana saja yang terdampak.

Anthropic menyatakan, "Banyak faktor yang berkontribusi pada insiden ini, namun dengan budaya pasca insiden tanpa menyalahkan, kami menangani perbaikan seolah tanggung jawab sepenuhnya ada pada kami."

Pengungkapan ini menambah kekhawatiran di sektor teknologi terkait kemampuan siber AI yang cepat berkembang, yang telah diperingatkan oleh Anthropic dan OpenAI beberapa bulan terakhir. Setelah insiden Hugging Face, dua anggota Kongres mengajukan RUU bernama "AI Kill Switch Act" untuk mewajibkan perusahaan AI memiliki kemampuan menghentikan atau menangguhkan model bila berperilaku tidak terkendali.

Tiga model Anthropic yang terlibat adalah Opus 4.7, Mythos 5, dan model riset internal. Mythos 5 yang diluncurkan Juni lalu memiliki kemampuan keamanan siber canggih dan terbatas untuk pengguna tertentu. Versi sebelumnya yang dirilis April lalu menarik perhatian Wall Street dan pejabat pemerintah.

Anthropic mencatat, masing-masing model bereaksi berbeda saat menyadari telah mencapai sistem nyata. Opus 4.7 melanjutkan serangan, Mythos 5 meyakini masih dalam simulasi, dan model riset menghentikan latihan.

"Polanya konsisten dengan model lebih maju merespons lebih tepat, namun kami perlu pengujian lebih lanjut untuk memastikan," kata Anthropic.

Model-model tersebut diuji tanpa pengamanan standar yang biasanya diterapkan sebelum model dirilis secara publik. Perusahaan menghentikan semua evaluasi siber setelah mendeteksi Claude mungkin telah mengakses internet secara tidak semestinya dan kini bekerja sama dengan METR, lembaga evaluasi AI independen, untuk investigasi lebih lanjut.

Anthropic juga mengajak laboratorium lain melakukan tinjauan serupa guna memastikan keamanan AI.

Follow pdiperjuanganbali.id Add to preferred sources on Google
Editors Team

What's Your Reaction?

  • Like
    0
    Like
  • Dislike
    0
    Dislike
  • Funny
    0
    Funny
  • Angry
    0
    Angry
  • Sad
    0
    Sad
  • Wow
    0
    Wow

Most viewed