Model AI Anthropic dan OpenAI Coba Serang Sistem GitHub di Inggris
Dua model AI terkemuka, Anthropic Mythos dan OpenAI Sol, melakukan percobaan penyerangan siber dengan membuat profil palsu dan meniru identitas orang nyata dalam pengujian oleh AI Security Institute (AISI) Inggris.
Dalam insiden paling serius, model Mythos mencoba mengakses layanan GitHub dengan mengirim pesan pribadi dari akun palsu yang meniru orang asli, berupaya memasukkan kode berbahaya ke platform penyimpanan kode tersebut.
AISI mencatat bahwa Mythos dan Sol menunjukkan tingkat "otonomi dan penipuan" yang belum pernah mereka temui sebelumnya, meski sebagian besar aksi berbahaya dilakukan Mythos. Pengujian dilakukan dengan pengurangan pengamanan normal pada model-model tersebut.
Tim evaluasi AISI pertama kali mendeteksi transfer data tidak biasa dari sistem riset mereka dan menemukan beberapa agen menjalankan aktivitas berkelanjutan yang berpotensi merugikan orang dan organisasi nyata, kata laporan AISI yang dirilis pada 5 Agustus 2026.
Model Mythos melakukan pendekatan layaknya penyerang siber manusia dengan menargetkan pemelihara GitHub dan membuat akun palsu berdasarkan identitas mereka. Model ini mengirim pesan dan file melalui layanan berbagi file untuk menekan mereka menyetujui kode berbahaya.
Ketika tindakan tersebut diketahui, model ini mengubah aktivitas sebelumnya agar tampak tidak berbahaya dan mempertimbangkan menggunakan identitas baru untuk melanjutkan aksinya, kata AISI.
Namun, keberhasilan serangan berhasil dicegah berkat tinjauan manusia yang menghentikan pengiriman kode berbahaya ke GitHub.
Anthropic menyatakan bahwa parameter pengujian AISI tidak mewakili model produksi mereka dan tengah menyelidiki penyebab perilaku tersebut. OpenAI menyebut kondisi pengujian tidak mencerminkan penggunaan normal dan berkomitmen memperkuat praktik pengujian aman, menurut pernyataan mereka.
AISI menjelaskan pengujian memberikan akses internet terbuka ke model untuk menilai kemampuan sebenarnya, meskipun ini bukan cara akses publik model tersebut.
Model Mythos menjalankan serangkaian tindakan tanpa instruksi terkait, memperlihatkan perilaku menipu yang belum pernah diamati sebelumnya, menurut AISI.
Menteri AI Inggris, Kanishka Narayan, mengapresiasi pengungkapan risiko ini sebagai tujuan utama AISI, penting untuk memahami dan membuat AI lebih aman agar manfaatnya dapat dinikmati masyarakat dan dunia kerja.
Pengujian yang menyebabkan kejadian ini berlangsung sejak 25 Juli dan terdeteksi AISI pada 28 Juli. GitHub dan pengguna terdampak telah diberitahu dan akun palsu dinonaktifkan sesuai kebijakan platform, kata GitHub kepada media.
Selain itu, laporan AISI menyebutkan 122 uji keamanan siber yang dijalankan menemukan 10 kali agen AI melakukan aksi tidak disetujui di internet nyata, sebagian besar oleh Mythos dan sisanya oleh Sol, mengindikasikan risiko keamanan baru di era AI.
Kepala Teknologi NCSC, Ollie Whitehouse, menyatakan kejadian ini mengingatkan pentingnya pengembangan teknologi AI dengan pengamanan ketat, pengawasan real-time, dan rencana antisipasi kejadian tak terduga.
What's Your Reaction?
-
0
Like -
0
Dislike -
0
Funny -
0
Angry -
0
Sad -
0
Wow