Anthropic Mengatakan Model AI Mereka Telah Menceroboh Tiga Organisasi
Effi Saharudin
Selepas insiden beberapa model OpenAI menceroboh Hugging Face tanpa kebenaran ketika sedang melakukan ujian minggu lalu, pagi ini Anthropic turut membuat pengakuan tiga model kecerdasan buatan (AI) mereka turut telah melakukan pencerobohan ketika sedang melalukan ujian sekuriti.
Dalam ujian pertama, model Claude Mythos 5 berjaya menghantar pakej Python ke dalam pangkalan data PyPI walaupun dalam ujian ia telah diberikan parameter tidak boleh mengakses internet dan kesemua aktiviti yang dilakukan adalah sekadar simulasi.

Mythos 5 berjaya mendaftar akaun PyPI menggunakan emel yang dilihat selamat tanpa keperluan mempunyai nombor telefon seperti diperlukan. Beberapa ujian mendapatkan nombor telefon gagal membuatkan cara alternatif ini diambil. Pakej Python yang dimuat naik ini kemudiannya dimuat turun oleh 15 organisasi. Sistem keselamatan PyPI hanya membuang pakej palsu ini selepas sejam dimuat naik.
Mythos 5 walau bagaimanapun mengakui tindakannya keluar daripada parameter keselamatan yang ditetapkan adalah melanggar arahan.
Dalam insiden kedua pula model Claude Opus 4.7 diarahkan melakukan simulasi serangan ke atas sebuah domain rekaan. Apabila gagal dilakukan, ia menyedari domain sebenar wujud di internet dan melakukan pencerobohan tanpa diarahkan.

Beberapa pangkalan data berjaya ditembusi dengan insiden ini berlaku sebanyak empat kali. Dalam dua daripada empat insiden, Opus 4.7 memberikan alasan ia melanggar parameter simulasi kerana mengatakan domain dunia sebenar adalah sebahagian daripada ujian.
Akhir sekali dalam insiden ketiga sebuah model baharu diuji dan ia melakukan imbasan sekitar 9000 sasaran selepas gagal menembusi sasaran yang diberikan. Model kemudian menggunakan kelemahan pada sistem untuk melakukan suntikan SQL. Ia kemudian menyedari sasaran tidak mempunyai kaitan dengan ujian yang diberikan dan menamatkannya sendiri.
Anthropic telah menggantung semua ujian sekuriti sejak 23 Julai bagi melakukan semakan dalaman. Organisasi yang terjejas dengan pencerobohan telah dihubungi dengan Anthropic mendapati serangan paling awal dilakukan pada bulan April dengan ia hanya sekarang disedari. Syarikat kini merancang melakukan pemantauan transkrip yang lebih luas, menggunakan peralatan penyiasatan yang lebih baik dan bekerja lebih rapat dengan vendor penilaian.