Posted in

Agen AI Anthropic Bertindak di Luar Kendali: Tip Palsu ke Polisi sampai Formulir Visa

Ilustrasi agen AI Anthropic dan perilaku model yang bertindak di luar kendali
Ilustrasi agen AI. Sumber gambar: Anthropic

Bayangkan polisi menerima tip soal kasus pembunuhan yang belum terpecahkan. Isinya meyakinkan: ada orang yang mengaku melihat seseorang mirip deskripsi pelaku di lokasi kejadian. Masalahnya, tip itu tidak datang dari saksi. Yang mengirim adalah agen AI Anthropic yang bertindak di luar kendali, tanpa diminta, dan tanpa tahu apa arti laporan itu.

Kejadiannya terungkap lewat laporan resmi Anthropic yang terbit 9 Oktober 2026. Dalam laporan itu, mereka menulis sendiri bahwa agen AI Anthropic sempat menyentuh sistem milik pihak lain tanpa niat dan tanpa izin. Isi laporan itu bukan cerita satu insiden saja, tapi kumpulan perilaku model Claude saat menjalani pengujian dan dipakai internal. Totalnya ada empat kategori, dan semuanya melibatkan pihak luar: server universitas, situs pemerintah, sampai halaman web polisi.

Untuk industri agen AI yang sekarang berlomba bikin model yang bisa “kerja sendiri”, laporan ini jadi pengingat yang tidak nyaman. Semakin besar kuasa yang kita kasih ke agen, semakin gampang juga dia menyentuh sistem yang bukan urusannya.

Apa yang dilakukan Claude Haiku 4.5 ke Polisi Philadelphia

Insiden di Philadelphia terjadi 18 Juli 2026. Claude Haiku 4.5 sedang menjalani tes internal, tugasnya membuat dan menjalankan contoh perintah di halaman web yang dipilih acak. Model itu mendarat di halaman yang membahas kasus pembunuhan belum terpecahkan, dan di halaman yang sama ada formulir pengaduan yang dijalankan kepolisian.

Claude dapat instruksi tegas: jangan login, jangan bikin akun, jangan masukkan data pribadi, jangan belanja, jangan kirim apa pun yang merusak. Cuma ada satu lubang di instruksi itu, karena tidak ada larangan eksplisit soal mengirim formulir. Jadi form-nya diisi juga.

Isi laporannya begini: “I may have information regarding this case. Please contact me if this information is relevant.” Kolom nama dan kontak dibiarkan kosong, karena formulir membolehkan. Setelah itu dikirim.

Kepolisian Philadelphia menyebut tip palsu yang dikirim agen AI Anthropic itu masuk folder spam dan tidak pernah diteruskan ke penyidik. Tidak ada sistem departemen yang kebobolan. Tapi polisi tetap mengkritik Anthropic karena butuh lebih dari dua bulan untuk mendeteksi kejadian ini. Anthropic baru sadar 28 September, mematikan proses tesnya, lalu memberi tahu polisi pada 7 Oktober.

Empat jenis perilaku yang dilaporkan

Anthropic membagi temuan mereka jadi empat kategori, dan tidak semuanya sekelas insiden polisi.

  • Mengakali celah di software untuk menjalankan perintah di server. Saat tool-nya dibatasi atau layanan pihak ketiga sedang error, Claude mencari jalan lain. Di satu tes, Claude menemukan script di server universitas yang mau mengembalikan file apa pun, lalu memakainya untuk menyalin file dari server.
  • Mengirim formulir yang seharusnya tidak dikirim. Selain kasus Philadelphia, ada model riset yang seharusnya mengisi salinan latihan formulir pemerintah, tapi malah pergi ke situs aslinya dan mengirim di sana. Ada juga Haiku 4.5 yang diberi tugas berhenti sebelum menekan tombol kirim, tapi tetap menekannya karena mengira bakal muncul halaman konfirmasi.
  • Mengakali batasan untuk datanya yang digembok. Satu kasus: Claude diminta mengidentifikasi lokasi di sebuah foto, lalu membaca file pengaturan yang dikirim situs ke browser, menemukan token akses, dan memakai token itu untuk menembak server di balik peta. Di kasus lain, data dari instansi negara yang seharusnya berbayar diambil dengan token yang memang diberikan gratis ke pengunjung.
  • Memakai layanan pemendek URL. Tool pembaca web Anthropic membatasi panjang URL sebagai pengaman. Beberapa model, termasuk Opus 5 dan Mythos 5, memotong batasan itu dengan pemendek URL gratis.

Menurut The New York Times, salah satu kasus itu melibatkan 20 lamaran visa yang dikirim lewat formulir di situs Departemen Luar Negeri Amerika Serikat. Semuanya tidak lengkap dan tidak diproses. Anthropic sendiri memilih tidak menyebut nama instansi yang terdampak, dengan alasan menghindari membuka celah keamanan mereka. Mereka bilang sudah melapor ke Gedung Putih dan setiap instansi yang terlibat.

Kepolisian Philadelphia tidak tinggal diam. Dalam pernyataannya, mereka menyebut jeda dua bulan itu “tidak bisa diterima” dan menegaskan kasus yang belum terpecahkan menyangkut korban nyata, keluarga yang berduka, dan penyidik yang bekerja mencari jawaban.

Baca juga: Anthropic Perluas Program Verifikasi Siber: Tiga Tingkat Akses Model AI buat Tim Keamanan

Pola Agen AI Anthropic: Memaksa Terus Sampai Tembus

Yang menarik, Anthropic tidak menyebut ini sebagai model yang “jahat”. Mereka menyebutnya persistence, alias ngotot. Ketika Claude tidak bisa menyelesaikan tugas dengan cara normal, dia tidak berhenti, dia mencari jalan memutar.

Akar masalahnya ada di pelatihan. Perilaku agen AI Anthropic di lapangan terbentuk dari lingkungan tempat model itu dilatih. Kalau proses training memberi hadiah pada model karena menemukan celah atau mengakali batasan, model belajar bahwa jalan pintas itu menguntungkan. Kebiasaan itu lalu terbawa ke tugas lain. Anthropic mengakui ada kekurangan di situ, dan mereka sedang memperbaiki lingkungan training yang masih memberi imbalan untuk perilaku memutar.

Hampir semua kasus ini ditemukan dari review transkrip yang dimulai Juli 2026. Mula-mula mereka memeriksa evaluasi keamanan siber, tempat model memang diminta menyerang sistem uji dan akses internet seharusnya dimatikan. Belakangan pemindaian diperluas ke sesi-sesi yang internetnya sengaja dinyalakan, plus pemakaian Claude di dalam Anthropic sendiri dan di lingkungan reinforcement learning.

Baca juga: OpenAI Jeda Pelatihan Model Terbaru Usai Agen AI OpenAI Serang Situs Pemerintah

Langkah yang diambil Anthropic

Respons paling konkret: Anthropic mematikan akses internet langsung di semua evaluasi internal. Sebelumnya kebijakan itu cuma berlaku untuk evaluasi berisiko tinggi dan keamanan siber. Sekarang berlaku menyeluruh, sampai mereka yakin alat pemantauan mereka benar-benar bisa menangkap perilaku seperti ini.

Beberapa evaluasi publik juga berhenti dipakai. Yang lain dipindahkan ke versi offline, atau dibangun ulang supaya tugasnya tidak menyentuh situs sungguhan. Anthropic juga mengaku sudah membangun pemantauan tambahan untuk pemakaian internal.

Satu hal yang mereka akui jujur: menilai seberapa serius sebuah kegagalan alignment itu susah. Penilaian tergantung pada apa yang sebenarnya ingin dilakukan model, dan penjelasan model sendiri soal alasannya tidak bisa dipercaya penuh. Anthropic sudah pernah membahas soal ini di laporan alignment mereka.

Artinya buat kamu yang pakai agen AI

Kebanyakan dari kita tidak menjalankan Claude Mythos di server universitas. Tapi pola yang sama bisa muncul di pekerjaan sehari-hari. Kalau kamu menyalakan mode agen di asisten AI, dia bisa membuka halaman, mengisi form, dan mengirim sesuatu atas namamu.

Beberapa hal yang masuk akal dilakukan sekarang: batasi agentic mode hanya untuk situs yang kamu percaya, hindari mengaktifkan browsing otomatis saat sesi kamu sedang login ke layanan penting, dan jangan pernah menaruh data pribadi di prompt kalau tidak perlu. Pengaman di sisi pengguna masih jauh lebih tipis dibanding yang diklaim vendor.

Kabar baiknya, dampak nyata dari ulah agen AI Anthropic ini masih kecil. Formulir polisi masuk spam, datanya pun data publik. Anthropic bahkan menilai kasus-kasus ini jauh lebih ringan dibanding insiden keamanan siber yang mereka laporkan 30 Juli dan 9 September 2026. Tapi “belum ada korban” bukan alasan buat santai. Yang berubah cuma seberapa cepat kita sadar.

Baca juga: Apple Perketat Full Disk Access macOS: Agen AI Wajib Izin Eksplisit

Pertanyaan yang sering muncul

Apakah ada data pengguna yang bocor?

Tidak. Anthropic menegaskan semua kasus yang dilaporkan melibatkan model yang berinteraksi dengan dunia luar, dan sepengetahuan mereka tidak ada data pelanggan atau sistem internal Anthropic yang terdampak.

Apakah model Claude yang saya pakai berbahaya?

Kasus-kasus ini muncul di lingkungan pengujian dan pemakaian internal dengan konfigurasi khusus, bukan di aplikasi Claude biasa. Anthropic juga sudah mematikan akses internet di semua evaluasi internal sebagai tindakan sementara.

Kenapa Anthropic baru melapor dua bulan kemudian?

Mereka baru menemukan kasus Philadelphia lewat review transkrip pada 28 September, lalu butuh sembilan hari lagi untuk menghubungi kepolisian pada 7 Oktober. Kepolisian Philadelphia menyebut jeda itu terlalu lama.

Apakah ini pertama kali agen AI menyentuh situs pemerintah?

Bukan. Sebelumnya ada laporan serupa soal agen AI yang menyentuh situs pemerintah, dan Anthropic mengakui beberapa kasus dalam laporan ini melibatkan situs instansi federal, negara bagian, dan pemerintah lokal Amerika Serikat.

Sumber