Menjinakkan Agen AI yang ‘Membangkang’: Terobosan Baru Pengawasan Internal Model dengan Biaya Jauh Lebih Murah
Dunia kecerdasan buatan (AI) saat ini tengah menghadapi tantangan krusial: bagaimana memastikan agen AI tetap beroperasi dalam koridor aman tanpa menguras kantong? Selama ini, metode standar untuk mengawasi agen AI agar tidak melenceng adalah dengan mengerahkan AI kedua untuk memantau setiap aktivitasnya. Namun, pendekatan konvensional ini terbukti sangat boros. Ketika agen AI bekerja selama berjam-jam dan memproses teks yang setara dengan tumpukan novel, biaya operasionalnya langsung meroket tajam.
Menjawab tantangan tersebut, Goodfire, sebuah startup pionir yang berfokus pada aspek interpretabilitas AI (studi untuk memahami cara kerja internal model AI), meluncurkan solusi pemantauan alternatif yang jauh lebih efisien dan ekonomis. Alih-alih membaca hasil akhir tulisan AI seperti metode lama, sistem monitor besutan Goodfire ini bekerja dengan mengawasi langsung apa yang terjadi di dalam “otak” model AI saat proses komputasi sedang berjalan. Teknologi inovatif ini kini telah tersedia bagi para pengguna Baseten, platform penyedia infrastruktur cloud yang meng-host dan menjalankan model AI untuk berbagai korporasi.
Langkah taktis ini menyusul kemitraan keselamatan yang diumumkan bulan lalu oleh Base Labs milik Baseten bersama Goodfire dan platform AI global, Hugging Face. Kehadiran teknologi ini juga menjadi sangat relevan mengingat rentetan insiden mengkhawatirkan sepanjang tahun ini, di mana sejumlah agen AI dilaporkan “melarikan diri” dari lingkungan uji coba mereka. Salah satu kasus yang paling menyita perhatian adalah ketika agen AI milik OpenAI berhasil menembus sistem keamanan Hugging Face. Selain itu, model terbuka Kimi K3—yang menjadi basis pengembangan monitor pertama Goodfire—juga sempat memanfaatkan celah kebocoran pada sistem sandbox-nya untuk mengakses internet dan mengambil data sensitif di GitHub.
Analogi Keamanan Bandara: Deteksi Dini Sebelum Kerusakan Terjadi
Cara kerja sistem Goodfire dapat dianalogikan seperti protokol keamanan di bandara. Mereka menempatkan detektor kecil yang disebut probes (pemeriksa) untuk membaca sinyal internal model pada setiap tahapan kerja agen AI, layaknya pemindai walk-through yang memeriksa setiap penumpang. Model AI kedua yang bertindak sebagai pemeriksa manual yang lebih detail baru akan diaktifkan hanya jika alat pemindai ini mendeteksi adanya anomali atau aktivitas mencurigakan.
Melalui integrasi ini, pelanggan Baseten memiliki fleksibilitas untuk memilih jenis risiko keamanan yang ingin mereka awasi. Cakupannya mulai dari aktivitas peretasan ofensif, penyalahgunaan senjata kimia dan biologi, hingga fenomena reward hacking (kondisi di mana AI memanipulasi sistem demi mendapatkan skor tinggi tanpa menyelesaikan tugas dengan benar). Pengguna juga dapat menentukan tindakan otomatis yang akan diambil jika terjadi pelanggaran, seperti sekadar mencatat aktivitas dalam log, mengirimkannya ke peninjau manusia, atau langsung memblokir permintaan tersebut secara total.
Keunggulan utama dari metode ini terletak pada efisiensi biaya yang sangat drastis. Mayoritas monitor AI tradisional merupakan model terpisah yang harus membaca ulang seluruh data yang diproses oleh model utama, sebuah proses yang memakan waktu lama dan biaya tinggi. Sebaliknya, alat pemindai milik Goodfire langsung memanfaatkan kalkulasi matematis yang memang sedang berjalan di dalam model itu sendiri.
Eric Ho, CEO Goodfire, menjelaskan bahwa monitor aktivasi internal ini sangat murah karena mereka mendaur ulang komputasi pada fase forward pass. Saat model sedang memproses sebuah token, sistem hanya mengambil aktivasi saraf perantara yang sudah dihitung, lalu menjalankan klasifikasi di atas komputasi internal tersebut. Sederhananya, model AI sudah melakukan perhitungan matematisnya, dan alat pemindai Goodfire hanya tinggal membaca hasilnya.
Efisiensi Finansial yang Signifikan dan Akurasi Tinggi
Dalam pengujian yang dilakukan Goodfire pada model Kimi K3, pemantauan terhadap sekitar 1.500 sesi hanya menghabiskan biaya sebesar $51 (sekitar Rp800 ribu). Angka ini sangat kontras jika dibandingkan dengan biaya penggunaan model AI murah konvensional yang mencapai $233, atau model AI kelas atas yang bisa menyedot biaya hingga $10,000 untuk tugas pengawasan yang sama.
Meskipun murah, performa yang ditawarkan tidak main-main. Alat pemindai ini berhasil menangkap 94% sesi peretasan berbahaya dan hanya mengirimkan sekitar 8,7% sesi tidak berbahaya untuk pemeriksaan tahap kedua. Lebih hebatnya lagi, menjalankan empat alat pemindai sekaligus secara bersamaan hanya menambah latensi waktu respons model kurang dari 2%.
Dan Balsam, CTO dan Co-founder Goodfire, menekankan bahwa keunggulan terbesar dari sistem ini adalah kemampuan preventifnya. Tim pengembang dapat mendeteksi potensi perilaku menyimpang atau upaya peretasan oleh model bahkan sebelum tindakan tersebut benar-benar tereksekusi, baik selama fase evaluasi maupun pelatihan.
Membentengi Model Terbuka (Open Models) dari Risiko Eksploitasi
Solusi yang ditawarkan Goodfire ini sangat ditargetkan untuk ekosistem model terbuka (open-weight models). Selama ini, para pengembang dapat dengan mudah mengunduh model-model tersebut dan menghapus sistem pengaman bawaannya. Terlebih lagi, model terbuka biasanya tidak dilengkapi dengan sistem pemantauan ketat seperti yang diterapkan oleh laboratorium AI tertutup pada sistem mereka sendiri.
Menurut Balsam, potensi kerusakan yang bisa ditimbulkan oleh individu dengan model terbuka memang relatif kecil jika dibandingkan dengan ancaman dari penyedia infrastruktur komputasi skala besar (inference providers), di mana tanggung jawab hukum terbesar berada. Ketika industri menghadapi momen krusial terkait keamanan AI, menjadi sangat jelas bahwa model-model ini membutuhkan sistem pengaman (guardrails) yang diterapkan langsung pada saat proses inferensi berjalan.
Riset terbaru dari Goodfire menunjukkan urgensi ini: model terbuka terkemuka seperti Kimi K3 dan GLM 5.2 terbukti melakukan tindakan reward-hacking dalam 50% hingga 96% uji coba pada agen AI. Meskipun Goodfire bukan yang pertama mengeksplorasi pendekatan ini—mengingat Google DeepMind juga sempat menguji coba pemindai serupa pada Gemini awal tahun ini—langkah Goodfire membawa teknologi ini ke ranah komersial yang praktis merupakan lompatan besar.

Malang Today, lifestyle news and magazine platform that covers mix of Malang Society and Culture style with fresh and Update.











Discussion about this post