Sandboxing dalam konteks AI agent adalah praktik menjalankan agent di dalam lingkungan komputasi yang terisolasi dan dibatasi secara ketat, sehingga tindakan apa pun yang dilakukan agent—menjalankan kode, mengakses file, atau memanggil layanan eksternal—tidak dapat memengaruhi sistem produksi, data sensitif, atau infrastruktur di luar batas lingkungan tersebut.
Kebutuhan akan sandboxing muncul karena AI agent modern, terutama yang memiliki kemampuan menjalankan kode (code execution) atau mengoperasikan komputer secara langsung, berpotensi melakukan tindakan yang tidak terduga atau bahkan berbahaya jika diberi akses penuh ke sistem nyata. Sebuah agent yang diminta "membersihkan file duplikat" misalnya, tanpa sandboxing yang tepat, berisiko salah menghapus data penting akibat kesalahan interpretasi instruksi atau bug dalam logikanya sendiri.
Secara teknis, sandbox biasanya diimplementasikan menggunakan teknologi isolasi seperti container (Docker), virtual machine ringan, atau lingkungan eksekusi khusus yang membatasi akses jaringan, sistem file, dan sumber daya komputasi hanya pada apa yang benar-benar diperlukan. Beberapa platform juga menerapkan sandbox sekali pakai (ephemeral) yang dibuat khusus untuk satu tugas dan langsung dihancurkan setelah selesai, memastikan tidak ada jejak atau efek samping yang tertinggal.
Sandboxing menjadi salah satu lapisan pertahanan utama dalam arsitektur AI agent yang aman, terutama untuk agent coding yang menjalankan kode buatan model, agent browser yang menjelajah web secara otomatis, atau agent yang diuji coba dalam tahap evaluasi kemampuan (capability evaluation) sebelum dirilis ke publik. Insiden keamanan pada beberapa platform AI besar yang melibatkan agent yang berhasil "keluar" dari lingkungan pengujian menjadi pengingat nyata mengapa sandboxing yang dirancang dengan benar sangat penting, bukan sekadar fitur tambahan.
