Agent Evaluation adalah proses sistematis untuk mengukur seberapa baik sebuah AI agent menyelesaikan tugas dunia nyata—bukan hanya menjawab pertanyaan dengan benar, melainkan berhasil menuntaskan rangkaian langkah yang kompleks, menggunakan alat dengan tepat, dan mengambil keputusan yang masuk akal di sepanjang prosesnya.
Evaluasi agent berbeda signifikan dari evaluasi model bahasa konvensional. Jika benchmark model bahasa biasa umumnya menguji satu jawaban terhadap satu pertanyaan, evaluasi agent perlu mengukur keberhasilan dalam menyelesaikan tugas berjenjang (multi-step task) yang bisa memakan puluhan hingga ratusan langkah, seperti menyelesaikan tiket customer support dari awal hingga akhir, melakukan riset dan menyusun laporan, atau memperbaiki bug dalam basis kode nyata.
Metrik yang umum digunakan meliputi task success rate (persentase tugas yang berhasil diselesaikan sepenuhnya), efisiensi (jumlah langkah atau biaya token yang dibutuhkan), serta keamanan dan keselarasan (apakah agent tetap berada dalam batas yang diinginkan dan tidak mengambil tindakan berbahaya atau di luar wewenangnya). Beberapa benchmark populer untuk evaluasi agent dirancang khusus untuk domain tertentu, seperti menyelesaikan tugas pemrograman di repositori kode nyata atau menavigasi situs web untuk menyelesaikan transaksi.
Tantangan besar dalam agent evaluation adalah sifatnya yang open-ended—ada banyak cara valid untuk menyelesaikan satu tugas, sehingga sulit diukur hanya dengan mencocokkan output secara persis seperti pada evaluasi tradisional. Karena itu, banyak evaluasi modern menggunakan pendekatan "LLM sebagai juri" (LLM-as-judge) atau verifikasi berbasis hasil akhir (misalnya, apakah kode yang dihasilkan benar-benar lolos test suite), ketimbang menilai proses langkah demi langkah secara kaku.
