Kamus AI

Benchmark (AI)

Standar pengujian yang dipakai untuk mengukur dan membandingkan kemampuan berbagai model AI secara objektif pada tugas-tugas tertentu, seperti penalaran, coding, atau pengetahuan umum.

Benchmark dalam konteks AI adalah standar pengujian yang dirancang untuk mengukur dan membandingkan kemampuan berbagai model AI secara objektif pada tugas-tugas tertentu, seperti penalaran matematis, pemrograman, pemahaman bahasa, atau pengetahuan umum lintas bidang.

Setiap benchmark biasanya terdiri dari sekumpulan soal atau tugas standar beserta jawaban yang telah ditentukan sebelumnya (ground truth). Model AI kemudian diuji dengan soal-soal tersebut, dan performanya diukur berdasarkan seberapa banyak jawaban yang benar, biasanya dinyatakan dalam bentuk persentase akurasi atau skor tertentu.

Sejumlah benchmark populer yang sering dijadikan acuan industri antara lain MMLU (Massive Multitask Language Understanding) untuk mengukur pengetahuan umum lintas berbagai bidang akademik, HumanEval untuk mengukur kemampuan menulis kode, GSM8K untuk soal matematika tingkat sekolah dasar-menengah, dan berbagai benchmark khusus lain yang terus bermunculan seiring model AI menjadi semakin mumpuni dan benchmark lama menjadi "usang" karena skornya sudah mendekati sempurna.

Benchmark menjadi alat penting bagi peneliti, developer, dan pengguna untuk membandingkan model AI secara relatif objektif, terutama saat memilih model mana yang paling cocok untuk kebutuhan spesifik. Perusahaan AI juga sering menggunakan hasil benchmark sebagai materi pemasaran untuk menunjukkan keunggulan model mereka dibanding kompetitor.

Namun, benchmark memiliki keterbatasan penting yang perlu dipahami. Skor tinggi pada suatu benchmark tidak selalu mencerminkan performa nyata pada kasus penggunaan dunia nyata, terutama jika data benchmark tersebut secara tidak sengaja "bocor" dan turut menjadi bagian dari data pelatihan model (data contamination). Selain itu, benchmark cenderung mengukur kemampuan pada tugas yang terstruktur dan terdefinisi dengan baik, sementara banyak aplikasi dunia nyata melibatkan konteks yang jauh lebih ambigu dan sulit diukur secara kuantitatif murni.

Jelajahi Kamus AI