Kamus AI

Inference

Proses menjalankan model AI yang sudah dilatih untuk menghasilkan prediksi atau output dari input baru, berbeda dengan proses pelatihan (training) yang bertujuan membangun model itu sendiri.

Inference, atau inferensi, adalah proses menjalankan model AI yang telah selesai dilatih untuk menghasilkan prediksi, jawaban, atau output tertentu berdasarkan input baru yang diberikan—berbeda secara mendasar dengan proses training (pelatihan), yang bertujuan membangun dan menyesuaikan model itu sendiri menggunakan data pelatihan.

Analogi sederhananya: training adalah proses seorang siswa belajar dan mengerjakan latihan soal selama bertahun-tahun di sekolah, sementara inference adalah momen ketika siswa tersebut mengerjakan ujian yang sesungguhnya—menerapkan pengetahuan yang telah dipelajari untuk menjawab soal baru yang belum pernah dilihat sebelumnya. Dalam konteks model AI, setiap kali pengguna mengirim pertanyaan ke ChatGPT dan menerima jawaban, itulah proses inference yang sedang berlangsung.

Training dan inference memiliki karakteristik komputasi yang sangat berbeda. Training biasanya dilakukan satu kali (atau berkala untuk pembaruan model) dan membutuhkan sumber daya komputasi masif dalam periode waktu terkonsentrasi—bisa memakan waktu berminggu-minggu dengan ribuan GPU. Inference, sebaliknya, terjadi berulang kali setiap ada permintaan dari pengguna, membutuhkan sumber daya komputasi yang jauh lebih kecil per permintaan, namun secara agregat—dengan jutaan pengguna mengirim permintaan setiap hari—biaya inference kumulatif dapat melampaui biaya training dalam jangka panjang.

Optimisasi kecepatan dan biaya inference menjadi fokus rekayasa yang sangat penting bagi penyedia layanan AI, karena hal ini secara langsung memengaruhi pengalaman pengguna (kecepatan respons) dan margin keuntungan bisnis. Berbagai teknik seperti quantization, distillation, dan penggunaan chip khusus inferensi dikembangkan secara khusus untuk mempercepat dan menekan biaya proses inference tanpa mengorbankan kualitas output secara signifikan.

Istilah "biaya inference" sering muncul dalam diskusi bisnis AI, merujuk pada biaya komputasi yang dikeluarkan setiap kali model AI digunakan untuk menjawab satu permintaan—biaya inilah yang menjadi dasar penetapan harga API model AI berbasis token yang umum digunakan industri saat ini.

Jelajahi Kamus AI