Kamus AI

RLHF (Reinforcement Learning from Human Feedback)

Teknik pelatihan yang menggunakan umpan balik manusia untuk mengarahkan perilaku model AI agar lebih selaras dengan preferensi dan nilai manusia, umumnya diterapkan setelah pre-training.

RLHF (Reinforcement Learning from Human Feedback) adalah teknik pelatihan model AI yang menggunakan umpan balik dari manusia untuk mengarahkan perilaku model agar lebih selaras dengan preferensi, nilai, dan harapan manusia. Teknik ini menjadi salah satu terobosan kunci yang mengubah model bahasa mentah menjadi asisten AI yang membantu dan aman digunakan, seperti yang pertama kali dipopulerkan lewat ChatGPT.

Proses RLHF umumnya terdiri dari tiga tahap. Pertama, model dasar (foundation model) yang sudah melalui pre-training menghasilkan beberapa kandidat jawaban untuk suatu prompt. Kedua, manusia memberi peringkat terhadap kandidat-kandidat jawaban tersebut berdasarkan kualitas, keamanan, dan kesesuaiannya. Ketiga, peringkat ini digunakan untuk melatih sebuah "model reward" yang mempelajari pola preferensi manusia, yang kemudian digunakan untuk lebih lanjut menyesuaikan model utama menggunakan teknik reinforcement learning.

Tanpa RLHF, model bahasa mentah hasil pre-training cenderung menghasilkan output yang tidak terarah, kadang tidak relevan dengan pertanyaan, atau bahkan berpotensi menghasilkan konten berbahaya. RLHF mengajarkan model untuk lebih memahami maksud di balik pertanyaan pengguna, mengikuti instruksi dengan lebih baik, menolak permintaan yang berbahaya, dan menyajikan jawaban dalam gaya yang lebih membantu dan ramah.

RLHF menjadi salah satu pilar utama dalam proses yang lebih luas disebut AI Alignment—upaya memastikan perilaku model AI selaras dengan nilai dan kepentingan manusia. Hampir semua asisten AI populer saat ini, termasuk ChatGPT, Claude, dan Gemini, melalui tahap RLHF atau variasi teknik serupa sebagai bagian dari proses pelatihannya.

Tantangan RLHF termasuk biaya tinggi untuk mengumpulkan data preferensi manusia berkualitas dalam jumlah besar, potensi bias dari para annotator manusia yang memberi peringkat, serta risiko model "overfit" terhadap preferensi permukaan (misalnya jawaban yang terdengar meyakinkan tapi tidak selalu benar) alih-alih benar-benar meningkatkan akurasi dan kejujuran jawabannya.

Jelajahi Kamus AI