Pre-training adalah tahap awal dan paling intensif secara komputasi dalam proses pelatihan model AI, di mana model dilatih menggunakan data mentah dalam jumlah sangat besar—untuk model bahasa, ini biasanya berarti triliunan token teks dari internet, buku, dan berbagai sumber tertulis lainnya—untuk mempelajari pola bahasa, fakta umum, dan struktur data secara luas, tanpa diarahkan pada tugas spesifik tertentu.
Selama pre-training, model biasanya dilatih dengan tugas sederhana namun sangat efektif, seperti memprediksi kata berikutnya dalam sebuah kalimat berdasarkan konteks sebelumnya. Melalui proses berulang pada data dalam skala masif ini, model secara bertahap "menyerap" pengetahuan tentang tata bahasa, fakta dunia, pola penalaran dasar, dan bahkan sejumlah kemampuan yang muncul secara tidak langsung (emergent abilities) tanpa secara eksplisit diprogram untuk mempelajarinya.
Pre-training adalah tahap yang paling mahal dalam siklus pengembangan model AI, membutuhkan ribuan hingga puluhan ribu GPU atau TPU yang berjalan secara paralel selama berminggu-minggu hingga berbulan-bulan, dengan biaya yang bisa mencapai puluhan hingga ratusan juta dolar untuk model flagship terbesar.
Setelah tahap pre-training selesai, model yang dihasilkan disebut sebagai "base model" atau model dasar—model ini memiliki pengetahuan luas namun belum tentu terampil mengikuti instruksi atau berperilaku sebagai asisten yang membantu. Tahap-tahap lanjutan seperti instruction tuning dan RLHF kemudian diterapkan di atas base model ini untuk menghasilkan model yang siap digunakan sebagai asisten AI yang responsif dan aman.
Perlombaan antar-laboratorium AI dalam melakukan pre-training pada skala yang lebih besar—baik dari sisi jumlah data, ukuran model, maupun daya komputasi—menjadi salah satu pendorong utama peningkatan kemampuan model AI generasi ke generasi sejak awal 2020-an.
