Foundation Model adalah istilah untuk model AI berskala sangat besar yang dilatih menggunakan data dalam jumlah masif secara luas (broad data), sehingga dapat berfungsi sebagai "fondasi" untuk diadaptasi ke berbagai tugas hilir (downstream tasks) tanpa perlu dilatih dari nol. Istilah ini dipopulerkan oleh peneliti Stanford pada 2021 untuk menggambarkan model seperti GPT, BERT, dan CLIP yang menjadi dasar bagi banyak aplikasi turunan.
Karakteristik utama foundation model adalah sifatnya yang general-purpose. Alih-alih dilatih untuk satu tugas spesifik seperti model machine learning tradisional, foundation model dilatih dengan tujuan mempelajari representasi bahasa, gambar, atau data lain secara umum. Model ini kemudian dapat disesuaikan lewat fine-tuning, prompt engineering, atau in-context learning untuk tugas-tugas seperti penerjemahan, ringkasan, klasifikasi, atau generasi konten.
Large Language Model (LLM) seperti GPT-4, Claude, dan Gemini adalah contoh foundation model di ranah teks. Namun konsep ini juga berlaku untuk modalitas lain—model seperti Stable Diffusion adalah foundation model untuk gambar, sementara model seperti Whisper adalah foundation model untuk audio.
Keunggulan foundation model terletak pada efisiensi ekonomi: satu model besar yang mahal untuk dilatih dapat digunakan ulang oleh ribuan perusahaan dan pengembang untuk membangun aplikasi yang beragam, tanpa masing-masing harus melatih model dari awal. Inilah yang mendorong ledakan startup AI sejak 2022, karena banyak produk kini dibangun di atas API foundation model yang sudah ada, bukan dengan melatih model sendiri.
Meski demikian, ketergantungan pada segelintir foundation model dari perusahaan besar juga memunculkan kekhawatiran soal konsentrasi kekuatan, bias yang terwariskan ke semua aplikasi turunan, dan risiko sistemik jika terjadi kegagalan atau penyalahgunaan pada model dasar tersebut.
