Synthetic Data atau data sintetis adalah data buatan yang dihasilkan secara artifisial oleh algoritma, simulasi, atau model AI lain—bukan dikumpulkan langsung dari kejadian atau interaksi dunia nyata. Data ini digunakan untuk melatih atau menguji model AI ketika data asli sulit didapat, terlalu mahal untuk dikumpulkan, memiliki masalah privasi, atau jumlahnya tidak mencukupi untuk kebutuhan pelatihan skala besar.
Dalam konteks model bahasa besar, synthetic data sering dihasilkan dengan cara meminta satu model AI (biasanya model yang sudah sangat mumpuni) untuk menghasilkan contoh-contoh percakapan, jawaban, atau skenario baru, yang kemudian digunakan sebagai data pelatihan tambahan untuk model lain. Teknik ini menjadi semakin penting seiring kekhawatiran bahwa data teks berkualitas tinggi yang tersedia secara alami di internet mulai mendekati titik kehabisan (data scarcity) untuk kebutuhan pelatihan model-model raksasa terbaru.
Synthetic data juga sangat berguna untuk domain-domain di mana data nyata sangat terbatas atau sensitif, seperti data medis pasien (di mana privasi menjadi perhatian utama), skenario kecelakaan mobil otonom yang jarang terjadi namun penting untuk dipelajari, atau data keuangan sensitif yang tidak dapat dibagikan secara bebas karena regulasi.
Keunggulan data sintetis mencakup kemampuan menghasilkan data dalam jumlah besar dengan biaya relatif rendah, kontrol penuh atas karakteristik dan distribusi data yang dihasilkan, serta terhindarnya masalah privasi karena tidak melibatkan data individu nyata. Namun, risiko utamanya adalah data sintetis dapat mewarisi atau bahkan memperkuat bias dan kesalahan dari model yang menghasilkannya—fenomena yang dalam kasus ekstrem disebut sebagai "model collapse", di mana kualitas model terus menurun jika terlalu banyak dilatih dari data yang dihasilkan modelnya sendiri secara berulang tanpa pengawasan kualitas yang memadai.
