Dataset adalah kumpulan data terstruktur yang digunakan sebagai bahan baku untuk melatih, menguji, atau mengevaluasi model AI. Dataset dapat berisi berbagai jenis data tergantung pada tugas model yang akan dibangun—mulai dari teks, gambar, audio, video, hingga data numerik terstruktur seperti data transaksi atau sensor.
Dalam siklus pengembangan model AI, dataset umumnya dibagi menjadi tiga bagian dengan fungsi berbeda. Training set adalah bagian terbesar yang digunakan untuk melatih model mempelajari pola. Validation set digunakan selama proses pelatihan untuk menyetel parameter model dan mendeteksi tanda-tanda overfitting. Test set adalah data yang benar-benar terpisah dan belum pernah dilihat model, digunakan untuk mengevaluasi performa akhir model secara objektif setelah pelatihan selesai.
Kualitas dataset menjadi salah satu faktor paling menentukan kualitas akhir sebuah model AI—sering diringkas dalam prinsip "garbage in, garbage out" (data buruk menghasilkan model buruk). Dataset yang baik harus memiliki volume yang cukup, keragaman yang merepresentasikan skenario dunia nyata secara memadai, label yang akurat (untuk data berlabel), serta bebas dari bias sistematis yang dapat menyebabkan model berperilaku tidak adil terhadap kelompok tertentu.
Untuk model bahasa besar, dataset pelatihan biasanya terdiri dari kumpulan teks dalam skala masif yang dikumpulkan dari internet, buku, artikel, dan berbagai sumber tertulis lainnya, mencapai triliunan token. Proses menyusun dataset berkualitas tinggi—termasuk membersihkan data dari duplikasi, konten berbahaya, dan informasi yang tidak akurat—menjadi salah satu tahap paling memakan waktu dan sumber daya dalam pengembangan model AI, sering kali melibatkan tim khusus yang berfokus pada kurasi dan pembersihan data (data curation) sebelum proses pelatihan sesungguhnya dimulai.
