Kamus AI

Vision-Language Model (VLM)

Model AI yang dilatih untuk memahami dan menghubungkan informasi visual (gambar) dengan bahasa teks sekaligus, memungkinkan tugas seperti menjawab pertanyaan tentang isi gambar.

Vision-Language Model (VLM) adalah jenis model AI yang dilatih untuk memahami dan menghubungkan informasi visual (gambar) dengan bahasa teks secara bersamaan. Model ini mampu "melihat" sebuah gambar dan "memahaminya" dalam konteks bahasa manusia, memungkinkan berbagai tugas seperti mendeskripsikan isi gambar, menjawab pertanyaan tentang gambar, atau mencari gambar berdasarkan deskripsi teks.

Secara arsitektural, VLM umumnya menggabungkan dua komponen utama: sebuah encoder visual yang mengubah gambar menjadi representasi numerik (embedding), dan sebuah model bahasa yang memproses representasi tersebut bersama dengan teks. Model seperti CLIP dari OpenAI menjadi salah satu VLM paling berpengaruh, karena mempelajari hubungan antara gambar dan teks dari jutaan pasangan gambar-caption di internet.

VLM adalah komponen inti di balik kemampuan "melihat gambar" pada asisten AI multimodal modern seperti GPT-4o, Gemini, dan Claude. Dengan kemampuan ini, pengguna dapat mengunggah foto—misalnya foto struk belanja, diagram, tangkapan layar kode, atau bahkan gambar makanan—dan meminta AI menjelaskan, menganalisis, atau mengambil tindakan berdasarkan isi gambar tersebut.

Aplikasi praktis VLM sangat luas: mulai dari alat bantu aksesibilitas bagi penyandang tunanetra yang mendeskripsikan lingkungan sekitar, sistem moderasi konten yang mendeteksi gambar bermasalah, hingga asisten belanja yang dapat mencari produk serupa hanya dari foto. Dalam bidang robotika, VLM juga menjadi fondasi bagi robot yang perlu memahami lingkungan visual sekaligus menerima instruksi dalam bahasa alami.

Tantangan utama VLM termasuk memastikan model tidak "berhalusinasi" saat mendeskripsikan detail gambar yang sebenarnya tidak ada, serta menangani gambar dengan kualitas rendah, sudut pandang tidak lazim, atau konten visual yang ambigu secara akurat.

Jelajahi Kamus AI