Yapay zekâ sözlüğü
İleri düzey
CLIP (Contrastive Language-Image Pre-training)
Contrastive Language–Image Pre-training (CLIP)
28.08.2026 tarihinde güncellendi
CLIP, görseller ile metinleri ortak bir vektör uzayında eşleştirerek görsel arama ve sınıflandırma yapılmasını sağlayan çok modlu modeldir.
Genel bakış
Kavramın çerçevesiCLIP, görsel ve metin çiftleriyle eğitilerek aynı kavramı anlatan görüntü ile ifadeyi ortak bir temsil uzayında yakınlaştırır. Bu sayede her görev için ayrı etiketli sınıflandırma modeli eğitmeden metinle görsel arama veya sıfır örnekli sınıflandırma yapılabilir. Modelin başarısı eğitim verisindeki kavram ve kültür kapsamına bağlıdır. Önyargılı veya düşük kaliteli görsel-metin eşleşmeleri, arama ve sınıflandırma sonuçlarına yansıyabilir.
Çalışma mantığı: CLIP, görsel kodlayıcı ile metin kodlayıcının çıktısını ortak uzayda karşılaştırır; eşleşen çiftleri yakınlaştıran kontrastif kayıpla eğitilir. Sorgu metni doğrudan sınıf adı veya doğal açıklama olabilir.
Kullanım alanları: Metinle görsel arama, sıfır örnekli sınıflandırma, içerik etiketleme ve görsel veri kümelerini filtrelemede kullanılır.
Sınırlılıklar: Eğitim kapsamı dışında kalan kültür, dil veya nesnelerde performans düşebilir; benzerlik skoru güvenlik veya anlam doğruluğu olarak yorumlanmamalıdır.
Çalışma mantığı: CLIP, görsel kodlayıcı ile metin kodlayıcının çıktısını ortak uzayda karşılaştırır; eşleşen çiftleri yakınlaştıran kontrastif kayıpla eğitilir. Sorgu metni doğrudan sınıf adı veya doğal açıklama olabilir.
Kullanım alanları: Metinle görsel arama, sıfır örnekli sınıflandırma, içerik etiketleme ve görsel veri kümelerini filtrelemede kullanılır.
Sınırlılıklar: Eğitim kapsamı dışında kalan kültür, dil veya nesnelerde performans düşebilir; benzerlik skoru güvenlik veya anlam doğruluğu olarak yorumlanmamalıdır.
Teknik tanım ve açıklama
Temel mekanizmaOpenAI tarafından geliştirilen, metin ve görselleri aynı uzayda temsil edebilen çok modlu bir modeldir. Görsel arama ve sınıflandırmada kullanılır.
Gerçek hayatta kullanım
Örnek senaryoCLIP benzeri bir model, görsel ile metin açıklamasını ortak vektör uzayında karşılaştırarak arama yapabilir. Editoryal bir uygulamada bu kavramı kullanırken önce hedefi ve başarı ölçütünü yazın, ardından küçük bir örnek üzerinde sonucu kontrol edip üretime almadan önce insan doğrulaması yapın.