Yapay zekâ sözlüğü İleri düzey

CLIP (Contrastive Language-Image Pre-training)

Contrastive Language–Image Pre-training (CLIP)

28.08.2026 tarihinde güncellendi

CLIP, görseller ile metinleri ortak bir vektör uzayında eşleştirerek görsel arama ve sınıflandırma yapılmasını sağlayan çok modlu modeldir.

Genel bakış

Kavramın çerçevesi
CLIP, görsel ve metin çiftleriyle eğitilerek aynı kavramı anlatan görüntü ile ifadeyi ortak bir temsil uzayında yakınlaştırır. Bu sayede her görev için ayrı etiketli sınıflandırma modeli eğitmeden metinle görsel arama veya sıfır örnekli sınıflandırma yapılabilir. Modelin başarısı eğitim verisindeki kavram ve kültür kapsamına bağlıdır. Önyargılı veya düşük kaliteli görsel-metin eşleşmeleri, arama ve sınıflandırma sonuçlarına yansıyabilir.

Çalışma mantığı: CLIP, görsel kodlayıcı ile metin kodlayıcının çıktısını ortak uzayda karşılaştırır; eşleşen çiftleri yakınlaştıran kontrastif kayıpla eğitilir. Sorgu metni doğrudan sınıf adı veya doğal açıklama olabilir.

Kullanım alanları: Metinle görsel arama, sıfır örnekli sınıflandırma, içerik etiketleme ve görsel veri kümelerini filtrelemede kullanılır.

Sınırlılıklar: Eğitim kapsamı dışında kalan kültür, dil veya nesnelerde performans düşebilir; benzerlik skoru güvenlik veya anlam doğruluğu olarak yorumlanmamalıdır.

Teknik tanım ve açıklama

Temel mekanizma
OpenAI tarafından geliştirilen, metin ve görselleri aynı uzayda temsil edebilen çok modlu bir modeldir. Görsel arama ve sınıflandırmada kullanılır.

Gerçek hayatta kullanım

Örnek senaryo
CLIP benzeri bir model, görsel ile metin açıklamasını ortak vektör uzayında karşılaştırarak arama yapabilir. Editoryal bir uygulamada bu kavramı kullanırken önce hedefi ve başarı ölçütünü yazın, ardından küçük bir örnek üzerinde sonucu kontrol edip üretime almadan önce insan doğrulaması yapın.