Yapay zekâ sözlüğü İleri düzey

Vision Transformer (ViT)

Vision Transformer (ViT)

28.08.2026 tarihinde güncellendi

Vision Transformer, görüntüyü küçük parçalara ayırıp bu parçalar arasındaki ilişkileri Transformer mimarisiyle öğrenen görsel modeldir.

Genel bakış

Kavramın çerçevesi
Vision Transformer görüntüyü sabit boyutlu patch adı verilen parçalara böler ve bu parçaları bir token dizisi gibi Transformer katmanlarına verir. Self-attention, görüntünün uzak bölgeleri arasındaki ilişkileri öğrenebilir. Yeterli veri ve hesaplama bulunduğunda güçlü sonuçlar verir; küçük veri kümelerinde önceden eğitim ve transfer learning önemlidir. Görüntü çözünürlüğü, patch boyutu ve konum bilgisi modelin ayrıntı yakalama gücünü belirler.

Çalışma mantığı: Görüntü patchlere bölünür, her patch token gibi kodlanır ve positional bilgiyle Transformer katmanlarına gönderilir. Self-attention uzak görsel bölgeler arasındaki bağı öğrenirken başlık görev çıktısını üretir.

Kullanım alanları: Görsel sınıflandırma, transfer learning, tıbbi görüntü araştırması ve büyük görsel veri kümelerinde kullanılır.

Sınırlılıklar: Yeterli ön eğitim ve veri olmadan geleneksel CNNlere göre zorlanabilir; çözünürlük, patch boyutu ve donanım maliyeti birlikte değerlendirilmelidir.

Teknik tanım ve açıklama

Temel mekanizma
Transformer mimarisini görüntü tanıma görevlerine uygulayan bir modeldir. Görüntüyü küçük parçalara bölerek işler.

Gerçek hayatta kullanım

Örnek senaryo
ViT, görüntüyü küçük parçalara ayırıp bu parçaların ilişkilerini transformer katmanlarıyla modelleyebilir. Editoryal bir uygulamada bu kavramı kullanırken önce hedefi ve başarı ölçütünü yazın, ardından küçük bir örnek üzerinde sonucu kontrol edip üretime almadan önce insan doğrulaması yapın.