Yapay zekâ sözlüğü
İleri düzey
Vision Transformer (ViT)
Vision Transformer (ViT)
28.08.2026 tarihinde güncellendi
Vision Transformer, görüntüyü küçük parçalara ayırıp bu parçalar arasındaki ilişkileri Transformer mimarisiyle öğrenen görsel modeldir.
Genel bakış
Kavramın çerçevesiVision Transformer görüntüyü sabit boyutlu patch adı verilen parçalara böler ve bu parçaları bir token dizisi gibi Transformer katmanlarına verir. Self-attention, görüntünün uzak bölgeleri arasındaki ilişkileri öğrenebilir. Yeterli veri ve hesaplama bulunduğunda güçlü sonuçlar verir; küçük veri kümelerinde önceden eğitim ve transfer learning önemlidir. Görüntü çözünürlüğü, patch boyutu ve konum bilgisi modelin ayrıntı yakalama gücünü belirler.
Çalışma mantığı: Görüntü patchlere bölünür, her patch token gibi kodlanır ve positional bilgiyle Transformer katmanlarına gönderilir. Self-attention uzak görsel bölgeler arasındaki bağı öğrenirken başlık görev çıktısını üretir.
Kullanım alanları: Görsel sınıflandırma, transfer learning, tıbbi görüntü araştırması ve büyük görsel veri kümelerinde kullanılır.
Sınırlılıklar: Yeterli ön eğitim ve veri olmadan geleneksel CNNlere göre zorlanabilir; çözünürlük, patch boyutu ve donanım maliyeti birlikte değerlendirilmelidir.
Çalışma mantığı: Görüntü patchlere bölünür, her patch token gibi kodlanır ve positional bilgiyle Transformer katmanlarına gönderilir. Self-attention uzak görsel bölgeler arasındaki bağı öğrenirken başlık görev çıktısını üretir.
Kullanım alanları: Görsel sınıflandırma, transfer learning, tıbbi görüntü araştırması ve büyük görsel veri kümelerinde kullanılır.
Sınırlılıklar: Yeterli ön eğitim ve veri olmadan geleneksel CNNlere göre zorlanabilir; çözünürlük, patch boyutu ve donanım maliyeti birlikte değerlendirilmelidir.
Teknik tanım ve açıklama
Temel mekanizmaTransformer mimarisini görüntü tanıma görevlerine uygulayan bir modeldir. Görüntüyü küçük parçalara bölerek işler.
Gerçek hayatta kullanım
Örnek senaryoViT, görüntüyü küçük parçalara ayırıp bu parçaların ilişkilerini transformer katmanlarıyla modelleyebilir. Editoryal bir uygulamada bu kavramı kullanırken önce hedefi ve başarı ölçütünü yazın, ardından küçük bir örnek üzerinde sonucu kontrol edip üretime almadan önce insan doğrulaması yapın.