Yapay zekâ sözlüğü
İleri düzey
Görsel Soru Yanıtlama (VQA)
Visual Question Answering (VQA)
29.08.2026 tarihinde güncellendi
Görsel içerikleri anlayarak onlar hakkında doğal dil sorularını yanıtlayan çok modlu yapay zeka görevidir.
Genel bakış
Kavramın çerçevesiGörsel soru yanıtlama, görüntüdeki nesne, metin, konum, renk ve ilişkileri soruyla birlikte yorumlar. Model hem görsel temsil hem de dil bağlamını kullanarak kısa yanıt, açıklama veya JSON alanları üretebilir. Soru türü, görsel çözünürlüğü, kültürel bağlam ve modelin görsel akıl yürütme yeteneği doğruluğu etkiler.
Çalışma mantığı: Görsel bir kodlayıcıyla temsil edilir, soru dil modeliyle işlenir ve iki temsil ortak bağlamda birleştirilerek yanıt üretilir.
Kullanım alanları: Erişilebilirlik, belge analizi, eğitim, kalite kontrol ve görsel arama deneyiminde kullanılır.
Sınırlılıklar: Küçük ayrıntılar, sayma, mekânsal ilişkiler ve belirsiz görüntülerde halüsinasyon görülebilir; kritik kararlar doğrulanmalıdır.
Çalışma mantığı: Görsel bir kodlayıcıyla temsil edilir, soru dil modeliyle işlenir ve iki temsil ortak bağlamda birleştirilerek yanıt üretilir.
Kullanım alanları: Erişilebilirlik, belge analizi, eğitim, kalite kontrol ve görsel arama deneyiminde kullanılır.
Sınırlılıklar: Küçük ayrıntılar, sayma, mekânsal ilişkiler ve belirsiz görüntülerde halüsinasyon görülebilir; kritik kararlar doğrulanmalıdır.
Teknik tanım ve açıklama
Temel mekanizmaBir görseli analiz edip kullanıcı sorusuna metin veya yapılandırılmış cevap veren çok modlu yapay zeka görevidir.
Gerçek hayatta kullanım
Örnek senaryoFotoğrafta kaç sandalye var sorusuna sistem üç sandalye yanıtını verir; görüntüdeki küçük veya belirsiz nesneler için güven seviyesi ayrıca raporlanır.