Reklam
Yapay zekâ sözlüğü İleri düzey

Görsel Soru Yanıtlama (VQA)

Visual Question Answering (VQA)

29.08.2026 tarihinde güncellendi

Görsel içerikleri anlayarak onlar hakkında doğal dil sorularını yanıtlayan çok modlu yapay zeka görevidir.

Genel bakış

Kavramın çerçevesi
Görsel soru yanıtlama, görüntüdeki nesne, metin, konum, renk ve ilişkileri soruyla birlikte yorumlar. Model hem görsel temsil hem de dil bağlamını kullanarak kısa yanıt, açıklama veya JSON alanları üretebilir. Soru türü, görsel çözünürlüğü, kültürel bağlam ve modelin görsel akıl yürütme yeteneği doğruluğu etkiler.

Çalışma mantığı: Görsel bir kodlayıcıyla temsil edilir, soru dil modeliyle işlenir ve iki temsil ortak bağlamda birleştirilerek yanıt üretilir.

Kullanım alanları: Erişilebilirlik, belge analizi, eğitim, kalite kontrol ve görsel arama deneyiminde kullanılır.

Sınırlılıklar: Küçük ayrıntılar, sayma, mekânsal ilişkiler ve belirsiz görüntülerde halüsinasyon görülebilir; kritik kararlar doğrulanmalıdır.

Teknik tanım ve açıklama

Temel mekanizma
Bir görseli analiz edip kullanıcı sorusuna metin veya yapılandırılmış cevap veren çok modlu yapay zeka görevidir.

Gerçek hayatta kullanım

Örnek senaryo
Fotoğrafta kaç sandalye var sorusuna sistem üç sandalye yanıtını verir; görüntüdeki küçük veya belirsiz nesneler için güven seviyesi ayrıca raporlanır.