Yapay zekâ sözlüğü
Orta seviye
Görselden Metne (Image-to-Text)
Image-to-Text
29.08.2026 tarihinde güncellendi
Görselleri analiz ederek açıklama, altyazı veya metin çıktısı üreten yapay zeka görevidir.
Genel bakış
Kavramın çerçevesiGörselden metne sistemleri bir görüntünün içeriğini insanın okuyabileceği açıklamaya dönüştürür. Görsel altyazı, ürün açıklaması, erişilebilirlik metni ve belge metni çıkarımı farklı çıktı biçimleridir. Nesne tanıma, sahne ilişkileri, OCR ve dil üretimi birlikte kullanılabilir; açıklamanın gözlemlenebilir bilgiyle sınırlı kalması gerekir.
Çalışma mantığı: Görsel kodlayıcı içerik temsili çıkarır, dil modeli bu temsilden açıklama veya yapılandırılmış alanlar üretir.
Kullanım alanları: Erişilebilirlik, katalog, medya arşivi, sosyal medya ve belge işleme süreçlerinde kullanılır.
Sınırlılıklar: Görselde olmayan ayrıntılar eklenebilir; kişisel veri ve hassas özellikler için filtreleme ve insan incelemesi gerekir.
Çalışma mantığı: Görsel kodlayıcı içerik temsili çıkarır, dil modeli bu temsilden açıklama veya yapılandırılmış alanlar üretir.
Kullanım alanları: Erişilebilirlik, katalog, medya arşivi, sosyal medya ve belge işleme süreçlerinde kullanılır.
Sınırlılıklar: Görselde olmayan ayrıntılar eklenebilir; kişisel veri ve hassas özellikler için filtreleme ve insan incelemesi gerekir.
Teknik tanım ve açıklama
Temel mekanizmaBir görseldeki nesneleri, sahneyi veya yazıları analiz ederek açıklayıcı doğal dil metni oluşturan yapay zeka görevidir.
Gerçek hayatta kullanım
Örnek senaryoBir ürün fotoğrafı için erişilebilirlik açıklaması üretilir: Krem renkli seramik kupa, ahşap masa üzerinde, yumuşak gün ışığı altında duruyor.