Temel Bilgiler · 7/15 Başlangıç

Büyük Dil Modeli (LLM) Nedir?

ChatGPT, Gemini ve Claude'un arkasındaki teknoloji: büyük dil modelleri. Nasıl eğitildiklerini, token ve bağlam penceresi gibi kavramların ne anlama geldiğini ve neden bazen yanıldıklarını anlatıyoruz.

YZ Merkezi Editör Ekibi Son güncelleme: 10 dk okuma
Tüm temel bilgiler

Büyük dil modeli ne demek?

Büyük dil modeli (İngilizce Large Language Model, kısaca LLM), insan dilini anlamak ve üretmek için eğitilmiş bir derin öğrenme modelidir. Adındaki üç kelime onu iyi özetler:

  • Büyük: Milyarlarca ayarlanabilir sayıdan (parametreden) oluşur ve çok büyük metin koleksiyonlarıyla eğitilir.
  • Dil: Kelimeler, cümleler ve metinler arasındaki ilişkileri öğrenir; kod da bir dil gibi ele alınır.
  • Model: Öğrendiklerini sayısal bir yapıda saklayan ve yeni girdilere cevap üreten matematiksel sistemdir.

Bugün en çok bilinen örnekleri ChatGPT'nin arkasındaki GPT modelleri, Google'ın Gemini modelleri ve Anthropic'in Claude modelleridir. Meta'nın Llama'sı ve Mistral gibi ağırlıkları açık paylaşılan modeller de yaygın olarak kullanılır.

Bir LLM nasıl eğitilir?

Bugünkü sohbet asistanlarının arkasındaki modeller genellikle üç aşamadan geçer:

  1. Ön eğitim (pre-training): Model; kitaplar, makaleler, web sayfaları ve kod gibi çok büyük bir metin koleksiyonu üzerinde "sıradaki kelime parçası ne olmalı?" tahminini milyarlarca kez yapar. Bu sırada dilbilgisini, kelimelerin anlam ilişkilerini ve metinlerde geçen bilgileri örüntü olarak öğrenir. Ortaya çıkan modele temel model denir.
  2. Talimatla ince ayar: Temel model metni sürdürmeyi bilir ama soruları cevaplamayı bilmez. İnsanların hazırladığı soru-cevap ve talimat örnekleriyle ek eğitim yapılır (talimat ayarı).
  3. İnsan geri bildirimiyle iyileştirme: İnsanlar modelin farklı cevaplarını karşılaştırıp daha yardımcı, doğru ve güvenli olanları işaretler; model bu tercihlere göre ayarlanır (RLHF ve benzeri yöntemler).

Bu süreç, çok sayıda özel işlemci ve yüksek maliyet gerektirir. Bu yüzden en büyük modelleri yalnızca birkaç büyük şirket ve araştırma kurumu sıfırdan eğitebilir; diğerleri çoğunlukla hazır modelleri kendi işlerine uyarlar (ince ayar).

Bilmeniz gereken dört kavram

KavramNe demek?Neden önemli?
TokenModelin metni böldüğü küçük parçalar: bir kelime, hece ya da noktalama işareti.Kullanım sınırları ve ücretler genellikle token sayısıyla ölçülür. Türkçe gibi eklemeli dillerde bir kelime birden fazla token olabilir.
Bağlam penceresiModelin aynı anda dikkate alabildiği toplam metin miktarı.Uzun belgeler ve uzun sohbetlerde, pencereyi aşan kısımlar dikkate alınmaz.
ParametreModelin eğitimde ayarlanan iç sayıları.Genellikle daha fazla parametre daha yetenekli ama daha pahalı ve yavaş model demektir.
Sıcaklık (temperature)Cevaptaki rastlantısallığı belirleyen ayar.Düşük değer daha tutarlı, yüksek değer daha yaratıcı ve çeşitli cevaplar verir.

Bugünkü LLM'lerin neredeyse tamamı 2017'de tanıtılan Transformer mimarisine dayanır. Bu mimarinin dikkat mekanizması, modelin bir kelimeyi yorumlarken metindeki diğer tüm kelimelerle ilişkisini hesaba katmasını sağlar.

LLM'ler neler yapabilir?

  • Metin yazmak, özetlemek, yeniden düzenlemek ve üslup değiştirmek
  • Diller arasında çeviri yapmak
  • Soruları cevaplamak ve konuları farklı seviyelerde açıklamak
  • Kod yazmak, açıklamak ve hata ayıklamak
  • Belgelerden bilgi çıkarmak, tablolara dönüştürmek
  • Araçlarla birlikte çalışarak web'de arama yapmak, hesaplama yapmak ya da işlemleri adım adım yürütmek (yapay zekâ ajanları)

Yeni nesil modellerin çoğu yalnızca metinle değil, görsel, ses ve belgelerle de çalışabilir (çok modlu modeller). Pratik kullanım için Yapay zekâ nasıl kullanılır? yazımıza bakabilirsiniz.

Sınırları ve dikkat edilmesi gerekenler

  • Halüsinasyon: Model "doğru" olanı değil "olası" olanı üretir. Olmayan kaynaklar, yanlış tarihler ya da uydurma alıntılar üretebilir (halüsinasyon).
  • Bilgi kesim tarihi: Model eğitim verisinin toplandığı tarihten sonrasını kendiliğinden bilmez. Güncel bilgi için web araması yapan asistanlar ya da RAG gibi yöntemler kullanılır.
  • Hesaplama ve mantık hataları: Uzun hesaplarda ve çok adımlı mantık sorularında hata yapabilir.
  • Önyargı: Eğitim verisindeki önyargıları yansıtabilir.
  • Güvenlik: Kötü niyetli talimatlarla yönlendirilmeye çalışılabilir (prompt enjeksiyonu).

Şirket belgeleriyle doğru ve kaynaklı cevap veren sistemlerin nasıl kurulduğunu merak ediyorsanız blogdaki RAG yazımıza göz atabilirsiniz.

Açık ve kapalı modeller

  • Kapalı (tescilli) modeller: Yalnızca geliştiren şirketin uygulaması ya da API'si üzerinden kullanılabilir. GPT, Gemini ve Claude modelleri bu gruptadır. Kurulum gerektirmez, genellikle en güçlü seçeneklerdir.
  • Açık ağırlıklı modeller: Model dosyaları paylaşılır; kendi bilgisayarınızda ya da sunucunuzda çalıştırabilir, kendi verinizle uyarlayabilirsiniz. Llama, Mistral ve benzerleri bu gruptadır ve Hugging Face gibi platformlarda bulunur.

Açık modeller veri gizliliği ve maliyet kontrolü açısından avantaj sağlar; ancak kurulum, donanım ve güvenlik sorumluluğu kullanana aittir.

Özetle

  • LLM, çok büyük metin verisiyle eğitilmiş ve dili anlayıp üretebilen bir derin öğrenme modelidir.
  • Ön eğitim, talimatla ince ayar ve insan geri bildirimiyle iyileştirme aşamalarından geçer.
  • Token, bağlam penceresi, parametre ve sıcaklık, LLM'leri anlamak için temel kavramlardır.
  • Metin, çeviri, kod ve belge işlerinde güçlüdür; halüsinasyon ve güncel bilgi eksikliği en önemli sınırlarıdır.
  • Kapalı modeller uygulama veya API ile, açık ağırlıklı modeller kendi sunucunuzda kullanılabilir.

Sık sorulan sorular

LLM ile ChatGPT aynı şey mi?

Tam olarak değil. LLM, arkadaki dil modelidir; ChatGPT ise bu modeller üzerine kurulmuş, sohbet arayüzü, web araması ve dosya yükleme gibi özellikleri olan bir üründür. Gemini ve Claude için de aynı ayrım geçerlidir.

LLM'ler Türkçe biliyor mu?

Evet. Büyük modellerin çoğu Türkçe dahil pek çok dilde eğitilmiştir ve Türkçe soruları anlayıp Türkçe cevap verebilir. Yine de eğitim verisinde İngilizce daha fazla olduğu için bazı konularda Türkçe cevaplar daha az ayrıntılı olabilir.

Token nedir, neden önemli?

Token, modelin metni böldüğü küçük parçalardır. Modellerin ne kadar metin okuyup yazabileceği ve API kullanım ücretleri token sayısıyla ölçülür. Türkçe eklemeli bir dil olduğu için aynı içerik İngilizceye göre daha fazla token tutabilir.

Kendi bilgisayarımda LLM çalıştırabilir miyim?

Evet, açık ağırlıklı küçük ve orta boy modelleri güçlü bir bilgisayarda çalıştırmak mümkündür. En büyük ve en yetenekli modeller ise genellikle yalnızca bulut hizmetleri üzerinden kullanılabilir.

Kaynaklar

  1. Vaswani ve diğerleri (2017), "Attention Is All You Need" (Transformer mimarisi)