Kural yazmak ile örnekten öğrenmek arasındaki fark
Bir bilgisayara e-postaların spam olup olmadığını ayırt etmeyi öğretmek istediğinizi düşünün. İki yol var:
- Kural yazmak: "İçinde 'bedava', 'kazandınız' ya da çok sayıda ünlem varsa spam say." Bu yöntem basit durumlarda çalışır ama spam gönderenler kelimeleri değiştirdiği anda kurallar yetersiz kalır. Her yeni hileye yeni kural yazmanız gerekir.
- Örnekten öğrenmek: Bilgisayara, "spam" ve "normal" diye işaretlenmiş on binlerce e-posta verirsiniz. Sistem hangi özelliklerin spam ile birlikte görüldüğünü kendisi çıkarır; siz hiç düşünmediğiniz ipuçlarını bile yakalayabilir.
Bugün "yapay zekâ" dediğimiz sistemlerin büyük çoğunluğu ikinci yolu, yani makine öğrenmesini kullanır. Kural tabanlı sistemler hâlâ var ve pek çok yerde öğrenen modellerle birlikte çalışıyor; ama son yıllardaki büyük sıçramanın kaynağı örnekten öğrenme yaklaşımıdır.
Dört adımda yapay zekânın yaşam döngüsü
1. Veri toplama ve hazırlama
Her şey veriyle başlar. Bir görüntü tanıma sistemi için etiketli fotoğraflar, bir dil modeli için kitaplar, makaleler ve web sayfaları gibi çok büyük metin koleksiyonları gerekir. Veri temizlenir, hatalı ve tekrar eden örnekler ayıklanır. Verinin kalitesi, modelin kalitesini doğrudan belirler. Eksik ya da tek taraflı veriyle eğitilen model, aynı eksikliği ve önyargıyı taşır.
2. Model seçimi
Model, verideki örüntüleri temsil edecek matematiksel yapıdır. Basit bir tahmin için birkaç ayarı olan küçük bir model yeterliyken, dil anlamak gibi karmaşık işler için milyarlarca ayarlanabilir sayıdan (parametreden) oluşan dev modeller kullanılır.
3. Eğitim
Eğitim, modelin deneme-yanılma yoluyla öğrendiği aşamadır:
- Model bir örneğe bakar ve bir tahmin yapar ("Bu fotoğrafta kedi var").
- Tahmin, doğru cevapla karşılaştırılır ve hatanın büyüklüğü ölçülür.
- Model, hatayı azaltacak yönde parametrelerini çok az değiştirir.
- Bu işlem milyonlarca örnek üzerinde, defalarca tekrarlanır.
Büyük modellerin eğitimi, binlerce özel işlemcide haftalarca sürebilir ve çok yüksek maliyet gerektirir. Bu yüzden en büyük modelleri yalnızca birkaç büyük şirket ve araştırma kurumu eğitebilmektedir.
4. Çıkarım (kullanım)
Eğitimi biten model artık kullanıma hazırdır. Ona yeni bir girdi verdiğinizde, öğrendiği örüntüleri kullanarak bir çıktı üretir. Buna çıkarım denir. Telefonunuzun yüzünüzü tanıması ya da ChatGPT'nin sorunuza cevap vermesi çıkarım anıdır. Önemli nokta: Model, siz onu kullanırken genellikle öğrenmeye devam etmez; eğitimde ne öğrendiyse onu uygular.
Makine öğrenmesinin üç temel türü
| Tür | Nasıl öğrenir? | Örnek |
|---|---|---|
| Denetimli öğrenme | Doğru cevabı işaretlenmiş örneklerden öğrenir. | "Spam / normal" etiketli e-postalarla spam filtresi; fiyatı bilinen evlerle ev fiyatı tahmini. |
| Denetimsiz öğrenme | Etiket olmadan, verideki benzerlikleri ve grupları kendisi bulur. | Müşterileri alışveriş alışkanlıklarına göre gruplara ayırmak. |
| Pekiştirmeli öğrenme | Bir ortamda deneme yapar; iyi sonuçlar için ödül, kötü sonuçlar için ceza alarak strateji geliştirir. | Oyun oynayan yapay zekâlar, robot kontrolü, sohbet asistanlarının insan geri bildirimiyle iyileştirilmesi. |
Gerçek sistemler bu türleri çoğu zaman birlikte kullanır. Örneğin bugünkü sohbet asistanları önce büyük miktarda metinle eğitilir, ardından insanların değerlendirmeleriyle (RLHF) daha yardımcı ve güvenli cevaplar verecek şekilde ince ayar yapılır.
Yapay sinir ağları ve derin öğrenme
Bugünkü güçlü yapay zekâ sistemlerinin çoğu yapay sinir ağlarıyla çalışır. Adı beyinden esinlenmiş olsa da, gerçek bir beyinle birebir benzerliği yoktur; aslında art arda bağlanmış çok sayıda basit matematik işleminden oluşur.
Bir sinir ağını, üst üste dizilmiş filtre katmanları gibi düşünebilirsiniz. Bir fotoğraf tanıma ağında:
- İlk katmanlar kenar ve renk geçişleri gibi basit özellikleri yakalar,
- Orta katmanlar bunları birleştirip göz, kulak, tekerlek gibi parçaları tanır,
- Son katmanlar bu parçalardan "kedi", "araba" gibi sonuca ulaşır.
Katman sayısı arttıkça ağ daha karmaşık örüntüleri öğrenebilir. Çok katmanlı bu ağlarla yapılan öğrenmeye derin öğrenme denir. Derin öğrenme; yeterli veri, güçlü grafik işlemciler ve yeni yöntemler bir araya geldiğinde, 2010'ların başından itibaren görüntü tanıma, ses tanıma ve çeviride büyük bir sıçrama yarattı.
ChatGPT bir soruya nasıl cevap verir?
ChatGPT, Gemini ve Claude gibi sohbet asistanlarının arkasında büyük dil modelleri (LLM) vardır. Bir soru yazdığınızda arka planda kabaca şunlar olur:
- Metin parçalara ayrılır: Yazdığınız metin, token denen küçük parçalara bölünür. Bir token bir kelime, bir hece ya da bir noktalama işareti olabilir.
- Bağlam okunur: Model sorunuzu, varsa önceki mesajlarınızı ve gizli sistem talimatlarını birlikte değerlendirir. Aynı anda dikkate alabildiği metin miktarına bağlam penceresi denir.
- Bir sonraki parça tahmin edilir: Model, eğitimde gördüğü milyarlarca metinden öğrendiği örüntülere dayanarak "bu bağlamda sıradaki en uygun token hangisi?" sorusuna olasılıklar hesaplar ve birini seçer.
- Tekrar edilir: Seçilen parça cevaba eklenir ve işlem, cevap tamamlanana kadar parça parça sürer. Ekranda cevabın yavaş yavaş belirmesinin sebebi budur.
Önemli: Dil modeli bir bilgi bankasından cevap "aramaz"; en olası metni üretir. Bu yüzden çok akıcı ve ikna edici yazar, ama bu akıcılık cevabın doğru olduğunu garanti etmez. Güncel bilgi gerektiren sorularda birçok asistan ayrıca web araması yapar ve kaynak gösterir.
Dil modellerinin nasıl eğitildiğini ve token, bağlam penceresi gibi kavramları ayrıntılı anlattık: Büyük dil modeli (LLM) nedir?
Yapay zekâ neden hata yapar?
Çalışma mantığını bilince, hataların nereden geldiğini anlamak da kolaylaşır:
- Halüsinasyon: Model "doğru" olanı değil "olası" olanı üretir. Bilmediği bir konuda bile kulağa mantıklı gelen ama gerçekte olmayan bir kaynak, rakam ya da olay uydurabilir. Buna halüsinasyon denir.
- Veri önyargısı: Eğitim verisinde bazı gruplar az ya da tek taraflı temsil edildiyse, model de o önyargıyı tekrarlayabilir (önyargı).
- Eski bilgi: Model, eğitim verisinin toplandığı tarihten sonraki olayları kendiliğinden bilmez.
- Eksik bağlam: Sorunuz belirsizse model boşlukları kendi tahminiyle doldurur. Ne istediğinizi ne kadar net anlatırsanız hata o kadar azalır.
- Beklenmedik durumlar: Eğitimde hiç benzerini görmediği girdilerle karşılaşan model güvenilmez sonuç verebilir.
Bu yüzden yapay zekâyı bir yardımcı olarak kullanmak ve önemli bilgileri başka kaynaklardan doğrulamak en sağlıklı yaklaşımdır.
Özetle
- Yapay zekânın çoğu kuralları ezberlemez; çok sayıda örnekten öğrenir (makine öğrenmesi).
- Yaşam döngüsü: veri → model → eğitim → çıkarım (kullanım).
- Denetimli, denetimsiz ve pekiştirmeli öğrenme üç temel öğrenme biçimidir.
- Derin öğrenme, çok katmanlı yapay sinir ağlarıyla çalışır ve bugünkü atılımların temelidir.
- ChatGPT gibi dil modelleri cevabı parça parça tahmin ederek üretir; bu yüzden akıcıdırlar ama yanılabilirler.
Sık sorulan sorular
Yapay zekâ kendi kendine öğrenir mi?
Eğitim sırasında örneklerden öğrenir; ama bu süreci insanlar tasarlar, veriyi insanlar seçer ve sonuçları insanlar değerlendirir. Kullanım sırasında ise çoğu model öğrenmeye devam etmez; eğitimde ne öğrendiyse onu uygular.
ChatGPT benimle konuştukça öğreniyor mu?
Konuşma sırasında aynı sohbetteki bilgileri dikkate alır, ama modelin kendisi o anda değişmez. Bazı hizmetler, izin verdiğiniz takdirde sohbetleri ileride modelleri geliştirmek için kullanabilir; bu ayarı hizmetin gizlilik ayarlarından kapatabilirsiniz.
Yapay zekâ internete bağlı mı?
Modelin kendisi eğitim verisindeki bilgiyle çalışır. Bazı sohbet asistanları ayrıca web araması yapabilir; bu durumda güncel bilgiyi arama sonuçlarından alır ve genellikle kaynak gösterir.
Yapay zekâ eğitmek için ne kadar veri gerekir?
İşe göre çok değişir. Basit bir sınıflandırma birkaç bin örnekle yapılabilirken, büyük dil modelleri çok büyük metin koleksiyonlarıyla eğitilir. Hazır bir modeli kendi işinize uyarlamak (ince ayar) ise çok daha az veriyle mümkündür.
Sinir ağları beyin gibi mi çalışır?
Adı ve genel fikri beyinden esinlenmiştir, ama işleyişi gerçek bir beyinden çok farklıdır. Yapay sinir ağları, art arda bağlanmış matematiksel işlemlerden oluşan bir hesaplama yöntemidir.