Bloga geri dön
Bir arkadaşınız size "ChatGPT gerçekten düşünüyor mu?" diye sorduğunda ne cevap verirdiniz?
"Evet, bir nevi" mi?
"Hayır, sadece tahmin yapıyor" mu?
Yoksa “Açıklaması zor" mu?
Bu soru göründüğünden çok daha derin bir yere götürüyor bizi. Gelin, LLM’lerin (Büyük Dil Modelleri) dünyasını birlikte inceleyelim.
LLM’ler, temel olarak bir sonraki kelimeyi en yüksek olasılıkla tahmin etmeye çalışan istatistiksel modellerdir.
Model, eğitim sürecinde;
-kelimeler arasındaki ilişkileri
-cümle yapılarını
-kontekst bağımlılıklarını
-dil içindeki istatistiksel örüntüleri öğrenir.
Yani aslında “ezber “ yapmaz, veriden genelleme çıkarır.
Örneğin;
“hava çok…” dediğimizde modelin olası tamamlamaları;
-sıcak, soğuk, güzel, rüzgarlı… olabilir.
Ama cümleyi şöyle değiştirirsek ;
“İstanbul’da Ocak ayında hava çok…”
Bu kez olası cevaplar hemen değişir;
-soğuk, yağmurlu, dondurucu…
Bunun nedeni, modelin eğitim verisinde “İstanbul + Ocak + kış” bağlamını milyonlarca kez görmüş olmasıdır.
Yani model kelimeleri tek tek değil, bağlam ilişkileri üzerinden değerlendirir.
LLM’lerin bugünkü başarısının arkasındaki en kritik yapı Transformer mimarisidir.
2017 yılında Google araştırmacıları tarafından yayımlanan “Attention is All You Need” makalesiyle tanıtılan Transformer mimarisi, yapay zeka tarihinde bir dönüm noktası olarak kabul edilir.
Önceki yaklaşımlarda, RNN, LSTM gibi modeller, metni sıralı şekilde işlerdi. Bu da özellikle uzun metinlerde bilgi kaybına ve “unutmaya” yol açıyordu.
Transformer mimarisi ile birlikte model;
Bu yapıyı mümkün kılan temel mekanizma self-attention’dır. Her kelime, cümledeki diğer kelimelere ne kadar “odaklanması gerektiğini” belirleyen ağırlıklar üretir.
Örneğin;
“Ali dün markete gitti ama o çok yorgundu.”
Burada model: “o” kelimesinin Ali’ye referans verdiğini anlar.
Aynı kelime, farklı bağlam ile:
“Banka” kelimesi
“Bankaya para yatırdım.”
banka = finans kurumu
“Nehir kenarındaki banka oturdum.”
burada banka = oturma yeri
Aynı kelime, bağlama göre farklı anlam kazanır ve model bunu dikkat ağırlıklarını değiştirerek ayırt eder.
Transformer mimarisi birden fazla self-attention katmanından (multi-head attention) oluşur. Her katman metni farklı bir perspektiften (gramer, anlam, bağlam, duygu) analiz eder.
Transformer ,
gibi farklı “bakış açılarıyla” metni analiz eder.
LLM’lerin eğitimi iki ana aşamadan oluşur;
Modelin dili “genel olarak” öğrendiği aşamadır.
Model;
-internet siteleri,
-kitaplar,
-haberler,
-akademik metinler
-kod depoları gibi devasa veri kümeleri üzerinde eğitilir. Bu veri miktarı trilyonlarca kelimeye ulaşabilir.
Bu sayede model:
- dilin yapısını
- kelime ilişkilerini
- yazım stillerini
- bağlamsal örüntüleri
- alanlara ait bilgi kümelerini
istatistiksel olarak öğrenir.
Örneğin: “Python” kelimesi ile “kod”, “import”, “print()” gibi kelimelerin birlikte sık geçtiğini öğrenir.
Ön eğitimden sonra model “ham zeka” gibidir. Genel dili biliyor olsa da, tutarsız veya istenmeyen cevaplar üretebilir.
Bu yüzden ikinci aşama devreye girer:
Fine-tuning:
Model, daha kaliteli ve belirli bir amaca yönelik veri setleriyle yeniden eğitilir.
RLHF (Reinforcement Learning from Human Feedback):
İnsan geri bildirimi ile modelin davranışını şekillendirme. İnsanlar model cevaplarını “iyi / kötü / daha iyi” şeklinde değerlendirir. Model bu geri bildirimlerden öğrenerek daha yardımcı, daha güvenli ve daha doğal yanıtlar üretir.
Model bu süreçte kelimelerin hangi bağlamlarla birlikte kullanıldığı, yüksek boyutlu bir olasılık haritası öğrenir.
ChatGPT’ye “Mavi renk nasıl bir sestir?” gibi ilk bakışta anlamsız görünen bir soru sorduğunuzda bile oldukça tutarlı ve mantıklı bir cevap alabilirsiniz. Cevap çoğu zaman sanki gerçekten “anlamış” gibi görünür.
Model, kelimelerin birlikte hangi bağlamlarda kullanıldığını istatistiksel olarak öğrenir ve bu örüntüden yola çıkarak mantıklı bir çıktı üretir.
LLM’ler (Büyük Dil Modelleri), kelimelerin birlikte hangi bağlamlarda kullanıldığını istatiksel olarak öğrenir bu örüntüden yola çıkarak mantıklı bir çıktı üretir.
LLM’ler bazen çok doğru, bazen de son derece ikna edici ama tamamen hatalı çıktılar üretebilir. Yapay zeka literatüründe buna halüsinasyon denir.
Örneğin model:
-var olmayan bir makaleyi gerçek gibi gösterebilir
-yanlış bir tarihi bilgiyi kesinmiş gibi sunabilir
Bunun temel nedeni, modelin doğruluğu değil, olasılığı optimize ederek bize cevap vermesidir. Bu sistemler, dilin istatistiksel yapısını büyük ölçekli veriden öğrenerek yüksek düzeyde bağlamsal üretim yapabilen modellerdir. Bu durum, modelin temel olarak olasılık temelli üretim yapmasından kaynaklanır.
Yani cevaplar “gerçeklik” üzerinden değil, “en olası dil çıktısı” üzerinden üretilir.
Kaynakça: