Furkan KapukayaYazılım geliştirme
Yapay Zekâ3 dk okuma

Büyük Dil Modelleri (LLM) Nasıl Çalışır? Token, Bağlam ve Olasılık

ChatGPT, Claude ve Gemini gibi büyük dil modellerinin temel çalışma mantığı; token, sonraki kelime tahmini, eğitim aşamaları, bağlam penceresi, sıcaklık ayarı ve modellerin güçlü ve zayıf yanları.

Büyük dil modelleri (LLM) e-posta yazıyor, kod üretiyor, belge özetliyor. Arkalarındaki mantığı kabaca bilmek, onlardan daha iyi sonuç almanızı ve nerede güvenmemeniz gerektiğini anlamanızı sağlar. Bu yazı, matematiğe girmeden temel fikirleri anlatıyor.

Temel fikir: Sonraki parçayı tahmin etmek

Bir LLM'in en temel becerisi, verilen metnin devamında en olası sonraki parçayı tahmin etmektir. "Türkiye'nin başkenti" ifadesinden sonra "Ankara" gelme olasılığı çok yüksektir. Model, bu tahmini tekrar tekrar yaparak cümleler ve paragraflar üretir. Basit görünen bu işlem, devasa miktarda metinle eğitilmiş milyarlarca parametreli bir sinir ağı tarafından yapıldığında akıl yürütmeye benzeyen yetenekler ortaya çıkar.

Token nedir?

Modeller metni kelime kelime değil, token adı verilen parçalar halinde işler. Bir token bir kelime, kelimenin bir parçası veya bir noktalama işareti olabilir. Türkçe gibi eklemeli dillerde bir kelime genellikle birkaç token'a bölünür. Token kavramı önemlidir çünkü:

  • Modelin okuyabileceği metin miktarı token ile ölçülür.
  • API ücretleri token üzerinden hesaplanır. Bkz. yapay zekâ maliyetleri.

Eğitim aşamaları

  1. Ön eğitim: Model, çok büyük metin koleksiyonları üzerinde sonraki token'ı tahmin etmeyi öğrenir. Dil bilgisi, genel bilgi ve kalıplar bu aşamada oluşur.
  2. İnce ayar: Talimatlara uyması, soru-cevap formatında yardımcı olması için örneklerle eğitilir.
  3. Geri bildirimle iyileştirme: İnsan ve yapay zekâ değerlendirmeleriyle daha faydalı, doğru ve güvenli cevaplar vermesi teşvik edilir.

Bağlam penceresi

Model, bir konuşmada aynı anda belirli miktarda token'ı "görebilir". Buna bağlam penceresi denir. Sohbet geçmişi, eklenen belgeler ve talimatlar bu pencereye sığmalıdır. Model kalıcı bir hafızaya sahip değildir; her istekte pencere içindeki metne bakarak cevap üretir. Kendi belgelerinizi kullanmak için bu sınır, RAG gibi yöntemlerin doğmasının nedenlerinden biridir.

Sıcaklık (temperature)

Model her adımda olası token'lar arasından seçim yapar. Düşük sıcaklık en olası seçeneklere yönelir ve daha tutarlı cevaplar verir; yüksek sıcaklık çeşitliliği ve yaratıcılığı artırır. Veri çıkarma gibi işlerde düşük, beyin fırtınasında daha yüksek değerler uygundur.

Güçlü ve zayıf yanlar

GüçlüZayıf
Metin üretme, özetleme, çeviriKesin olmayan bilgiyi kendinden emin anlatabilir
Kod yazma ve açıklamaEğitim tarihinden sonraki gelişmeleri bilmeyebilir
Yapılandırılmamış metinden veri çıkarmaTutarlılık için doğru yönlendirme ister
Doğal dille arayüzHesaplama ve kesin sayma işlerinde araç desteği gerekir

Modelin akıcı ama yanlış bilgi üretmesine halüsinasyon denir; nedenleri ve azaltma yolları için bkz. yapay zekâ halüsinasyonu.

Araç kullanımı ve ajanlar

Modern modeller yalnızca metin üretmekle kalmaz; arama yapma, hesap makinesi veya veritabanı sorgusu gibi araçları çağırabilir. Bu yetenek, birden çok adımı kendi planlayan yapay zekâ ajanlarının temelidir.

Sık sorulan sorular

Model internetten anlık bilgi alıyor mu?

Model kendi başına almaz; ancak arama aracına bağlanmışsa güncel bilgiyi çekip cevabına ekleyebilir.

Model verdiğim bilgileri öğrenir mi?

Konuşma sırasında bağlam penceresinde kullanır; kalıcı öğrenme ise sağlayıcının veri politikalarına bağlıdır. Kurumsal kullanımda bu ayarlar kontrol edilmelidir. Bkz. yapay zekâ ve KVKK.

Sonuç

LLM'ler, büyük ölçekte eğitilmiş olasılık makineleridir. Token, bağlam ve olasılık kavramlarını bilmek; onları doğru işte kullanmanızı, maliyeti kontrol etmenizi ve çıktılarını doğru şekilde doğrulamanızı sağlar.