Büyük dil modelleri (LLM) e-posta yazıyor, kod üretiyor, belge özetliyor. Arkalarındaki mantığı kabaca bilmek, onlardan daha iyi sonuç almanızı ve nerede güvenmemeniz gerektiğini anlamanızı sağlar. Bu yazı, matematiğe girmeden temel fikirleri anlatıyor.
Temel fikir: Sonraki parçayı tahmin etmek
Bir LLM'in en temel becerisi, verilen metnin devamında en olası sonraki parçayı tahmin etmektir. "Türkiye'nin başkenti" ifadesinden sonra "Ankara" gelme olasılığı çok yüksektir. Model, bu tahmini tekrar tekrar yaparak cümleler ve paragraflar üretir. Basit görünen bu işlem, devasa miktarda metinle eğitilmiş milyarlarca parametreli bir sinir ağı tarafından yapıldığında akıl yürütmeye benzeyen yetenekler ortaya çıkar.
Token nedir?
Modeller metni kelime kelime değil, token adı verilen parçalar halinde işler. Bir token bir kelime, kelimenin bir parçası veya bir noktalama işareti olabilir. Türkçe gibi eklemeli dillerde bir kelime genellikle birkaç token'a bölünür. Token kavramı önemlidir çünkü:
- Modelin okuyabileceği metin miktarı token ile ölçülür.
- API ücretleri token üzerinden hesaplanır. Bkz. yapay zekâ maliyetleri.
Eğitim aşamaları
- Ön eğitim: Model, çok büyük metin koleksiyonları üzerinde sonraki token'ı tahmin etmeyi öğrenir. Dil bilgisi, genel bilgi ve kalıplar bu aşamada oluşur.
- İnce ayar: Talimatlara uyması, soru-cevap formatında yardımcı olması için örneklerle eğitilir.
- Geri bildirimle iyileştirme: İnsan ve yapay zekâ değerlendirmeleriyle daha faydalı, doğru ve güvenli cevaplar vermesi teşvik edilir.
Bağlam penceresi
Model, bir konuşmada aynı anda belirli miktarda token'ı "görebilir". Buna bağlam penceresi denir. Sohbet geçmişi, eklenen belgeler ve talimatlar bu pencereye sığmalıdır. Model kalıcı bir hafızaya sahip değildir; her istekte pencere içindeki metne bakarak cevap üretir. Kendi belgelerinizi kullanmak için bu sınır, RAG gibi yöntemlerin doğmasının nedenlerinden biridir.
Sıcaklık (temperature)
Model her adımda olası token'lar arasından seçim yapar. Düşük sıcaklık en olası seçeneklere yönelir ve daha tutarlı cevaplar verir; yüksek sıcaklık çeşitliliği ve yaratıcılığı artırır. Veri çıkarma gibi işlerde düşük, beyin fırtınasında daha yüksek değerler uygundur.
Güçlü ve zayıf yanlar
| Güçlü | Zayıf |
|---|---|
| Metin üretme, özetleme, çeviri | Kesin olmayan bilgiyi kendinden emin anlatabilir |
| Kod yazma ve açıklama | Eğitim tarihinden sonraki gelişmeleri bilmeyebilir |
| Yapılandırılmamış metinden veri çıkarma | Tutarlılık için doğru yönlendirme ister |
| Doğal dille arayüz | Hesaplama ve kesin sayma işlerinde araç desteği gerekir |
Modelin akıcı ama yanlış bilgi üretmesine halüsinasyon denir; nedenleri ve azaltma yolları için bkz. yapay zekâ halüsinasyonu.
Araç kullanımı ve ajanlar
Modern modeller yalnızca metin üretmekle kalmaz; arama yapma, hesap makinesi veya veritabanı sorgusu gibi araçları çağırabilir. Bu yetenek, birden çok adımı kendi planlayan yapay zekâ ajanlarının temelidir.
Sık sorulan sorular
Model internetten anlık bilgi alıyor mu?
Model kendi başına almaz; ancak arama aracına bağlanmışsa güncel bilgiyi çekip cevabına ekleyebilir.
Model verdiğim bilgileri öğrenir mi?
Konuşma sırasında bağlam penceresinde kullanır; kalıcı öğrenme ise sağlayıcının veri politikalarına bağlıdır. Kurumsal kullanımda bu ayarlar kontrol edilmelidir. Bkz. yapay zekâ ve KVKK.
Sonuç
LLM'ler, büyük ölçekte eğitilmiş olasılık makineleridir. Token, bağlam ve olasılık kavramlarını bilmek; onları doğru işte kullanmanızı, maliyeti kontrol etmenizi ve çıktılarını doğru şekilde doğrulamanızı sağlar.