"Kargom nerede?" ile "siparişim hâlâ gelmedi" cümlelerinde ortak kelime neredeyse yoktur; ama anlamları çok yakındır. Klasik kelime aramaları bu iki cümleyi ilişkilendiremez. Embedding, metni anlamını yansıtan bir sayı dizisine çevirerek bilgisayarların "anlamca yakınlığı" ölçmesini sağlar.
Embedding nedir?
Embedding, bir metnin (kelime, cümle veya paragraf) yüzlerce ya da binlerce sayıdan oluşan bir vektöre dönüştürülmüş halidir. Bu sayılar tek tek anlam taşımaz; ama birlikte, metnin çok boyutlu bir uzaydaki konumunu belirler. Anlamca benzer metinler bu uzayda birbirine yakın düşer.
Basit bir benzetme: Şehirleri enlem ve boylamla iki sayıyla temsil edersiniz; birbirine yakın şehirlerin sayıları da yakındır. Embedding aynı fikri anlam için ve çok daha fazla boyutla uygular.
Benzerlik nasıl ölçülür?
İki vektör arasındaki yakınlık genellikle kosinüs benzerliği ile hesaplanır: iki vektörün yönü ne kadar benzerse sonuç 1'e o kadar yakındır. "Kargom nerede?" sorusunun embedding'i, "teslimat süresi" konulu destek makalesinin embedding'ine yakın çıkar.
Kullanım alanları
| Uygulama | Nasıl? |
|---|---|
| Anlamsal arama | Sorgu ve belgelerin embedding'lerini karşılaştırıp en yakınları getirmek |
| RAG | Yapay zekâya soru sorulmadan önce ilgili belge parçalarını bulmak (RAG nedir) |
| Benzer içerik önerisi | "Bu yazıyı okuyanlar şunları da okudu" |
| Sınıflandırma | Destek taleplerini konularına göre otomatik yönlendirmek |
| Kümeleme | Müşteri yorumlarını benzer şikâyet gruplarına ayırmak |
| Mükerrer tespiti | Aynı anlama gelen farklı yazılmış kayıtları bulmak |
Nasıl saklanır?
Az sayıda belge için embedding'leri bellekte veya normal bir veritabanında tutmak yeterlidir. Yüz binlerce veya milyonlarca belgede hızlı benzerlik araması için vektör veritabanları veya PostgreSQL'in vektör eklentisi gibi çözümler kullanılır. Bkz. vektör veritabanı.
Pratik ipuçları
- Aynı modeli kullanın: Sorgu ve belgeler aynı embedding modeliyle üretilmelidir; farklı modellerin vektörleri karşılaştırılamaz.
- Türkçe performansını test edin: Çok dilli modellerin Türkçe başarısı farklıdır; kendi verinizle küçük bir test yapın.
- Parçalayın: Uzun belgeleri anlamlı bölümlere ayırarak (başlık ve paragraf sınırlarında) embedding'leyin.
- Karma arama: Anlamsal arama ile klasik kelime aramasını birleştirmek; ürün kodu, fatura numarası gibi kesin terimlerde daha iyi sonuç verir.
- Maliyet: Embedding üretimi genellikle metin üretiminden çok daha ucuzdur; belgeler bir kez işlenir, yalnızca değişenler güncellenir.
Gizlilik notu
Embedding'ler metnin kendisi olmasa da içerik hakkında bilgi taşır ve bazı durumlarda metne dair çıkarımlar yapılabilir. Kişisel veri içeren belgelerin embedding'leri de aynı özenle korunmalıdır.
Sık sorulan sorular
Embedding ile LLM aynı şey mi?
Hayır. Embedding modeli metni vektöre çevirir; LLM ise metin üretir. RAG gibi sistemlerde ikisi birlikte çalışır.
Kendi sunucumda embedding üretebilir miyim?
Evet. Açık kaynak embedding modelleri yerel olarak çalıştırılabilir; bu, hassas verilerin dışarı çıkmamasını sağlar. Bkz. yerel LLM.
Sonuç
Embedding, bilgisayarlara kelimeleri değil anlamları karşılaştırma yeteneği kazandırır. Arama, öneri ve sınıflandırma gibi işlerde sessizce büyük fark yaratan bu teknik, işletmelerin kendi verileriyle yapay zekâ uygulamaları kurmasının da temelidir.