Furkan KapukayaYazılım geliştirme
Yapay Zekâ3 dk okuma

Embedding Nedir? Metni Anlamına Göre Sayılarla Temsil Etmek

Embedding (vektör temsili) kavramı, anlamsal benzerlik, kosinüs benzerliği, anlamsal arama, öneri, sınıflandırma ve kümeleme gibi kullanım alanları ile model seçimi ve maliyet ipuçları.

"Kargom nerede?" ile "siparişim hâlâ gelmedi" cümlelerinde ortak kelime neredeyse yoktur; ama anlamları çok yakındır. Klasik kelime aramaları bu iki cümleyi ilişkilendiremez. Embedding, metni anlamını yansıtan bir sayı dizisine çevirerek bilgisayarların "anlamca yakınlığı" ölçmesini sağlar.

Embedding nedir?

Embedding, bir metnin (kelime, cümle veya paragraf) yüzlerce ya da binlerce sayıdan oluşan bir vektöre dönüştürülmüş halidir. Bu sayılar tek tek anlam taşımaz; ama birlikte, metnin çok boyutlu bir uzaydaki konumunu belirler. Anlamca benzer metinler bu uzayda birbirine yakın düşer.

Basit bir benzetme: Şehirleri enlem ve boylamla iki sayıyla temsil edersiniz; birbirine yakın şehirlerin sayıları da yakındır. Embedding aynı fikri anlam için ve çok daha fazla boyutla uygular.

Benzerlik nasıl ölçülür?

İki vektör arasındaki yakınlık genellikle kosinüs benzerliği ile hesaplanır: iki vektörün yönü ne kadar benzerse sonuç 1'e o kadar yakındır. "Kargom nerede?" sorusunun embedding'i, "teslimat süresi" konulu destek makalesinin embedding'ine yakın çıkar.

Kullanım alanları

UygulamaNasıl?
Anlamsal aramaSorgu ve belgelerin embedding'lerini karşılaştırıp en yakınları getirmek
RAGYapay zekâya soru sorulmadan önce ilgili belge parçalarını bulmak (RAG nedir)
Benzer içerik önerisi"Bu yazıyı okuyanlar şunları da okudu"
SınıflandırmaDestek taleplerini konularına göre otomatik yönlendirmek
KümelemeMüşteri yorumlarını benzer şikâyet gruplarına ayırmak
Mükerrer tespitiAynı anlama gelen farklı yazılmış kayıtları bulmak

Nasıl saklanır?

Az sayıda belge için embedding'leri bellekte veya normal bir veritabanında tutmak yeterlidir. Yüz binlerce veya milyonlarca belgede hızlı benzerlik araması için vektör veritabanları veya PostgreSQL'in vektör eklentisi gibi çözümler kullanılır. Bkz. vektör veritabanı.

Pratik ipuçları

  1. Aynı modeli kullanın: Sorgu ve belgeler aynı embedding modeliyle üretilmelidir; farklı modellerin vektörleri karşılaştırılamaz.
  2. Türkçe performansını test edin: Çok dilli modellerin Türkçe başarısı farklıdır; kendi verinizle küçük bir test yapın.
  3. Parçalayın: Uzun belgeleri anlamlı bölümlere ayırarak (başlık ve paragraf sınırlarında) embedding'leyin.
  4. Karma arama: Anlamsal arama ile klasik kelime aramasını birleştirmek; ürün kodu, fatura numarası gibi kesin terimlerde daha iyi sonuç verir.
  5. Maliyet: Embedding üretimi genellikle metin üretiminden çok daha ucuzdur; belgeler bir kez işlenir, yalnızca değişenler güncellenir.

Gizlilik notu

Embedding'ler metnin kendisi olmasa da içerik hakkında bilgi taşır ve bazı durumlarda metne dair çıkarımlar yapılabilir. Kişisel veri içeren belgelerin embedding'leri de aynı özenle korunmalıdır.

Sık sorulan sorular

Embedding ile LLM aynı şey mi?

Hayır. Embedding modeli metni vektöre çevirir; LLM ise metin üretir. RAG gibi sistemlerde ikisi birlikte çalışır.

Kendi sunucumda embedding üretebilir miyim?

Evet. Açık kaynak embedding modelleri yerel olarak çalıştırılabilir; bu, hassas verilerin dışarı çıkmamasını sağlar. Bkz. yerel LLM.

Sonuç

Embedding, bilgisayarlara kelimeleri değil anlamları karşılaştırma yeteneği kazandırır. Arama, öneri ve sınıflandırma gibi işlerde sessizce büyük fark yaratan bu teknik, işletmelerin kendi verileriyle yapay zekâ uygulamaları kurmasının da temelidir.