Yapay zekâ özelliği eklenmiş bir uygulamanın faturası, kullanım arttıkça sürpriz yaratabilir. Maliyetin nasıl oluştuğunu anlamak ve birkaç temel optimizasyonu baştan uygulamak, aynı kaliteyi çok daha düşük maliyetle sunmayı mümkün kılar.
Token bazlı fiyatlandırma
Yapay zekâ API'leri genellikle token başına ücretlendirilir; fiyatlar çoğunlukla milyon token başına belirtilir. Token kavramı için bkz. LLM nasıl çalışır.
- Girdi token'ları: Gönderdiğiniz her şey: sistem talimatı, konuşma geçmişi, eklenen belgeler, soru.
- Çıktı token'ları: Modelin ürettiği cevap. Genellikle girdi token'larından birkaç kat daha pahalıdır.
Türkçe metinler, aynı içerikteki İngilizce metne göre çoğu zaman daha fazla token tutar; tahmin yaparken kendi örneklerinizle ölçüm yapın.
Aylık maliyet tahmini
Basit bir hesap tablosu yeterlidir:
| Kalem | Örnek değer |
|---|---|
| Günlük istek sayısı | 2.000 |
| İstek başına ortalama girdi token | 3.000 |
| İstek başına ortalama çıktı token | 400 |
| Aylık iş günü | 22 |
Bu değerleri seçtiğiniz modelin güncel fiyatıyla çarparak aylık tahmini bulursunuz. Fiyatlar sık değiştiği için sağlayıcının güncel fiyat sayfasını esas alın ve tahmini gerçek kullanım verisiyle düzenli güncelleyin.
Maliyeti düşürmenin yolları
1. İşe uygun model
Her iş için en büyük model gerekmez. Sınıflandırma, kısa özet ve veri çıkarma gibi işler küçük ve hızlı modellerle çok daha ucuza yapılabilir. Zor işleri büyük modele, kolay işleri küçük modele yönlendiren bir yapı ciddi tasarruf sağlar.
2. Bağlamı sadeleştirin
- Uzun konuşma geçmişini olduğu gibi göndermek yerine özetleyin.
- Belgenin tamamı yerine yalnızca ilgili bölümleri gönderin (RAG).
- Sistem talimatını gereksiz tekrarlardan arındırın.
3. İstem önbelleği (prompt caching)
Her istekte değişmeyen uzun bir talimat veya belge gönderiyorsanız, birçok sağlayıcının sunduğu önbellekleme özelliği bu tekrar eden kısmın maliyetini belirgin şekilde düşürür. Değişmeyen içeriği istemin başına, değişen kısmı sona koymak önbellekten yararlanmayı kolaylaştırır.
4. Toplu işleme
Anında cevap gerekmeyen işler (gece raporları, toplu belge sınıflandırma) için toplu işlem (batch) API'leri genellikle daha düşük fiyat sunar.
5. Çıktıyı sınırlayın
Kısa ve yapılandırılmış cevap isteyin. "Yalnızca JSON döndür" veya "en fazla üç cümle" gibi talimatlar çıktı token'larını azaltır.
6. Sonuçları önbelleğe alın
Aynı soruya aynı cevabın verileceği durumlarda (ürün açıklaması, sık sorulan sorular) sonucu kendi tarafınızda saklayın.
İzleme ve limitler
- Özellik, müşteri veya kullanıcı bazında token kullanımını kaydedin.
- Günlük ve aylık bütçe uyarıları tanımlayın.
- Kötüye kullanıma karşı kullanıcı başına hız sınırı koyun.
Sık sorulan sorular
Yerel model çalıştırmak daha ucuz mu?
Yüksek ve sabit hacimde olabilir; ancak donanım, enerji ve bakım maliyetleri hesaba katılmalıdır. Bkz. yerel LLM.
Abonelik planı ile API arasındaki fark nedir?
Sohbet uygulamalarının abonelikleri kişisel kullanım içindir; kendi yazılımınıza yapay zekâ eklemek için genellikle kullanıma göre ücretlendirilen API gerekir.
Sonuç
Yapay zekâ maliyeti, tasarım kararlarının doğrudan sonucudur. Doğru model, sade bağlam, önbellek ve izleme ile aynı özelliği çok daha düşük maliyetle sunmak mümkündür.