Ana içeriğe geç
Yapay Zeka

Büyük dil modellerinde istem önbellekleme maliyet ve gecikmeyi düşürüyor

Öne çıkanlar

  • İstem önbellekleme, tekrarlanan ön eklerde girdi belirteci maliyetini 10 kata kadar azaltıyor.
  • Sistem isteminin sabit tutulması ve bağlamın kesilmeden eklenmesi önbellek isabetini koruyor.
  • vLLM ve PagedAttention altyapıları KV tensörlerini paylaştırarak GPU verimini artırıyor.

Büyük dil modellerinde istem önbellekleme (prompt caching), tekrarlanan metin ön eklerine ait anahtar-değer (KV) tensörlerinin yeniden hesaplanmasını engelleyerek çıkarım maliyetini ve yanıt süresini azaltıyor. vLLM gibi modern çıkarım motorlarında kullanılan PagedAttention ve otomatik ön ek önbellekleme yöntemleri, GPU belleğinde tutulan tensörlerin birden fazla oturum veya kullanıcı arasında paylaşılmasına imkan tanıyor.

Sistemden en yüksek verimi almak için istem mühendisliğinde ön ek kararlılığının korunması gerekiyor. Sistem talimatlarındaki dinamik kullanıcı verilerinin kaldırılması, konuşma geçmişinin kesintiye uğratılmadan yalnızca sonuna ekleme yapılarak büyütülmesi ve araç çağrılarında deterministik JSON serileştirme kullanılması önbellek isabet oranını doğrudan artırıyor.

Önbellek isabeti sağlandığında girdi belirteci maliyetleri onda bire kadar düşüyor. OpenAI ve Anthropic gibi sağlayıcılar, GPU VRAM ve yerel depolama katmanlarını kullanarak bu tensörleri saklıyor ve gelen istekleri ön ek özetlerine göre yönlendiriyor.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.