Anahtar noktalar
- Mevcut SDK'larla tam uyumluluk ve entegrasyonu kolaylaştırmak için /v1/chat/completions uç noktasını kullanın.
- Erken kesilmeyi veya beklenmeyen maliyetleri önlemek için 100k tokenlık bağlam penceresini sıkı takip edin.
- Oran sınırlarını (RPM) ve sansürsüz gecikme varyasyonlarını işlemek için sağlam hata işleme uygulayın.
- Filtrelerin olmaması, gerekirse alt düzey denetimin sizin sorumluluğunuzda olduğu anlamına gelir.
Model Tanımı
Model seçimi, uygulamanızın davranışını belirler. sansürsüz AI kullanımı için, yetişkin veya tartışmalı konularda reddetmeyi minimize etmek üzere eğitilmiş açık ağırlıklı modelleri tercih edin. Standart ticari modellerin aksine, bu LLM türü kurumsal politikalara dayalı agresif güvenlik önlemleri uygulamaz ve kullanıcı istemine daha sadık yanıtlar verir.
Modelin yerel olarak fonksiyon çağırma (tool calling) desteklediğini doğrulayın. Bu, JSON çıktıları yapılandırması veya harici API'lerle etkileşim gerektiren uygulamalar için kritiktir. OpenAI API payload formatıyla uyumluluk, entegrasyon katmanını yeniden yazmadan sağlayıcılar arasında geçiş yapmanızı sağlar.
Bağlam Kontrolü
100.000 token'lık bağlam penceresi, uzun konuşmaları sürdürmenize veya uzun belgeleri işlemenize olanak tanır ve bilgiyi hemen kaybetmenize gerek kalmaz. Ancak daha fazla bağlam daha yüksek zeka anlamına gelmez; yalnızca genişletilmiş bellek demektir. Geliştiriciler, geçmişin büyümesini yönetmek için kayan pencere veya özetleme stratejileri uygulamalıdır.
- Girdi Tokenları: Konuşma geçmişini ve mevcut istemi içerir.
- Çıktı Tokenları: Oluşturulan yanıtı içerir.
Token kullanımını gerçek zamanlı izleyin. 100k limitini aşmak, sunucu uygulamasına bağlı olarak API hatasına veya kesilmeye neden olur. Uzun sohbet uygulamaları için, maliyeti öngörülebilir tutmak adına yalnızca son N etkileşimi göndermeyi düşünün.
Token Yönetimi
Sansürsüz AI'ın maliyeti, işlenen token hacmiyle doğru orantılıdır. Model, milyon başına girdi tokenı için $0,25 ve milyon başına çıktı için $1,00 ücretlendirir. Filtresiz modellerde çıktılar genellikle daha uzun ve karmaşık olduğu için çıktı maliyeti, girdi maliyetini önemli ölçüde aşabilir.
İstek göndermeden önce istemci tarafında bir token sayacı uygulayın. Bu, gönderimden önce yanıtın kesin maliyetini tahmin etmenizi sağlar. Optimizasyon için sistem isteminin ayrıntısını azaltın ve mümkün olduğunda doğal metin yerine verileri yapılandırmak için fonksiyonlar kullanın; çünkü JSON, doğal dilden daha token yoğunudur.
İstek Limitleri
İstikrar sağlamak için hizmet, API anahtarı başına dakikada 300 istek (RPM) ve maksimum 8 MB'lık bir istek gövdesi limiti uygular. Yoğunluk zirvelerinde RPM'i aşmak 429 hatasına neden olur. Geliştiriciler üstel geri çekilme ile yeniden denemeler uygulamalıdır.
Yüksek eşzamanlı istek uygulamalarında talebi yumuşatmak için mesaj kuyrukları kullanmayı düşünün. Daha yüksek veri akışı gerekiyorsa, altyapının doğal limitlerini saygı göstermek için yükü birden fazla API anahtarı arasında dağıtın veya kullanıcıda algılanan gecikmeyi artırın.
API Anahtarı Güvenliği
API anahtarınız, sansürsüz AI'a erişim için tekil kimlik bilginizdir. Otomatik olarak süresi dolmaz ancak herhangi bir anda iptal edilebilir. Anahtarı sunucudaki ortam değişkenlerinde tutun ve ön yüz kodunda veya genel depolarda asla ortaya çıkarmayın.
Yanlış kullanım şüphesi varsa, hemen yeni bir anahtar oluşturun. Bu, eski anahtarı geçersiz kılar ve onu kullanan tüm istemcilerin erişimini keser. Platformunuz detaylı izleme izin veriyorsa, botları veya sızan betikleri hızla tespit etmek için aşırı kullanım uyarılarını etkinleştirin.
Hata İşleme
Yaygın hatalar arasında 429 Too Many Requests (hız limiti), 400 Bad Request (geçersiz yapı) ve 500 Internal Server Error yer alır. Her zaman ağ hatalarını ve zaman aşımını işleyin. Sansürsüz modeller, eğitim verilerinin daha az özenle hazırlanmış olmasından dolayı bazen eksik yanıtlar veya daha sık halüsinasyonlar döndürebilir.
Yedek mantık uygulayın. Bir yanıt başarısız olursa, temperature değerini biraz değiştirerek veya bağlam penceresi boyutunu azaltarak yeniden deneyin. Ham teknik hataları son kullanıcıya göstermek kafa karıştırıcı olabilir; hata kodunu her zaman anlaşılır ve eyleme dönüştürülebilir bir mesajla eşleştirin.
Akış ve Gerçek Zamanlı
Server-Sent Events (SSE) akış desteği, yanıtı token token görüntülemenizi sağlar ve kullanıcıda gecikme algısını iyileştirir. Bu, gerçek zamanlı sohbet uygulamaları için kritiktir.
Akış uygulamak için HTTP istemcinizi gelen veri parçalarını okuyacak şekilde yapılandırın. Bu, algılanan ilk yanıt süresini (TTFT) azaltır. Bağlantı kesilirse ve yeniden bağlanması gerekirse tokenların çoğalmasını önlemek için istemci durumunu yönetmeyi unutmayın. Akış, alınan ücreti değiştirmez, yalnızca verinin teslim biçimini değiştirir.
Fonksiyon Kullanımı
Fonksiyon çağırma, modelin harici araçları ne zaman ve nasıl çağıracağına karar vermesini sağlar. Kısıtlamasız API ile model, fonksiyon argümanlarını yapılandırırken daha yaratıcı olabilir. Yürütmeden önce sunucu tarafında alınan parametreleri doğruladığınızdan emin olun.
Fonksiyonlarınız için net JSON şemaları tanımlayın. Sansürsüz olma durumu JSON'un teknik doğruluğunu etkilemez ancak modelin belirsiz bağlamları yorumlama yaratıcılığını etkileyebilir. Modelin şemada tanımlanmamış argümanlar uydurabileceği aşırı durumları kapsamlı şekilde test edin.
Veri Gizliliği
Model içerik filtrelemese de, eğitim için veri kullanım politikasını kontrol edin. Bu hizmet, istemlerin model eğitimi için kullanılmadığını belirtir ki bu da kurumsal veya hassas uygulamalar için kritik öneme sahiptir. Gizlilik, hizmetin sadeliği sayesinde sağlanır: hesap için yalnızca e-posta ve şifre gereklidir.
Çok hassas veriler için, gizlilik kritikse API'ye göndermeden önce bir gizleme katmanı uygulamayı düşünün. Modelin gönderilen isteme dayalı metin ürettiğini unutmayın; bir ad gönderirseniz, yanıtta görünebilir. Sansürsüz olma durumu, modelin Kişisel Tanımlayıcı Bilgileri (KTB) için otomatik engelleme yapmadığı anlamına gelir.