Girdi
Sisteme bir istek gelir: sesli bir cümle, yazılı bir mesaj, bir belge ya da anlaşılması gereken bir veri kaydı.
Inference katmanı, yapay zekâ modellerini canlı istekler karşısında hızlı, güvenilir ve ölçeklenebilir şekilde çalıştırır.
CBOT; yanıt süresi, GPU verimliliği, ölçekleme, maliyet ve kurulum davranışlarını kurumunuzun kontrolünde yönetmenizi sağlar. Bulut, hibrit ve on-premise ortamlarda AI iş yükleri ihtiyaçlarınıza göre yapılandırılır.
Çıkarım, eğitilmiş bir modelin yeni bir girdiyle çalışıp sonuç üretmesidir. Eğitim modele beceri kazandırır, çıkarım ise modelin işini yaptığı adımdır. Model bir istek alır ve bir yanıt, bir sınıflandırma, bir metin dökümü ya da sesli bir karşılık döndürür.
Kurumsal yapay zekânın işlediği her sesli çağrı, her mesaj, her arama ve her otomatik karar çıkarımdan geçer. Model bu anda durağan bir dosya olmaktan çıkar ve çalışan bir hizmete dönüşür.
Sisteme bir istek gelir: sesli bir cümle, yazılı bir mesaj, bir belge ya da anlaşılması gereken bir veri kaydı.
Eğitilmiş model girdiyi işler ve o iş yüküne ayrılan altyapı üzerinde çalışarak bir sonuç üretir.
Model kullanıma hazır bir yanıt, bir sınıflandırma, çıkarılmış veri, bir metin dökümü ya da üretilmiş metin döndürür.
Çıktı iş akışına geçer ve bir yanıtı, bir güncellemeyi, bir entegrasyonu ya da bir sonraki adımı tetikler.
Model, yapay zekânın ne yapabileceğini tanımlar. Çıkarım ise gerçek dünyada ne kadar iyi çalıştığını belirler.
Yetenekli bir model, ancak onu sunan çalışma zamanı kadar işe yarar. Çıkarım performansı; sistemin ne kadar hızlı yanıt verdiğini, ne kadar yük taşıdığını ve altyapıyı ne kadar verimli kullandığını belirler. Bu performansı altı boyut tanımlar.
Sistem, bir isteği aldıktan sonra ne kadar hızlı yanıt verir. Kullanıcının ilk fark ettiği şey gecikmedir, özellikle gerçek zamanlı seste.
Sistem, aynı anda kaç isteği yavaşlamadan ve kuyruk oluşturmadan karşılayabilir.
İşlem kaynakları ne kadar iyi kullanılır. Kapasite, boşta beklemek ya da gereğinden büyük durmak yerine yararlı iş üretir.
Hizmet, yük altında nasıl büyür. Her şeyi birden genişletmek yerine kapasiteyi talebin çıktığı yere ekler.
Hizmet ne kadar tutarlı biçimde erişilebilir kalır ve yanıt verir. Yoğun anlar ve kısmi arızalar da buna dahildir.
Çıkarımın nerede çalıştığı ve verinin nerede işlendiği. Hassas iş yükleri onaylı ortamın içinde kalabilir.
Kurumsal yapay zekâ performansı, altyapı performansıdır.
Kurumsal bir yapay zekâ isteği tek bir modele tek başına ulaşmaz. Her biri kendi sorumluluğunu ve kendi altyapı ihtiyacını taşıyan ayrı katmanlardan geçer.
ETKİLEŞİM KATMANI
YAPAY ZEKÂ İŞLEME KATMANI
BİLGİ VE AI AGENT KATMANI
ÇALIŞMA ZAMANI VE ALTYAPI KATMANI
Her servis, ihtiyacı olan altyapıyı alır. Tüm platform aynı anda ölçeklenmek zorunda kalmaz.
Gerçek zamanlı bir sesli görüşmede birkaç çıkarım adımı arka arkaya gerçekleşir ve kullanıcı yalnızca son yanıtı duyar. Her adım süre eklediği için çalışma zamanı baştan sona optimize edilir.
Konuşma-Metin, arayan konuşurken sesini metne çevirir.
Özel NLP ve NLU, metindeki niyeti, varlıkları ve bağlamı yorumlar.
Seçilen dil modeli; isteği, kurumsal bilgiyi ve iş akışının durumunu değerlendirir.
AI Agent iş kurallarını uygular, araçları çağırır ve bir sonraki adıma karar verir.
Metin-Konuşma, sonucu arayan için doğal konuşmaya dönüştürür.
UÇTAN UCA GECİKMEYİ AZALTAN OPTİMİZASYONLAR
Kullanıcı tek bir yanıt duyar. CBOT arkadaki her milisaniyeyi optimize eder.
Performans; model boyutuna, altyapıya, eşzamanlılığa ve kurulum yapılandırmasına göre değişir.
Kurumsal talep dengeli değildir. Bazı servisler ani zirveler yaşar, bazıları sabit kalır. CBOT her iş yükünü bağımsız ölçekler. Böylece kapasite talebi izler ve tüm platform bir anda büyümez.
Talep büyüdükçe daha fazla eşzamanlı isteği karşılamak için servis kopyalarını çoğaltır.
İş yükü ağırlaştığında bir servise daha fazla CPU, GPU ya da bellek verir.
Her servisi kendi sinyallerine göre ölçekler. Yoğunlaşan bileşen büyürken diğerleri olduğu gibi kalır.
Beklenen zirvelerden önce kapasite hazırlar. Servis, yoğun anlarda da yanıt vermeye devam eder.
Model konteynerlerini sıcak tutar. Yeni eklenen kapasite ilk isteği yavaşlatmadan karşılar.
Tüm platformu değil, baskı altındaki servisi ölçekleyin.
GPU, yapay zekâ altyapısının en pahalı parçasıdır ve bu yüzden bilinçli dağıtılmalıdır. Her iş yükü GPU gerektirmez, her model de en büyüğüne ihtiyaç duymaz. CBOT işlem gücünü her servisin gerçekte yaptığı işe göre boyutlandırır.
Her istek için en büyük modeli çalıştırmaz. Model boyutunu göreve göre seçer.
GPU gerektiren iş yüklerini hafif olanlardan ayırır. Böylece her biri kendine uygun kaynakta çalışır.
İşlem gücünü servis başına verir. Bir iş yükü büyürken diğerleri gereksiz yere genişlemez.
GPU gerektirmeyen servisleri CPU üzerinde çalıştırır ve GPU kapasitesini ihtiyaç duyan iş yüklerine bırakır.
İşlem gücünü tek bir sabit varsayıma göre değil, beklenen eşzamanlılığa ve trafik desenlerine göre planlar.
En pahalı altyapı, hiçbir değer üretmeyen kapasitedir.
ALTYAPI BOYUTLANDIRMASI ŞUNLARA BAĞLIDIR
Herkese uyan tek bir donanım önerisi yoktur. Ayrıntılı boyutlandırma, ilgili iş yüküne ve gereksinimlere göre çözüm tasarımı sırasında yapılır.
Bazı platformlar yalnızca uygulama katmanını özel ortamda çalıştırır; model inference, konuşma teknolojileri veya bilgi erişimi için dış servislere bağımlı kalır. CBOT; LLM inference, STT, TTS, RAG, vektör veri tabanı ve runtime katmanını müşterinin kontrolündeki ortama taşıyabilir. Böylece hassas AI iş yükleri, kurumunuzun belirlediği güvenlik ve veri sınırlarının dışına çıkmadan çalışır.
ON-PREMISE ÇALIŞABİLEN BİLEŞENLER
KURULUM SEÇENEKLERİ
Modelleriniz. Verileriniz. Altyapı sınırınız.
Dışarıda çalışması onaylanan iş yüklerinde CBOT çıkarımını yönetilen bir bulut servisi olarak kullanır.
Çıkarımı; güvenlik ve ağ gereksinimlerinize göre kurulan yalıtılmış bir özel bulut ortamında çalıştırır.
Bulut modellerini, kendi barındırdığınız ve on-premise çalışan çıkarımla birleştirir; her iş yükünü gereksinimine göre yönlendirir.
Modelleri, veriyi ve çalışma zamanını kendi altyapınızda tutar. Hassas veri, onaylı ağ sınırının dışına çıkmaz.
Inference altyapısı sabit bir formülle tasarlanmaz. Model tipi, trafik hacmi, eşzamanlı kullanım, yanıt süresi beklentisi, GPU ihtiyacı, kurulum modeli ve beklenen büyüme birlikte değerlendirilir. CBOT, runtime katmanını kurumunuzun gerçek operasyonel gereksinimlerine göre boyutlandırmak için teknik ekiplerinizle birlikte çalışır.
ALTYAPI TASARIMINDA DİKKATE ALDIKLARIMIZ
Altyapı boyutlandırması bir şablon değildir. Yapay zekâ çözümünün bir parçasıdır.
Yapay zekâ çıkarımı, eğitilmiş bir modelin yeni bir girdiyle çalışıp sonuç üretmesidir. Sonuç bir yanıt, bir sınıflandırma, bir metin dökümü ya da sesli bir karşılık olabilir. Eğitilmiş model bu adımda çalışan bir hizmete dönüşür.
Çıkarım, bir modelin canlıda nasıl performans gösterdiğini belirler. Yanıt hızını, sistemin taşıdığı yükü, altyapının ne kadar verimli kullanıldığını ve verinin nerede işlendiğini doğrudan etkiler.
LLM çıkarımı, büyük bir dil modelinin verilen girdiyle çalışıp metin üretmesidir. Modelin bir isteği değerlendirip yanıt ürettiği çalışma zamanı adımıdır.
Hayır. Dil modeli ve bazı konuşma iş yükleri GPU gerektirebilir, birçok servis ise CPU üzerinde çalışır. Doğru kurulum, kullanılan modellere ve iş yüklerine bağlıdır.
Evet. CBOT LLM, desteklenen açık kaynak modeller ve müşterinin barındırdığı modeller müşterinin kontrolündeki ortamda çalışabilir. Ticari modellere ise dışarıdan ya da özel uç noktalar üzerinden erişilir.
Evet. CBOT Konuşma-Metin ve Metin-Konuşma müşterinin ortamında çalışabilir. Böylece ses verisi onaylı sınırın içinde kalır.
Evet. AI Agent çalışma zamanı, model çıkarımı, özel NLP, konuşma, RAG, vektör depolama, analitik ve entegrasyonlar müşterinin ortamında çalışabilir.
CBOT her iş yükünü bağımsız ölçekler. Yatay ve dikey ölçekleme, iş yükü sinyalleri, zirveye hazırlık ve soğuk başlangıç optimizasyonu ile kapasiteyi talebin çıktığı yere ekler.
GPU gereksinimi; seçilen modele, model boyutuna, nicelemeye, iş yükü türüne, eşzamanlılığa, iş hacmine, gecikme hedeflerine ve erişilebilirlik modeline bağlıdır. Ayrıntılı boyutlandırma çözüm tasarımı sırasında yapılır.
Evet. CBOT; Docker, Kubernetes ve Red Hat OpenShift ile konteyner tabanlı kurulumu, bağımsız servis ölçeklemeyi ve müşterinin kontrolündeki GPU tahsisini destekler.
CBOT gecikmeyi; akışlı konuşma ve model yanıtları, yanıt önbellekleme, önceden ısıtılmış konteynerler, bağlantı havuzlama, asenkron işleme ve iş yüküne özel model seçimi ile azaltır.
Evet. Hibrit mimari; onaylı bulut modellerini, müşterinin barındırdığı özel modellerle ve on-premise modellerle birleştirir. Her iş yükü güvenlik, performans ve veri gereksinimine göre yönlendirilir.
MODELDEN ÜRETİME
CBOT ile gecikmeyi, GPU verimliliğini, ölçeklemeyi ve kurulumu konuşun. İş yüklerinize, verinize ve altyapınıza uyan bir çıkarım mimarisini bulut, hibrit ve tamamen on-premise ortamlarda birlikte tasarlayalım.