Gartner® Competitive Landscape: Conversational Solutions™, 2025 raporunda yer aldıkRaporu edinin
KURUMSAL YAPAY ZEKÂ ALTYAPISI VE ÇIKARIM

Model zekâ üretir. Inference onu çalıştırır.

Inference katmanı, yapay zekâ modellerini canlı istekler karşısında hızlı, güvenilir ve ölçeklenebilir şekilde çalıştırır.

CBOT; yanıt süresi, GPU verimliliği, ölçekleme, maliyet ve kurulum davranışlarını kurumunuzun kontrolünde yönetmenizi sağlar. Bulut, hibrit ve on-premise ortamlarda AI iş yükleri ihtiyaçlarınıza göre yapılandırılır.

Yapay zekâ çıkarımı nedir?

Çıkarım, eğitilmiş bir modelin yeni bir girdiyle çalışıp sonuç üretmesidir. Eğitim modele beceri kazandırır, çıkarım ise modelin işini yaptığı adımdır. Model bir istek alır ve bir yanıt, bir sınıflandırma, bir metin dökümü ya da sesli bir karşılık döndürür.

Kurumsal yapay zekânın işlediği her sesli çağrı, her mesaj, her arama ve her otomatik karar çıkarımdan geçer. Model bu anda durağan bir dosya olmaktan çıkar ve çalışan bir hizmete dönüşür.

Girdi

Sisteme bir istek gelir: sesli bir cümle, yazılı bir mesaj, bir belge ya da anlaşılması gereken bir veri kaydı.

Çıkarım

Eğitilmiş model girdiyi işler ve o iş yüküne ayrılan altyapı üzerinde çalışarak bir sonuç üretir.

Çıktı

Model kullanıma hazır bir yanıt, bir sınıflandırma, çıkarılmış veri, bir metin dökümü ya da üretilmiş metin döndürür.

Kurumsal aksiyon

Çıktı iş akışına geçer ve bir yanıtı, bir güncellemeyi, bir entegrasyonu ya da bir sonraki adımı tetikler.

Model, yapay zekânın ne yapabileceğini tanımlar. Çıkarım ise gerçek dünyada ne kadar iyi çalıştığını belirler.

Çıkarım performansı kurumsal yapay zekâyı neden belirler?

Yetenekli bir model, ancak onu sunan çalışma zamanı kadar işe yarar. Çıkarım performansı; sistemin ne kadar hızlı yanıt verdiğini, ne kadar yük taşıdığını ve altyapıyı ne kadar verimli kullandığını belirler. Bu performansı altı boyut tanımlar.

Gecikme

Sistem, bir isteği aldıktan sonra ne kadar hızlı yanıt verir. Kullanıcının ilk fark ettiği şey gecikmedir, özellikle gerçek zamanlı seste.

İş hacmi

Sistem, aynı anda kaç isteği yavaşlamadan ve kuyruk oluşturmadan karşılayabilir.

GPU verimliliği

İşlem kaynakları ne kadar iyi kullanılır. Kapasite, boşta beklemek ya da gereğinden büyük durmak yerine yararlı iş üretir.

Ölçeklenebilirlik

Hizmet, yük altında nasıl büyür. Her şeyi birden genişletmek yerine kapasiteyi talebin çıktığı yere ekler.

Güvenilirlik

Hizmet ne kadar tutarlı biçimde erişilebilir kalır ve yanıt verir. Yoğun anlar ve kısmi arızalar da buna dahildir.

Gizlilik

Çıkarımın nerede çalıştığı ve verinin nerede işlendiği. Hassas iş yükleri onaylı ortamın içinde kalabilir.

Kurumsal yapay zekâ performansı, altyapı performansıdır.

Her çıkarım isteğinin arkasındaki katmanlar

Kurumsal bir yapay zekâ isteği tek bir modele tek başına ulaşmaz. Her biri kendi sorumluluğunu ve kendi altyapı ihtiyacını taşıyan ayrı katmanlardan geçer.

ETKİLEŞİM KATMANI

  • Ses
  • Web
  • Mobil
  • Mesajlaşma
  • Kurumsal uygulamalar
  • İç iş akışları

YAPAY ZEKÂ İŞLEME KATMANI

  • CBOT LLM
  • Ticari ve açık kaynak dil modelleri
  • Özel NLP ve NLU
  • CBOT Konuşma-Metin
  • CBOT Metin-Konuşma
  • Sınıflandırma ve çıkarma modelleri

BİLGİ VE AI AGENT KATMANI

  • Kurumsal RAG
  • Gömülü ya da bağlı vektör depolama
  • AI Agent iş akışları
  • İş kuralları
  • Araçlar ve API'ler

ÇALIŞMA ZAMANI VE ALTYAPI KATMANI

  • Model sunumu
  • CPU ve GPU kaynak tahsisi
  • İstek kuyrukları
  • Önbellekleme
  • Akışlı yanıtlar
  • Konteyner orkestrasyonu
  • Sağlık kontrolleri
  • Otomatik ölçekleme
  • Loglar ve izleme

Her servis, ihtiyacı olan altyapıyı alır. Tüm platform aynı anda ölçeklenmek zorunda kalmaz.

Gerçek zamanlı ses, katmanların birlikte çalışmasına bağlıdır

Gerçek zamanlı bir sesli görüşmede birkaç çıkarım adımı arka arkaya gerçekleşir ve kullanıcı yalnızca son yanıtı duyar. Her adım süre eklediği için çalışma zamanı baştan sona optimize edilir.

  1. 01

    Dinle

    Konuşma-Metin, arayan konuşurken sesini metne çevirir.

  2. 02

    Anla

    Özel NLP ve NLU, metindeki niyeti, varlıkları ve bağlamı yorumlar.

  3. 03

    Çıkarım yap

    Seçilen dil modeli; isteği, kurumsal bilgiyi ve iş akışının durumunu değerlendirir.

  4. 04

    Aksiyon al

    AI Agent iş kurallarını uygular, araçları çağırır ve bir sonraki adıma karar verir.

  5. 05

    Yanıtla

    Metin-Konuşma, sonucu arayan için doğal konuşmaya dönüştürür.

UÇTAN UCA GECİKMEYİ AZALTAN OPTİMİZASYONLAR

  • Akışlı Konuşma-Metin
  • Akışlı model yanıtları
  • Düşük gecikmeli özel NLP
  • Yanıt önbellekleme
  • Önceden ısıtılmış model konteynerleri
  • Bağlantı havuzlama
  • Asenkron işleme
  • Optimize edilmiş Konuşma-Metin ve Metin-Konuşma sunumu
  • İş yüküne özel model seçimi

Kullanıcı tek bir yanıt duyar. CBOT arkadaki her milisaniyeyi optimize eder.

Performans; model boyutuna, altyapıya, eşzamanlılığa ve kurulum yapılandırmasına göre değişir.

Tüm platformu değil, iş yükünü ölçekleyin

Kurumsal talep dengeli değildir. Bazı servisler ani zirveler yaşar, bazıları sabit kalır. CBOT her iş yükünü bağımsız ölçekler. Böylece kapasite talebi izler ve tüm platform bir anda büyümez.

Yatay ölçekleme

Talep büyüdükçe daha fazla eşzamanlı isteği karşılamak için servis kopyalarını çoğaltır.

Dikey ölçekleme

İş yükü ağırlaştığında bir servise daha fazla CPU, GPU ya da bellek verir.

İş yüküne göre ölçekleme

Her servisi kendi sinyallerine göre ölçekler. Yoğunlaşan bileşen büyürken diğerleri olduğu gibi kalır.

Zirveye hazırlık

Beklenen zirvelerden önce kapasite hazırlar. Servis, yoğun anlarda da yanıt vermeye devam eder.

Soğuk başlangıç optimizasyonu

Model konteynerlerini sıcak tutar. Yeni eklenen kapasite ilk isteği yavaşlatmadan karşılar.

Tüm platformu değil, baskı altındaki servisi ölçekleyin.

GPU kapasitesini değer ürettiği yerde kullanın

GPU, yapay zekâ altyapısının en pahalı parçasıdır ve bu yüzden bilinçli dağıtılmalıdır. Her iş yükü GPU gerektirmez, her model de en büyüğüne ihtiyaç duymaz. CBOT işlem gücünü her servisin gerçekte yaptığı işe göre boyutlandırır.

Doğru boyutta modeller

Her istek için en büyük modeli çalıştırmaz. Model boyutunu göreve göre seçer.

İş yükü ayrımı

GPU gerektiren iş yüklerini hafif olanlardan ayırır. Böylece her biri kendine uygun kaynakta çalışır.

Bağımsız tahsis

İşlem gücünü servis başına verir. Bir iş yükü büyürken diğerleri gereksiz yere genişlemez.

Yerinde CPU kullanımı

GPU gerektirmeyen servisleri CPU üzerinde çalıştırır ve GPU kapasitesini ihtiyaç duyan iş yüklerine bırakır.

Kapasite planlaması

İşlem gücünü tek bir sabit varsayıma göre değil, beklenen eşzamanlılığa ve trafik desenlerine göre planlar.

En pahalı altyapı, hiçbir değer üretmeyen kapasitedir.

ALTYAPI BOYUTLANDIRMASI ŞUNLARA BAĞLIDIR

  • Seçilen model
  • Model boyutu
  • Niceleme
  • Metin ya da ses iş yükü
  • Eşzamanlı oturumlar
  • Saniyedeki token
  • Gecikme hedefi
  • Erişilebilirlik modeli
  • Kurulum mimarisi

Herkese uyan tek bir donanım önerisi yoktur. Ayrıntılı boyutlandırma, ilgili iş yüküne ve gereksinimlere göre çözüm tasarımı sırasında yapılır.

Tüm inference altyapısını kendi ortamınızda çalıştırın

Bazı platformlar yalnızca uygulama katmanını özel ortamda çalıştırır; model inference, konuşma teknolojileri veya bilgi erişimi için dış servislere bağımlı kalır. CBOT; LLM inference, STT, TTS, RAG, vektör veri tabanı ve runtime katmanını müşterinin kontrolündeki ortama taşıyabilir. Böylece hassas AI iş yükleri, kurumunuzun belirlediği güvenlik ve veri sınırlarının dışına çıkmadan çalışır.

ON-PREMISE ÇALIŞABİLEN BİLEŞENLER

Dil modeli çıkarımıCBOT LLMAçık kaynak modellerCBOT Konuşma-MetinCBOT Metin-KonuşmaÖzel NLP ve NLUKurumsal RAGGömülü vektör veritabanıAI Agent çalışma zamanıİş akışı orkestrasyonuAnalitik ve operasyonel servislerEntegrasyonlar ve API'ler

KURULUM SEÇENEKLERİ

İş yükünüze uyan sınırı seçin

Modelleriniz. Verileriniz. Altyapı sınırınız.

01

SaaS

Dışarıda çalışması onaylanan iş yüklerinde CBOT çıkarımını yönetilen bir bulut servisi olarak kullanır.

02

Özel bulut

Çıkarımı; güvenlik ve ağ gereksinimlerinize göre kurulan yalıtılmış bir özel bulut ortamında çalıştırır.

03

Hibrit

Bulut modellerini, kendi barındırdığınız ve on-premise çalışan çıkarımla birleştirir; her iş yükünü gereksinimine göre yönlendirir.

04

Tamamen on-premise

Modelleri, veriyi ve çalışma zamanını kendi altyapınızda tutar. Hassas veri, onaylı ağ sınırının dışına çıkmaz.

Her AI iş yükü farklı bir altyapı gerektirir

Inference altyapısı sabit bir formülle tasarlanmaz. Model tipi, trafik hacmi, eşzamanlı kullanım, yanıt süresi beklentisi, GPU ihtiyacı, kurulum modeli ve beklenen büyüme birlikte değerlendirilir. CBOT, runtime katmanını kurumunuzun gerçek operasyonel gereksinimlerine göre boyutlandırmak için teknik ekiplerinizle birlikte çalışır.

ALTYAPI TASARIMINDA DİKKATE ALDIKLARIMIZ

  • Kullanım senaryosu ve kanal
  • Model seçimi
  • Metin ya da ses işleme
  • Beklenen eşzamanlılık
  • Ortalama ve zirve trafik
  • Gecikme hedefleri
  • Token iş hacmi
  • GPU erişilebilirliği
  • Yüksek erişilebilirlik gereksinimleri
  • Veri güvenliği politikaları
  • Bulut ya da on-premise kurulum
  • Büyüme ve ölçekleme beklentileri

Altyapı boyutlandırması bir şablon değildir. Yapay zekâ çözümünün bir parçasıdır.

Sık sorulan sorular

Yapay zekâ çıkarımı nedir?

Yapay zekâ çıkarımı, eğitilmiş bir modelin yeni bir girdiyle çalışıp sonuç üretmesidir. Sonuç bir yanıt, bir sınıflandırma, bir metin dökümü ya da sesli bir karşılık olabilir. Eğitilmiş model bu adımda çalışan bir hizmete dönüşür.

Çıkarım neden önemlidir?

Çıkarım, bir modelin canlıda nasıl performans gösterdiğini belirler. Yanıt hızını, sistemin taşıdığı yükü, altyapının ne kadar verimli kullanıldığını ve verinin nerede işlendiğini doğrudan etkiler.

LLM çıkarımı nedir?

LLM çıkarımı, büyük bir dil modelinin verilen girdiyle çalışıp metin üretmesidir. Modelin bir isteği değerlendirip yanıt ürettiği çalışma zamanı adımıdır.

Her yapay zekâ iş yükü GPU gerektirir mi?

Hayır. Dil modeli ve bazı konuşma iş yükleri GPU gerektirebilir, birçok servis ise CPU üzerinde çalışır. Doğru kurulum, kullanılan modellere ve iş yüklerine bağlıdır.

CBOT dil modellerini on-premise çalıştırabilir mi?

Evet. CBOT LLM, desteklenen açık kaynak modeller ve müşterinin barındırdığı modeller müşterinin kontrolündeki ortamda çalışabilir. Ticari modellere ise dışarıdan ya da özel uç noktalar üzerinden erişilir.

CBOT Konuşma on-premise çalışabilir mi?

Evet. CBOT Konuşma-Metin ve Metin-Konuşma müşterinin ortamında çalışabilir. Böylece ses verisi onaylı sınırın içinde kalır.

Tüm CBOT platformu on-premise çalışabilir mi?

Evet. AI Agent çalışma zamanı, model çıkarımı, özel NLP, konuşma, RAG, vektör depolama, analitik ve entegrasyonlar müşterinin ortamında çalışabilir.

CBOT yapay zekâ iş yüklerini nasıl ölçekler?

CBOT her iş yükünü bağımsız ölçekler. Yatay ve dikey ölçekleme, iş yükü sinyalleri, zirveye hazırlık ve soğuk başlangıç optimizasyonu ile kapasiteyi talebin çıktığı yere ekler.

GPU gereksinimleri nasıl hesaplanır?

GPU gereksinimi; seçilen modele, model boyutuna, nicelemeye, iş yükü türüne, eşzamanlılığa, iş hacmine, gecikme hedeflerine ve erişilebilirlik modeline bağlıdır. Ayrıntılı boyutlandırma çözüm tasarımı sırasında yapılır.

CBOT Kubernetes ve OpenShift destekler mi?

Evet. CBOT; Docker, Kubernetes ve Red Hat OpenShift ile konteyner tabanlı kurulumu, bağımsız servis ölçeklemeyi ve müşterinin kontrolündeki GPU tahsisini destekler.

CBOT çıkarım gecikmesini nasıl azaltır?

CBOT gecikmeyi; akışlı konuşma ve model yanıtları, yanıt önbellekleme, önceden ısıtılmış konteynerler, bağlantı havuzlama, asenkron işleme ve iş yüküne özel model seçimi ile azaltır.

CBOT bulut ve özel modelleri aynı mimaride destekler mi?

Evet. Hibrit mimari; onaylı bulut modellerini, müşterinin barındırdığı özel modellerle ve on-premise modellerle birleştirir. Her iş yükü güvenlik, performans ve veri gereksinimine göre yönlendirilir.

MODELDEN ÜRETİME

Kurumsal yapay zekânızın performans göstermesi için gereken çalışma zamanını kurun.

CBOT ile gecikmeyi, GPU verimliliğini, ölçeklemeyi ve kurulumu konuşun. İş yüklerinize, verinize ve altyapınıza uyan bir çıkarım mimarisini bulut, hibrit ve tamamen on-premise ortamlarda birlikte tasarlayalım.