Gartner® Competitive Landscape: Conversational Solutions™, 2025 raporunda yer aldıkRaporu edinin
KURUMSAL LLM ORKESTRASYONU

Her görev için doğru modeli seçin, kaliteyi, hızı ve altyapı maliyetini birlikte iyileştirin.

Her iş yükü en büyük, en pahalı ya da en çok işlem gücü isteyen dil modeline ihtiyaç duymaz. CBOT LLM Orkestrasyonu her görevi ihtiyacına en uygun modele verir. Böylece çıktı kalitesi artar, gecikme ve gereksiz token tüketimi azalır, GPU kaynakları daha verimli kullanılır.

Ticari, açık kaynak, özel, müşterinin barındırdığı ve CBOT dil modelleri tek bir kurumsal yapay zekâ mimarisinde birlikte çalışır. Doğru model, doğru iş yükü, doğru sonuç.

Her görev için doğru modeli seçin.

Kurumsal yapay zekâda performans, maliyet ve kontrol; doğru model kararıyla başlar. Dil modelleri; reasoning kapasitesi, dil performansı, yanıt süresi, bağlam uzunluğu, token tüketimi, kurulum esnekliği ve GPU ihtiyacı açısından birbirinden ayrılır. CBOT, her görevin ihtiyacına göre en uygun model profilini değerlendirmeyi sağlar; böylece hız, doğruluk, maliyet ve altyapı kullanımı daha dengeli yönetilir. Önceliğinizi seçin ve model tercihinin nasıl değiştiğini görün.

Selected model profile

Akıl yürütmeye göre seçilmiş model

GECİKME
Daha yüksek
TOKEN PROFİLİ
Daha yüksek
GPU
Yüksek
BAĞLAM
Geniş
KURULUM
Bulut / özel

SEÇİLME NEDENİ

  • Karmaşık akıl yürütme
  • Daha yüksek doğruluk

Karmaşık akıl yürütmenin, dil anlamanın ya da yüksek doğruluğun ölçülebilir değer ürettiği yerde daha yetenekli modelleri kullanın.

Her işe uyan tek bir model yoktur. Her iş yükü ve önceliğe uyan doğru model vardır.

LLM ORKESTRASYONU NEDİR?

LLM orkestrasyonu nedir?

LLM orkestrasyonu, bir yapay zekâ uygulaması, AI Agent ya da kurumsal iş akışı içinde bir veya birden fazla dil modelini bağlayan, seçen, yönlendiren, yöneten ve izleyen mimari süreçtir. Her uygulamayı tek bir model sağlayıcısına bağlamak yerine orkestrasyon katmanı, iş ve iş akışı mantığını görevi yapan modellerden ayırır.

LLM orkestrasyonu olmadan

  • Sabit model bağlantısı
  • Sağlayıcıya özel mantık
  • Sınırlı fallback
  • Parçalı izleme

LLM orkestrasyonu ile

  • Gereksinimler ve politikalar
  • Göreve göre model seçimi
  • Bağlam ve bilgi
  • Doğrulama
  • Kurumsal aksiyon
  • Merkezi izlenebilirlik

Model değişir, kurumsal iş akışı yerinde kalır.

ORKESTRASYON RUNTIME'I

LLM orkestrasyonu nasıl çalışır?

Her iş yükü orkestrasyon katmanına farklı bir ihtiyaçla gelir. CBOT bu ihtiyacı değerlendirir, kurumsal politikaları uygular, uygun modeli seçer, gereken bağlamı toplar, sonucu doğrular ve iş akışını sürdürür.

01

İş yükü sinyali

Her iş yükünün kendi gereksinimleri vardır. Orkestrasyon katmanı, modeli seçmeden önce görevin neye ihtiyaç duyduğunu belirler.

Görev tipiKarmaşıklıkDilBağlam boyutuVeri hassasiyetiGecikme hedefiToken bütçesiKurulum gereksinimi
02

Politika matrisi

Kurumsal politikalar hangi model yollarının açık olduğunu belirler. Eşleşen politikalar aydınlanır, uygun olmayan yollar kapanır.

Onaylı modellerGüvenlik sınıfıVeri işleme konumuAzami gecikmeToken bütçesiDil yeteneğiGPU kapasitesiİş akışı izinleri
03

Model takımyıldızı

Kullanılabilir modeller yeteneklerine göre profillenir. Model önceden atanmaz, iş yükü için seçilir.

Akıl yürütme odaklıDüşük gecikmeToken verimliliğiTürkçe odaklıGeniş bağlamÖzelOn-premiseGPU verimliliği
04

Bağlam hazırlama

Model, eldeki her token'ı değil yalnızca görev için gereken bağlamı alır. İlgisiz içerik dışarıda kalır, önceki etkileşimler özetlenir, kritik bilgiler korunur.

Sistem talimatlarıGörüşme belleğiKurumsal bilgiGetirilen belgelerYapılandırılmış müşteri verisiİş akışı durumuİş kuralları
05

Inference, doğrulama ve aksiyon

Yanıt sürecin sonu değildir. Çıktı kurumsal bir aksiyona dönüşmeden önce doğrulanır. Doğrulamayı geçemezse fallback'e, kural tabanlı sürece ya da insan onayına gider.

İlk token gecikmesiToplam yanıt süresiGiriş / çıkış token'larıGPU kullanımıDoğrulama durumu

Model göreve göre seçilir, iş akışı kontrol altında kalır.

CANLI EXECUTİON TRACETEMSİLÎ VERİ
  • 10:42:08.124workload.received
  • 10:42:08.132language.detected: tr-TR
  • 10:42:08.140policy.private_processing: required
  • 10:42:08.147candidates.filtered: 6 → 2
  • 10:42:08.153model.selected: private_turkish_model
  • 10:42:08.171enterprise_context.retrieved
  • 10:42:08.196context.optimized
  • 10:42:08.214inference.started
  • 10:42:08.682first_token.generated
  • 10:42:09.044output.validated
  • 10:42:09.061workflow.action.triggered

Modelleri, politikaları, istemleri, kurumsal bilgiyi, araçları, iş akışlarını ve insan karar noktalarını birbirine bağlayan runtime, CBOT AIFlow üzerinden yönetilir.

Doğru iş için doğru model.

Doğru model, yapılacak işe göre değişir. Yönlendirme önceliklerini ve seçilen model profilini görmek için bir iş yükü seçin.

Selected model profile

Düşük gecikmeli görüşme modeli

GECİKME
Çok düşük ilk token
TOKEN PROFİLİ
Verimli
GPU
Düşük / orta
KURULUM
Bulut / özel
BAĞLAM
Kompakt
FALLBACK
Alternatif düşük gecikmeli model

BİRİNCİL ÖNCELİKLER

  • Düşük ilk token gecikmesi
  • Kararlı işlem hacmi

Canlı görüşmeye uygun bir model seçin. Kurumsal bilgi ve iş akışı aynı orkestrasyon mimarisinde çalışmayı sürdürür.

Model seçimini iş yükü belirler, sağlayıcı sözleşmesi değil.

Bir model çalışmadığında iş akışı durmasın.

Model servisleri erişilemez hâle gelebilir, gecikme hedeflerini aşabilir, istek limitine takılabilir ya da iş akışının beklediği çıktıyı üretemeyebilir. CBOT ile bağlamı kaybetmeden ve müşteri yolculuğunu yarıda kesmeden fallback ve alternatif yürütme yolları tasarlarsınız.

  1. 01

    Birincil model çalışıyor

    Tanımlı birincil model iş yükünü işler.

  2. 02

    Gecikme eşiği aşıldı

    Bir gecikme hedefi aşılır ya da servis erişilemez hâle gelir.

  3. 03

    Bağlam korundu

    Görüşme ve iş akışı durumu saklanır.

  4. 04

    Fallback politikası devrede

    Tanımlı fallback politikası çalışmaya başlar.

  5. 05

    Alternatif model seçildi

    Uygun bir alternatif model iş yükünü devralır.

  6. 06

    Inference sürdü

    Üretim, yolculuğu baştan başlatmadan devam eder.

  7. 07

    İş akışı tamamlandı

    Uygun model yoksa süreç kural tabanlı akışa ya da insan incelemesine geçer.

Bir model arızası iş sürecini durdurmamalı.

ÖRNEK RUNTIME TRACETEMSİLÎ VERİ
  • primary_model.timeout
  • fallback_policy.activated
  • context.transferred
  • secondary_model.ready
  • inference.resumed
  • workflow.continued

Her modeli yönetin, her kararı izleyin.

Birden fazla dil modeli kullanmak esnekliği artırır, yönetişimi ve operasyonel görünürlüğü parçalamaz. CBOT; ticari, açık kaynak, özel, müşterinin barındırdığı ve CBOT modelleri için ortak politika ve izlenebilirlik kontrolleri sunar.

YÖNETİŞİM KONTROLLERİ

Model ve iş akışı izinleriİstem ve alan kontrolleriVeri işleme politikalarıToken ve istek limitleriKurulum kısıtlarıOnay akışlarıSürümleme ve geri alma

İZLENEBİLİR VERİLER

Seçilen modelYönlendirme nedeniİstem ve bağlamGiriş / çıkış token'larıİlk token gecikmesiToplam yanıt süresiGPU kullanımıHatalar ve zaman aşımlarıFallback devreye girişiİş akışı tamamlanmaNihai kurumsal sonuç
İLK TOKEN GECİKMESİTEMSİLÎ VERİ
MODELE GÖRE İŞ YÜKÜTEMSİLÎ VERİ
Akıl yürütme
Düşük gecikme
Token verimliliği
Özel
MODELE GÖRE TOKEN TÜKETİMİTEMSİLÎ VERİ
  • Düşük gecikme
  • Akıl yürütme
  • Token verimliliği
  • Özel
İLK TOKEN GECİKMESİ
0,46s
GPU KULLANIMI
%61
FALLBACK SIKLIĞI
%2,3
İŞ AKIŞI TAMAMLANMA
%98,1

Modelleri yalnızca ürettikleri metinle değil, kurum için tamamladıkları işle ölçün.

Farklı modeller, farklı kurulumlar, tek orkestrasyon

CBOT; bulut modellerini, özel model uç noktalarını, açık kaynak modelleri, müşteri ortamında çalışan inference altyapısını ve CBOT LLM'i tek bir orkestrasyon katmanında yönetir. Her iş yükü; gizlilik, gecikme, mevzuat, maliyet ve altyapı gereksinimlerine göre doğru model ve doğru kurulumla çalıştırılır.

SaaS

Dışarıda işlenmesi onaylı iş yükleri için yönetilen model servislerini kullanın.

Özel Bulut

Modelleri ve platform bileşenlerini izole bulut ortamlarında çalıştırın.

Hibrit

Bulut modellerini özel kurumsal bilgiyle, iç sistemlerle ve on-premise iş akışlarıyla birleştirin.

Tamamen On-Premise

Dil modeli inference'ını, orkestrasyonu, RAG'i, vektör depolamayı, konuşma teknolojilerini ve tüm runtime'ı kendi altyapınızda çalıştırın.

Docker konteynerleştirmeKubernetes ve OpenShift uyumuBağımsız model ve servis ölçeklemeMüşterinin yönettiği GPU altyapısıÖzel model uç noktalarıYapılandırılabilir veri sınırlarıMüşterinin belirlediği güvenlik politikaları

Modelleriniz, altyapınız, tek kontrol katmanı.

Sıkça sorulan sorular

LLM orkestrasyonu nedir?

LLM orkestrasyonu; yapay zekâ uygulamaları, AI Agent'lar ve kurumsal iş akışları içinde dil modellerini bağlama, seçme, yönlendirme, yönetme ve izleme sürecidir.

Neden tek bir dil modeli her göreve uygun değildir?

Dil modelleri akıl yürütme kapasitesi, dil kalitesi, gecikme, token tüketimi, maliyet, bağlam kapasitesi, gizlilik ve işlem gücü ihtiyacı bakımından farklıdır. Her iş yükünde aynı modeli kullanmak verimliliği düşürür ve altyapı maliyetini artırır.

LLM orkestrasyonu yapay zekâ kalitesini nasıl artırır?

Her görev; gereken dil, alan bilgisi, akıl yürütme kapasitesi, bağlam kapasitesi ve çıktı kalitesi için seçilmiş bir modelle çalışır.

LLM orkestrasyonu token tüketimini nasıl azaltır?

Rutin ve yüksek hacimli görevler daha hafif, maliyeti düşük modellere verilir. Bağlam da her model çağrısına gereksiz veri göndermek yerine görevin ihtiyacına göre hazırlanır.

LLM orkestrasyonu GPU verimliliğini nasıl artırır?

Kurumlar her istek için gereğinden büyük model çalıştırmak yerine model boyutunu ve işlem gücünü iş yüküyle eşleştirir. Böylece GPU kaynağı ve altyapı daha verimli kullanılır.

LLM yönlendirme (routing) nedir?

LLM yönlendirme; bir isteği ya da iş akışı adımını görev tipi, karmaşıklık, dil, gecikme, maliyet, gizlilik, altyapı ve kurulum politikası gibi tanımlı kriterlere göre seçilen modele iletir.

Model fallback nedir?

Model fallback; birincil model erişilemez hâle geldiğinde, gecikme eşiğini aştığında ya da tanımlı iş akışı koşullarını karşılamadığında iş yükünü alternatif bir modele veya yürütme yoluna aktarır.

Aynı iş akışında farklı modeller kullanılabilir mi?

Evet. İş akışının farklı aşamaları; dil anlama, bilgi getirme, akıl yürütme, özetleme, bilgi çıkarma ya da doğrulama için farklı modeller kullanabilir.

CBOT özel ve müşterinin barındırdığı modelleri bağlayabilir mi?

Evet. CBOT; ticari, açık kaynak, özel, müşterinin barındırdığı ve CBOT dil modellerini aynı orkestrasyon mimarisinde destekler.

CBOT LLM Orkestrasyonu on-premise çalışabilir mi?

Evet. CBOT; dil modeli inference'ının, orkestrasyonun, RAG'in, vektör depolamanın, kurumsal bilginin, konuşma teknolojilerinin ve tüm runtime'ın on-premise çalışmasını destekler.

LLM orkestrasyonu sağlayıcı bağımlılığını (vendor lock-in) nasıl azaltır?

Kurumsal iş akışı mantığını model sağlayıcılarından ayırır. Böylece tüm süreci yeniden kurmadan model eklersiniz, birleştirirsiniz ya da değiştirirsiniz.

LLM orkestrasyonu ile Agentic AI arasındaki ilişki nedir?

LLM orkestrasyonu, her görevde zekâyı hangi modelin sağlayacağını belirler. Agentic AI ise bu zekâyı planlama, bellek, kurumsal bilgi, araçlar, iş kuralları, iş akışları ve aksiyonlarla birleştirir.

HER İŞ YÜKÜ İÇİN DOĞRU MODEL

Her modelden, token'dan ve işlem kaynağından daha iyi performans alın.

CBOT'un kurumunuza; kalite, hız, token tüketimi, GPU kullanımı, gizlilik ve altyapı maliyeti için optimize edilmiş çok modelli bir mimariyi nasıl kurduğunu görün.