Yapay Zeka

Kurumsal Ortamda Local LLM Kurulumu: Ollama ve vLLM ile Şirket İçi Yapay Zeka (2026)

01 Sep 2026
12 dakika okuma
İninia Teknoloji
3
0

ChatGPT ve benzeri bulut servisleri güçlü — ama sözleşmeler, müşteri verileri veya sağlık kayıtları söz konusu olduğunda birçok kurum veriyi üçüncü taraf API'lara göndermek istemiyor. Çözüm giderek yaygınlaşıyor: local LLM, yani açık kaynak büyük dil modellerini kendi sunucunuzda çalıştırmak. Bu rehber, kurumsal bir local LLM kurulumunun tüm kararlarını — model, donanım, yazılım katmanı, maliyet ve güvenlik — pratik tarafıyla ele alıyor.

Ne Zaman Local LLM Mantıklı?

  • Veri gizliliği ve KVKK: Kişisel veya özel nitelikli veri (sağlık, finans, hukuk) işleyen akışlarda verinin yurt dışına çıkmaması ciddi bir uyum avantajıdır.
  • Öngörülebilir maliyet: Yüksek hacimli kullanımda token başına ödemek yerine sabit donanım maliyeti daha ekonomik hale gelir.
  • Çevrimdışı/izole ortamlar: İnternet erişimi kısıtlı fabrika, saha veya güvenlik ortamlarında tek seçenektir.

Buna karşılık ayda birkaç bin isteklik hafif kullanımda bulut API'ları hâlâ daha pratiktir — local kurulum, hacim ve gizlilik gereksinimi arttıkça anlam kazanır.

Model Seçimi: Boyut ve İş Dengesi

2026 itibarıyla açık kaynak ekosistemde kurumsal işler için öne çıkan aileler: Llama, Qwen, Mistral ve Gemma. Pratik kural:

  • 7-9B parametreli modeller: Sınıflandırma, özetleme, basit soru-cevap ve RAG senaryolarının çoğu için yeterli; tek orta seviye GPU ile çalışır.
  • 30-70B sınıfı: Karmaşık akıl yürütme, kod üretimi ve çok adımlı görevlerde belirgin fark yaratır; ciddi GPU belleği ister.
  • Quantization (nicemleme): 4-bit quantize edilmiş bir 70B model, kalite kaybını sınırlı tutarak bellek ihtiyacını yarıdan fazla düşürür — kurumsal kurulumlarda standart pratiktir.
Önce işi tanımlayın, sonra model seçin. "En büyük modeli kuralım" yaklaşımı, çoğu kurumda atıl GPU yatırımıyla sonuçlanır. Pilot senaryoyu 7-9B ile başlatıp gerekirse büyümek en sağlıklı yoldur.

Ollama mı, vLLM mi?

  • Ollama: Kurulumu dakikalar süren, model indirme/sürüm yönetimini basitleştiren bir katmandır. Geliştirme, prototip ve düşük eşzamanlılıkta (birkaç eşzamanlı kullanıcı) küçük ekip kullanımı için idealdir.
  • vLLM: Üretim sınıfı sunum (serving) motorudur; continuous batching ve PagedAttention sayesinde aynı donanımdan kat kat fazla eşzamanlı istek geçirir, OpenAI-uyumlu API sunar. Çok kullanıcılı kurumsal yüklerde standart tercihtir.

Pratik yol haritası: pilotu Ollama ile hızlıca ayağa kaldırın, doğrulanan senaryoyu vLLM ile üretime taşıyın. İkisi de aynı açık kaynak modelleri çalıştırdığı için geçiş düşük maliyetlidir.

Donanım: Neye İhtiyacınız Var?

  • GPU belleği belirleyicidir: Kabaca, quantize 7-9B modeller 8-12 GB, 30B sınıfı 24-32 GB, 70B sınıfı 48 GB ve üzeri VRAM ister (bağlam uzunluğu arttıkça ihtiyaç büyür).
  • Tek sunucu çoğu kuruma yeter: 1-2 adet profesyonel GPU'lu bir sunucu, orta ölçekli bir şirketin iç asistan/RAG yükünü rahat taşır.
  • Alternatif: Sermaye harcaması istemeyenler için GPU'lu sunucu kiralama (aylık) — veri yine sizin kontrolünüzde kalacak şekilde kurgulanabilir.

Güvenlik: Local Olması Güvenli Olduğu Anlamına Gelmez

Model içeride çalışsa da LLM uygulama katmanı kendi risklerini taşır:

  • Prompt injection: RAG'e bağladığınız dokümanların içine gömülü talimatlar modeli manipüle edebilir; girdi/çıktı filtreleme katmanı şarttır.
  • Yetkilendirme: Model, kullanıcının erişemeyeceği dokümanlardan cevap üretmemeli — RAG katmanında belge bazlı erişim kontrolü uygulayın.
  • Loglama ve maskeleme: İstek/yanıt loglarında kişisel verinin maskelenmesi, KVKK tarafında kurulumun bütünleyicisidir.

Gerçekçi Kurulum Takvimi

Tipik bir kurumsal pilot: 1. hafta senaryo ve model seçimi + Ollama ile PoC; 2-3. hafta RAG/veri bağlantıları ve erişim kontrolü; 4-6. hafta vLLM ile üretim kurulumu, yük testi ve güvenlik sıkılaştırma. Yani ciddi bir kurulum, doğru ekiple 4-6 haftalık bir projedir.

Sonuç

Local LLM, "bulut yasak" diyen kurumlar için mecburiyet, yüksek hacimli kullanıcılar için maliyet optimizasyonu, veri hassasiyeti olanlar için uyum aracıdır. Başarının anahtarı modelin kendisinden çok kurgudadır: doğru boyutta model, işe uygun sunum katmanı ve baştan tasarlanmış güvenlik kontrolleri. Bu üçünü deneyimli bir ekiple kurgulamak, projenin aylarca sürünmesi ile birkaç haftada değer üretmesi arasındaki farktır.

Bu konuda bir yazılım projesi mi planlıyorsunuz?

Projenizi birlikte analiz edip teknik yol haritasını çıkarabiliriz. Ücretsiz keşif görüşmesi için hemen yazın.

İninia Teknoloji

İstanbul Teknik Üniversitesi ARI Teknokent'te kurulu Ininia Teknoloji, 12+ yıllık deneyimle AR/VR, yapay zeka ve mobil uygulama alanlarında yenilikçi çözümler sunmaktadır.

Projeniz için profesyonel destek mi arıyorsunuz?

12+ yıllık deneyimimizle dijital dönüşümünüzü hızlandıralım.

Ücretsiz Görüşme Talep Et