ChatGPT ve benzeri bulut servisleri güçlü — ama sözleşmeler, müşteri verileri veya sağlık kayıtları söz konusu olduğunda birçok kurum veriyi üçüncü taraf API'lara göndermek istemiyor. Çözüm giderek yaygınlaşıyor: local LLM, yani açık kaynak büyük dil modellerini kendi sunucunuzda çalıştırmak. Bu rehber, kurumsal bir local LLM kurulumunun tüm kararlarını — model, donanım, yazılım katmanı, maliyet ve güvenlik — pratik tarafıyla ele alıyor.
Ne Zaman Local LLM Mantıklı?
- Veri gizliliği ve KVKK: Kişisel veya özel nitelikli veri (sağlık, finans, hukuk) işleyen akışlarda verinin yurt dışına çıkmaması ciddi bir uyum avantajıdır.
- Öngörülebilir maliyet: Yüksek hacimli kullanımda token başına ödemek yerine sabit donanım maliyeti daha ekonomik hale gelir.
- Çevrimdışı/izole ortamlar: İnternet erişimi kısıtlı fabrika, saha veya güvenlik ortamlarında tek seçenektir.
Buna karşılık ayda birkaç bin isteklik hafif kullanımda bulut API'ları hâlâ daha pratiktir — local kurulum, hacim ve gizlilik gereksinimi arttıkça anlam kazanır.
Model Seçimi: Boyut ve İş Dengesi
2026 itibarıyla açık kaynak ekosistemde kurumsal işler için öne çıkan aileler: Llama, Qwen, Mistral ve Gemma. Pratik kural:
- 7-9B parametreli modeller: Sınıflandırma, özetleme, basit soru-cevap ve RAG senaryolarının çoğu için yeterli; tek orta seviye GPU ile çalışır.
- 30-70B sınıfı: Karmaşık akıl yürütme, kod üretimi ve çok adımlı görevlerde belirgin fark yaratır; ciddi GPU belleği ister.
- Quantization (nicemleme): 4-bit quantize edilmiş bir 70B model, kalite kaybını sınırlı tutarak bellek ihtiyacını yarıdan fazla düşürür — kurumsal kurulumlarda standart pratiktir.
Önce işi tanımlayın, sonra model seçin. "En büyük modeli kuralım" yaklaşımı, çoğu kurumda atıl GPU yatırımıyla sonuçlanır. Pilot senaryoyu 7-9B ile başlatıp gerekirse büyümek en sağlıklı yoldur.
Ollama mı, vLLM mi?
- Ollama: Kurulumu dakikalar süren, model indirme/sürüm yönetimini basitleştiren bir katmandır. Geliştirme, prototip ve düşük eşzamanlılıkta (birkaç eşzamanlı kullanıcı) küçük ekip kullanımı için idealdir.
- vLLM: Üretim sınıfı sunum (serving) motorudur; continuous batching ve PagedAttention sayesinde aynı donanımdan kat kat fazla eşzamanlı istek geçirir, OpenAI-uyumlu API sunar. Çok kullanıcılı kurumsal yüklerde standart tercihtir.
Pratik yol haritası: pilotu Ollama ile hızlıca ayağa kaldırın, doğrulanan senaryoyu vLLM ile üretime taşıyın. İkisi de aynı açık kaynak modelleri çalıştırdığı için geçiş düşük maliyetlidir.
Donanım: Neye İhtiyacınız Var?
- GPU belleği belirleyicidir: Kabaca, quantize 7-9B modeller 8-12 GB, 30B sınıfı 24-32 GB, 70B sınıfı 48 GB ve üzeri VRAM ister (bağlam uzunluğu arttıkça ihtiyaç büyür).
- Tek sunucu çoğu kuruma yeter: 1-2 adet profesyonel GPU'lu bir sunucu, orta ölçekli bir şirketin iç asistan/RAG yükünü rahat taşır.
- Alternatif: Sermaye harcaması istemeyenler için GPU'lu sunucu kiralama (aylık) — veri yine sizin kontrolünüzde kalacak şekilde kurgulanabilir.
Güvenlik: Local Olması Güvenli Olduğu Anlamına Gelmez
Model içeride çalışsa da LLM uygulama katmanı kendi risklerini taşır:
- Prompt injection: RAG'e bağladığınız dokümanların içine gömülü talimatlar modeli manipüle edebilir; girdi/çıktı filtreleme katmanı şarttır.
- Yetkilendirme: Model, kullanıcının erişemeyeceği dokümanlardan cevap üretmemeli — RAG katmanında belge bazlı erişim kontrolü uygulayın.
- Loglama ve maskeleme: İstek/yanıt loglarında kişisel verinin maskelenmesi, KVKK tarafında kurulumun bütünleyicisidir.
Gerçekçi Kurulum Takvimi
Tipik bir kurumsal pilot: 1. hafta senaryo ve model seçimi + Ollama ile PoC; 2-3. hafta RAG/veri bağlantıları ve erişim kontrolü; 4-6. hafta vLLM ile üretim kurulumu, yük testi ve güvenlik sıkılaştırma. Yani ciddi bir kurulum, doğru ekiple 4-6 haftalık bir projedir.
Sonuç
Local LLM, "bulut yasak" diyen kurumlar için mecburiyet, yüksek hacimli kullanıcılar için maliyet optimizasyonu, veri hassasiyeti olanlar için uyum aracıdır. Başarının anahtarı modelin kendisinden çok kurgudadır: doğru boyutta model, işe uygun sunum katmanı ve baştan tasarlanmış güvenlik kontrolleri. Bu üçünü deneyimli bir ekiple kurgulamak, projenin aylarca sürünmesi ile birkaç haftada değer üretmesi arasındaki farktır.