Müşteri PaneliDestek TalebiSunucu DurumuDuyurular+90 555 966 44 00
Yazılım

Kendi Sunucunuzda Yapay Zeka 2026: Ollama + Open WebUI ile Şirket İçi ChatGPT

📅 6 gün önce ⏱ 10 dk okuma 👁 49
Ollama + Open WebUI: API kimlik doğrulaması yok, varsayılan 1 paralel istek, 5 dakika bellekte tutma; Apache 2.0 modeller (Qwen3, gpt-oss, Mistral Small, Gemma 4), RAG, LDAP/SSO

Çalışanlarınız büyük ihtimalle yapay zeka sohbet araçlarını zaten kullanıyor; sözleşme metinlerini, müşteri yazışmalarını ve iç raporları da bu araçlara yapıştırıyor. Bu verinin şirket dışına çıkmasını istemiyorsanız alternatif, açık ağırlıklı bir dil modelini kendi sunucunuzda çalıştırıp çalışanlara ChatGPT benzeri bir arayüz sunmaktır. Bu rehberde bunun en yaygın açık kaynak yolunu, Ollama + Open WebUI ikilisini, projelerin kendi belgelerine ve model lisanslarına dayanarak (Ekim 2026) anlatıyoruz.

Kısa cevap: Modeli Ollama çalıştırır, çalışanlar Open WebUI arayüzünü kullanır. Open WebUI belge yükleme (RAG), kullanıcı grupları ve LDAP/SSO girişi sunar. Model seçiminde boyut kadar lisans da önemlidir: Qwen3, gpt-oss, Mistral Small 3.2 ve Gemma 4 Apache 2.0 lisanslıdır; Llama ve Gemma 3 ise kendi kullanım koşullarıyla gelir. Ollama'nın API'sinde kimlik doğrulama yoktur, bu yüzden internete doğrudan açılmamalıdır. Çok sayıda eşzamanlı kullanıcı için vLLM daha uygundur.

Mimari: üç katman

  1. Model sunucusu: modeli belleğe yükleyip yanıt üretir. Tek sunucu ve az kullanıcı için Ollama, yoğun kullanım için vLLM.
  2. Arayüz: çalışanların giriş yaptığı, sohbet geçmişinin tutulduğu, belge yüklenen web uygulaması. Open WebUI hem Ollama'ya hem de OpenAI uyumlu her API'ye bağlanır.
  3. Şirket verisi (isteğe bağlı): modelin iç belgelere dayanarak yanıt vermesi için RAG. Open WebUI'da yerleşik gelir; daha kapsamlı ihtiyaçlarda Dify veya AnythingLLM gibi araçlar kullanılır.

Model seçimi: boyut ve lisans

Aşağıdaki tablo, Ollama kütüphanesinde bulunan ve şirket içi kullanım için sık tercih edilen modellerden bazılarını, Ollama'nın listelediği indirme boyutlarıyla gösteriyor. İndirme boyutu, modelin belleğe sığması için gereken miktara kabaca yakındır; buna bağlam (context) penceresi ve eşzamanlı istekler için ek bellek eklenir.

Model (Ollama etiketi)İndirme boyutuBağlamLisans
qwen3:8b / 14b / 32b5,2 / 9,3 / 20 GB40KApache 2.0
gemma3:12b / 27b8,1 / 17 GB128KGemma Kullanım Koşulları
gemma4:12b / 31b7,7 / 19 GB256KApache 2.0
mistral-small3.2:24b15 GB128KApache 2.0
gpt-oss:20b / 120b14 / 65 GB128KApache 2.0 + kullanım politikası
llama3.3:70b43 GB128KLlama 3.3 Topluluk Lisansı

Lisanslarda dikkat edilecekler

Pratik öneri: şirket içi sohbet ve belge özetleme için 8–14 milyar parametreli bir modelle başlayın, kaliteyi kendi örnek sorularınızla ölçün, yetmezse büyütün. Türkçe yanıt kalitesi modelden modele belirgin biçimde değişir; karar vermeden önce kendi belgelerinizle deneyin.

Donanım: GPU, bellek ve eşzamanlılık

Ollama; NVIDIA (compute capability 5.0 ve üzeri, sürücü 550+), AMD (ROCm v7) ve Apple Silicon (Metal) GPU'larıyla hızlanır. GPU olmadan da çalışır ama yanıtlar belirgin biçimde yavaşlar. Ollama belgeleri iki ayarın belleği doğrudan etkilediğini belirtir:

Bu yüzden 10–20 kişinin ara ara kullandığı bir ortam için tek GPU'lu bir sunucuda Ollama yeterli olabilir. Onlarca kişinin aynı anda kullanacağı bir sistemde ise eşzamanlı istekleri toplu işleyen (continuous batching, PagedAttention) ve yüksek verim için tasarlanmış vLLM daha doğru seçimdir. vLLM de OpenAI uyumlu bir API sunar; Open WebUI ona da aynı şekilde bağlanır.

Open WebUI: şirket için gerekenler

Lisans notu: Open WebUI'ın 0.6.6 (Nisan 2025) ve sonraki sürümlerindeki lisans, son 30 günde 50'den fazla kullanıcısı olan kurulumlarda "Open WebUI" markasının kaldırılmasını ya da değiştirilmesini yazılı izin veya kurumsal lisans şartına bağlar. Markayı olduğu gibi bırakarak kullanmak serbesttir. Arayüze kendi logonuzu koymayı planlıyorsanız bunu baştan hesaba katın.

Güvenlik: en sık yapılan hata

Ollama varsayılan olarak yalnızca 127.0.0.1:11434 adresini dinler ve yerel API'si kimlik doğrulama istemez. Ağdan erişim için OLLAMA_HOST=0.0.0.0 yapıldığında, o porta ulaşabilen herkes modeli parolasız kullanabilir. Doğru düzen şudur:

Ne zaman kendi sunucunuzda çalıştırmayın?

e-veri.com ile kendi yapay zeka sunucunuz

Kullanım senaryonuza göre model ve donanım seçimini birlikte yapıyoruz. Ollama veya vLLM ile Open WebUI'ı Türkiye'deki sunucularımızda ya da sizin altyapınızda kuruyor; şirket girişini (LDAP/SSO), HTTPS'i, kullanıcı gruplarını ve belge (RAG) kurulumunu yapıyoruz. Yedekleme, izleme ve güncellemeleri de üstleniyoruz. Ayrıntılar kurumsal hizmetler sayfamızda; diğer seçenekler yapay zeka çözümleri kategorimizde.

Sık sorulan sorular

Ollama ve Open WebUI ücretsiz mi?

Evet. Ollama MIT lisanslıdır. Open WebUI kendi lisansıyla ücretsiz kullanılabilir; yalnız son 30 günde 50'den fazla kullanıcısı olan kurulumlarda "Open WebUI" markasını kaldırmak için yazılı izin veya kurumsal lisans gerekir.

Hangi açık modeller ticari kullanıma uygun?

Qwen3, Mistral Small 3.2, gpt-oss ve Gemma 4 Apache 2.0 lisanslıdır ve ticari kullanıma açıktır. Llama modelleri Meta'nın topluluk lisansıyla, Gemma 3 ise Google'ın kullanım koşullarıyla gelir. Bu lisansların ek şartları vardır.

Ollama'yı internete açmak güvenli mi?

Hayır. Ollama'nın yerel API'si kimlik doğrulama istemez. Ollama yalnız iç ağda çalışmalı; kullanıcılar HTTPS ve şirket girişi olan Open WebUI üzerinden erişmeli, başka uygulamalar için önüne kimlik doğrulamalı bir ters vekil konmalıdır.

Kaç kişi aynı anda kullanabilir?

Ollama'da bir model varsayılan olarak aynı anda tek isteği işler, diğerleri kuyruğa girer. Paralel istek sayısı artırılabilir ama bellek ihtiyacı paralel istek × bağlam uzunluğu oranında büyür. Çok sayıda eşzamanlı kullanıcı için vLLM önerilir.

GPU olmadan çalışır mı?

Ollama işlemciyle de çalışır, ancak yanıtlar belirgin biçimde yavaşlar. Şirket içi düzenli kullanım için NVIDIA, AMD (ROCm) veya Apple Silicon GPU'lu bir sunucu önerilir.

Şirket belgelerimizle nasıl çalıştırırım?

Open WebUI'ın yerleşik RAG özelliğiyle belgeler yüklenir, vektör veritabanında dizinlenir ve model yanıtlarken bu belgelerden yararlanır. Daha karmaşık iş akışları için Dify veya AnythingLLM gibi araçlar kullanılabilir.

İlgili rehberler:

İlgili Makaleler