Çalışanlarınız büyük ihtimalle yapay zeka sohbet araçlarını zaten kullanıyor; sözleşme metinlerini, müşteri yazışmalarını ve iç raporları da bu araçlara yapıştırıyor. Bu verinin şirket dışına çıkmasını istemiyorsanız alternatif, açık ağırlıklı bir dil modelini kendi sunucunuzda çalıştırıp çalışanlara ChatGPT benzeri bir arayüz sunmaktır. Bu rehberde bunun en yaygın açık kaynak yolunu, Ollama + Open WebUI ikilisini, projelerin kendi belgelerine ve model lisanslarına dayanarak (Ekim 2026) anlatıyoruz.
Mimari: üç katman
- Model sunucusu: modeli belleğe yükleyip yanıt üretir. Tek sunucu ve az kullanıcı için Ollama, yoğun kullanım için vLLM.
- Arayüz: çalışanların giriş yaptığı, sohbet geçmişinin tutulduğu, belge yüklenen web uygulaması. Open WebUI hem Ollama'ya hem de OpenAI uyumlu her API'ye bağlanır.
- Şirket verisi (isteğe bağlı): modelin iç belgelere dayanarak yanıt vermesi için RAG. Open WebUI'da yerleşik gelir; daha kapsamlı ihtiyaçlarda Dify veya AnythingLLM gibi araçlar kullanılır.
Model seçimi: boyut ve lisans
Aşağıdaki tablo, Ollama kütüphanesinde bulunan ve şirket içi kullanım için sık tercih edilen modellerden bazılarını, Ollama'nın listelediği indirme boyutlarıyla gösteriyor. İndirme boyutu, modelin belleğe sığması için gereken miktara kabaca yakındır; buna bağlam (context) penceresi ve eşzamanlı istekler için ek bellek eklenir.
| Model (Ollama etiketi) | İndirme boyutu | Bağlam | Lisans |
|---|---|---|---|
| qwen3:8b / 14b / 32b | 5,2 / 9,3 / 20 GB | 40K | Apache 2.0 |
| gemma3:12b / 27b | 8,1 / 17 GB | 128K | Gemma Kullanım Koşulları |
| gemma4:12b / 31b | 7,7 / 19 GB | 256K | Apache 2.0 |
| mistral-small3.2:24b | 15 GB | 128K | Apache 2.0 |
| gpt-oss:20b / 120b | 14 / 65 GB | 128K | Apache 2.0 + kullanım politikası |
| llama3.3:70b | 43 GB | 128K | Llama 3.3 Topluluk Lisansı |
Lisanslarda dikkat edilecekler
- Apache 2.0 (Qwen3, Mistral Small 3.2, gpt-oss, Gemma 4): ticari kullanım dahil serbesttir. gpt-oss'a ayrıca yürürlükteki hukuka uyulmasını isteyen kısa bir kullanım politikası eşlik eder.
- Llama Topluluk Lisansı: aylık 700 milyonun üzerinde aktif kullanıcısı olan şirketler Meta'dan ayrı lisans almalıdır. Llama ile ürün geliştirenler "Built with Llama" ibaresini belirgin biçimde göstermeli, türetilmiş modellerin adı da "Llama" ile başlamalıdır. Kabul edilebilir kullanım politikası da geçerlidir.
- Gemma 3: Google'ın Gemma Kullanım Koşulları ve yasaklı kullanım politikasıyla dağıtılır. Gemma 4 ise Apache 2.0 lisansına geçti.
Pratik öneri: şirket içi sohbet ve belge özetleme için 8–14 milyar parametreli bir modelle başlayın, kaliteyi kendi örnek sorularınızla ölçün, yetmezse büyütün. Türkçe yanıt kalitesi modelden modele belirgin biçimde değişir; karar vermeden önce kendi belgelerinizle deneyin.
Donanım: GPU, bellek ve eşzamanlılık
Ollama; NVIDIA (compute capability 5.0 ve üzeri, sürücü 550+), AMD (ROCm v7) ve Apple Silicon (Metal) GPU'larıyla hızlanır. GPU olmadan da çalışır ama yanıtlar belirgin biçimde yavaşlar. Ollama belgeleri iki ayarın belleği doğrudan etkilediğini belirtir:
- Bağlam uzunluğu: güncel belgelere göre varsayılan bağlam GPU belleğine göre seçilir: 24 GiB altında 4K, 24–48 GiB arasında 32K, 48 GiB ve üzerinde 256K. Uzun belgeleri tek seferde okutacaksanız bağlamı (ve belleği) büyütmeniz gerekir.
- Paralel istek:
OLLAMA_NUM_PARALLELvarsayılan olarak 1'dir; yani bir model aynı anda tek isteğe yanıt verir, diğerleri kuyruğa girer. Değeri artırmak mümkündür, ancak belgeye göre gereken bellek paralel istek × bağlam uzunluğu ile büyür. - Bellekte tutma: kullanılmayan bir model varsayılan olarak 5 dakika sonra bellekten çıkarılır; ilk istekte yeniden yüklenmesi birkaç saniye sürebilir.
keep_aliveile bu süre uzatılabilir.
Bu yüzden 10–20 kişinin ara ara kullandığı bir ortam için tek GPU'lu bir sunucuda Ollama yeterli olabilir. Onlarca kişinin aynı anda kullanacağı bir sistemde ise eşzamanlı istekleri toplu işleyen (continuous batching, PagedAttention) ve yüksek verim için tasarlanmış vLLM daha doğru seçimdir. vLLM de OpenAI uyumlu bir API sunar; Open WebUI ona da aynı şekilde bağlanır.
Open WebUI: şirket için gerekenler
- Kullanıcı yönetimi: rol tabanlı yetkilendirme ve kullanıcı grupları. Hangi grubun hangi modeli kullanacağı ayrı ayrı belirlenebilir.
- Kurumsal giriş: LDAP/Active Directory, OAuth ile tek oturum açma (Okta, Azure AD, Google Workspace) ve SCIM 2.0. Şirkette Keycloak ya da authentik varsa ona bağlanır.
- Belgelerle çalışma (RAG): yerleşik belge yükleme, vektör veritabanı seçenekleri, hibrit arama ve yeniden sıralama.
- Veritabanı: varsayılan SQLite (isteğe bağlı şifreli). Çok kullanıcılı kurulumda PostgreSQL önerilir.
- Tamamen çevrim dışı çalışabilir; isterseniz SearXNG gibi bir arama motoruyla web araması eklenebilir.
Lisans notu: Open WebUI'ın 0.6.6 (Nisan 2025) ve sonraki sürümlerindeki lisans, son 30 günde 50'den fazla kullanıcısı olan kurulumlarda "Open WebUI" markasının kaldırılmasını ya da değiştirilmesini yazılı izin veya kurumsal lisans şartına bağlar. Markayı olduğu gibi bırakarak kullanmak serbesttir. Arayüze kendi logonuzu koymayı planlıyorsanız bunu baştan hesaba katın.
Güvenlik: en sık yapılan hata
Ollama varsayılan olarak yalnızca 127.0.0.1:11434 adresini dinler ve yerel API'si kimlik doğrulama istemez. Ağdan erişim için OLLAMA_HOST=0.0.0.0 yapıldığında, o porta ulaşabilen herkes modeli parolasız kullanabilir. Doğru düzen şudur:
- Ollama yalnızca iç ağda ya da aynı sunucuda Open WebUI'ın erişebileceği şekilde çalışsın; 11434 portu internete açılmasın.
- Kullanıcılar yalnız Open WebUI'a, HTTPS ve şirket girişi (LDAP/SSO) ile ulaşsın.
- Başka uygulamalar API kullanacaksa önlerine kimlik doğrulama yapan bir ters vekil (nginx) konsun.
- Sohbet geçmişi ve yüklenen belgeler Open WebUI veritabanında ve dosya deposunda tutulur; bunlar da yedekleme planına girmelidir.
Ne zaman kendi sunucunuzda çalıştırmayın?
- En yüksek model kalitesi şartsa: kendi sunucunuzda çalıştırabileceğiniz modeller, en büyük ticari modellerin bazı görevlerdeki kalitesine ulaşmayabilir. Gizlilik ile kalite arasındaki dengeyi kullanım senaryosuna göre kurun.
- Kullanım çok seyrekse: GPU'lu bir sunucu, ayda birkaç yüz soru için pahalı kalabilir. Hassas olmayan işler için bulut API'si daha ekonomik olabilir.
- Bakımı üstlenecek kimse yoksa: modeller, Ollama ve Open WebUI sık güncellenir. Güncellenmeyen bir yapay zeka sunucusu, diğer sunucular gibi zamanla risk taşır.
e-veri.com ile kendi yapay zeka sunucunuz
Kullanım senaryonuza göre model ve donanım seçimini birlikte yapıyoruz. Ollama veya vLLM ile Open WebUI'ı Türkiye'deki sunucularımızda ya da sizin altyapınızda kuruyor; şirket girişini (LDAP/SSO), HTTPS'i, kullanıcı gruplarını ve belge (RAG) kurulumunu yapıyoruz. Yedekleme, izleme ve güncellemeleri de üstleniyoruz. Ayrıntılar kurumsal hizmetler sayfamızda; diğer seçenekler yapay zeka çözümleri kategorimizde.
Sık sorulan sorular
Ollama ve Open WebUI ücretsiz mi?
Evet. Ollama MIT lisanslıdır. Open WebUI kendi lisansıyla ücretsiz kullanılabilir; yalnız son 30 günde 50'den fazla kullanıcısı olan kurulumlarda "Open WebUI" markasını kaldırmak için yazılı izin veya kurumsal lisans gerekir.
Hangi açık modeller ticari kullanıma uygun?
Qwen3, Mistral Small 3.2, gpt-oss ve Gemma 4 Apache 2.0 lisanslıdır ve ticari kullanıma açıktır. Llama modelleri Meta'nın topluluk lisansıyla, Gemma 3 ise Google'ın kullanım koşullarıyla gelir. Bu lisansların ek şartları vardır.
Ollama'yı internete açmak güvenli mi?
Hayır. Ollama'nın yerel API'si kimlik doğrulama istemez. Ollama yalnız iç ağda çalışmalı; kullanıcılar HTTPS ve şirket girişi olan Open WebUI üzerinden erişmeli, başka uygulamalar için önüne kimlik doğrulamalı bir ters vekil konmalıdır.
Kaç kişi aynı anda kullanabilir?
Ollama'da bir model varsayılan olarak aynı anda tek isteği işler, diğerleri kuyruğa girer. Paralel istek sayısı artırılabilir ama bellek ihtiyacı paralel istek × bağlam uzunluğu oranında büyür. Çok sayıda eşzamanlı kullanıcı için vLLM önerilir.
GPU olmadan çalışır mı?
Ollama işlemciyle de çalışır, ancak yanıtlar belirgin biçimde yavaşlar. Şirket içi düzenli kullanım için NVIDIA, AMD (ROCm) veya Apple Silicon GPU'lu bir sunucu önerilir.
Şirket belgelerimizle nasıl çalıştırırım?
Open WebUI'ın yerleşik RAG özelliğiyle belgeler yüklenir, vektör veritabanında dizinlenir ve model yanıtlarken bu belgelerden yararlanır. Daha karmaşık iş akışları için Dify veya AnythingLLM gibi araçlar kullanılabilir.