TR / EN

Yerel Yapay Zekâ Modeli Kurarken Donanım ve Model Dengesi

Yerel yapay zekâ denemelerinde ilk soru genellikle “Bu bilgisayar kaç milyar parametreli model çalıştırır?” oluyor. Bir iş istasyonunda model gerçekten açılmış, fakat uzun belgelerde cevap süresi uzamış, bağlam büyüdüğünde GPU kullanımı değişmiş ve eş zamanlı kullanıcı düşünülünce deneyim sürdürülemez hale gelmişti. Teknik olarak çalışmak ile iş için kullanılabilir olmak aynı sonuç değildir.

17-20 Temmuz 2026 arasında Windows ve Ollama üzerinde yaptığımız değerlendirmede model adından önce kullanım profilini tanımladık. Kod yardımı, Türkçe metin özeti, görsel anlama ve araç çağırma farklı kalite ile kaynak beklentileri taşır. Amaç laboratuvar rekoru değil; veriyi kontrollü tutan, ölçülebilir ve desteklenebilir bir yerel AI hizmeti kurmaktı.

Sorunun ortaya çıkışı

Qwen ve Gemma sınıfındaki farklı modeller denenirken katalogdaki parametre sayısı ana seçim ölçütü yapılmıştı. Daha büyük modelin her görevde daha iyi olacağı kabul ediliyor, quantization düzeyi ile bağlam uzunluğunun bellek etkisi gözden kaçıyordu. Model dosyası GPU belleğine sığsa bile KV cache, çalışma zamanı payı, görüntü bileşeni ve işletim sisteminin kullandığı kaynaklar için yeterli boşluk kalmayabiliyordu.

İş beklentileri de tek listede toplanmıştı: doküman özetleme, kod üretimi, kurum içi soru-cevap, görsel analizi ve otomasyon. Oysa bir modelin Türkçe anlatımı güçlü olabilirken araç çağırma biçimi zayıf, başka bir model kodda iyi iken uzun bağlamda yavaş olabilirdi. Önce görevleri önem, veri hassasiyeti, beklenen doğruluk ve kabul edilebilir yanıt süresine göre ayırdık.

İlk belirtiler ve yanlış varsayımlar

İlk belirti GPU kullanımının bazı isteklerde yüksek, bazılarında beklenmedik biçimde düşük olmasıydı. Bu durum hemen sürücü arızası sanıldı. Gerçekte modelin bir bölümü sistem belleğine taşınıyor, uzun bağlam veya farklı quantization nedeniyle CPU-GPU paylaşımı değişiyordu. Token üretim hızı ile ilk token gecikmesi de tek metrik sanılmıştı; kullanıcı deneyiminde ikisi farklı etkiler yaratır.

“RAM iki katına çıkarsa hız iki katına çıkar” ve “daha düşük quantization her zaman kabul edilemez kalite verir” varsayımları da ölçümle doğrulanmadı. Sistem belleği modeli çalıştırmayı mümkün kılabilir, fakat GPU belleği darboğazını otomatik olarak çözmez. Quantization etkisi modele ve göreve göre değişir. Aynı örnek kümesiyle kalite, gecikme ve kaynak tüketimi ölçülmeden katalog bilgisine dayanmak güvenilir değildir.

Teknik analiz

Model ağırlıklarının yaklaşık bellek ihtiyacı parametre sayısı ve bit genişliğiyle tahmin edilebilir; ancak bu yalnızca başlangıçtır. Çalışma zamanı ek yükü, KV cache, context window, batch büyüklüğü ve eş zamanlı oturumlar ayrıca yer tüketir. VRAM dolduğunda katmanların RAM ve CPU tarafına taşınması kapasite sağlar, fakat veri yolu ve işlem hızı nedeniyle gecikmeyi artırabilir. Ölçüm bu nedenle gerçek istemlerle yapılmalıdır.

Test matrisine model sürümü, quantization, bağlam uzunluğu, GPU aktarım oranı, ilk token süresi, saniyedeki token, tepe VRAM/RAM ve görev kalitesi eklendi. Türkçe özet, teknik soru, güvenli kod inceleme ve uzun belge bulma gibi anonim örnekler sabitlendi. Vision ve tool desteği yalnızca katalogda var diye kabul edilmedi; arayüzün, şablonun ve agent katmanının bu yeteneği doğru kullanıp kullanmadığı da doğrulandı.

# Yalnızca yerel model envanteri ve çalışma durumunu gözlemleyin.
ollama list
ollama ps

# İşletim sisteminde GPU kullanımını üreticinin desteklenen aracıyla izleyin.
# Sonuçları aynı test metni ve aynı bağlam ayarıyla karşılaştırın.

Uygulanan çözüm veya önerilen mimari

Tek model yaklaşımı yerine kullanım profillerine göre küçük bir model kataloğu önerdik. Günlük hızlı işler için daha küçük ve dengeli quantize model, zor analiz için daha güçlü fakat kontrollü kullanılan model, görsel işler için ilgili yeteneği doğrulanmış ayrı seçenek tanımlandı. Varsayılan context gereksiz büyütülmedi; kullanıcıya görevine uygun profil sunuldu. Böylece donanım yükseltmeden önce mevcut kapasite daha verimli kullanıldı.

Ollama model sunumu ile web arayüzü ve erişim katmanı ayrı değerlendirildi. Kaynak ölçümleri merkezi kayda alınırken istem içeriği gereksiz yere loglanmadı. Kurumsal belge kullanımı için erişim kontrolü, saklama politikası ve RAG veri yetkileri model seçiminden bağımsız güvenlik gereksinimleri olarak ele alındı. Pilot sonuçları kabul eşiğini karşılamazsa donanım yatırımı somut ölçüme dayandırıldı.

Alternatifler ve karar gerekçesi

Tamamen yerel çalışma veri kontrolü ve çevrimdışı kullanım sağlar; buna karşılık ilk yatırım, enerji, bakım ve kapasite sınırı getirir. Bulut API seçenekleri ölçek ve güçlü modellere erişim sunabilir, ancak veri işleme koşulları, değişken maliyet, bağlantı ve sağlayıcı bağımlılığı değerlendirilmelidir. Hassas görevleri yerelde, uygun sınıftaki yoğun veya özel işleri onaylı hizmette çalıştıran hibrit yaklaşım birçok kurum için dengelidir.

Tek büyük GPU almak sade görünür; birden fazla kullanıcı, yüksek erişilebilirlik veya büyüme hedefinde iş istasyonu mimarisi kısa sürede sınır olabilir. CPU ağırlıklı çalışma düşük başlangıç maliyetiyle deneme sağlar fakat etkileşimli kullanımda yavaş kalabilir. Kararı en yüksek parametreye göre değil, hedef görevlerin yüzde kaçını kabul edilen kalite ve sürede karşıladığına göre vermek daha savunulabilir oldu.

Güvenlik ve operasyonel riskler

Yerel model kullanmak verinin otomatik olarak güvende olduğu anlamına gelmez. Web arayüzü, sohbet geçmişi, yüklenen belgeler, eklentiler ve yedekler ayrı veri yüzeyleridir. Servis yalnızca gerekli ağ alanından erişilmeli, güçlü kimlik doğrulama uygulanmalı, modeller ile konteynerler güvenilir kaynaklardan alınmalı ve güncellemeler önce test ortamında doğrulanmalıdır. Gizli anahtarlar istemlere veya model dosyalarına eklenmemelidir.

Model çıktıları doğru görünse de hatalı olabilir; özellikle yapılandırma, hukuk, insan kaynakları ve güvenlik kararlarında insan onayı gerekir. Araç çağıran modellerin dosya ve terminal izinleri varsayılan olarak sınırlandırılmalı, çalışma alanı ayrılmalı ve yıkıcı eylemler açık onaya bağlanmalıdır. Kaynak tükenmesi, disk büyümesi ve model sürümü değişikliğine karşı kapasite, yedekleme ve geri dönüş planı tutulmalıdır.

Çıkarılan Dersler

Kontrol Listesi