Qwen3.8-27B modelini LM Studio 0.4.21 üzerinde gerçek bir Windows bilgisayarda yükledik; ilk engine hatasından RTX 2070 8 GB VRAM sınırına, GPU Offload denemelerinden Think/Reasoning gecikmesine kadar tüm süreci 22 gerçek ekran görüntüsüyle belgeledik.
Context 4096
CPU Threads 6
Eval Batch 1024
Concurrent 1
Dedicated Limit ON
Think OFF
Clean test 2.82 tok/snQwen3.8-27B, LM Studio model kataloğunda dense 27B vision-language model olarak listeleniyor. Kodlama, profesyonel çalışma, araştırma ve uzun süreli agent görevleri hedefleniyor; vision, tool use ve configurable reasoning yetenekleri bulunuyor. Model sayfasında native 262K context window belirtiliyor.
Bu sayfadaki amaç sentetik benchmark paylaşmak değil; gerçek bir Windows bilgisayarda modeli indirip LM Studio 0.4.21 içinde yüklerken yaşadığımız hatayı, GPU offload denemelerini, RTX 2070 8 GB VRAM sınırını ve Think/Reasoning davranışını aynı ekran görüntüleri üzerinden belgelemek.
Test bilgisayarında Intel Core i7-10875H, 63.84 GB RAM ve NVIDIA GeForce RTX 2070 8 GB CUDA GPU kullanıldı. Dolayısıyla burada ölçülen token/sn değerleri yalnız bu sisteme aittir.
Model indirme işleminden hemen sonra ilk Load Model denemesinde LM Studio sağ altta “Model yüklenemedi” ve “Engine protocol startup was aborted” uyarısını gösterdi. Bu mesaj tek başına kesin bir RAM, CUDA veya model bozukluğu teşhisi değildir; inference engine model hazır duruma gelmeden başlangıç süreci kesilmiştir.
Pratikte ilk kontrol download işleminin gerçekten bitip bitmediği, model dosyasının listede doğru görünmesi ve runtime'ın güncel olmasıdır. Sonra modeli yeniden Load Model ile yüklemek, gerekirse context ve GPU offload değerlerini düşürmek ve LM Studio loglarındaki CUDA/Vulkan/memory satırlarını incelemek gerekir.
Bu testte bekleyip modeli yeniden yüklediğimizde aynı Qwen3.8-27B modelinin başarıyla açıldığını gördük. Bu nedenle ilk uyarıyı görür görmez model dosyasını silmek yerine önce tekrar yükleme ve kaynak kontrolü yapmak daha doğru oldu.
Model ilk kez çalıştığında bağlam uzunluğu 8192, GPU yük aktarma 21, CPU thread pool 6, evaluation batch 2048, physical batch 512 ve Max Concurrent Predictions 4 görünüyordu. Basit “merhabalar” mesajında model yanıt üretebildi.
İlk ekranda yaklaşık 2.74 token/sn görülürken cevap öncesi “Thought for 13.66 seconds” satırı da vardı. Yani hissedilen gecikme yalnız ham token üretim hızından değil, modelin basit selamlaşma için bile reasoning üretmesinden kaynaklanıyordu.
Optimizasyona başlamadan önce aynı promptu ve aynı sohbet koşullarını korumak önemlidir. Aksi halde context büyüklüğü, geçmiş mesaj sayısı ve reasoning tokenları farklılaştığı için ayarları adil karşılaştıramazsınız.
Günlük kullanım için 262K veya çok yüksek context yerine önce 4096 ile başladık. GPU offload 21'den 23'e çıkarıldı, evaluation batch 1024'e indirildi ve tek kullanıcı testi için Max Concurrent Predictions 1 yapıldı. Unified KV Cache açık bırakıldı.
Bu profil model yeniden yüklendikten sonra yaklaşık 2.89 token/sn gördü. 21 offload profilindeki 2.74 token/sn ile kıyaslandığında küçük ama ölçülebilir bir iyileşme vardı. Daha önemlisi, ayar değişikliğinin modelin yüklenmesini bozmadığı doğrulandı.
CPU thread pool 6 olarak tutuldu. Thread değerini sistemdeki tüm mantıksal çekirdeklere zorlamak her zaman daha hızlı sonuç vermez; en doğru yöntem aynı promptla birkaç sabit değeri benchmark etmektir.
Context Length: 4096
GPU Offload: 23
CPU Thread Pool: 6
Evaluation Batch: 1024
Physical Batch: 512
Max Concurrent Predictions: 1
Unified KV Cache: ON


GPU offload kaydırıcısını maksimuma yakın 65'e çıkarmak ilk bakışta mantıklı görünebilir: daha fazla katman GPU'da ise daha hızlı olmasını beklersiniz. Ancak 27B modelin ağırlıkları ve çalışma tamponları RTX 2070'in 8 GB dedicated VRAM'ine bütünüyle sığmaz.
Dedicated GPU Memory limiti kapalıyken 65 offload denemesinde prompt işleme uzadı ve üretim hızı yaklaşık 1.30 token/sn seviyesine düştü. Aynı sistemde daha düşük 23 offload 2.89 token/sn verdiği için “maksimum offload = maksimum hız” varsayımı bu testte geçerli değildi.
Windows shared GPU memory devreye girdiğinde GPU'nun sistem RAM'ine erişmesi PCIe ve bellek taşıma maliyeti nedeniyle performansı aşağı çekebilir. LM Studio bu senaryo için dedicated GPU memory limiter seçeneği sunuyor.




LM Studio Hardware ekranında sistem donanımı doğrudan görünür: bu testte i7-10875H, 63.84 GB RAM ve RTX 2070 8 GB VRAM raporlandı. Aynı ekranda “Limit Model Offload to Dedicated GPU Memory” seçeneği ilk başta kapalıydı.
LM Studio'nun resmi açıklamasına göre bu seçenek açıkken model ağırlıkları dedicated GPU memory ile sınırlandırılır; model ağırlıkları VRAM'e sığmazsa GPU offload miktarı otomatik azaltılır ve kalan ağırlıklar sistem RAM'inde tutulur. Bu, model ağırlıklarının shared GPU memory'ye taşınmasını engellemeyi hedefler.
“Offload KV Cache to GPU Memory” ayarı bu testte açık bırakıldı. KV cache için VRAM yetmiyorsa bunu ayrıca ON/OFF benchmark etmek mümkündür; LM Studio REST load dokümanında kapalı olduğunda KV cache'in CPU memory/RAM tarafında tutulduğu belirtilir.
Windows kısayolu: Ctrl + Shift + H
RTX 2070: ON
Limit Model Offload to Dedicated GPU Memory: ON
Offload KV Cache to GPU Memory: ONDedicated GPU Memory limiter açıldıktan sonra GPU Offload tekrar 65 seçildi. LM Studio yükleme penceresinde “Model offload limited to dedicated GPU memory. Actual number of offloaded layers may differ” mesajını gösterdi. Bu, kaydırıcıdaki 65'in zorunlu gerçek katman sayısı olmadığını doğruluyor.
Model bu profil ile yeniden yüklendi ve testte yaklaşık 2.45 token/sn görüldü. Bu, limiter kapalı 65 offload testindeki 1.30 token/sn'den belirgin şekilde iyiydi; ancak 23 offload profilindeki 2.89 token/sn değerinin gerisinde kaldı.
Sonuç: limiter güvenli bir temel sağlıyor ama optimum performans yine benchmark ile bulunmalı. Bazı sistemlerde manuel orta seviye offload, bazı sistemlerde limiter ile maksimum talep daha iyi çalışabilir.




Qwen3.8-27B reasoning destekliyor. Ekran görüntülerinde aynı “Merhabalar” benzeri kısa mesajlarda 13.66, 26.42 ve 38.52 saniyelik thinking süreleri görüldü. Kullanıcı açısından model yavaşmış gibi görünse de bu sürenin önemli bölümü görünür cevaptan önce üretilen reasoning tokenlarıydı.
Think seçeneği kapatıldığında model basit sohbetlerde doğrudan final cevaba geçmeye başladı. Günlük soru, kısa metin, basit çeviri veya hızlı chat için bu profil daha kullanışlıdır. Kod, matematik, planlama ve karmaşık analizde Think/Reasoning tekrar açılabilir.
Eski sohbet üzerinde Think kapalı ilk denemede yaklaşık 2.36 token/sn görüldü. Fakat eski sohbet geçmişi context'e dahil olduğu için bu sayı temiz benchmark değildir; bu yüzden sonraki adımda yeni chat açıldı.
Hızlı günlük profil: Think = OFF
Zor analiz profili: Think = ON + Reasoning Low/MediumSohbet geçmişi büyüdükçe modelin işlediği input token sayısı artar. Bu yüzden farklı ayarları karşılaştırırken sıfır tokenlı yeni sohbet açmak, aynı kısa promptu göndermek ve her koşulda aynı sampling/reasoning ayarını kullanmak gerekir.
Yeni sohbet içinde “Merhabalar” gönderildiğinde prompt işlendi ve Think kapalı olduğu için uzun “Thought for … seconds” bölümü oluşmadı. Sonuç yaklaşık 2.82 token/sn ve 4.35 saniye oldu. 11 tokenlık çok kısa cevap olduğu için 2.82 ile 2.89 arasındaki küçük farkı kesin performans farkı saymamak gerekir.
Daha güvenilir benchmark için 150-300 tokenlık sabit bir cevap isteyen prompt kullanın. Örneğin aynı PHP/PDO güvenlik sorusunu her profilde çalıştırıp token/sn, toplam süre ve ilk token gecikmesini not edin.
Benchmark promptu:
PHP ile PDO kullanarak güvenli kullanıcı giriş sistemi nasıl oluşturulur? Yaklaşık 300 kelimeyle teknik olarak açıkla.Bu gerçek testte en dengeli başlangıç noktası 4096 context, 6 CPU thread, evaluation batch 1024, physical batch 512, Max Concurrent Predictions 1 ve Dedicated GPU Memory limiter açık profildi. GPU offload için tek bir evrensel sayı vermek yerine 23 civarı manuel profil ile limiter açık maksimum talebi ayrı ayrı benchmark etmek daha doğru.
Günlük kullanımda Think kapalı tutulabilir. Speculative Decoding ekranda yaklaşık yüzde 46-59 draft token kabul oranlarıyla aktif görünüyordu; bunun gerçekten hız kazandırıp kazandırmadığını görmek için aynı uzun benchmark promptunu Speculative Decoding ON ve OFF olarak ayrı test edin.
Modelin native context kapasitesi yüksek olsa da 4096 ile başlamak RAM/VRAM baskısını azaltır. Daha uzun belge veya kod tabanı gerektiğinde 8192, 16K ve üzeri context'e kademeli çıkmak daha güvenli bir yaklaşımdır.
Başlangıç profili
Context: 4096
CPU Threads: 6
Evaluation Batch: 1024
Physical Batch: 512
Concurrent Predictions: 1
Dedicated GPU Memory Limit: ON
KV Cache GPU Offload: ON
Think: OFF (günlük kullanım)
GPU Offload: 23 ile başlayıp benchmark yap8 GB VRAM'li sistemde Qwen3.8-27B çalıştırılabiliyor ancak modelin önemli bölümü sistem RAM'i üzerinden işlendiği için üretim hızı sınırlı kalıyor. Uzun context, Vision kullanımı, birden fazla paralel istek veya yüksek token/sn hedeflendiğinde VRAM kapasitesi daha kritik hale gelir.
LM Studio'nun sistem gereksinimleri Windows için en az 16 GB RAM ve en az 4 GB dedicated VRAM önerse de bunlar uygulamanın genel minimum önerileridir; 27B sınıfı bir model için model dosyasının boyutu, quantization ve context ayrıca hesaba katılmalıdır.
EKA Sunucu tarafında yerel AI, Ollama, LM Studio benzeri LLM testleri için ihtiyaç duyulan RAM, CPU ve GPU kapasitesini kullanım senaryosuna göre boyutlandırmak mümkündür. Model seçimini yalnız parametre sayısına göre değil, quantization, context, eşzamanlı kullanıcı ve hedef token/sn değerine göre yapmak gerekir.
Evet. Bu rehberde Qwen3.8-27B, LM Studio 0.4.21 üzerinde gerçek olarak yüklendi ve sohbet üretimi yapıldı. Modelin bellek ihtiyacı donanıma, quantization sürümüne, context uzunluğuna ve offload ayarlarına göre değişir.
LM Studio model kataloğu Qwen3.8 ailesinin en küçük seçeneği için en az 17 GB RAM gerektiğini belirtiyor. 27B model ve yüksek context değerlerinde daha fazla sistem belleği pratikte avantaj sağlar.
Bu testte RTX 2070 8 GB VRAM ve yaklaşık 64 GB sistem RAM'i ile model çalıştı. Ancak 27B model bütünüyle 8 GB VRAM'e sığmadığı için ağırlıkların bir bölümü RAM/CPU tarafında kalır ve üretim hızı yüksek VRAM'li kartlara göre daha düşük olur.
Bu mesaj, LM Studio inference engine başlangıcının model hazır olmadan kesildiğini gösterir. Tek bir kesin nedeni yoktur. İndirme tamamlanmamış olabilir, runtime/model yükleme işlemi kesilebilir veya bellek/offload ayarları uygun olmayabilir. Logları kontrol etmek, modeli yeniden yüklemek ve daha muhafazakâr context/offload değerleri denemek gerekir.
Windows'ta dedicated VRAM dolduğunda model ağırlıklarının shared GPU memory kullanması performansı düşürebilir. LM Studio'nun Dedicated GPU Memory limiter seçeneği, model ağırlıklarını dedicated VRAM ve sistem RAM'i ile sınırlandırarak bu durumu azaltmak için tasarlanmıştır.
Özellikle modeli VRAM'e tamamen sığdıramayan NVIDIA/Windows sistemlerinde test edilmesi mantıklıdır. LM Studio bu seçenek açıkken gerçek offload miktarını dedicated VRAM'e sığacak şekilde otomatik azaltabilir.
Think/Reasoning kapalı kullanım basit sohbetlerde daha hızlı yanıt için uygundur. Kodlama, matematik, planlama veya karmaşık analizlerde reasoning'i yeniden açmak daha iyi sonuç verebilir. Kullanım senaryosuna göre ayrı profiller oluşturmak en sağlıklı yaklaşımdır.
Hayır. Draft model ana modele hızlı token önerileri üretir ve ana model bunları doğrular. Uygun draft model ve yeterli kaynak olduğunda hız artabilir; ancak ek VRAM/RAM tüketimi veya düşük kabul oranı bazı sistemlerde faydayı azaltabilir. Açık ve kapalı benchmark yapmak gerekir.
Model 262K native context desteklese bile yerel donanımda her zaman maksimum context kullanmak gerekli değildir. Daha uzun context KV cache ve bellek ihtiyacını artırır. Günlük kullanımda 4096 veya 8192 gibi daha küçük değerlerle başlamak daha pratiktir.
23 GPU offload ile yaklaşık 2.89 token/sn görüldü. Temiz yeni sohbet, Think kapalı ve dedicated limiter aktif profilde yaklaşık 2.82 token/sn ölçüldü. Bunlar yalnız bu test sistemine aittir ve başka donanımlarda değişir.
Qwen, Ollama, LM Studio ve diğer yerel LLM iş yükleri için CPU, RAM, NVMe ve GPU kapasitesini kullanım senaryonuza göre planlayın; EKA Sunucu sunucu seçeneklerini inceleyin.
Güncellendi: 15.08.2026