OpenAI GPT-OSS 20B modelini LM Studio 0.4.21 üzerinde gerçek bir Windows bilgisayarda çalıştırdık. Model indirme ekranından donanım ayarlarına, 2489 tokenlık uzun teknik yanıttan Max Concurrent Predictions 4 ve 1 karşılaştırmasına kadar bütün süreci 23 gerçek ekran görüntüsüyle belgeledik.
Context 8192 GPU Offload 24 CPU Threads 6 Eval / Physical 2048 / 512 Concurrent 1 Reasoning Low
Aşağıdaki değerler yalnızca bu cihaz, bu LM Studio sürümü ve bu oturumda gözlenen sonuçlardır. Aynı prompt kullanılmış olsa da model her çalıştırmada farklı uzunlukta çıktı üretebildiği için küçük hız farkları tek başına kesin performans üstünlüğü anlamına gelmez.
LM Studio içindeki model kataloğunda openai/gpt-oss-20b modelini açtığımızda 12.11 GB boyutlu GGUF seçeneğinin cihazda zaten indirildiği görülüyor. Aynı ekran reasoning ve tool use yeteneklerini de işaretliyor.
OpenAI’nin resmî model kartına göre gpt-oss-20b 20.9 milyar toplam parametreye, token başına 3.6 milyar aktif parametreye ve 24 katmana sahip bir Mixture-of-Experts modelidir. OpenAI modeli yerel inference ve düşük gecikmeli kullanım senaryoları için konumlandırıyor.
Buradaki 12.11 GB indirme boyutunu minimum RAM veya minimum VRAM değeri gibi okumamak gerekir. Model dosyasına ek olarak context, KV cache, runtime tamponları ve işletim sistemi de bellek tüketir.
Model ekranındaki 12.11 GB, bu LM Studio GGUF paketinin dosya boyutudur; çalışma anındaki toplam bellek tüketimi değildir.
Bütün ölçümler aynı Windows bilgisayarda yapıldı: Intel Core i7-10875H, 63.84 GB sistem RAM’i ve NVIDIA GeForce RTX 2070 8 GB. LM Studio GPU’yu CUDA üzerinden görüyor.
Hardware ekranında “Limit Model Offload to Dedicated GPU Memory” ve “Offload KV Cache to GPU Memory” seçenekleri açık bırakıldı. Dedicated memory limiti özellikle Windows’ta model ağırlıklarının shared GPU memory alanına taşınmasını sınırlamak için kullanılıyor.
Bu donanım kombinasyonu önemli bir ayrımı gösteriyor: model 8 GB VRAM’li kartta çalıştı, ancak sistemde 64 GB sınıfı RAM de bulunduğu için modelin GPU’ya sığmayan bölümlerini sistem belleği destekledi.
Bu rehberdeki sonuçlar “RTX 2070 8 GB tek başına yeterlidir” iddiası değildir; gerçek sistem 8 GB VRAM + 63.84 GB RAM kombinasyonudur.
Model ilk yüklendiğinde context length 8192, GPU offload 24, CPU Thread Pool Size 6, Evaluation Batch Size 2048, Physical Batch Size 512 ve Max Concurrent Predictions 4 olarak çalıştırıldı. Unified KV Cache açık kaldı.
LM Studio model ekranı gpt-oss-20b için 131072 token maksimum context desteğini gösterse de benchmark için 8192 seçildi. Maksimum context’i kullanmak her masaüstü kullanımında gerekli değildir ve daha yüksek context daha fazla cache/bellek baskısı oluşturabilir.
GPU offload kaydırıcısının 24’te sona ermesi modelin 24 katmanlı yapısıyla uyumludur. Dedicated GPU Memory limiti açık olduğu için LM Studio gerçek offload katmanı sayısının seçilen değerden farklı olabileceğini ayrıca uyarır.
Context Length: 8192 GPU Offload: 24 CPU Thread Pool Size: 6 Evaluation Batch Size: 2048 Physical Batch Size: 512 Max Concurrent Predictions: 4 Unified KV Cache: ON Dedicated GPU Memory Limit: ON KV Cache -> GPU: ON Reasoning: Low
Kısa “merhaba” testi yerine modeli birkaç dakika boyunca gerçek teknik metin üretmeye zorlayan sabit bir prompt kullandık. İstek; PHP 8.3, MySQL, Redis, session, queue, güvenlik ve yedekleme katmanlarını birlikte açıklamasını istedi.
Low Reasoning seçildi. Model cevapta veritabanı, Redis cache/session, queue, güvenlik, backup ve DevOps başlıklarına kadar uzanan binlerce tokenlık teknik içerik üretti. Ama bu çıktı bir performans iş yüküdür; üretim mimarisi tavsiyesi olarak doğrulanmış değildir.
Uzun cevap sayesinde token/sn değeri 10-20 tokenlık kısa cevaplara göre daha anlamlı biçimde gözlemlenebildi. Aynı zamanda test sırasında kaynak kullanımını Hardware ekranından kaydettik.
Türkiye'de küçük bir e-ticaret sitesi için PHP 8.3, MySQL ve Redis kullanarak ölçeklenebilir bir sistem mimarisi öner. Veritabanı, cache, session, queue, güvenlik ve yedekleme yapısını teknik olarak açıkla.
İlk uzun test tamamlandığında LM Studio 10.85 token/sn ve 2489 output token gösterdi. Aynı satırda 1.56 sn zaman göstergesi bulunuyor; LM Studio istatistiklerinde bu metrik Time to First Token, yani ilk tokenın üretilmesine kadar geçen süredir.
Üretim devam ederken Hardware Resource Monitor toplam RAM + VRAM kullanımını 11.61 GB, CPU kullanımını yaklaşık %35.27 gösterdi. Bu değer LM Studio panelinin o anki toplam göstergesidir; ayrı ayrı yalnız model ağırlığı veya yalnız VRAM tüketimi olarak yorumlanmamalıdır.
Cevap sonunda context göstergesi 2614 / 8192 token, yani yaklaşık %31.9 kullanım gösterdi. Böylece uzun bir teknik yanıtta 8192 context’in bu deneme için yeterli kaldığı da görüldü.



Bir sonraki benchmarkta yalnız Max Concurrent Predictions değerini değiştirmek istediğimiz için önce üretilen sohbeti Markdown olarak dışa aktardık. Böylece model cevabı ve kullanılan prompt ayrı bir dosyada saklandı.
Ardından Clear all messages ile mesaj geçmişi temizlendi; ayrıca sohbetin tamamen silinmesi için Delete akışı da ekran görüntüsüyle kaydedildi. Bu adımlar LM Studio’da context geçmişini sıfırlamak ve yeni ölçüme daha temiz bir başlangıç sağlamak için kullanıldı.
Benchmarklarda tek bir değişkeni değiştirmek önemlidir. Eski mesajları taşımak, context uzunluğunu ve prompt processing süresini değiştirerek karşılaştırmayı bozabilir.







İkinci testte yalnız Max Concurrent Predictions değeri 4’ten 1’e indirildi. Context 8192, GPU offload 24, 6 CPU thread, 2048 evaluation batch, 512 physical batch, Unified KV Cache, dedicated GPU memory limiti ve KV cache GPU offload aynı bırakıldı.
LM Studio’nun resmî açıklamasına göre Max Concurrent Predictions, aynı anda kaç prediction isteğinin paralel işlenebileceğini belirler. Tek kişinin masaüstü sohbeti için 1 kaynak kullanımını daha öngörülebilir hale getirir; çok kullanıcılı API servisi için ise throughput ihtiyacına göre daha yüksek değerler test edilmelidir.
Aynı uzun e-ticaret promptu yine Low Reasoning ile gönderildi. Böylece değişken sayısını mümkün olduğunca tek ayara indirmiş olduk.
Context Length: 8192 GPU Offload: 24 CPU Thread Pool Size: 6 Evaluation Batch Size: 2048 Physical Batch Size: 512 Max Concurrent Predictions: 1 Unified KV Cache: ON Dedicated GPU Memory Limit: ON KV Cache -> GPU: ON Reasoning: Low



İkinci uzun cevap sırasında RAM + VRAM yine 11.61 GB olarak görünürken CPU yaklaşık %33.05 ölçüldü. Cevap tamamlandığında 11.14 token/sn, 2237 output token ve 1.78 sn ilk-token zaman göstergesi görüldü.
10.85’ten 11.14 token/sn’ye geçiş yaklaşık %2.7’lik gözlenen farktır. Ancak ikinci cevap 2237 token, ilk cevap 2489 token üretti ve üretim içeriği birebir aynı olmadı. Bu nedenle farkı “Concurrent 1 kesin %2.7 daha hızlıdır” şeklinde genellemek doğru değildir.
Pratik sonuç şu: tek kullanıcı için Concurrent 1 profili bu makinede sorunsuz çalıştı, CPU kullanımı biraz daha düşük göründü ve token/sn değeri en azından gerilemedi. Çoklu istemci servislerinde ise 4 veya daha yüksek paralellik ayrı throughput testleriyle değerlendirilmelidir.




Token/sn, cevap üretim aşamasındaki generation hızını gösterir. Bu değer tek başına kullanıcının hissettiği toplam süre değildir; prompt processing, reasoning ve ilk token gecikmesi de toplam deneyimi etkiler.
LM Studio REST istatistiklerinde Time to First Token ayrı bir metriktir. Bu nedenle ekrandaki 1.56 sn veya 1.78 sn gibi küçük değerleri 2489 veya 2237 tokenlık cevabın toplam bitiş süresi sanmamak gerekir. Basit hesapla yalnız token üretim bölümü ilk testte yaklaşık 229 saniye, ikinci testte yaklaşık 201 saniyedir; gerçek duvar saati prompt işleme ve diğer gecikmeler nedeniyle farklı olabilir.
Context göstergesi ise mevcut sohbetin modelin yüklü context kapasitesinin ne kadarını kullandığını takip etmek için faydalıdır. Uzun sohbetlerde bu oran yükseldikçe prompt processing yükü ve cache ihtiyacı da artabilir.
Bu iki gerçek testten sonra günlük tek kullanıcılı LM Studio sohbeti için kullandığımız profil 8192 context, 24 GPU offload, 6 CPU thread, 2048 evaluation batch, 512 physical batch, Concurrent Predictions 1, Unified KV Cache açık, dedicated GPU memory limiti açık, KV cache GPU offload açık ve Low Reasoning şeklinde kaldı.
Bu profil “tüm RTX 2070 sistemleri için en iyi ayar” değildir. Aynı GPU’da sistem RAM miktarı, sürücüler, LM Studio runtime sürümü, arka plandaki uygulamalar ve model dosyası değiştiğinde optimum değer de değişebilir.
Daha karmaşık matematik, planlama veya zor kodlama görevlerinde GPT-OSS’un Medium ve High reasoning seçenekleri ayrıca denenebilir. Bu sayfadaki benchmark yalnız Low Reasoning ile yapıldığı için diğer reasoning seviyeleri için hız değeri uydurmuyoruz.
Context: 8192 GPU Offload: 24 CPU Threads: 6 Evaluation Batch: 2048 Physical Batch: 512 Concurrent Predictions: 1 Unified KV Cache: ON Dedicated GPU Memory Limit: ON KV Cache GPU Offload: ON Reasoning Effort: Low
Benchmark promptu kasıtlı olarak geniş tutuldu ve model binlerce tokenlık PHP, MySQL, Redis, queue, backup ve güvenlik önerisi üretti. Bu, modelin uzun Türkçe teknik çıktı üretme kabiliyetini gözlemlemek için faydalıdır.
Bununla birlikte LLM çıktılarında sürüm uyuşmazlıkları, gerçekçi olmayan kapasite iddiaları, eksik güvenlik ayrıntıları veya bağlama uygun olmayan teknoloji seçimleri bulunabilir. Bu nedenle ekran görüntülerindeki mimari metinleri “OpenAI veya EKA Sunucu tarafından doğrulanmış üretim tasarımı” olarak değil, benchmark sırasında modelin ürettiği örnek cevap olarak sunuyoruz.
Gerçek e-ticaret altyapısında kapasite planı; trafik, sorgu profili, veri hacmi, yedekleme hedefleri, RPO/RTO, ödeme akışları ve yük testleri üzerinden hazırlanmalıdır.
Bu testin net cevabı evet: GPT-OSS 20B, LM Studio 0.4.21 içinde RTX 2070 8 GB ve 63.84 GB RAM’li bilgisayarda uzun Türkçe teknik cevaplar üretti. İki uzun denemede 10.85 ve 11.14 token/sn görüldü.
Ancak model bütünüyle yalnız 8 GB VRAM’e dayanarak çalışmıyor; LM Studio’nun CPU/RAM ile GPU arasında yaptığı yerleşim bu sonucu mümkün kılıyor. Daha yüksek VRAM, daha uzun context veya çoklu eşzamanlı kullanıcı senaryolarında farklı performans beklenmelidir.
Kendi sisteminizde en doğru yaklaşım aynı uzun promptu sabitlemek, bir defada yalnız bir ayarı değiştirmek ve token/sn, TTFT, context, RAM/VRAM ve CPU değerlerini birlikte kaydetmektir.
VRAM ihtiyacı yüksek yerel LLM, inference, görüntü üretimi ve AI iş yükleri için GPU sunucu seçeneklerini inceleyin. Donanımı model boyutu, context ve eşzamanlı kullanıcı sayısına göre planlayın.
GPT-OSS 20B, OpenAI tarafından yayımlanan açık ağırlıklı bir Mixture-of-Experts reasoning modelidir. Resmî model kartında 20.9 milyar toplam parametre, token başına 3.6 milyar aktif parametre ve 24 katman belirtilir.
Bu testte LM Studio model ekranında indirilen GGUF dosyası 12.11 GB görünmektedir. Dosya boyutu ile çalışma anındaki toplam bellek ihtiyacı aynı şey değildir; runtime, context ve cache ek bellek kullanır.
Bu test 8 GB RTX 2070 ile başarıyla çalıştı; ancak bilgisayarda ayrıca yaklaşık 64 GB sistem RAM’i vardı. Bu nedenle sonuç “yalnız 8 GB VRAM yeterlidir” şeklinde yorumlanmamalıdır. LM Studio model ağırlıklarının bir bölümünü GPU’ya, kalanını sistem belleğine yerleştirebilir.
OpenAI, gpt-oss-20b modelinin 16 GB bellek sınıfındaki cihazlarda çalışabildiğini belirtiyor. Bu ifade cihazın bütün çalışma koşullarını garanti etmez; uygulama, quantization, context ve runtime ayarları gerçek tüketimi etkiler.
Bu modelde yükleme kaydırıcısının üst sınırı 24 katmandır. Dedicated GPU Memory limiti açık olduğunda LM Studio ekranda gerçek offload katmanı sayısının değişebileceğini belirtir; yani 24 seçmek tüm katmanların mutlaka 8 GB VRAM’e sığdığı anlamına gelmez.
LM Studio bu modun model ağırlıklarını dedicated GPU memory ve RAM ile sınırlandırdığını, context’in yine shared memory kullanabileceğini açıklıyor. LM Studio kendi testlerinde dedicated VRAM + sistem RAM bölüşümünün shared GPU memory kullanımından daha hızlı olabildiğini bildiriyor.
Bu ayar aynı anda kaç tahmin isteğinin paralel işlenebileceğini belirler. Tek kullanıcılı masaüstü sohbetinde 1 daha öngörülebilir kaynak kullanımı sağlar; API üzerinden çoklu eşzamanlı istemci sunulacaksa daha yüksek değerler throughput için test edilebilir.
Bu oturumda 4 concurrent profilinde 10.85 token/sn, 1 concurrent profilinde 11.14 token/sn görüldü; fark yaklaşık %2.7’dir. Çıktı uzunlukları farklı olduğu için bunu evrensel bir hız kazanımı olarak değil, bu oturumun gözlemi olarak değerlendirmek gerekir.
LM Studio inference istatistiklerinde token/sn yanında Time to First Token (TTFT) metriği bulunur. Bu süre toplam cevabın bitiş süresi değildir; ilk tokenın üretilmesine kadar geçen süreyi ifade eder.
Daha düşük gecikme istenen günlük sohbet, özet ve birçok kodlama görevinde Low iyi bir başlangıç profilidir. GPT-OSS, low, medium ve high reasoning effort seçeneklerini destekler; daha zor problemlerde medium veya high ayrıca test edilebilir.
Hayır. Uzun e-ticaret promptu yalnızca modeli sürekli teknik çıktı üretmeye zorlayan benchmark iş yüküdür. Modelin ürettiği mimari, kod ve kapasite iddiaları uzman incelemesi, güvenlik kontrolü ve gerçek yük testi yapılmadan üretim kararı olarak kullanılmamalıdır.
Önceki mesajlar context’e eklenir ve prompt işleme yükünü değiştirir. Aynı koşullara yaklaşmak için sohbetin Markdown çıktısı alındı, mesajlar temizlendi ve ikinci test mümkün olduğunca temiz başlangıçtan çalıştırıldı.
VRAM ihtiyacı yüksek yerel LLM, inference, görüntü üretimi ve AI iş yükleri için GPU sunucu seçeneklerini inceleyin. Donanımı model boyutu, context ve eşzamanlı kullanıcı sayısına göre planlayın.
Güncellendi: 16.08.2026 · LM Studio 0.4.21