Arama Yap Mesaj Gönder
Biz Sizi Arayalım
+90
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro

Bize Ulaşın

Konum Halkalı merkez mahallesi fatih cd ozgur apt no 46 , Küçükçekmece , İstanbul , 34303 , TR
LM Studio · GPT-OSS 20B · Windows · Gerçek Benchmark

LM Studio’da OpenAI GPT-OSS 20B Kurulumu: RTX 2070 8 GB Gerçek Performans Testi

OpenAI GPT-OSS 20B modelini LM Studio 0.4.21 üzerinde gerçek bir Windows bilgisayarda çalıştırdık. Model indirme ekranından donanım ayarlarına, 2489 tokenlık uzun teknik yanıttan Max Concurrent Predictions 4 ve 1 karşılaştırmasına kadar bütün süreci 23 gerçek ekran görüntüsüyle belgeledik.

GPT-OSS 20BOpenAI GPT-OSSLM StudioRTX 20708 GB VRAMLocal LLMGPU OffloadLow ReasoningToken/sWindows AIGGUFMoE
LM Studio 0.4.21 · openai/gpt-oss-20b
Test profiliRTX 2070 · 8 GB VRAMi7-10875H · 63.84 GB RAM · CUDA
Context              8192
GPU Offload           24
CPU Threads            6
Eval / Physical   2048 / 512
Concurrent             1
Reasoning            Low
Best11.14 tok/snOutput2237 tokens
23gerçek ekran görüntüsü
TR · EN · DETR · EN · DE içerik
RTX 20708 GB test GPU
11.14tok/sn en iyi gözlem
0112.11 GB GGUF modelini LM Studio içinde doğrula
02RTX 2070 8 GB + 64 GB RAM test sistemini gör
03Aynı uzun promptla 10.85 ve 11.14 token/sn ölçümlerini karşılaştır
04Tek kullanıcı için uygulanabilir LM Studio yükleme profilini çıkar
00
Gözlenen benchmark

Gerçek test sonuçları

Aşağıdaki değerler yalnızca bu cihaz, bu LM Studio sürümü ve bu oturumda gözlenen sonuçlardır. Aynı prompt kullanılmış olsa da model her çalıştırmada farklı uzunlukta çıktı üretebildiği için küçük hız farkları tek başına kesin performans üstünlüğü anlamına gelmez.

Profiletok/snOutputTTFTRAM+VRAMCPU
Concurrent 4 · Low10.85 tok/sn24891.56 sn11.61 GB35.27%
Concurrent 1 · Low11.14 tok/sn22371.78 sn11.61 GB33.05%
01
İçindekiler

GPT-OSS 20B kurulum, donanım, benchmark ve LM Studio ayarları

  1. 01OpenAI GPT-OSS 20B nedir ve LM Studio’da hangi dosyayı kullandık?
  2. 02Test bilgisayarı: RTX 2070 8 GB, i7-10875H ve 63.84 GB RAM
  3. 03GPT-OSS 20B için kullandığımız ilk LM Studio yükleme ayarları
  4. 04Baseline benchmark: aynı PHP, MySQL ve Redis promptuyla uzun cevap üretimi
  5. 05Baseline sonucu: 10.85 token/sn, 2489 output token ve 11.61 GB RAM + VRAM
  6. 06İkinci testten önce sohbeti neden export edip temizledik?
  7. 07Max Concurrent Predictions 4 yerine 1 yapıldığında ne değişti?
  8. 08Concurrent 1 sonucu: 11.14 token/sn, 2237 output token ve CPU %33.05
  9. 09LM Studio sonuç satırındaki token/sn, token ve saniye değerleri nasıl okunur?
  10. 10RTX 2070 8 GB + 64 GB RAM için kullandığımız dengeli GPT-OSS 20B profili
  11. 11Modelin ürettiği teknik cevap neden doğrudan sunucu mimarisi rehberi sayılmamalı?
  12. 12GPT-OSS 20B bu eski 8 GB GPU’lu sistemde kullanılabilir mi?
02
Modeli doğrulama

OpenAI GPT-OSS 20B nedir ve LM Studio’da hangi dosyayı kullandık?

LM Studio içindeki model kataloğunda openai/gpt-oss-20b modelini açtığımızda 12.11 GB boyutlu GGUF seçeneğinin cihazda zaten indirildiği görülüyor. Aynı ekran reasoning ve tool use yeteneklerini de işaretliyor.

OpenAI’nin resmî model kartına göre gpt-oss-20b 20.9 milyar toplam parametreye, token başına 3.6 milyar aktif parametreye ve 24 katmana sahip bir Mixture-of-Experts modelidir. OpenAI modeli yerel inference ve düşük gecikmeli kullanım senaryoları için konumlandırıyor.

Buradaki 12.11 GB indirme boyutunu minimum RAM veya minimum VRAM değeri gibi okumamak gerekir. Model dosyasına ek olarak context, KV cache, runtime tamponları ve işletim sistemi de bellek tüketir.

Test notu

Model ekranındaki 12.11 GB, bu LM Studio GGUF paketinin dosya boyutudur; çalışma anındaki toplam bellek tüketimi değildir.

03
Gerçek donanım

Test bilgisayarı: RTX 2070 8 GB, i7-10875H ve 63.84 GB RAM

Bütün ölçümler aynı Windows bilgisayarda yapıldı: Intel Core i7-10875H, 63.84 GB sistem RAM’i ve NVIDIA GeForce RTX 2070 8 GB. LM Studio GPU’yu CUDA üzerinden görüyor.

Hardware ekranında “Limit Model Offload to Dedicated GPU Memory” ve “Offload KV Cache to GPU Memory” seçenekleri açık bırakıldı. Dedicated memory limiti özellikle Windows’ta model ağırlıklarının shared GPU memory alanına taşınmasını sınırlamak için kullanılıyor.

Bu donanım kombinasyonu önemli bir ayrımı gösteriyor: model 8 GB VRAM’li kartta çalıştı, ancak sistemde 64 GB sınıfı RAM de bulunduğu için modelin GPU’ya sığmayan bölümlerini sistem belleği destekledi.

Test notu

Bu rehberdeki sonuçlar “RTX 2070 8 GB tek başına yeterlidir” iddiası değildir; gerçek sistem 8 GB VRAM + 63.84 GB RAM kombinasyonudur.

04
Başlangıç profili

GPT-OSS 20B için kullandığımız ilk LM Studio yükleme ayarları

Model ilk yüklendiğinde context length 8192, GPU offload 24, CPU Thread Pool Size 6, Evaluation Batch Size 2048, Physical Batch Size 512 ve Max Concurrent Predictions 4 olarak çalıştırıldı. Unified KV Cache açık kaldı.

LM Studio model ekranı gpt-oss-20b için 131072 token maksimum context desteğini gösterse de benchmark için 8192 seçildi. Maksimum context’i kullanmak her masaüstü kullanımında gerekli değildir ve daha yüksek context daha fazla cache/bellek baskısı oluşturabilir.

GPU offload kaydırıcısının 24’te sona ermesi modelin 24 katmanlı yapısıyla uyumludur. Dedicated GPU Memory limiti açık olduğu için LM Studio gerçek offload katmanı sayısının seçilen değerden farklı olabileceğini ayrıca uyarır.

Test profili
Context Length: 8192
GPU Offload: 24
CPU Thread Pool Size: 6
Evaluation Batch Size: 2048
Physical Batch Size: 512
Max Concurrent Predictions: 4
Unified KV Cache: ON
Dedicated GPU Memory Limit: ON
KV Cache -> GPU: ON
Reasoning: Low
05
Uzun üretim testi

Baseline benchmark: aynı PHP, MySQL ve Redis promptuyla uzun cevap üretimi

Kısa “merhaba” testi yerine modeli birkaç dakika boyunca gerçek teknik metin üretmeye zorlayan sabit bir prompt kullandık. İstek; PHP 8.3, MySQL, Redis, session, queue, güvenlik ve yedekleme katmanlarını birlikte açıklamasını istedi.

Low Reasoning seçildi. Model cevapta veritabanı, Redis cache/session, queue, güvenlik, backup ve DevOps başlıklarına kadar uzanan binlerce tokenlık teknik içerik üretti. Ama bu çıktı bir performans iş yüküdür; üretim mimarisi tavsiyesi olarak doğrulanmış değildir.

Uzun cevap sayesinde token/sn değeri 10-20 tokenlık kısa cevaplara göre daha anlamlı biçimde gözlemlenebildi. Aynı zamanda test sırasında kaynak kullanımını Hardware ekranından kaydettik.

Test profili
Türkiye'de küçük bir e-ticaret sitesi için PHP 8.3, MySQL ve Redis kullanarak ölçeklenebilir bir sistem mimarisi öner. Veritabanı, cache, session, queue, güvenlik ve yedekleme yapısını teknik olarak açıkla.
06
Ölçüm 1

Baseline sonucu: 10.85 token/sn, 2489 output token ve 11.61 GB RAM + VRAM

İlk uzun test tamamlandığında LM Studio 10.85 token/sn ve 2489 output token gösterdi. Aynı satırda 1.56 sn zaman göstergesi bulunuyor; LM Studio istatistiklerinde bu metrik Time to First Token, yani ilk tokenın üretilmesine kadar geçen süredir.

Üretim devam ederken Hardware Resource Monitor toplam RAM + VRAM kullanımını 11.61 GB, CPU kullanımını yaklaşık %35.27 gösterdi. Bu değer LM Studio panelinin o anki toplam göstergesidir; ayrı ayrı yalnız model ağırlığı veya yalnız VRAM tüketimi olarak yorumlanmamalıdır.

Cevap sonunda context göstergesi 2614 / 8192 token, yani yaklaşık %31.9 kullanım gösterdi. Böylece uzun bir teknik yanıtta 8192 context’in bu deneme için yeterli kaldığı da görüldü.

07
Adil karşılaştırma

İkinci testten önce sohbeti neden export edip temizledik?

Bir sonraki benchmarkta yalnız Max Concurrent Predictions değerini değiştirmek istediğimiz için önce üretilen sohbeti Markdown olarak dışa aktardık. Böylece model cevabı ve kullanılan prompt ayrı bir dosyada saklandı.

Ardından Clear all messages ile mesaj geçmişi temizlendi; ayrıca sohbetin tamamen silinmesi için Delete akışı da ekran görüntüsüyle kaydedildi. Bu adımlar LM Studio’da context geçmişini sıfırlamak ve yeni ölçüme daha temiz bir başlangıç sağlamak için kullanıldı.

Benchmarklarda tek bir değişkeni değiştirmek önemlidir. Eski mesajları taşımak, context uzunluğunu ve prompt processing süresini değiştirerek karşılaştırmayı bozabilir.

08
Tek kullanıcı optimizasyonu

Max Concurrent Predictions 4 yerine 1 yapıldığında ne değişti?

İkinci testte yalnız Max Concurrent Predictions değeri 4’ten 1’e indirildi. Context 8192, GPU offload 24, 6 CPU thread, 2048 evaluation batch, 512 physical batch, Unified KV Cache, dedicated GPU memory limiti ve KV cache GPU offload aynı bırakıldı.

LM Studio’nun resmî açıklamasına göre Max Concurrent Predictions, aynı anda kaç prediction isteğinin paralel işlenebileceğini belirler. Tek kişinin masaüstü sohbeti için 1 kaynak kullanımını daha öngörülebilir hale getirir; çok kullanıcılı API servisi için ise throughput ihtiyacına göre daha yüksek değerler test edilmelidir.

Aynı uzun e-ticaret promptu yine Low Reasoning ile gönderildi. Böylece değişken sayısını mümkün olduğunca tek ayara indirmiş olduk.

Test profili
Context Length: 8192
GPU Offload: 24
CPU Thread Pool Size: 6
Evaluation Batch Size: 2048
Physical Batch Size: 512
Max Concurrent Predictions: 1
Unified KV Cache: ON
Dedicated GPU Memory Limit: ON
KV Cache -> GPU: ON
Reasoning: Low
09
Ölçüm 2

Concurrent 1 sonucu: 11.14 token/sn, 2237 output token ve CPU %33.05

İkinci uzun cevap sırasında RAM + VRAM yine 11.61 GB olarak görünürken CPU yaklaşık %33.05 ölçüldü. Cevap tamamlandığında 11.14 token/sn, 2237 output token ve 1.78 sn ilk-token zaman göstergesi görüldü.

10.85’ten 11.14 token/sn’ye geçiş yaklaşık %2.7’lik gözlenen farktır. Ancak ikinci cevap 2237 token, ilk cevap 2489 token üretti ve üretim içeriği birebir aynı olmadı. Bu nedenle farkı “Concurrent 1 kesin %2.7 daha hızlıdır” şeklinde genellemek doğru değildir.

Pratik sonuç şu: tek kullanıcı için Concurrent 1 profili bu makinede sorunsuz çalıştı, CPU kullanımı biraz daha düşük göründü ve token/sn değeri en azından gerilemedi. Çoklu istemci servislerinde ise 4 veya daha yüksek paralellik ayrı throughput testleriyle değerlendirilmelidir.

10
Token/sn ve TTFT

LM Studio sonuç satırındaki token/sn, token ve saniye değerleri nasıl okunur?

Token/sn, cevap üretim aşamasındaki generation hızını gösterir. Bu değer tek başına kullanıcının hissettiği toplam süre değildir; prompt processing, reasoning ve ilk token gecikmesi de toplam deneyimi etkiler.

LM Studio REST istatistiklerinde Time to First Token ayrı bir metriktir. Bu nedenle ekrandaki 1.56 sn veya 1.78 sn gibi küçük değerleri 2489 veya 2237 tokenlık cevabın toplam bitiş süresi sanmamak gerekir. Basit hesapla yalnız token üretim bölümü ilk testte yaklaşık 229 saniye, ikinci testte yaklaşık 201 saniyedir; gerçek duvar saati prompt işleme ve diğer gecikmeler nedeniyle farklı olabilir.

Context göstergesi ise mevcut sohbetin modelin yüklü context kapasitesinin ne kadarını kullandığını takip etmek için faydalıdır. Uzun sohbetlerde bu oran yükseldikçe prompt processing yükü ve cache ihtiyacı da artabilir.

11
Bu bilgisayar için sonuç

RTX 2070 8 GB + 64 GB RAM için kullandığımız dengeli GPT-OSS 20B profili

Bu iki gerçek testten sonra günlük tek kullanıcılı LM Studio sohbeti için kullandığımız profil 8192 context, 24 GPU offload, 6 CPU thread, 2048 evaluation batch, 512 physical batch, Concurrent Predictions 1, Unified KV Cache açık, dedicated GPU memory limiti açık, KV cache GPU offload açık ve Low Reasoning şeklinde kaldı.

Bu profil “tüm RTX 2070 sistemleri için en iyi ayar” değildir. Aynı GPU’da sistem RAM miktarı, sürücüler, LM Studio runtime sürümü, arka plandaki uygulamalar ve model dosyası değiştiğinde optimum değer de değişebilir.

Daha karmaşık matematik, planlama veya zor kodlama görevlerinde GPT-OSS’un Medium ve High reasoning seçenekleri ayrıca denenebilir. Bu sayfadaki benchmark yalnız Low Reasoning ile yapıldığı için diğer reasoning seviyeleri için hız değeri uydurmuyoruz.

Test profili
Context: 8192
GPU Offload: 24
CPU Threads: 6
Evaluation Batch: 2048
Physical Batch: 512
Concurrent Predictions: 1
Unified KV Cache: ON
Dedicated GPU Memory Limit: ON
KV Cache GPU Offload: ON
Reasoning Effort: Low
12
Benchmark çıktısını doğru yorumlama

Modelin ürettiği teknik cevap neden doğrudan sunucu mimarisi rehberi sayılmamalı?

Benchmark promptu kasıtlı olarak geniş tutuldu ve model binlerce tokenlık PHP, MySQL, Redis, queue, backup ve güvenlik önerisi üretti. Bu, modelin uzun Türkçe teknik çıktı üretme kabiliyetini gözlemlemek için faydalıdır.

Bununla birlikte LLM çıktılarında sürüm uyuşmazlıkları, gerçekçi olmayan kapasite iddiaları, eksik güvenlik ayrıntıları veya bağlama uygun olmayan teknoloji seçimleri bulunabilir. Bu nedenle ekran görüntülerindeki mimari metinleri “OpenAI veya EKA Sunucu tarafından doğrulanmış üretim tasarımı” olarak değil, benchmark sırasında modelin ürettiği örnek cevap olarak sunuyoruz.

Gerçek e-ticaret altyapısında kapasite planı; trafik, sorgu profili, veri hacmi, yedekleme hedefleri, RPO/RTO, ödeme akışları ve yük testleri üzerinden hazırlanmalıdır.

13
Kısa değerlendirme

GPT-OSS 20B bu eski 8 GB GPU’lu sistemde kullanılabilir mi?

Bu testin net cevabı evet: GPT-OSS 20B, LM Studio 0.4.21 içinde RTX 2070 8 GB ve 63.84 GB RAM’li bilgisayarda uzun Türkçe teknik cevaplar üretti. İki uzun denemede 10.85 ve 11.14 token/sn görüldü.

Ancak model bütünüyle yalnız 8 GB VRAM’e dayanarak çalışmıyor; LM Studio’nun CPU/RAM ile GPU arasında yaptığı yerleşim bu sonucu mümkün kılıyor. Daha yüksek VRAM, daha uzun context veya çoklu eşzamanlı kullanıcı senaryolarında farklı performans beklenmelidir.

Kendi sisteminizde en doğru yaklaşım aynı uzun promptu sabitlemek, bir defada yalnız bir ayarı değiştirmek ve token/sn, TTFT, context, RAM/VRAM ve CPU değerlerini birlikte kaydetmektir.

GPU · VRAM · LOCAL AI

GPT-OSS, Qwen veya diğer yerel AI modelleri için daha güçlü GPU mu gerekiyor?

VRAM ihtiyacı yüksek yerel LLM, inference, görüntü üretimi ve AI iş yükleri için GPU sunucu seçeneklerini inceleyin. Donanımı model boyutu, context ve eşzamanlı kullanıcı sayısına göre planlayın.

GPU Sunucu Seçeneklerini İncele
R
Resmî kaynak

Resmî OpenAI ve LM Studio kaynakları

+
EKA SUNUCU

İlgili EKA Sunucu rehberleri

?
FAQ

GPT-OSS 20B ve LM Studio hakkında sık sorulan sorular

GPT-OSS 20B nedir?

GPT-OSS 20B, OpenAI tarafından yayımlanan açık ağırlıklı bir Mixture-of-Experts reasoning modelidir. Resmî model kartında 20.9 milyar toplam parametre, token başına 3.6 milyar aktif parametre ve 24 katman belirtilir.

GPT-OSS 20B kaç GB?

Bu testte LM Studio model ekranında indirilen GGUF dosyası 12.11 GB görünmektedir. Dosya boyutu ile çalışma anındaki toplam bellek ihtiyacı aynı şey değildir; runtime, context ve cache ek bellek kullanır.

GPT-OSS 20B için 8 GB VRAM yeterli mi?

Bu test 8 GB RTX 2070 ile başarıyla çalıştı; ancak bilgisayarda ayrıca yaklaşık 64 GB sistem RAM’i vardı. Bu nedenle sonuç “yalnız 8 GB VRAM yeterlidir” şeklinde yorumlanmamalıdır. LM Studio model ağırlıklarının bir bölümünü GPU’ya, kalanını sistem belleğine yerleştirebilir.

OpenAI neden 16 GB bellekten söz ediyor?

OpenAI, gpt-oss-20b modelinin 16 GB bellek sınıfındaki cihazlarda çalışabildiğini belirtiyor. Bu ifade cihazın bütün çalışma koşullarını garanti etmez; uygulama, quantization, context ve runtime ayarları gerçek tüketimi etkiler.

LM Studio’da GPU Offload 24 ne anlama geliyor?

Bu modelde yükleme kaydırıcısının üst sınırı 24 katmandır. Dedicated GPU Memory limiti açık olduğunda LM Studio ekranda gerçek offload katmanı sayısının değişebileceğini belirtir; yani 24 seçmek tüm katmanların mutlaka 8 GB VRAM’e sığdığı anlamına gelmez.

Limit Model Offload to Dedicated GPU Memory neden açık?

LM Studio bu modun model ağırlıklarını dedicated GPU memory ve RAM ile sınırlandırdığını, context’in yine shared memory kullanabileceğini açıklıyor. LM Studio kendi testlerinde dedicated VRAM + sistem RAM bölüşümünün shared GPU memory kullanımından daha hızlı olabildiğini bildiriyor.

Max Concurrent Predictions 1 mi 4 mü olmalı?

Bu ayar aynı anda kaç tahmin isteğinin paralel işlenebileceğini belirler. Tek kullanıcılı masaüstü sohbetinde 1 daha öngörülebilir kaynak kullanımı sağlar; API üzerinden çoklu eşzamanlı istemci sunulacaksa daha yüksek değerler throughput için test edilebilir.

Concurrent 1 testi ne kadar hızlandı?

Bu oturumda 4 concurrent profilinde 10.85 token/sn, 1 concurrent profilinde 11.14 token/sn görüldü; fark yaklaşık %2.7’dir. Çıktı uzunlukları farklı olduğu için bunu evrensel bir hız kazanımı olarak değil, bu oturumun gözlemi olarak değerlendirmek gerekir.

1.56 sn ve 1.78 sn neyi gösteriyor?

LM Studio inference istatistiklerinde token/sn yanında Time to First Token (TTFT) metriği bulunur. Bu süre toplam cevabın bitiş süresi değildir; ilk tokenın üretilmesine kadar geçen süreyi ifade eder.

Low Reasoning ne zaman kullanılmalı?

Daha düşük gecikme istenen günlük sohbet, özet ve birçok kodlama görevinde Low iyi bir başlangıç profilidir. GPT-OSS, low, medium ve high reasoning effort seçeneklerini destekler; daha zor problemlerde medium veya high ayrıca test edilebilir.

Bu sayfadaki e-ticaret mimarisi cevabı doğrudan üretimde kullanılmalı mı?

Hayır. Uzun e-ticaret promptu yalnızca modeli sürekli teknik çıktı üretmeye zorlayan benchmark iş yüküdür. Modelin ürettiği mimari, kod ve kapasite iddiaları uzman incelemesi, güvenlik kontrolü ve gerçek yük testi yapılmadan üretim kararı olarak kullanılmamalıdır.

Sohbeti neden temizleyip yeniden test ettiniz?

Önceki mesajlar context’e eklenir ve prompt işleme yükünü değiştirir. Aynı koşullara yaklaşmak için sohbetin Markdown çıktısı alındı, mesajlar temizlendi ve ikinci test mümkün olduğunca temiz başlangıçtan çalıştırıldı.

EKA SUNUCU · GPU INFRASTRUCTURE

GPT-OSS, Qwen veya diğer yerel AI modelleri için daha güçlü GPU mu gerekiyor?

VRAM ihtiyacı yüksek yerel LLM, inference, görüntü üretimi ve AI iş yükleri için GPU sunucu seçeneklerini inceleyin. Donanımı model boyutu, context ve eşzamanlı kullanıcı sayısına göre planlayın.

Güncellendi: 16.08.2026 · LM Studio 0.4.21
GPU Sunucu Seçeneklerini İnceleİletişim
Top