Arama Yap Mesaj Senden
Rückruf anfordern
+90
X
X

Wählen Sie Ihre Währung

Türkische Lira $ US Dollar Euro
X
X

Wählen Sie Ihre Währung

Türkische Lira $ US Dollar Euro

Kontaktieren Sie uns

Standort Halkali Merkez Viertel Fatih Str. Ozgur Apt. No. 46, Kucukcekmece, Istanbul, 34303, TR
LOCAL AI · 2026 DONANIM REHBERİ

Welche KI-Modelle laufen mit 128 GB RAM?

Welche Local-LLMs passen in 128 GB System-RAM? CPU/GPU-Offload, Kontext, KV-Cache und Betriebssystem-Reserve praxisnah einordnen.

128 GB sistem veya birleşik bellek128 GB RAM / Unified MemoryLetzte technische Prüfung: 13. August 2026
VRAM / RAM128 GB RAM / Unified Memory
  • LLM / Coding
  • Vision
  • Image
  • Video
Kurzantwort

Die praktische Grenze wird zuerst durch den nutzbaren Beschleunigerspeicher bestimmt, danach durch Quantisierung, Kontext/KV-Cache und Runtime-Overhead. Die Seite trennt komfortable Modelle von Grenzfällen und unpassenden Zielen.

VRAM ≠ sistem RAM

Wichtig: Die Modelldatei allein bestimmt den Speicherbedarf nicht. KV-Cache, Kontext, Vision-Encoder, Runtime-Workspace und parallele Anfragen benötigen zusätzlichen Speicher.

01
Hardware- und Speicherrealität

128 GB sistem veya birleşik bellek

Wir unterscheiden komfortabel, Grenzbereich/Tuning nötig und kein natürliches Ziel. Das ist aussagekräftiger als nur 'läuft/läuft nicht'.

Creator- und Community-Benchmarks ändern sich je nach Backend, Treiber, Quantisierung, Kontext, Batch und Power-Limit. Sie dienen als Praxisbeleg, nicht als garantierte Leistung.

02

Modell-Kompatibilitätsmatrix

3 model / varyant
ModellGröße / SpeicherWorkloadStatusTechnische Bewertung
Qwen3.5 35B-A3B Q424 GBMoE LLM · VisionKomfortabel24 GB kart için ağırlık düzeyinde tavana dayanır; 32 GB sınıfı daha güvenli.
gpt-oss-20b16 GB bellek hedefiReasoning · Agent · KodKomfortabelOpenAI resmi olarak 16 GB bellekte çalışabildiğini belirtiyor; bağlam ve backend ek yükü ayrıca değerlendirilir.
gpt-oss-120b80 GB bellek hedefiReasoning · AgentGrenzbereich / Tuning nötigOpenAI MXFP4 ile 80 GB bellek hedefi veriyor; tipik oyuncu GPU'ları için sistem RAM/offload gerekir.
03 · Coding- und Agent-Modelle

Coding- und Agent-Modelle

Für Coding- und Agent-Workloads sollte das Modell Speicherreserve für Repository-Kontext, Tool-Aufrufe und KV-Cache lassen, statt den gesamten Speicher nur mit Gewichten zu belegen.

Qwen3.54B · 9B · 27B · 35B-A3B
gpt-oss20b · 120b
Gemma 412B · 26B-A4B · 31B
04 · Vision und Multimodal

Vision und Multimodal

Vision/Multimodal benötigt zusätzlichen Speicher für Bild-Encoder und visuelle Tokens. Ein Textmodell, das gerade passt, kann mit mehreren hochauflösenden Bildern zum Grenzfall werden.

Qwen3.5Text + Image · 256K etiketli context
Gemma 4Multimodal · reasoning · coding
05 · Bildgenerierungsmodelle

Bildgenerierungsmodelle

Bei Bildgenerierung zählen neben dem Checkpoint auch Text-Encoder, VAE, Auflösung und Referenzbilder. Die offizielle Model-Card-Anforderung ist der sinnvollste Ausgangspunkt.

  • FLUX.2 Klein 4B: ~13 GB VRAM resmi hedef
  • Z-Image-Turbo 6B: hızlı yerel üretim, tüketici GPU odağı
  • Qwen-Image 20B: güçlü metin renderı ve düzenleme
06 · Videogenerierungsmodelle

Videogenerierungsmodelle

Video-Diffusion ist deutlich schwerer als Chat-Inferenz. Auflösung, Frame-Zahl, VAE und temporale Module beeinflussen Speicher und Laufzeit stark.

  • Wan2.2 TI2V-5B: T2V + I2V · 720p · 24 fps
  • LTX-2.3: 22B sınıfı video/ses iş akışları
  • Quantized workflow: topluluk sonuçları resmî minimumdan ayrıdır
07
Quantisierung, Kontext und Offload

Q4, INT4, Q8, context ve CPU offload nasıl okunmalı?

Q4/INT4 reduziert die Gewichte, aber KV-Cache und Runtime-Workspace bleiben. Offload in System-RAM ermöglicht größere Modelle, kostet jedoch Durchsatz und Latenz.

Model weightsCheckpoint / quantization
+
KV cacheContext × layers × precision
+
RuntimeVision / VAE / workspace
=
Gerçek bellekVRAM + kontrollü offload
08

Modell-Radar 2026: Qualitäts-Score ist nicht Hardware-Kompatibilität

local.ai · canlı benchmark verisi

Der Intelligence-Score von local.ai kombiniert τ²-bench, GAIA und GDPval. Er ist ein Qualitätsindikator, keine Aussage darüber, ob das Modell in Ihren VRAM/RAM passt.

ModelDeveloperIntelligenceRoleHardware note
Step 3.7 FlashStepFun78,8Genel zekâ / reasoninglocal.ai Intelligence lideri; skor donanım uyumluluğu anlamına gelmez.
DeepSeek V4 Flash 0731DeepSeek77,5Genel / reasoning / kodÇok büyük model sınıfı; tüketici GPU'suna sırf 'Flash' adına bakarak uygun kabul edilmemeli.
Qwen3.6 27BQwen / Alibaba76,5Genel / coding / multimodal27B sınıfı güncel kalite referansı; checkpoint ve quantization boyutu ayrıca doğrulanmalı.
Qwen3.6 35B-A3BQwen / Alibaba74,9MoE / agent / multimodalAktif parametre düşük olsa da model ağırlıklarının bellek yerleşimi ayrıca hesaplanır.
Gemma 4 31B ITGoogle66,2Multimodal / coding / reasoningYerel kullanımda quantization ve context VRAM ihtiyacını belirler.
Nemotron 3.5 LightningNVIDIA65,5Agent / reasoning30B-A3B sınıfı güncel NVIDIA yerel/agent modeli.
Qwen3.5 9B BaseQwen / Alibaba59,3Küçük-orta local LLMOllama Q4 6,6 GB sınıfı nedeniyle 8 GB donanımlarda pratik önemi yüksek.
gpt-oss-20bOpenAI43,3Reasoning / agent / codingOpenAI resmi minimumu 16 GB bellek; benchmark skoru tek başına model seçimi değildir.

local.ai metodolojisi: Intelligence = %10 τ²-bench + %35 GAIA + %55 GDPval. Decode/prefill ölçümleri 32K soğuk context ve tek stream üzerinde raporlanır. Skorlar ve model sürümleri zamanla değişebilir.

09

Bild- und Videomodelle: welches Modell für welchen Zweck?

ComfyUI · Diffusers · local inference
TypeModelMemory referenceBest fitModel card
GörselFLUX.2 Klein 4B~13 GB VRAMHızlı yerel üretim, düzenleme, multi-referenceHugging Face ↗
GörselZ-Image-Turbo 6B16 GB tüketici sınıfıFotogerçekçilik, EN/Çince metin, 8 NFEHugging Face ↗
GörselQwen-Image-251220B model ailesiMetin doğruluğu, layout, multimodal entegrasyonHugging Face ↗
VideoWan2.2 TI2V-5B4090 resmi tüketici örneğiT2V + I2V, 720p, 24 fpsHugging Face ↗
VideoMotif-Video-2B2B sınıfıÜretici değerlendirmesinde VBench toplam 83,76Hugging Face ↗
Video + SesLTX-2.5Checkpoint/precision'a göreAçık ağırlık, yerel çalıştırma, senkron video + sesHugging Face ↗
Video + SesMiniMax H333B sınıfı2K'ya kadar, 15 sn'ye kadar, native stereo audio; lisansı ticari kullanım öncesi okunmalıHugging Face ↗
Metin / logo / tabela

Qwen-Image-2512 ve Z-Image-Turbo özellikle yazı üretimi için incelenmeli. Qwen ailesi karmaşık text rendering ve düzenlemede, Z-Image ise 16 GB tüketici sınıfında fotogerçekçilik ve EN/Çince metinde öne çıkıyor.

Yerel hızlı görsel

FLUX.2 Klein 4B için resmî yaklaşık 13 GB VRAM hedefi var. 16 GB kartlar burada 8 GB kartlara göre doğrudan farklı bir sınıfa geçiyor.

Yerel video

Wan2.2 5B olgun 720p/24 fps referansı; Motif-Video-2B daha küçük araştırma seçeneği; LTX-2.5 senkron ses-video; MiniMax H3 ise çok daha ağır 33B omni-modal sınıf. “En yeni” ile “donanımınıza en uygun” aynı şey değildir.

08

Benchmarks und Validierung

Resmî + gerçek cihaz
ModellÖlçüm / veriQuellentypWas zeigt es?
gpt-oss-120b80 GB bellekOpenAI128 GB kapasite içinde
Qwen3.5 122B~81 GB Ollama sınıfıOllama128 GB kapasite içinde
Ryzen AI Max+ 395128 GB unified seçenekAMDKlasik DDR'den farklı bellek mimarisi
Benchmark okuma kuralı

Creator- und Community-Benchmarks ändern sich je nach Backend, Treiber, Quantisierung, Kontext, Batch und Power-Limit. Sie dienen als Praxisbeleg, nicht als garantierte Leistung.

09

Offizielle Quellen und Praxistests

15 kaynak
10

Häufige Fragen

Läuft Ollama auf dieser Hardware?

Ja, wenn quantisiertes Modell und Kontext in den verfügbaren Speicher passen. Beginnen Sie mit den als komfortabel markierten Modellen.

Garantiert eine passende Modelldatei hohe Geschwindigkeit?

Nein. KV-Cache, Runtime, Bandbreite, GPU-Architektur, Kontext und Laptop-Power-Limits beeinflussen die Leistung.

Q4 oder Q8?

Bei knappem VRAM ist Q4 oft sinnvoller, weil mehr Platz für Kontext bleibt. Q8 benötigt deutlich mehr Speicher.

Erhöht mehr RAM den VRAM?

Nein. System-RAM kann für Offload genutzt werden, vergrößert aber diskreten VRAM nicht. Unified Memory ist eine andere Architektur.

Reicht Ollama für Bildgenerierung?

Ollama ist primär für LLM/Vision. FLUX, Z-Image und Qwen-Image werden typischerweise mit ComfyUI oder Diffusers genutzt.

Was zählt bei lokaler Videogenerierung?

Neben Parametern zählen Auflösung, Frames, Precision, VAE und die Hardware-Angaben der Model Card.

Ist CPU-Offload sinnvoll?

Ja, wenn Kapazität wichtiger als Latenz ist. Für interaktive Nutzung ist mehr VRAM besser, sobald Offload zum Flaschenhals wird.

Soll ich immer den maximalen Kontext verwenden?

Nein. Nur den benötigten Kontext nutzen; KV-Cache wächst mit Kontext und verbraucht zusätzlichen Speicher.

11

Verwandte Local-AI-Ratgeber

EKA SUNUCU · GPU ALTYAPISI

Wird für ein größeres Modell ein GPU-Server benötigt?

Nennen Sie Checkpoint-Größe, Zielkontext und parallele Nutzerzahl; daraus lässt sich VRAM/RAM korrekt dimensionieren.

Top