Qwen-Image-2512 ve Z-Image-Turbo özellikle yazı üretimi için incelenmeli. Qwen ailesi karmaşık text rendering ve düzenlemede, Z-Image ise 16 GB tüketici sınıfında fotogerçekçilik ve EN/Çince metinde öne çıkıyor.
Welche Local-LLMs passen in 64 GB System-RAM? CPU/GPU-Offload, Kontext, KV-Cache und Betriebssystem-Reserve praxisnah einordnen.
Die praktische Grenze wird zuerst durch den nutzbaren Beschleunigerspeicher bestimmt, danach durch Quantisierung, Kontext/KV-Cache und Runtime-Overhead. Die Seite trennt komfortable Modelle von Grenzfällen und unpassenden Zielen.
Wichtig: Die Modelldatei allein bestimmt den Speicherbedarf nicht. KV-Cache, Kontext, Vision-Encoder, Runtime-Workspace und parallele Anfragen benötigen zusätzlichen Speicher.
Wir unterscheiden komfortabel, Grenzbereich/Tuning nötig und kein natürliches Ziel. Das ist aussagekräftiger als nur 'läuft/läuft nicht'.
Creator- und Community-Benchmarks ändern sich je nach Backend, Treiber, Quantisierung, Kontext, Batch und Power-Limit. Sie dienen als Praxisbeleg, nicht als garantierte Leistung.
| Modell | Größe / Speicher | Workload | Status | Technische Bewertung |
|---|---|---|---|---|
| Qwen3.5 27B Q4_K_M | 17 GB | LLM · Vision · Kod | Komfortabel | 24 GB sınıfında güçlü genel/kodlama seçeneği; uzun bağlam ayrıca bellek tüketir. |
| Qwen3.5 35B-A3B Q4 | 24 GB | MoE LLM · Vision | Komfortabel | 24 GB kart için ağırlık düzeyinde tavana dayanır; 32 GB sınıfı daha güvenli. |
| gpt-oss-20b | 16 GB bellek hedefi | Reasoning · Agent · Kod | Komfortabel | OpenAI resmi olarak 16 GB bellekte çalışabildiğini belirtiyor; bağlam ve backend ek yükü ayrıca değerlendirilir. |
| Gemma 4 31B | 31B sınıfı | Dense LLM · Vision · Kod | Grenzbereich / Tuning nötig | 24-32 GB üstü quantization planı gerektirir; bağlam büyüdükçe ek VRAM tüketir. |
| gpt-oss-120b | 80 GB bellek hedefi | Reasoning · Agent | Kein natürliches Ziel für diese Hardware | OpenAI MXFP4 ile 80 GB bellek hedefi veriyor; tipik oyuncu GPU'ları için sistem RAM/offload gerekir. |
Für Coding- und Agent-Workloads sollte das Modell Speicherreserve für Repository-Kontext, Tool-Aufrufe und KV-Cache lassen, statt den gesamten Speicher nur mit Gewichten zu belegen.
Vision/Multimodal benötigt zusätzlichen Speicher für Bild-Encoder und visuelle Tokens. Ein Textmodell, das gerade passt, kann mit mehreren hochauflösenden Bildern zum Grenzfall werden.
Bei Bildgenerierung zählen neben dem Checkpoint auch Text-Encoder, VAE, Auflösung und Referenzbilder. Die offizielle Model-Card-Anforderung ist der sinnvollste Ausgangspunkt.
Video-Diffusion ist deutlich schwerer als Chat-Inferenz. Auflösung, Frame-Zahl, VAE und temporale Module beeinflussen Speicher und Laufzeit stark.
Q4/INT4 reduziert die Gewichte, aber KV-Cache und Runtime-Workspace bleiben. Offload in System-RAM ermöglicht größere Modelle, kostet jedoch Durchsatz und Latenz.
Der Intelligence-Score von local.ai kombiniert τ²-bench, GAIA und GDPval. Er ist ein Qualitätsindikator, keine Aussage darüber, ob das Modell in Ihren VRAM/RAM passt.
| Model | Developer | Intelligence | Role | Hardware note |
|---|---|---|---|---|
| Step 3.7 Flash | StepFun | 78,8 | Genel zekâ / reasoning | local.ai Intelligence lideri; skor donanım uyumluluğu anlamına gelmez. |
| DeepSeek V4 Flash 0731 | DeepSeek | 77,5 | Genel / reasoning / kod | Çok büyük model sınıfı; tüketici GPU'suna sırf 'Flash' adına bakarak uygun kabul edilmemeli. |
| Qwen3.6 27B | Qwen / Alibaba | 76,5 | Genel / coding / multimodal | 27B sınıfı güncel kalite referansı; checkpoint ve quantization boyutu ayrıca doğrulanmalı. |
| Qwen3.6 35B-A3B | Qwen / Alibaba | 74,9 | MoE / agent / multimodal | Aktif parametre düşük olsa da model ağırlıklarının bellek yerleşimi ayrıca hesaplanır. |
| Gemma 4 31B IT | 66,2 | Multimodal / coding / reasoning | Yerel kullanımda quantization ve context VRAM ihtiyacını belirler. | |
| Nemotron 3.5 Lightning | NVIDIA | 65,5 | Agent / reasoning | 30B-A3B sınıfı güncel NVIDIA yerel/agent modeli. |
| Qwen3.5 9B Base | Qwen / Alibaba | 59,3 | Küçük-orta local LLM | Ollama Q4 6,6 GB sınıfı nedeniyle 8 GB donanımlarda pratik önemi yüksek. |
| gpt-oss-20b | OpenAI | 43,3 | Reasoning / agent / coding | OpenAI resmi minimumu 16 GB bellek; benchmark skoru tek başına model seçimi değildir. |
local.ai metodolojisi: Intelligence = %10 τ²-bench + %35 GAIA + %55 GDPval. Decode/prefill ölçümleri 32K soğuk context ve tek stream üzerinde raporlanır. Skorlar ve model sürümleri zamanla değişebilir.
| Type | Model | Memory reference | Best fit | Model card |
|---|---|---|---|---|
| Görsel | FLUX.2 Klein 4B | ~13 GB VRAM | Hızlı yerel üretim, düzenleme, multi-reference | Hugging Face ↗ |
| Görsel | Z-Image-Turbo 6B | 16 GB tüketici sınıfı | Fotogerçekçilik, EN/Çince metin, 8 NFE | Hugging Face ↗ |
| Görsel | Qwen-Image-2512 | 20B model ailesi | Metin doğruluğu, layout, multimodal entegrasyon | Hugging Face ↗ |
| Video | Wan2.2 TI2V-5B | 4090 resmi tüketici örneği | T2V + I2V, 720p, 24 fps | Hugging Face ↗ |
| Video | Motif-Video-2B | 2B sınıfı | Üretici değerlendirmesinde VBench toplam 83,76 | Hugging Face ↗ |
| Video + Ses | LTX-2.5 | Checkpoint/precision'a göre | Açık ağırlık, yerel çalıştırma, senkron video + ses | Hugging Face ↗ |
| Video + Ses | MiniMax H3 | 33B sınıfı | 2K'ya kadar, 15 sn'ye kadar, native stereo audio; lisansı ticari kullanım öncesi okunmalı | Hugging Face ↗ |
Qwen-Image-2512 ve Z-Image-Turbo özellikle yazı üretimi için incelenmeli. Qwen ailesi karmaşık text rendering ve düzenlemede, Z-Image ise 16 GB tüketici sınıfında fotogerçekçilik ve EN/Çince metinde öne çıkıyor.
FLUX.2 Klein 4B için resmî yaklaşık 13 GB VRAM hedefi var. 16 GB kartlar burada 8 GB kartlara göre doğrudan farklı bir sınıfa geçiyor.
Wan2.2 5B olgun 720p/24 fps referansı; Motif-Video-2B daha küçük araştırma seçeneği; LTX-2.5 senkron ses-video; MiniMax H3 ise çok daha ağır 33B omni-modal sınıf. “En yeni” ile “donanımınıza en uygun” aynı şey değildir.
| Modell | Ölçüm / veri | Quellentyp | Was zeigt es? |
|---|---|---|---|
| Qwen3.5 35B-A3B Q4 | 24 GB | Ollama | 64 GB RAM'de rahat kapasite |
| 70B Q4 ağırlık hesabı | ~35-45 GB+ | Quantization hesabı | KV/context nedeniyle 48-64 GB planlanır |
| gpt-oss-120b | 80 GB minimum | OpenAI | 64 GB'a doğal olarak sığmaz |
Creator- und Community-Benchmarks ändern sich je nach Backend, Treiber, Quantisierung, Kontext, Batch und Power-Limit. Sie dienen als Praxisbeleg, nicht als garantierte Leistung.
Ja, wenn quantisiertes Modell und Kontext in den verfügbaren Speicher passen. Beginnen Sie mit den als komfortabel markierten Modellen.
Nein. KV-Cache, Runtime, Bandbreite, GPU-Architektur, Kontext und Laptop-Power-Limits beeinflussen die Leistung.
Bei knappem VRAM ist Q4 oft sinnvoller, weil mehr Platz für Kontext bleibt. Q8 benötigt deutlich mehr Speicher.
Nein. System-RAM kann für Offload genutzt werden, vergrößert aber diskreten VRAM nicht. Unified Memory ist eine andere Architektur.
Ollama ist primär für LLM/Vision. FLUX, Z-Image und Qwen-Image werden typischerweise mit ComfyUI oder Diffusers genutzt.
Neben Parametern zählen Auflösung, Frames, Precision, VAE und die Hardware-Angaben der Model Card.
Ja, wenn Kapazität wichtiger als Latenz ist. Für interaktive Nutzung ist mehr VRAM besser, sobald Offload zum Flaschenhals wird.
Nein. Nur den benötigten Kontext nutzen; KV-Cache wächst mit Kontext und verbraucht zusätzlichen Speicher.
Nennen Sie Checkpoint-Größe, Zielkontext und parallele Nutzerzahl; daraus lässt sich VRAM/RAM korrekt dimensionieren.