Qwen-Image-2512 ve Z-Image-Turbo özellikle yazı üretimi için incelenmeli. Qwen ailesi karmaşık text rendering ve düzenlemede, Z-Image ise 16 GB tüketici sınıfında fotogerçekçilik ve EN/Çince metinde öne çıkıyor.
Local-AI-Ratgeber 2026 für GeForce RTX 4060 Laptop GPU: LLM, Coding, Vision, Bild und Video nach Modellgröße, VRAM, Kontext und Praxistests vergleichen.
Die praktische Grenze wird zuerst durch den nutzbaren Beschleunigerspeicher bestimmt, danach durch Quantisierung, Kontext/KV-Cache und Runtime-Overhead. Die Seite trennt komfortable Modelle von Grenzfällen und unpassenden Zielen.
Wichtig: Die Modelldatei allein bestimmt den Speicherbedarf nicht. KV-Cache, Kontext, Vision-Encoder, Runtime-Workspace und parallele Anfragen benötigen zusätzlichen Speicher.
Wir unterscheiden komfortabel, Grenzbereich/Tuning nötig und kein natürliches Ziel. Das ist aussagekräftiger als nur 'läuft/läuft nicht'.
Creator- und Community-Benchmarks ändern sich je nach Backend, Treiber, Quantisierung, Kontext, Batch und Power-Limit. Sie dienen als Praxisbeleg, nicht als garantierte Leistung.
| Modell | Größe / Speicher | Workload | Status | Technische Bewertung |
|---|---|---|---|---|
| Qwen3.5 4B Q4_K_M | 3,4 GB | LLM · Vision | Komfortabel | 6-8 GB VRAM sınıfında mantıklı başlangıç; 256K azami bağlam etiketi olsa da gerçek bağlam VRAM'e göre düşürülmeli. |
| Qwen3.5 9B Q4_K_M | 6,6 GB | LLM · Vision · Kod | Komfortabel | 8 GB kartta ağırlıklar sığabilir; KV cache ve vision yükü için bağlamı kontrollü tutmak gerekir. |
| Gemma 4 12B | 12B sınıfı | LLM · Vision · Kod | Grenzbereich / Tuning nötig | Google'ın güncel açık ağırlıklı multimodal ailesi; quantization seçimi gerçek bellek ihtiyacını belirler. |
| gpt-oss-20b | 16 GB bellek hedefi | Reasoning · Agent · Kod | Grenzbereich / Tuning nötig | OpenAI resmi olarak 16 GB bellekte çalışabildiğini belirtiyor; bağlam ve backend ek yükü ayrıca değerlendirilir. |
| Qwen3.5 27B INT4 | 16 GB | LLM · Vision · Kod | Kein natürliches Ziel für diese Hardware | 16 GB VRAM'i tamamen doldurmaya yakın; 20-24 GB ve üzeri daha sağlıklı çalışma alanı bırakır. |
| FLUX.2 Klein 4B | ~13 GB VRAM | Görsel üretim · Düzenleme | Kein natürliches Ziel für diese Hardware | Resmi model kartı yaklaşık 13 GB VRAM ve RTX 3090/4070 ve üzerini hedefliyor. |
| Wan2.2 TI2V-5B | 5B video modeli | T2V · I2V · 720p | Kein natürliches Ziel für diese Hardware | Resmi kart 720p/24 fps ve tek RTX 4090 sınıfında çalışma hedefini açıklıyor. |
Für Coding- und Agent-Workloads sollte das Modell Speicherreserve für Repository-Kontext, Tool-Aufrufe und KV-Cache lassen, statt den gesamten Speicher nur mit Gewichten zu belegen.
Vision/Multimodal benötigt zusätzlichen Speicher für Bild-Encoder und visuelle Tokens. Ein Textmodell, das gerade passt, kann mit mehreren hochauflösenden Bildern zum Grenzfall werden.
Bei Bildgenerierung zählen neben dem Checkpoint auch Text-Encoder, VAE, Auflösung und Referenzbilder. Die offizielle Model-Card-Anforderung ist der sinnvollste Ausgangspunkt.
Video-Diffusion ist deutlich schwerer als Chat-Inferenz. Auflösung, Frame-Zahl, VAE und temporale Module beeinflussen Speicher und Laufzeit stark.
Q4/INT4 reduziert die Gewichte, aber KV-Cache und Runtime-Workspace bleiben. Offload in System-RAM ermöglicht größere Modelle, kostet jedoch Durchsatz und Latenz.
Der Intelligence-Score von local.ai kombiniert τ²-bench, GAIA und GDPval. Er ist ein Qualitätsindikator, keine Aussage darüber, ob das Modell in Ihren VRAM/RAM passt.
| Model | Developer | Intelligence | Role | Hardware note |
|---|---|---|---|---|
| Step 3.7 Flash | StepFun | 78,8 | Genel zekâ / reasoning | local.ai Intelligence lideri; skor donanım uyumluluğu anlamına gelmez. |
| DeepSeek V4 Flash 0731 | DeepSeek | 77,5 | Genel / reasoning / kod | Çok büyük model sınıfı; tüketici GPU'suna sırf 'Flash' adına bakarak uygun kabul edilmemeli. |
| Qwen3.6 27B | Qwen / Alibaba | 76,5 | Genel / coding / multimodal | 27B sınıfı güncel kalite referansı; checkpoint ve quantization boyutu ayrıca doğrulanmalı. |
| Qwen3.6 35B-A3B | Qwen / Alibaba | 74,9 | MoE / agent / multimodal | Aktif parametre düşük olsa da model ağırlıklarının bellek yerleşimi ayrıca hesaplanır. |
| Gemma 4 31B IT | 66,2 | Multimodal / coding / reasoning | Yerel kullanımda quantization ve context VRAM ihtiyacını belirler. | |
| Nemotron 3.5 Lightning | NVIDIA | 65,5 | Agent / reasoning | 30B-A3B sınıfı güncel NVIDIA yerel/agent modeli. |
| Qwen3.5 9B Base | Qwen / Alibaba | 59,3 | Küçük-orta local LLM | Ollama Q4 6,6 GB sınıfı nedeniyle 8 GB donanımlarda pratik önemi yüksek. |
| gpt-oss-20b | OpenAI | 43,3 | Reasoning / agent / coding | OpenAI resmi minimumu 16 GB bellek; benchmark skoru tek başına model seçimi değildir. |
local.ai metodolojisi: Intelligence = %10 τ²-bench + %35 GAIA + %55 GDPval. Decode/prefill ölçümleri 32K soğuk context ve tek stream üzerinde raporlanır. Skorlar ve model sürümleri zamanla değişebilir.
| Type | Model | Memory reference | Best fit | Model card |
|---|---|---|---|---|
| Görsel | FLUX.2 Klein 4B | ~13 GB VRAM | Hızlı yerel üretim, düzenleme, multi-reference | Hugging Face ↗ |
| Görsel | Z-Image-Turbo 6B | 16 GB tüketici sınıfı | Fotogerçekçilik, EN/Çince metin, 8 NFE | Hugging Face ↗ |
| Görsel | Qwen-Image-2512 | 20B model ailesi | Metin doğruluğu, layout, multimodal entegrasyon | Hugging Face ↗ |
| Video | Wan2.2 TI2V-5B | 4090 resmi tüketici örneği | T2V + I2V, 720p, 24 fps | Hugging Face ↗ |
| Video | Motif-Video-2B | 2B sınıfı | Üretici değerlendirmesinde VBench toplam 83,76 | Hugging Face ↗ |
| Video + Ses | LTX-2.5 | Checkpoint/precision'a göre | Açık ağırlık, yerel çalıştırma, senkron video + ses | Hugging Face ↗ |
| Video + Ses | MiniMax H3 | 33B sınıfı | 2K'ya kadar, 15 sn'ye kadar, native stereo audio; lisansı ticari kullanım öncesi okunmalı | Hugging Face ↗ |
Qwen-Image-2512 ve Z-Image-Turbo özellikle yazı üretimi için incelenmeli. Qwen ailesi karmaşık text rendering ve düzenlemede, Z-Image ise 16 GB tüketici sınıfında fotogerçekçilik ve EN/Çince metinde öne çıkıyor.
FLUX.2 Klein 4B için resmî yaklaşık 13 GB VRAM hedefi var. 16 GB kartlar burada 8 GB kartlara göre doğrudan farklı bir sınıfa geçiyor.
Wan2.2 5B olgun 720p/24 fps referansı; Motif-Video-2B daha küçük araştırma seçeneği; LTX-2.5 senkron ses-video; MiniMax H3 ise çok daha ağır 33B omni-modal sınıf. “En yeni” ile “donanımınıza en uygun” aynı şey değildir.
| Modell | Ölçüm / veri | Quellentyp | Was zeigt es? |
|---|---|---|---|
| RTX 4060 Laptop | 8 GB VRAM | NVIDIA resmi özellik | Model sığdırma sınırı |
| 8 GB coding benchmark | RTX 4060 8 GB | YouTube 2026 testi | Yerel kodlama modelleri karşılaştırılıyor |
| Qwen3.5 9B Q4 | 6,6 GB | Ollama | 8 GB'da en mantıklı güncel sınıflardan |
Creator- und Community-Benchmarks ändern sich je nach Backend, Treiber, Quantisierung, Kontext, Batch und Power-Limit. Sie dienen als Praxisbeleg, nicht als garantierte Leistung.
Ja, wenn quantisiertes Modell und Kontext in den verfügbaren Speicher passen. Beginnen Sie mit den als komfortabel markierten Modellen.
Nein. KV-Cache, Runtime, Bandbreite, GPU-Architektur, Kontext und Laptop-Power-Limits beeinflussen die Leistung.
Bei knappem VRAM ist Q4 oft sinnvoller, weil mehr Platz für Kontext bleibt. Q8 benötigt deutlich mehr Speicher.
Nein. System-RAM kann für Offload genutzt werden, vergrößert aber diskreten VRAM nicht. Unified Memory ist eine andere Architektur.
Ollama ist primär für LLM/Vision. FLUX, Z-Image und Qwen-Image werden typischerweise mit ComfyUI oder Diffusers genutzt.
Neben Parametern zählen Auflösung, Frames, Precision, VAE und die Hardware-Angaben der Model Card.
Ja, wenn Kapazität wichtiger als Latenz ist. Für interaktive Nutzung ist mehr VRAM besser, sobald Offload zum Flaschenhals wird.
Nein. Nur den benötigten Kontext nutzen; KV-Cache wächst mit Kontext und verbraucht zusätzlichen Speicher.
Nennen Sie Checkpoint-Größe, Zielkontext und parallele Nutzerzahl; daraus lässt sich VRAM/RAM korrekt dimensionieren.