Dense-Architektur
Architecture-Key in dichten Qwen3.5-GGUFs
Wenn eine Qwen3.5-GGUF-Datei in LM Studio mit 'Failed to load model' und 'unknown model architecture: qwen35' scheitert, erkennt der ausgewählte llama.cpp-Runtime meist die in der GGUF-Metadaten gespeicherte Architektur noch nicht. Dieser Leitfaden trennt qwen35/qwen35moe-Kompatibilitätsfehler sauber von VRAM-, Context-, CUDA- und mmproj-Problemen.
'unknown model architecture: qwen35' bedeutet, dass der aktive llama.cpp-Runtime den Wert general.architecture=qwen35 der GGUF-Datei nicht kennt. Das ist nicht dasselbe wie zu wenig RAM oder VRAM. LM Studio und den GGUF-Runtime aktualisieren, einen aktuellen CUDA/Vulkan/CPU-Motor auswählen, Modell entladen und neu laden.
Wenn im Runtime-Bereich nur v1.x-Motoren erscheinen, kann eine ältere LM-Studio-/Runtime-Katalogversion aktiv sein. Am 15. August 2026 ist LM Studio 0.4.21 die aktuelle stabile Version; im Changelog werden llama.cpp-Motoren 2.28.1 und neuer erwähnt. v1.104.2 als 'latest' beweist daher nicht, dass ein aktueller Qwen3.5-fähiger 2.x-Runtime verwendet wird.
Architecture-Key in dichten Qwen3.5-GGUFs
Kann bei Qwen3.5-35B-A3B erscheinen
Einen aktuellen llama.cpp-Motor verwenden
Stabile Version am 15. August 2026
Beim Öffnen einer GGUF-Datei liest LM Studio zunächst Metadaten wie general.architecture. Bei dichten Qwen3.5-GGUFs kann dort qwen35 stehen. Kennt der ausgewählte llama.cpp-Motor diesen Schlüssel nicht, stoppt das Laden, bevor das Modell normal initialisiert wird.
'Failed to load model' ist nur die allgemeine Überschrift. Entscheidend ist die technische Zeile mit 'unknown model architecture'. 'Unknown' bedeutet nicht automatisch, dass die GGUF beschädigt ist, sondern dass der Runtime keinen passenden Loader für diese Architektur besitzt.
Der Fehler kann unter Windows oder Linux und mit verschiedenen GPUs auftreten, weil er häufig vor der eigentlichen GPU-Speicherbelegung entsteht.
Failed to load model
error loading model: error loading model architecture: unknown model architecture: 'qwen35'
Der interne Architektur-Schlüssel einer GGUF muss nicht exakt dem Produktnamen entsprechen. Dichte Qwen3.5-Dateien können qwen35 verwenden; Mixture-of-Experts-Varianten können qwen35moe verwenden.
Qwen3.5-27B kann daher qwen35 melden, während Qwen3.5-35B-A3B als MoE-Variante qwen35moe verwenden kann. In beiden Fällen deutet 'unknown architecture' zuerst auf Runtime-Kompatibilität.
Aktueller llama.cpp-Quellcode enthält Qwen3.5-Architekturkonstanten; ein älteres gepacktes Runtime kann trotzdem noch scheitern.
Speicherfehler entstehen, nachdem der Runtime die Architektur erkannt hat und Gewichte, KV-Cache oder Compute-Buffer reserviert. Dann erscheinen eher 'out of memory', 'failed to allocate' oder CUDA-Allocation-Fehler.
Auch ein PC mit viel RAM/VRAM kann qwen35 nicht laden, wenn der Runtime zu alt ist. Nach einem Update kann anschließend ein echter OOM auftreten; das ist ein zweiter, separater Fehler.
Die Desktop-App stellt Oberfläche, Katalog, Chat und Server bereit. GGUF-Inferenz läuft über ein llama.cpp Runtime Extension Pack. Nur die App oder nur den Runtime zu aktualisieren kann deshalb unvollständig sein.
Laut offizieller Dokumentation öffnet Ctrl + Shift + R unter Windows/Linux die Runtime-Verwaltung. Alternativ gibt es lms runtime in der CLI. Am 15. August 2026 ist LM Studio 0.4.21 stabil; der Changelog nennt llama.cpp 2.28.1+.
Wenn nur 1.x-Motoren erscheinen, zuerst LM Studio aktualisieren, Runtime-Katalog aktualisieren und dann den aktiven GGUF-Motor prüfen.
Eine 10-30+ GB große GGUF sofort neu herunterzuladen ist bei einem Architekturfehler meist unnötig. Derselbe Download mit demselben alten Runtime führt oft zum selben Ergebnis.
Änderungen einzeln durchführen und nach wichtigen Schritten neu laden. Ändert sich die Fehlermeldung, muss die neue Meldung separat diagnostiziert werden.
'Latest' kann lediglich das neueste Paket bedeuten, das die aktuelle App bzw. der aktuelle Kanal kennt. Eine ältere LM-Studio-Version kann daher v1.104.2 als aktuell markieren, obwohl moderne 2.x-Motoren existieren.
Der Screenshot zeigt Vulkan, CUDA, CPU und CUDA 12 jeweils mit v1.104.2. Zwischen diesen alten Builds zu wechseln bringt qwen35-Unterstützung nicht automatisch. App aktualisieren, Katalog neu laden und aktuellen 2.x-Motor auswählen.
Nach der Installation zusätzlich kontrollieren, ob GGUF tatsächlich auf den neuen Motor zeigt.

Bei NVIDIA ist ein aktueller CUDA-basierter llama.cpp-Motor meist die erste Wahl. CUDA 12 passt zu kompatiblen Treibern und Karten. Für diesen Fehler ist vor allem entscheidend, dass der Motor neu genug für Qwen3.5 ist.
Vulkan bietet breite Unterstützung für AMD/Intel und kann auch zur Diagnose dienen. Ein kleiner Qwen3.5-Test auf CPU hilft, GPU-Abhängigkeiten auszuschließen.
Zuerst stabil laden, erst danach Geschwindigkeit optimieren.
| Runtime | Geeignet für | Vorteil | Prüfen |
|---|---|---|---|
| CUDA llama.cpp | NVIDIA GPU | Direkte NVIDIA-Beschleunigung | Treiber, Runtime-Version, Offload |
| CUDA 12 llama.cpp | Aktuelle NVIDIA-Systeme | Neue CUDA-Linie | Treiber-/Runtime-Kompatibilität |
| Vulkan llama.cpp | AMD/Intel/Kompatibilität | Herstellerübergreifend | Treiber und Vulkan-Support |
| CPU llama.cpp | Ohne GPU / Diagnose | Keine GPU-Abhängigkeit | Bei großen Modellen langsam |
Ja. qwen35moe betrifft Qwen3.5-MoE-Varianten wie 35B-A3B. Im offiziellen LM-Studio-Bugtracker gibt es entsprechende Meldungen.
MoE beeinflusst später Speicher und Performance, aber 'unknown architecture' entsteht vorher. Erst Runtime-Kompatibilität herstellen.
Failed to load model
error loading model: error loading model architecture: unknown model architecture: 'qwen35moe'Nicht nur installierte, sondern die tatsächlich aktive Engine prüfen. Mehrere Versionen können parallel vorhanden sein. Modell entladen, LM Studio neu starten und mit dem neuen Motor erneut laden.
Danach ein kleines Qwen3.5 aus einer vertrauenswürdigen Quelle testen. Funktioniert 2B/4B, aber ein einzelnes Drittanbieter-GGUF nicht, ist die Datei bzw. deren Build genauer zu prüfen.
Server-Logs zeigen, welche Architektur gelesen und welcher Runtime verwendet wird.
Quantisierung verändert Dateigröße, Speicherbedarf und Qualität, ergänzt aber keinen fehlenden Architektur-Loader. Wenn qwen35 unbekannt ist, behebt Q4 statt Q8 den Grundfehler nicht.
Sobald die Architektur erkannt wird, wird Quantisierung für RAM/VRAM relevant. KV-Cache, Context, Projektor und Runtime-Buffer benötigen zusätzlichen Speicher.
Ein kleines Qwen3.5 eignet sich gut, um die Runtime-Kompatibilität getrennt vom Speicherbedarf zu testen.
Die offizielle Qwen3.5-27B-Karte nennt 262.144 Token Standardkontext und empfiehlt bei OOM, das Context Window zu reduzieren. Langer Kontext kann den KV-Cache stark vergrößern.
Lokal zunächst mit 8K oder 16K stabil testen und nur bei Bedarf erhöhen. GPU-Offload, Quantisierung und Context gemeinsam an RAM/VRAM anpassen.
Ein OOM nach dem Verschwinden von qwen35 ist ein anderer Fehler und kann zeigen, dass der Runtime das Modell nun erkennt.
Das ist eine andere Fehlerstufe. Qwen3.5 kann multimodal sein, bei GGUF kann dafür jedoch eine passende mmproj/Projector-Datei nötig sein. llama.cpp-Fehlerberichte zeigen die separate Meldung 'image input is not supported'.
Wenn Textchat funktioniert, war das Architektur-Laden erfolgreich. Prüfen, ob der Model-Build einen Projektor mitliefert und ob LM Studio ihn korrekt zuordnet.
Textbetrieb kann auch dann funktionieren, wenn der Vision-Projektor fehlt.
Die Überschrift ist nur ein Sammelfehler. Die nächste technische Zeile unterscheidet Runtime-, Speicher-, Datei-, GPU- und Vision-Probleme.
Für Details Developer Logs oder lms log stream --source server nutzen und nach dem exakten Fehlertext suchen.
| Fehler / Symptom | Ebene | Erster Schritt | Neu laden? |
|---|---|---|---|
| unknown model architecture: 'qwen35' | Alter/inkompatibler Runtime | App + Runtime aktualisieren | Meist nein |
| unknown model architecture: 'qwen35moe' | Alter MoE-Support | Aktuellen 2.x-Runtime wählen | Meist nein |
| out of memory / failed to allocate | RAM/VRAM/Context | Context/Offload/Quantisierung reduzieren | Nein |
| unexpected EOF / missing tensor | Datei/Build | Download/Quelle prüfen | Eventuell |
| image input is not supported / mmproj | Vision-Projektor | Passende mmproj nutzen | Hauptmodell meist nein |
| CUDA initialization / driver error | GPU-Backend | Treiber/Runtime prüfen | Nein |
| Sehr langsam | Offload/Backend/Context | GPU-Offload optimieren | Nein |
| Spezialtoken-Schleife | Template/Runtime-Regression | Runtime/Template prüfen | Meist nein |
Mit lms runtime ls, lms runtime update und lms runtime select lassen sich installierte und ausgewählte Runtimes kontrollieren.
lms log stream --source server zeigt Lade-Logs; lms ls listet Modelle auf der Platte und lms ps geladene Modelle im Speicher.
Private Pfade oder Zugangsdaten vor dem Teilen von Logs entfernen.
lms runtime ls
lms runtime update
lms runtime selectlms ls
lms ps
lms log stream --source serverLM Studio listet unter anderem 2B, 4B, 9B, 27B und 35B-A3B. Kleine Modelle sind ideal für Kompatibilitätstests; große Modelle benötigen deutlich mehr Ressourcen.
Nach einem Runtime-Update zuerst ein kleines Qwen3.5 laden. Funktioniert es, anschließend 27B oder 35B-A3B testen und Kapazitätsprobleme getrennt lösen.
Für Coding, Mehrsprachigkeit, Tools und Dokumente zählen zusätzlich Quantisierung, Context und Prompt-Format.
Immer mit gleichem Modell, Quantisierung, Context und Prompt vergleichen. GPU-Offload erhöhen, aber genügend VRAM für KV-Cache und Buffer frei lassen.
Unnötig große Context Windows vermeiden. Bei Benchmarks App-Version, Runtime, GPU, GGUF-Datei und Quantisierung notieren, weil sich Qwen3.5-Leistung zwischen llama.cpp-Versionen ändern kann.
Neben tokens/s auch Time-to-first-token und Prompt-Verarbeitung messen.
Nur qwen35/qwen35moe ist meist kein Grund für einen neuen Download, da die Metadaten bereits gelesen werden konnten.
Neu herunterladen bei falscher Dateigröße, abgebrochenem Transfer, unexpected EOF, fehlenden Tensor-/Header-Daten oder Checksum-Abweichung. Bei gesplitteten GGUFs müssen alle Shards vorhanden sein.
Öffnet dieselbe Datei in einer anderen aktuellen llama.cpp-Anwendung, spricht das für eine grundsätzlich lesbare Datei.
Vorher Modellverzeichnis notieren und Dateien behalten. Oft reicht es, alte Runtimes zu entfernen und einen aktuellen Runtime neu zu installieren.
Bei kompletter Neuinstallation Chatverlauf, Einstellungen und Modellpfade sichern. Danach zuerst ein kleines Qwen3.5 testen.
Für einen Bugreport LM-Studio-Version, OS, GPU, Runtime-Version, exakten GGUF-Namen und Server-Logs angeben.
Ctrl + Shift + R ile runtime yönetimi ve GGUF için llama.cpp kullanımı
lmstudio.ai ↗SOURCELM Studio CLI — lms runtimeRuntime listeleme, indirme, seçme ve güncelleme komutları
lmstudio.ai ↗SOURCELM Studio 0.4.21 Changelog12 Ağustos 2026 sürümü ve llama.cpp 2.28.1+ motor notları
lmstudio.ai ↗SOURCELM Studio — Qwen3.5 Model SayfasıQwen3.5 model ailesi, GGUF/MLX seçenekleri ve kabiliyetleri
lmstudio.ai ↗SOURCEQwen — Qwen3.5-27B Model CardResmi model bilgileri ve 262.144 token varsayılan context açıklaması
huggingface.co ↗SOURCEllama.cpp — GGUF Architecture ConstantsGüncel llama.cpp kaynak kodunda Qwen3.5 mimari anahtarları
github.com ↗SOURCELM Studio Bug Tracker #1606Qwen3.5 model yükleme sorununun resmi hata takipçisindeki örneği
github.com ↗SOURCELM Studio Bug Tracker #1587'qwen35moe' unknown model architecture örneği
github.com ↗SOURCEllama.cpp Issue #19903Qwen3.5-35B-A3B qwen35moe yükleme raporu
github.com ↗SOURCELM Studio Docs — lms log streamModel ve sunucu loglarını izlemek için resmi CLI dokümanı
lmstudio.ai ↗SOURCELM Studio System RequirementsWindows için AVX2, RAM ve VRAM önerileri
lmstudio.ai ↗SOURCEUnsloth Qwen3.5-27B Discussion #9Aynı qwen35 hatasının topluluk çözüm örneği
huggingface.co ↗Der aktive llama.cpp-Runtime kennt die in der Qwen3.5-GGUF gespeicherte qwen35-Architektur nicht. App und Runtime aktualisieren.
Nein. VRAM-Probleme erscheinen meist als OOM/Allocation-Fehler, nachdem die Architektur erkannt wurde.
Bei reinem qwen35 meist nicht. Zuerst Runtime aktualisieren; nur bei Datei-/EOF-/Tensor-Problemen neu laden.
Ein interner Architektur-Schlüssel für Qwen3.5-MoE-Varianten wie 35B-A3B.
Es öffnet laut LM-Studio-Dokumentation die Runtime-Verwaltung unter Windows/Linux.
Ein älterer App-Katalog kann das neueste ihm bekannte 1.x-Paket als latest markieren. App aktualisieren und 2.x-Runtime prüfen.
Zuerst einen aktuellen CUDA/CUDA-12-Runtime verwenden; Vulkan/CPU eignen sich als Diagnosevergleich.
Nein. Quantisierung ändert Speicherbedarf, nicht die fehlende Architektur-Unterstützung.
Der Runtime erkennt das Modell nun und scheitert erst bei Speicherbelegung. Context, Offload oder Modellgröße reduzieren.
Die offizielle Modellkarte nennt 262.144 Token und empfiehlt bei OOM eine Reduzierung.
Für Vision kann eine passende mmproj/Projector-Datei nötig sein. Das ist ein separater Fehler.
Es listet installierte LM-Studio-Inferenz-Runtimes auf.
Mit lms log stream --source server oder den Developer Logs.
Beim letzten Check am 15. August 2026 listet der offizielle Changelog 0.4.21 als stabile Version.
Ja, es ist eine Mixture-of-Experts-Variante und kann qwen35moe verwenden.
Damit lässt sich Architektur-Support schnell vom Speicherproblem großer Modelle trennen.
Nein. Die Architektur steht in den GGUF-Metadaten.
Ja. Modell entladen/ejecten und neu laden, damit sicher der neue Motor genutzt wird.
Dann ist die Datei vermutlich lesbar; aktive LM-Studio-Runtime und App-Version prüfen.
Nein. Die technische Zeile darunter entscheidet zwischen Architektur, Speicher, CUDA, Tensor oder mmproj.
Qwen3.5 ist mehrsprachig; Qualität hängt von Modellgröße, Quantisierung, Prompt und Aufgabe ab.
Ja, die Modellfamilie unterstützt unter anderem Reasoning, Tools und Coding-Aufgaben; lokale Leistung hängt von Hardware und Modellvariante ab.
Qwen, Llama, Gemma und ähnliche Modelle profitieren unter Windows und Linux von viel RAM, schneller NVMe und passenden GPU-Ressourcen. Für Entwicklung und Inferenz können GPU-Server und VPS von Eka Sunucu genutzt werden.