Arama Yap Mesaj Senden
Rückruf anfordern
+90
X
X

Wählen Sie Ihre Währung

Türkische Lira $ US Dollar Euro
X
X

Wählen Sie Ihre Währung

Türkische Lira $ US Dollar Euro

Kontaktieren Sie uns

Standort Halkali Merkez Viertel Fatih Str. Ozgur Apt. No. 46, Kucukcekmece, Istanbul, 34303, TR
Letzte technische Prüfung: 15. August 2026

LM Studio Qwen3.5 lädt nicht: 'unknown model architecture: qwen35' beheben

Wenn eine Qwen3.5-GGUF-Datei in LM Studio mit 'Failed to load model' und 'unknown model architecture: qwen35' scheitert, erkennt der ausgewählte llama.cpp-Runtime meist die in der GGUF-Metadaten gespeicherte Architektur noch nicht. Dieser Leitfaden trennt qwen35/qwen35moe-Kompatibilitätsfehler sauber von VRAM-, Context-, CUDA- und mmproj-Problemen.

Windows 10/11LM StudioQwen3.5GGUFllama.cppCUDA / Vulkan
Kurzdiagnose

'unknown model architecture: qwen35' bedeutet, dass der aktive llama.cpp-Runtime den Wert general.architecture=qwen35 der GGUF-Datei nicht kennt. Das ist nicht dasselbe wie zu wenig RAM oder VRAM. LM Studio und den GGUF-Runtime aktualisieren, einen aktuellen CUDA/Vulkan/CPU-Motor auswählen, Modell entladen und neu laden.

↳ Fix
!

'Latest Version Installed' kann trotzdem eine alte Runtime-Linie sein

Wenn im Runtime-Bereich nur v1.x-Motoren erscheinen, kann eine ältere LM-Studio-/Runtime-Katalogversion aktiv sein. Am 15. August 2026 ist LM Studio 0.4.21 die aktuelle stabile Version; im Changelog werden llama.cpp-Motoren 2.28.1 und neuer erwähnt. v1.104.2 als 'latest' beweist daher nicht, dass ein aktueller Qwen3.5-fähiger 2.x-Runtime verwendet wird.

qwen35

Dense-Architektur

Architecture-Key in dichten Qwen3.5-GGUFs

qwen35moe

MoE-Architektur

Kann bei Qwen3.5-35B-A3B erscheinen

2.x

Aktuelle Runtime-Linie

Einen aktuellen llama.cpp-Motor verwenden

0.4.21

LM Studio

Stabile Version am 15. August 2026

01

In diesem Leitfaden

  1. Was bedeutet 'unknown model architecture: qwen35'?
  2. Was sind qwen35 und qwen35moe?
  3. Warum dies nicht primär ein RAM- oder VRAM-Fehler ist
  4. LM-Studio-Version und llama.cpp-Runtime sind getrennte Ebenen
  5. Schritt-für-Schritt-Lösung unter Windows
  6. Warum v1.104.2 als 'Latest Version Installed' erscheinen kann
  7. CUDA 12, CUDA, Vulkan oder CPU: welcher Runtime passt?
  8. Ist 'unknown model architecture: qwen35moe' derselbe Fehlertyp?
  9. Alles aktualisiert, Fehler bleibt: zweite Prüfebene
  10. Beeinflussen Q4_K_M, Q5, Q6 oder Q8 diesen Fehler?
  11. qwen35 behoben, jetzt Out of Memory: Context Length
  12. Text funktioniert, Bild-Input nicht: mmproj/Projektor
  13. 'Failed to load model': technische Zeile richtig lesen
  14. Runtime und Logs per CLI prüfen
  15. Welche Qwen3.5-Größe wählen?
  16. Performance nach erfolgreichem Laden optimieren
  17. Wann GGUF wirklich neu herunterladen?
  18. Saubere Neuinstallation nur als letzter Schritt
02

Was bedeutet 'unknown model architecture: qwen35'?

Beim Öffnen einer GGUF-Datei liest LM Studio zunächst Metadaten wie general.architecture. Bei dichten Qwen3.5-GGUFs kann dort qwen35 stehen. Kennt der ausgewählte llama.cpp-Motor diesen Schlüssel nicht, stoppt das Laden, bevor das Modell normal initialisiert wird.

'Failed to load model' ist nur die allgemeine Überschrift. Entscheidend ist die technische Zeile mit 'unknown model architecture'. 'Unknown' bedeutet nicht automatisch, dass die GGUF beschädigt ist, sondern dass der Runtime keinen passenden Loader für diese Architektur besitzt.

Der Fehler kann unter Windows oder Linux und mit verschiedenen GPUs auftreten, weil er häufig vor der eigentlichen GPU-Speicherbelegung entsteht.

Exakte Fehlermeldung
Failed to load model
error loading model: error loading model architecture: unknown model architecture: 'qwen35'
LM Studio Qwen3.5 unknown model architecture qwen35 Fehler
Realer LM-Studio-Fehler: qwen35 wird vom ausgewählten Runtime nicht erkannt.
03

Was sind qwen35 und qwen35moe?

Der interne Architektur-Schlüssel einer GGUF muss nicht exakt dem Produktnamen entsprechen. Dichte Qwen3.5-Dateien können qwen35 verwenden; Mixture-of-Experts-Varianten können qwen35moe verwenden.

Qwen3.5-27B kann daher qwen35 melden, während Qwen3.5-35B-A3B als MoE-Variante qwen35moe verwenden kann. In beiden Fällen deutet 'unknown architecture' zuerst auf Runtime-Kompatibilität.

Aktueller llama.cpp-Quellcode enthält Qwen3.5-Architekturkonstanten; ein älteres gepacktes Runtime kann trotzdem noch scheitern.

04

Warum dies nicht primär ein RAM- oder VRAM-Fehler ist

Speicherfehler entstehen, nachdem der Runtime die Architektur erkannt hat und Gewichte, KV-Cache oder Compute-Buffer reserviert. Dann erscheinen eher 'out of memory', 'failed to allocate' oder CUDA-Allocation-Fehler.

Auch ein PC mit viel RAM/VRAM kann qwen35 nicht laden, wenn der Runtime zu alt ist. Nach einem Update kann anschließend ein echter OOM auftreten; das ist ein zweiter, separater Fehler.

05

LM-Studio-Version und llama.cpp-Runtime sind getrennte Ebenen

Die Desktop-App stellt Oberfläche, Katalog, Chat und Server bereit. GGUF-Inferenz läuft über ein llama.cpp Runtime Extension Pack. Nur die App oder nur den Runtime zu aktualisieren kann deshalb unvollständig sein.

Laut offizieller Dokumentation öffnet Ctrl + Shift + R unter Windows/Linux die Runtime-Verwaltung. Alternativ gibt es lms runtime in der CLI. Am 15. August 2026 ist LM Studio 0.4.21 stabil; der Changelog nennt llama.cpp 2.28.1+.

Wenn nur 1.x-Motoren erscheinen, zuerst LM Studio aktualisieren, Runtime-Katalog aktualisieren und dann den aktiven GGUF-Motor prüfen.

06

Schritt-für-Schritt-Lösung unter Windows

Eine 10-30+ GB große GGUF sofort neu herunterzuladen ist bei einem Architekturfehler meist unnötig. Derselbe Download mit demselben alten Runtime führt oft zum selben Ergebnis.

Änderungen einzeln durchführen und nach wichtigen Schritten neu laden. Ändert sich die Fehlermeldung, muss die neue Meldung separat diagnostiziert werden.

  1. LM Studio über App Settings aktualisieren.
  2. LM Studio vollständig beenden und neu starten.
  3. Mit Ctrl + Shift + R Runtime Extension Packs öffnen.
  4. Refresh ausführen und aktuelle llama.cpp-2.x-Motoren prüfen.
  5. Für NVIDIA aktuellen CUDA/CUDA-12-Motor, für Diagnose ggf. Vulkan/CPU wählen.
  6. Sicherstellen, dass der GGUF-Dropdown wirklich den neuen Motor nutzt.
  7. Modell entladen und neu laden.
  8. Bei neuem OOM Context/GPU-Offload reduzieren oder kleinere Quantisierung verwenden.
  9. Bei weiterem qwen35 lms runtime ls und Server-Logs prüfen.
  10. Erst danach alte Runtimes entfernen oder Modell neu laden.
07

Warum v1.104.2 als 'Latest Version Installed' erscheinen kann

'Latest' kann lediglich das neueste Paket bedeuten, das die aktuelle App bzw. der aktuelle Kanal kennt. Eine ältere LM-Studio-Version kann daher v1.104.2 als aktuell markieren, obwohl moderne 2.x-Motoren existieren.

Der Screenshot zeigt Vulkan, CUDA, CPU und CUDA 12 jeweils mit v1.104.2. Zwischen diesen alten Builds zu wechseln bringt qwen35-Unterstützung nicht automatisch. App aktualisieren, Katalog neu laden und aktuellen 2.x-Motor auswählen.

Nach der Installation zusätzlich kontrollieren, ob GGUF tatsächlich auf den neuen Motor zeigt.

LM Studio Runtime Extension Packs v1.104.2
Beispiel: v1.104.2 wird als 'Latest Version Installed' angezeigt; App/Katalog aktualisieren und aktuelle 2.x-Engine prüfen.
08

CUDA 12, CUDA, Vulkan oder CPU: welcher Runtime passt?

Bei NVIDIA ist ein aktueller CUDA-basierter llama.cpp-Motor meist die erste Wahl. CUDA 12 passt zu kompatiblen Treibern und Karten. Für diesen Fehler ist vor allem entscheidend, dass der Motor neu genug für Qwen3.5 ist.

Vulkan bietet breite Unterstützung für AMD/Intel und kann auch zur Diagnose dienen. Ein kleiner Qwen3.5-Test auf CPU hilft, GPU-Abhängigkeiten auszuschließen.

Zuerst stabil laden, erst danach Geschwindigkeit optimieren.

Runtime-Auswahl

RuntimeGeeignet fürVorteilPrüfen
CUDA llama.cppNVIDIA GPUDirekte NVIDIA-BeschleunigungTreiber, Runtime-Version, Offload
CUDA 12 llama.cppAktuelle NVIDIA-SystemeNeue CUDA-LinieTreiber-/Runtime-Kompatibilität
Vulkan llama.cppAMD/Intel/KompatibilitätHerstellerübergreifendTreiber und Vulkan-Support
CPU llama.cppOhne GPU / DiagnoseKeine GPU-AbhängigkeitBei großen Modellen langsam
09

Ist 'unknown model architecture: qwen35moe' derselbe Fehlertyp?

Ja. qwen35moe betrifft Qwen3.5-MoE-Varianten wie 35B-A3B. Im offiziellen LM-Studio-Bugtracker gibt es entsprechende Meldungen.

MoE beeinflusst später Speicher und Performance, aber 'unknown architecture' entsteht vorher. Erst Runtime-Kompatibilität herstellen.

MoE-Fehler
Failed to load model
error loading model: error loading model architecture: unknown model architecture: 'qwen35moe'
10

Alles aktualisiert, Fehler bleibt: zweite Prüfebene

Nicht nur installierte, sondern die tatsächlich aktive Engine prüfen. Mehrere Versionen können parallel vorhanden sein. Modell entladen, LM Studio neu starten und mit dem neuen Motor erneut laden.

Danach ein kleines Qwen3.5 aus einer vertrauenswürdigen Quelle testen. Funktioniert 2B/4B, aber ein einzelnes Drittanbieter-GGUF nicht, ist die Datei bzw. deren Build genauer zu prüfen.

Server-Logs zeigen, welche Architektur gelesen und welcher Runtime verwendet wird.

11

Beeinflussen Q4_K_M, Q5, Q6 oder Q8 diesen Fehler?

Quantisierung verändert Dateigröße, Speicherbedarf und Qualität, ergänzt aber keinen fehlenden Architektur-Loader. Wenn qwen35 unbekannt ist, behebt Q4 statt Q8 den Grundfehler nicht.

Sobald die Architektur erkannt wird, wird Quantisierung für RAM/VRAM relevant. KV-Cache, Context, Projektor und Runtime-Buffer benötigen zusätzlichen Speicher.

Ein kleines Qwen3.5 eignet sich gut, um die Runtime-Kompatibilität getrennt vom Speicherbedarf zu testen.

12

qwen35 behoben, jetzt Out of Memory: Context Length

Die offizielle Qwen3.5-27B-Karte nennt 262.144 Token Standardkontext und empfiehlt bei OOM, das Context Window zu reduzieren. Langer Kontext kann den KV-Cache stark vergrößern.

Lokal zunächst mit 8K oder 16K stabil testen und nur bei Bedarf erhöhen. GPU-Offload, Quantisierung und Context gemeinsam an RAM/VRAM anpassen.

Ein OOM nach dem Verschwinden von qwen35 ist ein anderer Fehler und kann zeigen, dass der Runtime das Modell nun erkennt.

13

Text funktioniert, Bild-Input nicht: mmproj/Projektor

Das ist eine andere Fehlerstufe. Qwen3.5 kann multimodal sein, bei GGUF kann dafür jedoch eine passende mmproj/Projector-Datei nötig sein. llama.cpp-Fehlerberichte zeigen die separate Meldung 'image input is not supported'.

Wenn Textchat funktioniert, war das Architektur-Laden erfolgreich. Prüfen, ob der Model-Build einen Projektor mitliefert und ob LM Studio ihn korrekt zuordnet.

Textbetrieb kann auch dann funktionieren, wenn der Vision-Projektor fehlt.

14

'Failed to load model': technische Zeile richtig lesen

Die Überschrift ist nur ein Sammelfehler. Die nächste technische Zeile unterscheidet Runtime-, Speicher-, Datei-, GPU- und Vision-Probleme.

Für Details Developer Logs oder lms log stream --source server nutzen und nach dem exakten Fehlertext suchen.

Schnelle Fehlerdiagnose

Fehler / SymptomEbeneErster SchrittNeu laden?
unknown model architecture: 'qwen35'Alter/inkompatibler RuntimeApp + Runtime aktualisierenMeist nein
unknown model architecture: 'qwen35moe'Alter MoE-SupportAktuellen 2.x-Runtime wählenMeist nein
out of memory / failed to allocateRAM/VRAM/ContextContext/Offload/Quantisierung reduzierenNein
unexpected EOF / missing tensorDatei/BuildDownload/Quelle prüfenEventuell
image input is not supported / mmprojVision-ProjektorPassende mmproj nutzenHauptmodell meist nein
CUDA initialization / driver errorGPU-BackendTreiber/Runtime prüfenNein
Sehr langsamOffload/Backend/ContextGPU-Offload optimierenNein
Spezialtoken-SchleifeTemplate/Runtime-RegressionRuntime/Template prüfenMeist nein
15

Runtime und Logs per CLI prüfen

Mit lms runtime ls, lms runtime update und lms runtime select lassen sich installierte und ausgewählte Runtimes kontrollieren.

lms log stream --source server zeigt Lade-Logs; lms ls listet Modelle auf der Platte und lms ps geladene Modelle im Speicher.

Private Pfade oder Zugangsdaten vor dem Teilen von Logs entfernen.

Runtime prüfen
lms runtime ls
lms runtime update
lms runtime select
Modelle und Logs
lms ls
lms ps
lms log stream --source server
16

Welche Qwen3.5-Größe wählen?

LM Studio listet unter anderem 2B, 4B, 9B, 27B und 35B-A3B. Kleine Modelle sind ideal für Kompatibilitätstests; große Modelle benötigen deutlich mehr Ressourcen.

Nach einem Runtime-Update zuerst ein kleines Qwen3.5 laden. Funktioniert es, anschließend 27B oder 35B-A3B testen und Kapazitätsprobleme getrennt lösen.

Für Coding, Mehrsprachigkeit, Tools und Dokumente zählen zusätzlich Quantisierung, Context und Prompt-Format.

17

Performance nach erfolgreichem Laden optimieren

Immer mit gleichem Modell, Quantisierung, Context und Prompt vergleichen. GPU-Offload erhöhen, aber genügend VRAM für KV-Cache und Buffer frei lassen.

Unnötig große Context Windows vermeiden. Bei Benchmarks App-Version, Runtime, GPU, GGUF-Datei und Quantisierung notieren, weil sich Qwen3.5-Leistung zwischen llama.cpp-Versionen ändern kann.

Neben tokens/s auch Time-to-first-token und Prompt-Verarbeitung messen.

18

Wann GGUF wirklich neu herunterladen?

Nur qwen35/qwen35moe ist meist kein Grund für einen neuen Download, da die Metadaten bereits gelesen werden konnten.

Neu herunterladen bei falscher Dateigröße, abgebrochenem Transfer, unexpected EOF, fehlenden Tensor-/Header-Daten oder Checksum-Abweichung. Bei gesplitteten GGUFs müssen alle Shards vorhanden sein.

Öffnet dieselbe Datei in einer anderen aktuellen llama.cpp-Anwendung, spricht das für eine grundsätzlich lesbare Datei.

19

Saubere Neuinstallation nur als letzter Schritt

Vorher Modellverzeichnis notieren und Dateien behalten. Oft reicht es, alte Runtimes zu entfernen und einen aktuellen Runtime neu zu installieren.

Bei kompletter Neuinstallation Chatverlauf, Einstellungen und Modellpfade sichern. Danach zuerst ein kleines Qwen3.5 testen.

Für einen Bugreport LM-Studio-Version, OS, GPU, Runtime-Version, exakten GGUF-Namen und Server-Logs angeben.

K

Technische Quellen und Verifikation

?

Häufige Fragen zu LM Studio und Qwen3.5

Was bedeutet unknown model architecture qwen35?

Der aktive llama.cpp-Runtime kennt die in der Qwen3.5-GGUF gespeicherte qwen35-Architektur nicht. App und Runtime aktualisieren.

Ist qwen35 ein VRAM-Fehler?

Nein. VRAM-Probleme erscheinen meist als OOM/Allocation-Fehler, nachdem die Architektur erkannt wurde.

Muss ich das Modell neu herunterladen?

Bei reinem qwen35 meist nicht. Zuerst Runtime aktualisieren; nur bei Datei-/EOF-/Tensor-Problemen neu laden.

Was ist qwen35moe?

Ein interner Architektur-Schlüssel für Qwen3.5-MoE-Varianten wie 35B-A3B.

Was macht Ctrl + Shift + R?

Es öffnet laut LM-Studio-Dokumentation die Runtime-Verwaltung unter Windows/Linux.

Warum steht bei v1.104.2 Latest Version Installed?

Ein älterer App-Katalog kann das neueste ihm bekannte 1.x-Paket als latest markieren. App aktualisieren und 2.x-Runtime prüfen.

CUDA oder Vulkan bei NVIDIA?

Zuerst einen aktuellen CUDA/CUDA-12-Runtime verwenden; Vulkan/CPU eignen sich als Diagnosevergleich.

Behebt Q4 statt Q8 den qwen35-Fehler?

Nein. Quantisierung ändert Speicherbedarf, nicht die fehlende Architektur-Unterstützung.

Warum kommt nach der Lösung plötzlich OOM?

Der Runtime erkennt das Modell nun und scheitert erst bei Speicherbelegung. Context, Offload oder Modellgröße reduzieren.

Welchen Standard-Context hat Qwen3.5-27B?

Die offizielle Modellkarte nennt 262.144 Token und empfiehlt bei OOM eine Reduzierung.

Warum funktioniert Text, aber kein Bild?

Für Vision kann eine passende mmproj/Projector-Datei nötig sein. Das ist ein separater Fehler.

Was macht lms runtime ls?

Es listet installierte LM-Studio-Inferenz-Runtimes auf.

Wie sehe ich Lade-Logs?

Mit lms log stream --source server oder den Developer Logs.

Welche LM-Studio-Version ist hier aktuell?

Beim letzten Check am 15. August 2026 listet der offizielle Changelog 0.4.21 als stabile Version.

Ist Qwen3.5-35B-A3B MoE?

Ja, es ist eine Mixture-of-Experts-Variante und kann qwen35moe verwenden.

Warum zuerst ein kleines Qwen3.5 testen?

Damit lässt sich Architektur-Support schnell vom Speicherproblem großer Modelle trennen.

Hilft Umbenennen der GGUF-Datei?

Nein. Die Architektur steht in den GGUF-Metadaten.

Modell nach Runtime-Update entladen?

Ja. Modell entladen/ejecten und neu laden, damit sicher der neue Motor genutzt wird.

GGUF läuft in llama.cpp, aber nicht in LM Studio?

Dann ist die Datei vermutlich lesbar; aktive LM-Studio-Runtime und App-Version prüfen.

Reicht 'Failed to load model' für die Diagnose?

Nein. Die technische Zeile darunter entscheidet zwischen Architektur, Speicher, CUDA, Tensor oder mmproj.

Kann Qwen3.5 Türkisch?

Qwen3.5 ist mehrsprachig; Qualität hängt von Modellgröße, Quantisierung, Prompt und Aufgabe ab.

Eignet sich Qwen3.5 zum Programmieren?

Ja, die Modellfamilie unterstützt unter anderem Reasoning, Tools und Coding-Aufgaben; lokale Leistung hängt von Hardware und Modellvariante ab.

EKA SUNUCU

Mehr Leistung für lokale KI benötigt?

Qwen, Llama, Gemma und ähnliche Modelle profitieren unter Windows und Linux von viel RAM, schneller NVMe und passenden GPU-Ressourcen. Für Entwicklung und Inferenz können GPU-Server und VPS von Eka Sunucu genutzt werden.

Top