Arama Yap Mesaj Senden
Rückruf anfordern
+90
X
X

Wählen Sie Ihre Währung

Türkische Lira $ US Dollar Euro
X
X

Wählen Sie Ihre Währung

Türkische Lira $ US Dollar Euro

Kontaktieren Sie uns

Standort Halkali Merkez Viertel Fatih Str. Ozgur Apt. No. 46, Kucukcekmece, Istanbul, 34303, TR
EKA SUNUCU · KI-TRAINING-FEHLERZENTRUM

SFTTrainer Loss 0.0, NaN und Eval NaN: Warum Fine-Tuning nicht lernt

TRL SFTTrainer loss=0.0/NaN anhand Dataset-Format, -100 Labels, Truncation, assistant_only_loss, Learning Rate und Precision diagnostizieren.

PyTorchTransformersPEFT / TRLLetzte technische Prüfung: 14. August 2026
01

Mit offizieller Dokumentation geprüfte Kernaussagen

01

Bei `assistant_only_loss=True` wird Loss nur auf Assistant-Tokens berechnet; das Chat Template muss eine gültige Maske liefern.

02

Werden Assistant-Tokens durch max length abgeschnitten, können alle Labels -100 werden und Training ohne echte Supervision mit 0-Loss erscheinen.

03

Prompt-Completion und Conversational Datasets haben unterschiedliche Masking-Semantik; Format und Training-Config müssen zusammenpassen.

02

Loss 0.0 ist nicht automatisch gut

Ein exakter Loss von 0.0 direkt zu Trainingsbeginn ist verdächtig. Wahrscheinlicher sind maskierte Labels als perfektes Lernen.

03

Erste Prüfung: wie viele echte Labels gibt es?

Bei Cross-Entropy ist `-100` typischer Ignore-Index. Sind alle Labels -100, bleibt kein Supervision-Token. Vor Training `labels.ne(-100).sum()` prüfen.

Diagnose- / Validierungsbefehle
python - <<'PY'
# batch = next(iter(trainer.get_train_dataloader()))
# print((batch['labels'] != -100).sum(dim=1))
PY
04

Truncation kann die komplette Assistant-Antwort entfernen

Lange Prompts plus kurze max_length können die gesamte Assistant-Antwort abschneiden. Tokenlängen-Perzentile im Dataset messen.

05

`assistant_only_loss` und Chat-Template-Kompatibilität

Aktuelles TRL benötigt passende Generation-Marker im Chat Template, damit Assistant-Masken entstehen. Ohne diese Unterstützung kann Masking fehlschlagen.

06

NaN Loss: Precision und Learning Rate

NaN kann durch hohe Learning Rate, FP16 Overflow, Custom-Loss-Fehler, ungültige Logits oder model-spezifische Bugs entstehen. Mini-Batch direkt im Train-Modus testen.

07

Eval Loss NaN bei normalem Train Loss

Eval-Dataset kann andere Formate, fehlende Assistant-Antworten oder komplett maskierte Batches enthalten. Train- und Eval-Preprocessing angleichen.

08

Falsches Dataset-Format

TRL unterstützt LM-, Prompt-Completion- und Conversational-Formate. Ein `text`-Dataset und ein `messages`-Dataset haben andere Masking-Semantik.

09

Sanity-Test außerhalb des Trainers

Zur Isolation einen Batch direkt ins Modell geben und Shapes, Label-Anzahl, finite Logits und Raw Loss prüfen. NaN hier bedeutet Model/Data-Problem.

10

Wie man den Fix verifiziert

In den ersten 20-50 Steps sollten Supervision-Tokens >0, Loss/Grad-Norm finite und Learning Rate plausibel sein. Feste Prompts mit Base und Checkpoint vergleichen.

DIAGNOSTIC MATRIX

Symptom → wahrscheinliche Ursache

SymptomErster VerdachtPrüfung
Loss=0 im ersten StepAlle Labels -100Labels zählen
0 nur bei langen BeispielenTruncationTokenlängen
Loss NaNLR/Precision/LogitsSingle-Batch Forward
Eval NaNEval-Masking/FormatEval-Labels prüfen
Produktionshinweis

In einer funktionierenden Trainingsumgebung Pakete nicht blind aktualisieren. GPU, Treiber, CUDA/PyTorch-Runtime, Transformers, Accelerate, PEFT, TRL, bitsandbytes/Diffusers, Modellrevision und Dataset-Fingerprint pro Run protokollieren.

FAQ

Häufige Fragen

Bedeutet Loss 0 perfektes Lernen?

Meist nein. Direkt ab Start deutet 0 häufig auf fehlende Supervision oder Masking-/Logging-Probleme.

Funktioniert `assistant_only_loss=True` bei jedem Modell?

Nein. Das Chat Template muss Assistant-Token-Masken erzeugen können.

OFFICIAL SOURCES

Offizielle technische Quellen und Projekt-Issues

CLUSTER

Verwandte KI-Training-Ratgeber

EKA SUNUCU · GPU ALTYAPISI

GPU nach Trainingskonfiguration wählen.

Modellgröße, Precision, Context, Batch, LoRA/QLoRA oder Full Fine-Tuning und Multi-GPU gemeinsam bewerten.

GPU Sunucu VPS Destek
Top