KI
Qwen3-32B manuell quantisieren – ein 32B-Modell auf 16 GB VRAM
Wie ich Qwen3-32B mit llama.cpp und einer Importance-Matrix so quantisiert habe, dass es auf einer 16-GB-GPU läuft: GGUF-Konvertierung, imatrix, Quant-Level im Vergleich, VRAM-Budget und Layer-Offload.
• Alain Ritter
