IA
Quantiser Qwen3-32B à la main – un modèle 32B sur 16 Go de VRAM
Comment j'ai quantisé Qwen3-32B avec llama.cpp et une matrice d'importance pour le faire tourner sur un GPU de 16 Go : conversion GGUF, imatrix, niveaux de quantisation comparés, budget VRAM et offload de couches.
• Alain Ritter
