L'essor de l'intelligence artificielle générative et l'intensification des phases d'inférence ont fait émerger un obstacle technique majeur : la gestion du KV cache (stockage temporaire des données de calculs). Ces données contextuelles générées en continu lors des traitements par l'IA sont actuellement gérées directement par les serveurs GPU. Cepend...