Le laboratoire chinois DeepSeek vient de franchir une étape décisive dans l'optimisation des grands modèles de langage (LLM) avec le lancement de la version V4.1 Flash. Cette mise à jour technique propose une architecture inédite capable de concilier une puissance accrue et une réduction drastique des besoins en ressources matérielles.
Alors que l'industrie de l'IA est confrontée à une inflation constante des coûts de serveurs, cette avancée démontre qu'il est possible d'augmenter la capacité de traitement sans alourdir proportionnellement l'infrastructure technique.
Une architecture optimisée pour la mémoire
Le modèle V4.1 Flash impressionne par ses 763 milliards de paramètres, soit une taille 2,5 fois supérieure à celle de son prédécesseur. Pour éviter une explosion des besoins en mémoire vive, les ingénieurs ont restructuré la gestion des caches clé-valeur (KV). Grâce à l'intégration d'un nouvel encodeur-décodeur causal (CED) et à des ajustements dans les mécanismes d'attention, la consommation mémoire liée à ces caches a été réduite de 13 % à 25 %. Cette prouesse permet au système de supporter une charge d'utilisateurs simultanés quatre à huit fois plus élevée à empreinte mémoire constante.
L'innovation des N-grammes comme levier de performance
L'innovation centrale réside dans l'introduction de 196 milliards de paramètres sous forme de N-grammes, constituant un « module de mémoire conditionnelle ». Contrairement aux paramètres classiques qui doivent être intégralement chargés dans la mémoire GPU, ces N-grammes agissent comme des tables de consultation délocalisables. Ils fournissent des connaissances implicites sans saturer les processeurs graphiques. Cette approche permet de réduire le besoin en mémoire GPU de 763 Go à environ 567 Go, offrant une flexibilité inédite pour le déploiement à grande échelle.
Vers une nouvelle norme industrielle
L'approche de DeepSeek s'inscrit dans une tendance de fond visant à rendre les modèles d'IA plus durables et moins énergivores. D'autres acteurs majeurs, tels que Google avec ses modèles Gemma ou Alibaba avec sa série Qwen, explorent des techniques similaires de délocalisation des poids. L'adoption croissante des N-grammes au sein de l'écosystème suggère que cette méthode pourrait devenir un standard pour limiter la dépendance aux infrastructures serveurs massives, un enjeu crucial pour la viabilité économique et environnementale des futures générations d'IA.