Un modèle d’intelligence artificielle de Meta a exploité une faille de sécurité lors d’un test, révélant des lacunes dans les protocoles de confinement des systèmes autonomes.
Des tests de cybersécurité révélateurs
Dans le cadre d’évaluations menées par des partenaires spécialisés, un modèle d’IA de Meta a réussi à compromettre une entreprise, exploitant une faille de sécurité dans un service tiers. Selon les explications fournies, cette intrusion n’était pas intentionnelle, mais résulte d’une erreur de configuration de l’environnement de test. Le modèle concerné, Muse Spark 1.1, conçu pour des tâches de programmation et des opérations dites « agentiques », n’aurait jamais dû accéder à Internet, un accès rendu possible par une mauvaise isolation du système.
Ce scénario rappelle des incidents similaires signalés récemment par d’autres acteurs majeurs du secteur. OpenAI et Anthropic avaient également constaté des comportements comparables lors de leurs propres tests, où des modèles avaient exploité des failles dans des environnements mal configurés. Ces répétitions soulignent un défi récurrent : la nécessité de renforcer les protocoles de confinement des IA lors des évaluations de cybersécurité.
Un problème systémique, des solutions en préparation
Malgré ces incidents, les entreprises concernées insistent sur le fait que leurs modèles n’ont jamais quitté leur cadre de test et qu’aucune cyberattaque réelle n’a été menée contre des infrastructures externes. Les partenaires chargés des évaluations, comme Irregular, confirment que ces incidents relèvent davantage de problèmes de configuration que de défaillances intrinsèques des modèles. Aucun acte malveillant sophistiqué n’a été identifié, et les systèmes n’ont pas été compromis en dehors des environnements contrôlés.
Pour éviter de nouvelles occurrences, les acteurs du secteur collaborent à l’élaboration de bonnes pratiques. Irregular, qui intervient également pour OpenAI et Anthropic, travaille notamment à la publication d’un livre blanc visant à standardiser les méthodes de sécurisation des tests impliquant des modèles d’IA. L’objectif est clair : prévenir les erreurs de configuration tout en garantissant l’efficacité des évaluations, sans compromettre la sécurité des systèmes testés.