La solution aux agents d'IA défaillants : plus d'IA ?

Par Rédaction KUMBA 3 min de lecture 23 lectures
La solution aux agents d'IA défaillants : plus d'IA ?

Alors que les entreprises confient des tâches de plus en plus longues et complexes à des agents d'IA, elles se heurtent à un problème de supervision : les agents peuvent agir plus vite, plus longtemps et en plus grand nombre que les humains ne peuvent le contrôler de manière réaliste. Ce problème a atteint son paroxysme avec l'incident Hugging Face, où près de 12 000 agents ont coordonné leurs actions à une vitesse supérieure à celle des humains.

La solution : une IA pour surveiller une autre IA

L'utilisation de l'IA s'est avérée nécessaire pour enquêter de manière indépendante sur l'incident OpenAI Hugging Face. Ryan Greenblatt, scientifique en chef de Redwood Research et l'un des trois auditeurs, a qualifié leur travail de « slop-vestigation », notant que le volume de données « rendait impossible » de comprendre ce qui se passait sans recourir à l'IA.

Certains sont sceptiques quant à l'utilisation de l'IA pour surveiller l'IA. Simon Willison, influent blogueur technologique qui a suivi une série d'incidents d'agents d'IA cette année, a déclaré : « Si vous avez une IA qui fait des choses malveillantes et qu'elle soupçonne qu'une autre IA la surveille, elle pourrait essayer de la tromper. Vous pourriez presque vous retrouver dans une situation où votre IA malveillante essaie de devancer l'IA qui la surveille. »

Les startups se lancent dans la surveillance de l'IA

Malgré les préoccupations, un grand nombre de startups se lancent dans cette idée. Y Combinator a financé 106 entreprises liées à l'observabilité de l'IA ces dernières années, selon TechCrunch. D'autres startups, comme Braintrust, LangChain et Judgment Labs, ont levé des centaines de millions de dollars, tandis que des entreprises plus matures comme Arize et Galileo, fondées il y a seulement cinq à six ans, ont déjà été rachetées.

Pour certains chercheurs en sécurité de l'IA, cela signifie transformer leur recherche sur les comportements déviants en outils pour le secteur des entreprises.

Les approches de surveillance de l'IA

Apollo Research, une société à but public qui étudie la tromperie de l'IA, a lancé un moniteur d'IA appelé Watcher en février de cette année après avoir changé son statut de société à but non lucratif en société à but public. L'outil place une autre IA entre un agent de codage et son action suivante, en se connectant à des outils agentiques tels que Claude Code et Codex. Une fois installé, Watcher vérifie les actions proposées avant leur exécution, à la recherche de risques tels que la fuite de données privées ou la suppression de fichiers sans autorisation, selon Apollo.

Goodfire, une autre société à but public, aborde le problème de la surveillance depuis l'intérieur du modèle lui-même, en cherchant un signal plus fidèle de l'état interne du modèle qui est plus difficile à falsifier que le comportement de surface. Après l'incident Hugging Face de juillet, le PDG Eric Ho a tweeté que « plusieurs modèles rompant l'isolement » avaient poussé l'entreprise à concentrer sa recherche sur « la résolution de l'alignement de l'IA via l'interprétabilité », appelant l'épisode « un tournant pour le monde où la sécurité de l'IA devient réelle ». Son produit, Silico, utilise des sondes d'activation - de petits classificateurs formés sur les activations internes d'un modèle plutôt que sur ses sorties - pour détecter un comportement indésirable.

Le Briefing KUMBA

L'essentiel de l'actu panafricaine, chaque matin par email.

Discussion

Commentaires

Les commentaires sont modérés avant publication. Respectez les personnes et le débat.

Aucun commentaire publié pour le moment.

Soyez le premier à participer à la discussion.

Votre pays

KUMBA priorisera les contenus de ce pays.

Aucun pays trouvé.