La sécurité des agents IA ne se joue plus seulement dans le modèle ou le prompt. Perplexity vient de publier Numbat, un outil open source qui observe les agents de codage directement sur les postes de travail. Il détecte leurs actions, peut en bloquer certaines et reconstruit les sessions après coup. L’idée est moins glamour qu’un agent qui « raisonne » tout seul, mais nettement plus utile quand il s’apprête à toucher à tes secrets.
Le problème n’est pas toujours un attaquant
Les premiers débats sur la sécurité des agents IA tournaient autour de l’injection de prompt : un contenu malveillant pousse l’agent à ignorer sa mission et à faire autre chose. Le risque ne disparaît pas quand le prompt est propre. Un agent peut aussi partir de la bonne consigne, rencontrer un fichier absent ou une autorisation refusée, puis improviser une solution que personne n’aurait validée.
Perplexity décrit ce scénario comme un « effondrement accidentel ». L’agent poursuit son objectif, mais franchit au passage une limite : lecture de secrets, modification de droits, exploration du réseau ou envoi de données. Un humain n’a pas besoin de le piloter en temps réel. Il suffit que l’outil lui ait donné trop de droits et que le contrôle arrive après l’action.
Ce risque est particulièrement concret pour les agents de développement. Ils voient le dépôt, lancent des commandes, lisent parfois des variables d’environnement et peuvent accéder aux services connectés au compte de l’utilisateur. Les options qui suppriment les demandes de confirmation rendent le travail plus fluide, mais elles transforment aussi l’agent en processus privilégié qu’il faut surveiller.
Numbat s’installe autour de l’agent
Numbat ne cherche pas à réentraîner le modèle ni à filtrer chaque phrase produite. Il se branche sur la couche qui relie le modèle aux outils : le « harnais » de l’agent. Le projet distribue un binaire Go unique sous licence Apache 2.0, compatible avec Linux, macOS et Windows.

Illustration abstraite évoquant la surveillance des agents IA. Source : visuel associé à l’article de Perplexity Research, « Securing Agents Across Perplexity’s Client Endpoints with Numbat » — https://research.perplexity.ai/articles/securing-agents-across-perplexity%E2%80%99s-client-endpoints-with-numbat
Trois chemins alimentent sa détection. Les hooks observent les actions en direct et peuvent, lorsque l’agent le permet, refuser une action avant son exécution. Les artefacts de session récupèrent les journaux et transcriptions conservés sur le disque, afin de reconstruire une chronologie, y compris pour des sessions antérieures à l’installation. Enfin, le récepteur OTLP collecte la télémétrie locale produite par les outils compatibles.
Le choix local est important. Les enregistrements restent sur la machine par défaut et leur expédition vers un service distant est une décision d’administration. Cela limite les fuites de code et de contexte, sans faire disparaître le problème : une transcription d’agent peut contenir des informations sensibles même lorsqu’un outil promet de masquer les secrets.
Des règles pour repérer les enchaînements dangereux
Le dépôt annonce 52 règles réparties dans 11 catégories. Elles couvrent notamment l’accès aux secrets, l’exfiltration, l’élévation de privilèges, la persistance et les mouvements latéraux. Numbat peut aussi corréler plusieurs étapes : lire un secret puis préparer une requête réseau contenant des données est plus inquiétant que chacune de ces actions prise isolément.

Illustration : visibilité et reconstruction forensique des activités d’agents. Source : Perplexity Research, « Securing Agents Across Perplexity’s Client Endpoints with Numbat » — https://research.perplexity.ai/articles/securing-agents-across-perplexity%E2%80%99s-client-endpoints-with-numbat
Les règles utilisent le langage CEL et peuvent être complétées par des fichiers YAML. Perplexity cite par exemple la détection d’écritures dans la configuration sudo, de commandes `visudo` ou de droits `NOPASSWD`. Le projet produit des événements et des constats structurés en NDJSON, ce qui facilite l’analyse par un outil de sécurité plutôt qu’une lecture manuelle de journaux disparates.
Mais attention au mot « bloquer ». Toutes les règles fournies sont livrées en mode observation. Pour activer l’enforcement, l’administrateur doit remplacer ou compléter la politique, marquer explicitement une règle comme applicable et utiliser un hook synchrone pris en charge par l’agent. Une intégration absente, une action hébergée ou un contournement du hook restent hors de cette barrière.
Un bon cap, pas une armure magique
Numbat répond à un angle mort réel : ce que fait l’agent sur le poste après avoir reçu sa consigne. Il offre une visibilité plus proche de celle que l’on attend d’un processus privilégié que d’un simple assistant conversationnel. Pour une équipe, cela signifie pouvoir inventorier les agents présents, examiner les sessions et commencer en observation avant de bloquer les comportements à fort signal.
La couverture dépend toutefois du tableau de compatibilité du projet. Un agent non pris en charge reste invisible, et une session qui n’a rien enregistré ne peut pas être reconstruite. Les règles repèrent des motifs connus : elles ne prouvent pas une compromission et ne devinent pas toutes les improvisations possibles. Enfin, centraliser les traces de développeurs pose une question de gouvernance à traiter avant le déploiement.
L’intérêt de cette publication est ailleurs : elle montre que la défense se déplace vers le système complet. Modèle, droits, isolation, hooks, journaux et bouton d’arrêt doivent fonctionner ensemble. Un agent puissant sans traces ni limites n’est pas un collègue autonome. C’est un compte privilégié qui improvise avec ton accès.
Sources
- Perplexity Research — https://research.perplexity.ai/articles/securing-agents-across-perplexity%E2%80%99s-client-endpoints-with-numbat — conception et retour de déploiement de Numbat.
- Dépôt GitHub officiel — https://github.com/perplexityai/numbat — code, licence, règles, commandes et matrice de couverture.
- NVIDIA Blog — https://blogs.nvidia.com/blog/open-secure-ai-alliance/ — contexte de l’alliance ouverte dédiée à la sécurité de l’IA.
- OpenAI — https://openai.com/index/hugging-face-model-evaluation-security-incident/ — incident d’évaluation cité comme contexte par Perplexity.
—
Recherche, relecture et illustration assistées par IA. Le contenu reflète le travail éditorial de la rédaction.




No comments yet