Retour à la veille
Sécurité·21 septembre 2026·Par Anthony Capirchio·Source : arXiv
OpenClawClawHubGitHubarXiv

85 % des skills touchent aux privilèges, et les trois scanners ne sont d’accord sur rien

Lien copié
Contexte

L’étude mesure ce que la vague OpenClaw du premier semestre 2026 a laissé derrière elle, à partir de l’historique Git du projet, de ses tickets et pull requests, et de trois instantanés du registre ClawHub. Les skills sont des instructions en langue naturelle qui dirigent un agent vers des actions shell, réseau, identifiants, fichiers et processus. La majorité de ceux qui sont lisibles portent des traces de ces accès, et l’immense majorité n’a jamais reçu le moindre retour public. Les trois scanners de sécurité testés ne fournissent pas le filet de rattrapage attendu : ils divergent sur plus d’un tiers du périmètre commun, et leur sensibilité mesurée contre un étalon arbitré par des humains va du simple au triple. Les auteurs concluent qu’une gouvernance de registre ne peut reposer ni sur des métadonnées simples ni sur le score d’un scanner unique.

Analyse

Un skill est une instruction en langue naturelle qui dirige un agent vers le shell, le réseau, des identifiants, des fichiers, des processus. Le registre public d’OpenClaw en a presque doublé le stock en 91 jours. Sur ceux qui sont lisibles, 85,06 % portent des traces de ces accès. Sur l’ensemble, 77,86 % n’ont reçu ni étoile ni commentaire.

Faits clés

  • Le stock observable de skills a presque doublé en 91 jours au premier semestre 2026
  • 85,06 % des skills lisibles portent des traces d’accès privilégiés : shell, réseau, identifiants, fichiers, processus
  • 77,86 % des skills n’ont ni étoile ni commentaire : aucune trace d’un examen humain
  • Les trois scanners de sécurité se contredisent sur 23 702 des 61 990 skills qu’ils couvrent tous
  • Après arbitrage humain, leur sensibilité pondérée s’étale de 21,67 % à 61,06 %
  • Les 10 % de skills les plus téléchargés captent 46,93 % des téléchargements
  • Aucune caractéristique simple ne prédit le maintien d’un skill une fois l’âge et la cohorte neutralisés
  • La création mensuelle de listings refluait déjà à la fin de la fenêtre d’étude

Le Fait

L’étude s’appuie sur l’historique Git d’OpenClaw, ses tickets, ses pull requests et trois instantanés du registre ClawHub. Elle mesure d’abord la vague : un stock qui double en trois mois, une majorité des annonces visibles en juin créées dans les deux mois précédents, puis un reflux dès la fin de la fenêtre d’observation.

Elle mesure ensuite ce que cette vague a laissé. L’attention est concentrée à l’extrême : un dixième des skills reçoit près de la moitié des téléchargements. La revue humaine, elle, est absente sur plus des trois quarts du registre. Et les scanners automatiques ne comblent pas le vide : sur les 61 990 skills couverts par les trois outils, ils se contredisent sur 23 702. Confrontés à un étalon établi par arbitrage humain, leur sensibilité pondérée va de 21,67 % à 61,06 %. Le meilleur des trois laisse passer deux cas sur cinq.

Dernier résultat, celui qui ferme la porte de sortie facile : une fois neutralisés l’âge du skill et sa cohorte de création, aucune caractéristique simple, ni la taille ni le nombre de téléchargements, ne prédit de façon stable qu’il restera en ligne. Les métadonnées ne remplacent pas l’examen.

La Lecture

Ce registre est une chaîne d’approvisionnement logicielle. Il en a le volume, la concentration d’usage et la surface d’attaque, mais aucun des contrôles que quinze ans d’incidents ont imposés à npm, PyPI ou RubyGems : ni signature, ni épinglage, ni provenance vérifiable. Ce qui change avec les skills, c’est que le contenu est du texte, donc illisible pour les outils qui cherchent du code, et parfaitement lisible pour l’agent qui l’exécute.

Le chiffre des trois scanners mérite qu’on s’y arrête, parce qu’il défait le réflexe habituel. Face à un risque de chaîne d’approvisionnement, une direction technique achète un outil et considère la case cochée. Ici, les trois outils testés ne sont pas seulement imparfaits, ils sont en désaccord sur plus du tiers du périmètre, ce qui interdit de traiter leur verdict comme un signal. Un score unique donnerait un faux sentiment de couverture, et c’est exactement ce que les auteurs écartent.

Reste la concentration : un dixième des skills capte la moitié des téléchargements. C’est la seule bonne nouvelle du papier, et elle est opérationnelle. Une revue humaine sur l’ensemble du registre est hors de portée de n’importe quelle organisation. Une revue humaine sur les skills que vos équipes utilisent réellement tient dans une liste courte.

L’Enseignement

Commencez par l’inventaire, pas par l’interdiction. Demandez quels skills sont installés sur les postes et dans les chaînes de construction, et par qui. Sans cette liste, toute politique d’usage que vous écrirez portera sur un objet que personne ne sait nommer.

Traitez ensuite les skills comme du code, parce que c’en est : un dépôt, une version épinglée, un auteur identifié, une revue avant mise à jour. Les skills qui touchent au shell, au réseau ou aux identifiants passent en revue humaine, les autres attendent.

Sur l’outillage, faites tourner plus d’un scanner et considérez leur désaccord comme le vrai résultat. Un cas sur trois sortira contradictoire : ce sont ceux-là qui méritent un humain, pas ceux que tout le monde valide.

Sources et références

  • arXiv 2609.17274 : After the Party : Governing What a Viral Agent-Skill Ecosystem Left Behind. Source de l’ensemble des mesures citées, dont la divergence des scanners et leur sensibilité après arbitrage humain.

Court terme

Les équipes qui ont laissé les skills entrer par la porte des postes de travail vont devoir en dresser l’inventaire avant de pouvoir en discuter. La première question n’est pas « lesquels sont dangereux » mais « lesquels sont installés ».

Moyen terme

Les registres de skills suivront le chemin qu’ont pris les registres de paquets : signature, épinglage de version, provenance vérifiable. La question ouverte est de savoir qui écrit la norme, et si elle sera opposable ou seulement recommandée.

Lien copié

À lire ensuite