Un skill est une instruction en langue naturelle qui dirige un agent vers le shell, le réseau, des identifiants, des fichiers, des processus. Le registre public d’OpenClaw en a presque doublé le stock en 91 jours. Sur ceux qui sont lisibles, 85,06 % portent des traces de ces accès. Sur l’ensemble, 77,86 % n’ont reçu ni étoile ni commentaire.
Faits clés
- Le stock observable de skills a presque doublé en 91 jours au premier semestre 2026
- 85,06 % des skills lisibles portent des traces d’accès privilégiés : shell, réseau, identifiants, fichiers, processus
- 77,86 % des skills n’ont ni étoile ni commentaire : aucune trace d’un examen humain
- Les trois scanners de sécurité se contredisent sur 23 702 des 61 990 skills qu’ils couvrent tous
- Après arbitrage humain, leur sensibilité pondérée s’étale de 21,67 % à 61,06 %
- Les 10 % de skills les plus téléchargés captent 46,93 % des téléchargements
- Aucune caractéristique simple ne prédit le maintien d’un skill une fois l’âge et la cohorte neutralisés
- La création mensuelle de listings refluait déjà à la fin de la fenêtre d’étude
Le Fait
L’étude s’appuie sur l’historique Git d’OpenClaw, ses tickets, ses pull requests et trois instantanés du registre ClawHub. Elle mesure d’abord la vague : un stock qui double en trois mois, une majorité des annonces visibles en juin créées dans les deux mois précédents, puis un reflux dès la fin de la fenêtre d’observation.
Elle mesure ensuite ce que cette vague a laissé. L’attention est concentrée à l’extrême : un dixième des skills reçoit près de la moitié des téléchargements. La revue humaine, elle, est absente sur plus des trois quarts du registre. Et les scanners automatiques ne comblent pas le vide : sur les 61 990 skills couverts par les trois outils, ils se contredisent sur 23 702. Confrontés à un étalon établi par arbitrage humain, leur sensibilité pondérée va de 21,67 % à 61,06 %. Le meilleur des trois laisse passer deux cas sur cinq.
Dernier résultat, celui qui ferme la porte de sortie facile : une fois neutralisés l’âge du skill et sa cohorte de création, aucune caractéristique simple, ni la taille ni le nombre de téléchargements, ne prédit de façon stable qu’il restera en ligne. Les métadonnées ne remplacent pas l’examen.
La Lecture
Ce registre est une chaîne d’approvisionnement logicielle. Il en a le volume, la concentration d’usage et la surface d’attaque, mais aucun des contrôles que quinze ans d’incidents ont imposés à npm, PyPI ou RubyGems : ni signature, ni épinglage, ni provenance vérifiable. Ce qui change avec les skills, c’est que le contenu est du texte, donc illisible pour les outils qui cherchent du code, et parfaitement lisible pour l’agent qui l’exécute.
Le chiffre des trois scanners mérite qu’on s’y arrête, parce qu’il défait le réflexe habituel. Face à un risque de chaîne d’approvisionnement, une direction technique achète un outil et considère la case cochée. Ici, les trois outils testés ne sont pas seulement imparfaits, ils sont en désaccord sur plus du tiers du périmètre, ce qui interdit de traiter leur verdict comme un signal. Un score unique donnerait un faux sentiment de couverture, et c’est exactement ce que les auteurs écartent.
Reste la concentration : un dixième des skills capte la moitié des téléchargements. C’est la seule bonne nouvelle du papier, et elle est opérationnelle. Une revue humaine sur l’ensemble du registre est hors de portée de n’importe quelle organisation. Une revue humaine sur les skills que vos équipes utilisent réellement tient dans une liste courte.
L’Enseignement
Commencez par l’inventaire, pas par l’interdiction. Demandez quels skills sont installés sur les postes et dans les chaînes de construction, et par qui. Sans cette liste, toute politique d’usage que vous écrirez portera sur un objet que personne ne sait nommer.
Traitez ensuite les skills comme du code, parce que c’en est : un dépôt, une version épinglée, un auteur identifié, une revue avant mise à jour. Les skills qui touchent au shell, au réseau ou aux identifiants passent en revue humaine, les autres attendent.
Sur l’outillage, faites tourner plus d’un scanner et considérez leur désaccord comme le vrai résultat. Un cas sur trois sortira contradictoire : ce sont ceux-là qui méritent un humain, pas ceux que tout le monde valide.