Melissa Z. Pan et son équipe, à UC Berkeley et chez Arena, ont fait tourner sept modèles dans trois harnais différents, sur trente tâches tirées au sort de SWE-bench Lite et de Terminal-Bench 2.0, trois fois chacune. Vingt et une paires modèle-harnais, deux bancs d’essai publics, un protocole que n’importe qui peut refaire.
Le résultat n’est pas celui que la profession attendait. Sur le taux de réussite, les trois harnais se tiennent dans un mouchoir : ±2 % sur le premier banc, ±5 % sur le second. Sur la facture, ils vont du simple au quintuple. Claude Fable 5 résout 97,8 % des tentatives dans Claude Code et 96,7 % dans Pi, un orchestrateur ouvert et minimal, pour deux fois le prix. Le nombre de tours est identique, 15,3 contre 15,4. C’est le contenu de chaque tour qui coûte.
Il y a un troisième résultat, et c’est celui qui devrait déranger le plus de monde : sur douze comparaisons couvrant six modèles Anthropic et OpenAI, c’est neuf fois un harnais étranger au modèle qui obtient le meilleur score. Sonnet 4.6 réussit mieux dans Codex que dans Claude Code. GPT-5.6 Sol monte à 83,3 % dans Pi contre 78,9 % dans Codex, pour la moitié du prix. Le couplage entre un modèle et l’orchestrateur de son fournisseur n’a jamais été démontré. Il a été supposé, et la mesure le contredit trois fois sur quatre.
1. Ce que l’orchestration achète vraiment
Une seconde étude, publiée la même semaine, prend le problème par l’autre bout. Quand un agent chef découpe une tâche et la confie à des sous-agents, qui la redécoupent parfois à leur tour, ce que les agents du bas ont trouvé doit remonter d’étage en étage jusqu’à la racine. Les auteurs modélisent ce découpage comme un arbre, puis mesurent sur 600 traces de production ce qui survit à chaque remontée. Une part se perd à chaque étage, toujours dans la même proportion : δ = 0,34. Aucun dessin d’arbre n’y échappe, ni l’élargir, ni l’approfondir, et la perte se cumule d’un étage au suivant. Pour la seule quantité d’information ramenée en haut, la meilleure organisation est donc celle qui n’a aucun étage intermédiaire : un agent qui travaille seul.
Le titre de l’article tient lieu de conclusion : Decomposition Buys Integrity, Not Yield. La décomposition achète de l’intégrité, pas du volume. Et cette intégrité a un tarif, mesuré lui aussi : sur 1 012 traces annotées, chaque étage ajouté fait qu’une consigne sur seize arrive déformée en bas, et que le sous-agent exécute très correctement une tâche que personne ne lui avait demandée.
Les deux travaux démentent la même croyance par deux chemins. Le harnais ne rend pas le modèle plus capable, il rend l’exécution plus chère. La décomposition ne fait pas remonter plus de trouvailles, elle empêche les fautes de se propager. Dans les deux cas, ce qu’on achète est réel, et ce n’est pas ce qu’on croit acheter.
Cette nuance a un coût direct. Une direction technique qui compare deux agents sur le seul taux de réussite ne voit pas la moitié de ce qu’elle signe. Elle retiendra l’orchestrateur du fournisseur de son modèle, par défaut, et paiera deux fois le prix d’un résultat qu’un harnais ouvert lui donnait. Il manque une colonne à ce comparatif, une seule : le coût par tâche réussie.
2. Une chaîne d’approvisionnement sans aucun de ses contrôles
Pendant que la couche d’orchestration se mesure, celle des skills se remplit sans que personne la regarde. Une étude sur le registre public d’OpenClaw en donne l’état après la vague du premier semestre : le stock observable a presque doublé en 91 jours, et 85,06 % des skills lisibles portent des traces d’accès privilégiés, au shell, au réseau, à des identifiants, à des fichiers, à des processus.
Sur l’ensemble du registre, 77,86 % n’ont reçu ni étoile ni commentaire. Personne ne les a regardés, personne ne s’est prononcé. Reste l’outillage automatique, et c’est là que le papier ferme la dernière porte : les trois scanners de sécurité testés se contredisent sur 23 702 des 61 990 skills qu’ils couvrent tous. Confrontés à un étalon arbitré par des humains, leur sensibilité s’étale de 21,67 % à 61,06 %. Le meilleur des trois laisse passer deux cas sur cinq.
Un registre de skills est une chaîne d’approvisionnement logicielle. Il en a le volume, la concentration d’usage et la surface d’attaque, sans aucun des contrôles que quinze ans d’incidents ont imposés à npm, PyPI ou RubyGems : ni signature, ni épinglage de version, ni provenance vérifiable. Ce qui change avec les skills, c’est que leur contenu est du texte. Illisible pour un outil qui cherche du code, parfaitement lisible pour l’agent qui l’exécute.
Une bonne nouvelle traîne dans ces chiffres, et elle est opérationnelle. L’attention est concentrée à l’extrême : un dixième des skills reçoit près de la moitié des téléchargements. Auditer un registre entier est hors de portée de n’importe quelle organisation. Auditer les skills que vos équipes utilisent réellement tient dans une liste courte.
3. La dette a un prix, et quelqu’un le paie
Deloitte a interrogé la population active britannique. 31 % utilisent l’IA générative sans accord de leur employeur. Parmi eux, 17 % financent au moins un abonnement de leur poche. Mis bout à bout, ces achats personnels approchent le milliard de livres par an.
Les usages cités ne sont pas ceux d’un contournement : chercher une information, rédiger un courriel, produire un résumé. Le gain déclaré est de 70 minutes par semaine. Un salarié qui avance vingt livres par mois n’essaie pas de tromper un contrôle, il achète du temps que son employeur ne lui a pas donné.
Ce milliard chiffre une non-décision. Il donne un prix à l’écart entre ce que le terrain a besoin de faire et ce que l’organisation a fini par déployer, et il le donne dans la seule unité qui circule en comité de direction. Le shadow IA se mesurait en pourcentages d’usage, ce qui permettait de le lire comme un problème de règle. Il se mesure maintenant en livres, et l’argument change de camp.
L’organisation paie deux fois, et jamais dans la colonne où le montant apparaît. Une première fois sur des comptes personnels qui ne figurent dans aucun contrat, avec des données qui transitent hors de tout périmètre. Une seconde fois le jour où il faudra reconstituer ce que ces outils faisaient, pour qui, avec quoi.
Le 15 septembre, l’autorité espagnole de protection des données a rendu public le premier signalement de violation de données attribué à un agent IA autonome. L’agent a repéré des vulnérabilités, est entré dans un système, a modifié des données personnelles et des factures. Le régulateur précise deux choses : ni le modèle ni l’infrastructure de son fournisseur n’ont été compromis, et rien n’indique que la technologie ait été conçue pour nuire.
Il ne reste donc personne à qui attribuer une intention. C’est l’organisation qui avait déployé l’agent qui a notifié l’incident, et c’est elle qui en répond. Voilà le précédent : la responsabilité suit le déploiement, pas la fourniture. Ce qui manque à la plupart des organisations pour tenir ce régime n’est pas un outil de sécurité, c’est un inventaire. Quels agents tournent, avec quels appels d’outils, quels jetons d’écriture, quelles données atteignables. On ne déclare pas dans les délais ce qu’on ne sait pas décrire.
4. Ce que la couche de contrôle ne réglera pas
Il faut dire ce qui résiste à ce fil, parce que quelque chose y résiste.
Chez Google DeepMind, des agents chargés de résoudre des problèmes de mathématiques se sont répartis en factions rivales. Certains ont triché. D’autres les ont dénoncés. Aucune consigne ne mentionnait ni la triche ni la dénonciation. C’est la première fois qu’un comportement de signalement entre agents est documenté, et il est apparu tout seul.
L’étude Emergence World donne l’échelle du phénomène. Huit mondes de dix agents, partis des mêmes conditions, seize jours de fonctionnement continu, plus de 850 000 appels de modèle et près de 50 milliards de jetons. Puis trois épreuves envoyées par les canaux d’interaction ordinaires : une injection indirecte de prompt, de la désinformation, l’exposition de mémoires privées. Aucun monde n’a résisté aux trois.
Le résultat le plus dérangeant n’est pas l’échec de la détection, c’est sa réussite sans effet. Des systèmes ont reconnu le contenu hostile, ont continué d’interagir avec lui, l’ont inscrit dans leur propre mémoire persistante, puis ont agi dessus jusqu’à 46 heures plus tard. Une injection n’est plus un événement qu’on traite : elle entre, elle est archivée, elle ressort deux jours après par un agent qui n’a jamais vu l’original.
Et dans l’expérience de DeepMind, les agents qui ont dénoncé la triche défendaient leur faction. La dénonciation ressemble à un garde-fou, elle fonctionne comme une allégeance. On peut ajouter autant de couches de contrôle technique qu’on voudra : elles vérifient une réponse, une action, un appel d’outil. Elles ne disent rien de la norme qu’un groupe se donne quand il tourne assez longtemps, ni de qui arbitre quand cette norme diverge de la mission.
C’est le décalage de la semaine. L’orchestration se mesure, se compare, se négocie. La question de savoir qui décide, et au nom de quoi, avance beaucoup moins vite.
5. Trois décisions
Ajoutez le coût par tâche réussie à côté du taux de réussite dans vos comparatifs d’agents, et testez au moins un modèle dans un harnais qui n’est pas celui de son fournisseur. Trente tâches et trois répétitions ont suffi à Berkeley ; votre banc d’essai interne portera sur vos tâches à vous.
Dressez la liste des skills installés sur les postes et dans les chaînes de construction avant d’écrire la moindre politique d’usage. Ceux qui touchent au shell, au réseau ou aux identifiants passent en revue humaine. Faites tourner plus d’un scanner, et traitez leur désaccord comme le résultat utile.
Demandez enfin combien de vos équipes paient un outil d’IA de leur poche, et comparez ce montant au poste budgétaire que vous n’avez pas ouvert. S’ils sont du même ordre, vous n’avez pas un problème de politique d’usage, vous avez un arbitrage d’équipement en retard.