Retour à la veille
Organisation·21 septembre 2026·Par Anthony Capirchio·Source : HarnessTax (UC Berkeley), arXiv
UC BerkeleyArenaHarnessTaxClaude CodeCodex CLIPiSWE-benchTerminal-BencharXiv

Deux fois le prix pour le même résultat : ce que le harnais change vraiment

Lien copié
Contexte

Deux mesures indépendantes convergent sur un même déplacement. HarnessTax (UC Berkeley et Arena) évalue 21 paires modèle-harnais sur deux bancs d’essai publics et trouve que le choix de l’orchestrateur ne déplace presque pas le taux de réussite, mais déplace fortement la dépense : jusqu’à cinq fois pour un résultat équivalent. Les auteurs relèvent aussi qu’un modèle réussit souvent mieux dans un harnais qui n’est pas celui de son fournisseur. L’étude arXiv « Decomposition Buys Integrity, Not Yield » modélise la décomposition en sous-agents comme un arbre où chaque niveau perd une fraction de ce que les feuilles ont trouvé. Sur 600 traces de production, cette perte se mesure : un agent à plat est optimal pour le rendement, et aucune disposition d’agents n’échappe à l’exposant. Ce que la profondeur achète, c’est l’intégrité, pas le volume.

Analyse

Sept modèles, trois harnais, deux bancs d’essai publics. Le résultat tient en une ligne : l’orchestrateur ne change presque rien à ce que l’agent réussit, et beaucoup à ce qu’il coûte.

Faits clés

  • 21 paires modèle-harnais évaluées : sept modèles, trois harnais (Claude Code, Codex CLI, Pi), sur SWE-bench Lite et Terminal-Bench 2.0
  • L’effet moyen du harnais sur le taux de réussite reste dans ±2 % sur SWE-bench Lite et ±5 % sur Terminal-Bench 2.0
  • Le même modèle atteint un taux comparable à des coûts allant jusqu’au quintuple
  • Claude Fable 5 : 97,8 % de réussite dans Claude Code contre 96,7 % dans Pi, pour 1,33 $ contre 0,67 $
  • Claude Code coûte en moyenne 2,0 fois Pi et 1,6 fois Codex sur SWE-bench Lite
  • Sur douze comparaisons couvrant six modèles Anthropic et OpenAI, un harnais étranger au modèle obtient le meilleur taux observé dans neuf cas
  • Sur 600 traces de production deep-research, δ = 0,34 [0,30, 0,38] : l’architecture ne rattrape pas cet exposant
  • Sur 1 012 traces annotées, un brief sur seize part hors sujet à chaque niveau ajouté

Le Fait

L’équipe de Melissa Z. Pan, à UC Berkeley et chez Arena, a fait tourner sept modèles dans trois harnais différents, sur trente tâches tirées au sort de SWE-bench Lite et de Terminal-Bench 2.0, trois fois chacune. Sur le taux de réussite, les harnais se tiennent : ±2 % sur le premier banc, ±5 % sur le second. Sur la facture, ils divergent jusqu’au facteur cinq. Claude Fable 5 résout 97,8 % des tentatives dans Claude Code et 96,7 % dans Pi, un harnais ouvert et minimal, pour deux fois le prix. Le nombre de tours est le même, 15,3 contre 15,4 : c’est le contenu de chaque tour qui coûte.

Troisième constat, moins attendu : sur les douze comparaisons couvrant six modèles Anthropic et OpenAI, c’est neuf fois un harnais étranger au modèle qui obtient le meilleur taux. Sonnet 4.6 réussit 68,9 % dans Codex contre 66,7 % dans Claude Code, à coût comparable. GPT-5.6 Sol monte à 83,3 % dans Pi contre 78,9 % dans Codex, pour la moitié du prix.

En parallèle, une étude arXiv pose la question du côté de l’architecture : que devient l’information trouvée par les feuilles quand on découpe une tâche en arbre de sous-agents ? Réponse mesurée sur 600 traces de production : chaque niveau en perd une fraction stable, δ = 0,34, et aucune forme d’arbre n’échappe à cet exposant. À plat est optimal pour le rendement. Le titre de l’article dit le reste : la décomposition achète de l’intégrité, pas du volume.

La Lecture

Les deux mesures démentent la même croyance, par deux chemins. On a beaucoup dit cette année que le modèle devenait interchangeable et que la performance était passée dans l’orchestration. Ces chiffres disent l’inverse : la performance reste dans le modèle, et c’est la dépense qui est passée dans l’orchestration.

Ce n’est pas une nuance de vocabulaire, c’est un changement de ligne budgétaire. Une organisation qui compare deux agents sur le seul taux de réussite ne voit pas la moitié de ce qu’elle achète. Elle validera l’orchestrateur du fournisseur de son modèle, par défaut, et paiera deux fois le prix d’un résultat qu’un harnais ouvert lui donnait. Le couplage entre le modèle et son harnais maison n’a jamais été prouvé, il a été supposé, et la mesure le contredit dans trois cas sur quatre.

L’étude sur la décomposition prolonge le même déplacement à l’intérieur du système. Découper un agent en sous-agents ne fait pas remonter davantage de trouvailles à la racine, et coûte un brief sur seize qui part hors sujet à chaque niveau. Ce que la profondeur donne est réel, mais c’est de la maîtrise : des contextes plus petits, des frontières nettes, des fautes qui ne se propagent pas. Payer cette maîtrise est une décision défendable. La payer en croyant acheter du rendement ne l’est pas.

L’Enseignement

Posez une seule colonne de plus dans votre comparatif d’agents : le coût par tâche réussie, à côté du taux de réussite. C’est elle qui révèle l’écart, parce que le taux le masque.

Ensuite, testez votre modèle dans un harnais qui n’est pas celui de son fournisseur. Trente tâches et trois répétitions ont suffi à l’équipe de Berkeley ; votre propre banc d’essai interne suffira à trancher, et il porte sur vos tâches à vous, pas sur SWE-bench.

Enfin, si vous découpez vos agents en sous-agents, écrivez ce que vous en attendez avant de mesurer. Si la réponse est « plus de résultats », les chiffres disent que vous serez déçu. Si la réponse est « des fautes qui restent locales », vous achetez la bonne chose, et le prix par niveau est connu.

Sources et références

  • HarnessTax : How Much Does the Harness Matter for Coding Agents ?, Melissa Z. Pan, Shuo Yang, Negar Arabzadeh, Wei-Lin Chiang, Ion Stoica, Matei Zaharia (UC Berkeley, Arena). Source des 21 paires modèle-harnais, des écarts de coût et des comparaisons croisées.
  • arXiv 2609.17464 : Decomposition Buys Integrity, Not Yield. Source de δ = 0,34 sur 600 traces de production, du coefficient par niveau et de la pénalité d’alignement.

Court terme

Les équipes qui comparent des agents sur le seul taux de réussite vont découvrir qu’elles ont acheté le même résultat au double du prix. Le rapport coût par tâche réussie devient l’indicateur à poser à côté du taux.

Moyen terme

Si un harnais minimal et ouvert tient la comparaison avec les orchestrateurs des fournisseurs, la question du couplage entre modèle et harnais se rouvre : rien n’oblige à prendre les deux chez le même vendeur, et la mesure devient un argument de négociation.

Lien copié

À lire ensuite