Orchard a été révisé discrètement le 30 juillet, et ses chiffres de benchmark ont bougé
Orchard, le framework open source de modélisation d'agents de Microsoft Research, n'est pas nouveau : l'article a été soumis le 14 mai 2026. Ce qui est nouveau, c'est qu'il a été révisé pour la dernière fois le 30 juillet 2026, et que cette révision a déplacé les chiffres mis en avant. Le billet de blog et la quasi-totalité des reprises citent encore les résultats de mai. Si vous évaluez des frameworks d'agents sur des benchmarks publiés, vous comparez probablement des valeurs dépassées.
Ce qu'est réellement Orchard
Le problème auquel Orchard s'attaque est concret, et quiconque a tenté de reproduire un article sur les agents le reconnaîtra. Construire des systèmes agentiques à l'état de l'art demande généralement une infrastructure propriétaire : bacs à sable maison, chaînes d'entraînement fermées, jeux de données auxquels la plupart des équipes n'ont ni accès ni moyen de reproduction. Le résultat est un domaine où les résultats publiés sont difficiles à vérifier, et plus encore à prolonger.
Au centre du framework se trouve Orchard Env, décrit comme un service d'environnement léger et natif Kubernetes. Plutôt que de livrer un agent avec ses partis pris, il expose des primitives génériques : cycle de vie du bac à sable, exécution de commandes, entrées-sorties fichiers, politique réseau, une API REST et une injection d'agent légère. Cette liste mérite d'être lue lentement, car c'est essentiellement la couche d'infrastructure que chaque équipe reconstruit dans son coin dès qu'elle fait tourner des agents à une échelle sérieuse.
Au-dessus de cette base, trois domaines spécialisés sont fournis : Orchard-SWE pour le génie logiciel, Orchard-GUI pour la navigation web, et Orchard-Claw pour les tâches d'assistant personnel.
Les chiffres qui ont changé
C'est le passage sur lequel il faut être précis, car deux jeux de chiffres circulent et les deux sont réels.
La version de mai annonçait 64,3 % sur SWE-bench Verified après affinage supervisé, et 67,5 % après SFT plus apprentissage par renforcement. Ce sont les valeurs du billet de Microsoft Research et de presque tous les articles écrits sur Orchard depuis.
La révision du 30 juillet annonce 69,7 % avec un apprentissage par renforcement fondé sur RPR, et 73,0 % avec reclassement par modèle de valeur, sur une base Qwen3.5-35B-A3B. C'est un bond de plus de cinq points sur le même benchmark, par la même équipe, dans un article portant le même identifiant arXiv.
Les deux autres domaines sont documentés avec la même précision dans la révision : 68,4 % de réussite moyenne sur WebVoyager, Online-Mind2Web et DeepShop pour l'agent GUI, et 59,6 % de pass@3 sur Claw-Eval, qui monte à 73,9 % lorsqu'il est associé au ZeroClaw plus puissant. Les budgets d'entraînement méritent d'être notés tant ils sont modestes : 0,4K trajectoires distillées et 2,2K tâches ouvertes pour le volet GUI, 0,2K tâches synthétiques pour Claw.
Pourquoi une révision silencieuse compte plus qu'il n'y paraît
Un préprint révisé ne fait pas les gros titres. Il n'y a pas de communiqué pour une v2, pas d'entrée de changelog dans la plupart des flux, et l'URL ne change pas. L'article s'améliore simplement pendant qu'internet continue de citer la version lue trois mois plus tôt.
Pour qui choisit un framework sur la foi de benchmarks publiés, c'est un vrai piège, et il joue dans les deux sens : vous pouvez sous-estimer un framework qui s'est amélioré, ou comparer deux systèmes dont les valeurs ont été mesurées dans des conditions et à des dates différentes. L'habitude utile n'a rien de spectaculaire : vérifier l'historique de soumission sur arXiv avant de citer un benchmark, et pas seulement le résumé.
Ce que nous en retenons
Deux choses, dites simplement. D'abord, la contribution intéressante ici n'est pas le score mais Orchard Env : un substrat ouvert et natif Kubernetes pour exécuter des agents en isolation est précisément la pièce qui manque à la plupart des équipes, et celle qui est habituellement mal reconstruite en interne. Ensuite, les chiffres de benchmark sur des préprints qui bougent vite ont une durée de validité qui se compte en semaines.
Si vous construisez des agents qui touchent à de vrais systèmes, la question du bac à sable précède celle du modèle. C'est dans cet ordre que ces problèmes se manifestent.
Sources
Orchard: An Open-Source Agentic Modeling Framework, arXiv 2605.15040, soumis le 14 mai 2026, dernière révision le 30 juillet 2026. Blog Microsoft Research, Orchard: An open framework for scalable agentic AI.