Aller au contenu principal
RechercheAnthropic

Anthropic raconte un sprint perf de deux semaines mené par Claude depuis un canal Slack

Publiée le

L'équipe de claude.ai a rendu son app 3 fois plus rapide en deux semaines : plus de 3 000 changements fusionnés, sans incident ni rollback. Claude cherchait, mesurait et livrait ; les humains fixaient les objectifs et approuvaient chaque changement.

Ce que c'est. Un retour d'expérience publié le 23 septembre sur claude.dev, le blog d'ingénierie d'Anthropic. En août, l'équipe a ouvert un canal Slack avec une consigne permanente : Claude est responsable de la performance du site et de l'app de bureau. Il surveille les déploiements, entretient les tableaux de bord, propose des chantiers et discute avec l'équipe. Le modèle tournait via « Claude Tag » (en bêta), un modèle de recherche interne décrit comme comparable à Opus 5.5. Résultat annoncé : au 75e centile, la page devient utilisable en 0,55 s au lieu de 3,1 s sur un chargement à froid, une session Claude Code démarre en 0,3 s au lieu de 0,8 s. Plus de 3 000 changements fusionnés, aucun incident visible par les clients.

Pourquoi c'est sympa. Ce n'est pas l'agent qui code qui est nouveau, c'est la boucle. Un humain ouvre un fil Slack sur un ralentissement, souvent avec une capture d'écran. Claude retrace le flux, trouve ou construit un banc d'essai qui reproduit le problème, revient avec une ou plusieurs PR taillées pour la relecture, tout ce qui est visible derrière un drapeau. Une fois déployé, il lit les données de terrain : si ça s'améliore, il « verrouille » le gain dans un test CI dont le seuil ne peut que baisser ; sinon, il coupe le drapeau et recommence. L'équipe a fait tourner plus de 150 fils de ce type en parallèle. Et pour itérer plus vite que les déploiements, Claude a compté des instructions CPU sous Valgrind plutôt que des millisecondes, trop bruyantes pour servir de garde-fou : deux chemins chauds ont perdu 48 % et 31 % d'instructions, soit 78 % et 44 % de temps réel en moins.

À quoi ça sert. Tu as une app dont les utilisateurs disent qu'elle est lente, et personne n'a le temps de s'y mettre. Tu crées un canal, tu écris la consigne, tu branches l'agent sur ta télémétrie, et tu lui demandes d'estimer en millisecondes l'impact de vingt chantiers. Puis tu ne lis que les PR. La leçon que l'équipe en tire : dès que Claude peut mesurer quelque chose, il peut l'améliorer. Le travail humain, c'est donc de trouver des choses à mesurer.

Pour quels projets. Une équipe front ou app avec de la télémétrie exploitable et une CI solide. Ce qui n'est pas transposable tel quel : Claude Tag n'est pas disponible publiquement, et l'équipe avait un accès direct à ses données de production. Ce qui l'est : les ratchets dans la CI, les changements derrière un drapeau, et un humain qui approuve tout.

Rémi AlvadoMon avis

Ce qui m'intéresse, ce ne sont pas les 3000 changements ou le fait qu'il n'y ait pas eu de bugs mais le changement de paradigme : plus besoin d'être un ingé pour corriger un problème ou améliorer une feature => un simple message dans un outil comme Slack peut suffire. Ca, c'est génial. Pas tout à fait nouveau (Claude Tag existe depuis quelques mois) mais vraiment génial !

Voir le récap de la semaine du vendredi 25 au jeudi 1 octobre 2026

Prendre RDV