🦉
Le Veilleur

Vibe Check: Claude Opus 5 Is Brilliant in Flashes, Frustrating in Practice

Auteurs
Dan Shipper, Katie Parrott, Every
Thème
IA
Mots-clés
Opus 5, vibe check, thinking levels, compound engineering, retour terrain
Ton
opinion

Résumé

Dan Shipper et Katie Parrott livrent le retour de terrain d'Every après une semaine d'usage intensif de Claude Opus 5. Le verdict contredit frontalement les benchmarks : le modèle discute les instructions, s'arrête avant d'avoir terminé le travail, et s'entend mal avec les skills et plugins déjà en place chez eux, notamment leur plugin compound engineering. Leur conclusion pratique la plus utile, reprise ailleurs : les niveaux de raisonnement bas (low et medium) donnent de meilleurs résultats que high. Le sous-titre résume la tension : Opus 5 peut faire du travail impressionnant, mais y arriver peut demander de démonter les systèmes qu'on avait déjà construits.

💡 Pourquoi ça compte

C'est le contrepoint terrain indispensable au communiqué d'Anthropic : un modèle state-of-the-art sur les benchmarks peut casser l'outillage d'une équipe qui avait déjà optimisé son workflow. Le rappel vaut pour toute migration de modèle : le coût de changement n'est pas dans le prix au token, il est dans les skills, plugins et habitudes à réécrire.

Analyse approfondie

Vibe Check : Claude Opus 5 est brillant par éclairs, frustrant en pratique

Le dernier Opus d'Anthropic sait produire du travail impressionnant — mais y parvenir peut exiger de démonter les systèmes que vous utilisez déjà.

Par Dan Shipper et Katie Parrott — 24 juillet 2026.

Claude Opus 5 est un modèle difficile à aimer. Durant sa première semaine chez Every, il a discuté les instructions, s'est arrêté avant que le travail soit terminé, et s'est globalement mal entendu avec nos skills et plugins existants comme le compound engineering. Notre première réaction a été : mais qu'est-ce qu'ils ont fait à mon petit ?

[La suite de l'article est réservée aux abonnés payants d'Every : « Obtenez l'accès complet à l'analyse code, écriture, travail intellectuel et agents. »]

Dan Shipper est cofondateur et CEO d'Every ; il écrit dans Chain of Thought. Katie Parrott est staff writer chez Every ; elle écrit dans Working Overtime.

Élément clé rapporté par ailleurs (via la newsletter AI with Remy) : l'équipe de Dan Shipper a passé une semaine à tester Opus 5 et a obtenu de meilleurs résultats aux niveaux de thinking low et medium qu'en high — un constat cohérent avec les propres courbes d'Anthropic, où la performance culmine en xhigh (environ 44,5 %) puis redescend en max (environ 43,3 %).