🦉
Le Veilleur
L'autopilote vient de gagner un cran. Et tes pilotes ?

L'autopilote vient de gagner un cran. Et tes pilotes ?

Aurélien Allienne

Aurélien Allienne

Publié le • 6 min de lecture

L’autopilote vient de gagner un cran. Et tes pilotes ?

Hier, Anthropic a sorti le modèle le plus capable jamais mis entre les mains du grand public : Claude Fable 5, à $10 / $50 le million de tokens, état de l’art sur quasiment tous les benchmarks [1]. Tout le monde commente la courbe. Moi, je regarde ailleurs.

Parce que la vraie question d’un directeur d’ingénierie aujourd’hui, ce n’est pas « est-ce que le modèle est meilleur ? ». C’est : qu’est-ce qu’un modèle meilleur fait de mes équipes et de mon code ?

Le saut est réel — inutile de le nier

Commençons par poser les faits, parce qu’ils sont impressionnants. Fable 5 est un modèle « Mythos-class » rendu sûr pour un usage général : 1 million de tokens de contexte, capable de travailler en autonomie sur des tâches longues, et d’autant plus en avance que la tâche est complexe [1].

Simon Willison, qui n’a pas eu d’accès anticipé, a passé cinq heures à le pousser dans ses retranchements. Son verdict : « a beast ». Lent, cher, mais le vrai défi devient de trouver des tâches qu’il n’arrive pas à faire [2].

Ethan Mollick va plus loin. Pour lui, ce n’est pas une itération, c’est un saut net au-dessus de tout ce qu’il avait utilisé : le modèle a travaillé jusqu’à une dizaine d’heures d’affilée sur des specs de plusieurs pages [3]. Et il décrit une sensation troublante :

Delightful because I just asked for something and it happened. And also unnerving because I just asked for something and it happened.

Délicieux et déstabilisant à la fois. Retiens ce mot : déstabilisant. C’est tout le sujet.

Le meilleur autopilote produit les pires pilotes

Il y a un texte que je relie immédiatement à cette sensation. Son titre dit tout : The Better the Autopilot, the Worse the Pilot [4].

L’argument est emprunté à l’aviation. On automatise pour libérer de la charge mentale. Sauf que dans la réalité, c’est l’inverse qui se produit : quand un système gère une tâche de façon fiable, l’humain qui surveille arrête progressivement de surveiller. L’attention soutenue sans retour, notre cerveau ne sait pas le faire. L’aviation appelle ça la automation-induced complacency — et l’ironie est cruelle : plus l’automatisation est fiable, plus l’opérateur est mal préparé au moment rare où elle lâche [4].

Tu vois où je veux en venir. Un modèle qui code dix heures sans broncher, c’est exactement cet autopilote « presque jamais en faute ». La contre-mesure proposée est simple, presque rustique : identifier les tâches critiques déléguées, les refaire à la main de temps en temps, à intervalle assez court pour que la compétence ne se dégrade pas [4].

Le rockstar de l’équipe, c’est désormais l’agent

Et quand la compétence se dégrade, qui nettoie ? Jesse Skinner décrit un personnage qu’on a tous croisé : le rockstar developer. Plein d’énergie, des idées d’archi à la pelle, du code brillant que personne d’autre ne comprend. Il avance vite, très vite — puis il part. Et l’équipe hérite d’une base de code où « suivre le flux de données ressemble à essayer de couvrir un meurtre » [5].

Relis cette description en remplaçant « rockstar » par « agent ». Du code malin, produit à toute vitesse, optimisé pour la vélocité de celui qui l’écrit — pas pour celui qui devra le maintenir. La différence, c’est qu’avant on avait un rockstar par équipe. Aujourd’hui, on peut en industrialiser des dizaines en parallèle.

La dette technique ne disparaît pas avec un meilleur modèle. Elle change juste de vitesse de production.

Le harnais compte plus que le modèle

Alors où mettre l’effort, si ce n’est pas dans la course au modèle ? Une étude PwC tombe à pic. Sur un benchmark de mémoire longue, le bon vieux grep bat la recherche vectorielle sémantique — parfois de plus de 20 points [6].

Mais le vrai enseignement est ailleurs. À modèle et corpus identiques, changer uniquement le harnais — la façon dont les résultats sont livrés au modèle — fait bouger la précision de 16 points (93,1 % vs 76,7 % pour le même Opus 4.6) [6].

Autrement dit : l’intelligence brute du modèle est devenue une commodité qui se renouvelle tous les deux mois. Ce qui fait la différence durable, c’est l’ingénierie autour — le contexte, les outils, la façon de livrer l’information. Ça, ça reste ton travail.

La sécurité comme avantage stratégique

Dernier signal, et pas le moindre. Fable 5 arrive avec des garde-fous lourds : certaines requêtes sont silencieusement reroutées vers Opus 4.8, et l’API propose désormais un fallback automatique quand une demande est rejetée [1], [2].

Nathan Lambert y voit autre chose qu’une précaution technique. Pour lui, ces mesures de sécurité inégalement appliquées trahissent une intention : protéger — ou verrouiller — une avance [7]. La sécurité n’est plus seulement un sujet d’éthique. Elle devient un levier de positionnement marché, et donc une variable que tout décideur tech doit intégrer dans sa stratégie de dépendance fournisseur.

Le modèle le plus puissant du moment est aussi celui qui décide, parfois sans te le dire, ce qu’il accepte de faire pour toi.

Ce que je retiens

L’autopilote vient de gagner un cran. C’est une excellente nouvelle pour la vélocité. Mais le rôle d’un leader tech ne se joue pas sur la puissance du modèle — il se joue sur ce qui l’entoure : garder ses pilotes affûtés, refuser la dette de slop générée à grande vitesse, investir dans le harnais plutôt que courir après la prochaine version.

La question que je me pose ce soir : dans six mois, est-ce que ton équipe saura encore faire à la main ce que l’agent fait pour elle aujourd’hui ?


Sources

  1. Claude Fable 5 and Claude Mythos 5
  2. Initial impressions of Claude Fable 5
  3. What it feels like to work with Mythos
  4. The Better the Autopilot, the Worse the Pilot
  5. Cleaning up after AI rockstar developers
  6. Is Grep All You Need? The Harness Matters More Than the Search
  7. Claude Fable 5 and new safety fables

Pour aller plus loin

Cet article a été rédigé en m’appuyant sur une IA pour m’aider à synthétiser et structurer ma veille. Les idées, le choix des sources et la relecture restent les miens.

Pour aller plus loin

Three Labs With a Plan and A Memorandum

— pour situer Fable 5 dans la course stratégique entre les grands labos et les enjeux de politique publique.

If Claude Fable stops helping you, you'll never know

— le revers provocateur du reroutage silencieux : que se passe-t-il quand l'opacité devient la norme ?

Report: Why Developers Use LLMs to Write Blog Posts

— une enquête concrète sur l'usage réel des LLM par les développeurs, au-delà du code.

Apple Wins Consumer AI By Default

— l'autre lecture du marché : pendant que les labos se battent sur la capacité, la distribution reste reine.

Cet article a été rédigé en m'appuyant sur une IA pour m'aider à synthétiser et structurer ma veille. Les idées, le choix des sources et la relecture restent les miens.