🦉
Le Veilleur
Arrêtez de courir après le meilleur modèle

Arrêtez de courir après le meilleur modèle

Aurélien Allienne

Aurélien Allienne

Publié le • 6 min de lecture

Arrêtez de courir après le meilleur modèle

GPT-5.6 sort jeudi. Gemma 4, MiniMax M3 et Muse Image sont tombés cette semaine. Et pendant que tout le monde scrute le prochain modèle, un chiffre passe presque inaperçu : depuis le 8 février, plus de 30 % des tokens consommés par les entreprises américaines sur OpenRouter partent vers des modèles chinois, avec des pics à 46 %, contre une moyenne de 11 % l’an dernier [1]. La vraie question du moment n’est pas « quel modèle ». C’est « à quoi ça sert de le savoir ».

Le mythe du « moins cher par token »

Le basculement vers les modèles chinois est d’abord une histoire de coût. La startup Lindy a migré 100 % de son trafic de Claude vers DeepSeek : « on a vu la courbe de coût s’effondrer », raconte son CEO [1]. Sur le papier, imparable.

Sauf que le prix affiché ne dit rien de la facture. Microsoft a benchmarké Sonnet 5 face à Sonnet 4.6 : 33 % moins cher par token sur toute la grille tarifaire. Résultat en conditions réelles ? Sur des tâches d’architecture, le nouveau modèle a consommé 12 fois plus de tokens en médiane, avec un run qui a explosé à 47x [2]. Sur des tâches d’upgrade de code, le « moins cher » revient à 2,01 $ par run contre 0,55 $ — soit 3,7x plus cher.

Cheaper tokens, higher bills.

Et la qualité ? Sur le critère « idiomatique », l’ancien modèle score 90 % contre 78 % pour le nouveau [2]. Un « upgrade » qui part dans le mauvais sens. La leçon tient en une phrase : tu ne connais la direction de ta facture qu’après l’avoir mesurée.

La vraie contrainte n’est pas la génération de code

Admettons que tu aies choisi le bon modèle au bon prix. Tu produis du code plus vite. Beaucoup plus vite. Et pourtant, tu shippes à la même vitesse qu’avant. Familier ?

Swizec le pose sans détour : les gains de productivité IA au niveau macro sont marginaux — 4 % en moyenne sur 1 300 entreprises européennes, 0,8 % sur 6 000 dirigeants, 0,4 à 1,3 % à l’échelle des pays riches [3]. Alors qu’individuellement, on code 50 % plus vite et on ferme 26 % de tâches en plus. Où passe la différence ?

Dans le goulot. La théorie des contraintes de Goldratt le dit depuis les années 80 : ton usine ne va pas plus vite que son maillon le plus lent. Accélérer la génération de code quand la contrainte, c’est la review, ne change rien au débit global [3]. Tu produis 10 PR de plus, tu en fais relire 1. Le tas grossit, le flux stagne.

Le vrai levier, c’est le harness

Si le modèle n’est ni le prix ni la vitesse, où est la valeur ? Dans la couche qu’on construit autour. Lilian Weng appelle ça le harness : le système qui entoure le modèle brut, orchestre son exécution, gère le contexte, appelle les outils, stocke les artefacts et évalue les résultats [4]. Claude Code et Codex ne sont pas « juste un LLM » — ce sont des harnesses. Weng va jusqu’à dire que cette couche entre le modèle et le monde réel compte autant que l’intelligence brute du modèle.

Concrètement, ça se joue sur des détails d’ingénierie très terre-à-terre. La mémoire, d’abord : quand plusieurs agents bossent sur le même projet — un dans ton terminal, un dans ton navigateur, un sur AWS — chacun a sa propre mémoire et personne ne sait ce que l’autre a fait. D’où l’intérêt d’une mémoire partagée en graphe, versionnée comme du Git, plutôt qu’un dossier de texte sans structure [5].

Et parfois, le meilleur geste d’ingénierie, c’est de ne rien réécrire. Microsoft a testé l’idée reçue selon laquelle il faudrait exposer ses CLI en JSON pour les agents : dans leur expérience, le JSON n’a jamais amélioré la justesse et a toujours augmenté le coût, là où de simples arguments de ligne de commande, contraints et prévisibles, passaient parfaitement [6]. « Should » ne survit pas au contact du réel. Mesure avant de réécrire.

Et au bout de la chaîne, il y a des humains

Tout ce système autour du modèle, ce sont des gens qui le conçoivent, le mesurent et le subissent. Et là, l’enquête de Lenny sur l’état d’esprit des tech workers en 2026 fait mal : la population se scinde en deux. Ceux qui se sentent « amplifiés » par l’IA (49 %) et ceux qui se sentent « déstabilisés » ou « diminués » (19 %) [7].

Le burnout significatif est passé de 44,7 % à 55,7 % en un an, l’optimisme de carrière a chuté de 54,8 % à 48,7 %. Et contre-intuitivement, la peur n°1 n’est pas de perdre son job face à l’IA (22 %) mais d’être surchargé : en faire plus pour le même salaire (51 %), rester coincé dans un rythme intenable (46 %) [7]. 82 % se disent plus productifs, mais beaucoup doutent de la qualité de ce qu’ils produisent.

Le levier le plus corrélé au bonheur dans cette étude ? Ni le modèle, ni l’outil. La qualité du manager.

Alors oui, GPT-5.6 sort jeudi. Tu vas le tester, c’est normal. Mais la vraie compétence de 2026, ce n’est peut-être pas de choisir le bon modèle — c’est de savoir mesurer ta facture, identifier ta vraie contrainte, et construire le système, humain compris, qui transforme cette puissance brute en valeur livrée. Tu regardes le modèle, ou tu regardes ton système ?


Sources

  1. Chinese AI models are gaining ground with U.S. companies as OpenAI, Anthropic costs surge
  2. Not all model upgrades are upgrades
  3. Theory of constraints, AI, and code review
  4. Harness Engineering for Self-Improvement
  5. Graph based Agent Memory
  6. Don’t rewrite your CLI for agents
  7. How tech workers are feeling in 2026: a workforce splitting in two

Pour aller plus loin

Cet article a été rédigé en m’appuyant sur une IA pour m’aider à synthétiser et structurer ma veille. Les idées, le choix des sources et la relecture restent les miens.

Pour aller plus loin

China May Restrict Access to Its Most Powerful AI Models

— la face géopolitique de la même bascule : Pékin envisage de limiter la diffusion de ses meilleurs modèles.

Facing US export controls, China's DeepSeek plans to make its own chips

— quand le vrai goulot devient le silicium, pas le logiciel.

The People Who Will Thrive in the AI Age

— ce qui différenciera les gens, ce n'est pas leur intelligence mais leur rapport à l'effort mental.

Claude Cowork is coming to mobile and web

— le harness qui sort du terminal pour venir sur mobile et web.

Expanding Managed Agents in Gemini API: background tasks, remote MCP and more

— Google industrialise l'orchestration d'agents côté plateforme.

Cet article a été rédigé en m'appuyant sur une IA pour m'aider à synthétiser et structurer ma veille. Les idées, le choix des sources et la relecture restent les miens.