💌How I share skills across my whole team
- Auteurs
- AI with Remy, Remy Gaskell
- Thème
- IA
- Mots-clés
- Fable 5, export control, modèles open-weight chinois, harnais d'agents, skills
- Ton
- opinion
Résumé
L'édition de la semaine d'« AI with Remy » couvre cinq temps forts : le lancement puis le retrait en 72 heures de Fable 5 d'Anthropic (premier modèle public « Mythos-class », débranché mondialement sur ordre du gouvernement américain), l'arrivée de trois modèles chinois open-weight 20 à 25 fois moins chers, le nouveau Siri d'Apple dont l'atout est le contexte personnel, le modèle d'image Reve 2.0 « layout-first », et Kickbacks (de la pub dans le spinner de Claude Code). La newsletter se conclut sur une thèse récurrente de l'auteur : tous les harnais d'agents sont identiques au fond (contexte + outils + skills), et le vrai sujet pour une équipe est de savoir partager et versionner ses skills.
💡 Pourquoi ça compte
C'est l'illustration parfaite d'un basculement stratégique : le modèle frontière devient un actif géopolitique fragile et une commodité interchangeable, tandis que la valeur durable migre vers ce qu'on possède autour (contexte, outils, skills). Une lecture clé pour tout décideur qui bâtit une stack IA.
Analyse approfondie
TL;DR. Fable 5 → premier modèle public d'Anthropic au-dessus d'Opus, le meilleur jamais sorti ; puis le gouvernement américain force son extinction mondiale, 3 jours plus tard. Le nouveau Siri d'Apple → enfin un vrai assistant conversationnel, dont le véritable atout est de voir vos SMS, photos et agenda, un contexte qu'aucune autre IA ne peut toucher. Les modèles chinois → GLM-5.2, Kimi K2.7 Code et MiniMax M3 ont tous débarqué, et ils sont ridiculement bon marché ; mais ils ne sont toujours pas meilleurs qu'Opus/GPT-5.5. Reve 2.0 → un labo de 70 personnes arrive #2 du leaderboard image, devant Nano Banana 2 de Google, grâce à une approche « layout-first ». Kickbacks → Claude Code a désormais de la pub, et on est payé pour regarder le spinner tourner.
Fable 5 : le meilleur modèle jamais conçu, disparu en 72 heures. Le 9 juin, Anthropic lance Claude Fable 5, son premier modèle public « Mythos-class », un cran au-dessus d'Opus 4.8. « Mythos-class » signifie qu'ils ont pris leur modèle interne le plus dangereux et le plus capable (Claude Mythos) et en ont fait une version assez sûre pour le grand public. Tarif : 10 $ / 50 $ par million de tokens (entrée / sortie), le double d'Opus 4.8. Et il était vraiment bon. L'équipe d'every.to a eu une semaine complète avant le lancement : stupéfiant sur l'ingénierie difficile (91/100 au test d'ingénieur senior, contre 63 pour Opus 4.8 et 62 pour GPT-5.5) ; on peut le laisser tourner des heures (Stripe l'a pointé sur une migration de 50M de lignes, bouclée en un jour là où une équipe aurait mis deux mois) ; il a du goût, soigne les détails. C'est un outil de power-user : si vous orchestrez déjà des agents, il fait des choses inédites ; sinon, vous ne sentirez pas la différence. Il est lent et gourmand (un million de tokens sur une seule tâche), donc surdimensionné pour le quotidien. Puis le 12 juin, il a disparu : le gouvernement américain a émis un export-control order forçant Anthropic à éteindre Fable 5 et Mythos 5 pour tous les clients du monde. Anthropic conteste fermement : c'est une capacité étroite que GPT-5.5 a déjà, et éteindre un modèle utilisé par des centaines de millions pour un seul défaut gèlerait les nouvelles sorties de toute l'industrie. La justification gouvernementale : la sécurité nationale, un modèle aussi doué pour lire du code et repérer des failles étant dangereux entre de mauvaises mains.
Le nouveau Siri d'Apple : tardif et prudent, mais il voit ce que personne d'autre ne voit. À la WWDC, Apple a enfin montré un Siri nouvelle génération : très conversationnel, dans une app autonome, historique synchronisé entre iPhone, iPad et Mac. Surtout, il peut lire et agir dans vos apps (Messages, Photos, Calendrier, Rappels) et cite ses sources. Il voit vos SMS, vos photos, votre agenda — le contexte personnel que ChatGPT, Claude et Gemini ne peuvent pas toucher : c'est là le vrai fossé. Il est délibérément prudent (il ajoute le concert à votre agenda mais n'achète pas les billets, contrairement à la démo plus agressive de Google). Bémols : les apps tierces sont peu fluides, la version on-device ne tourne que sur iPhone Air et iPhone 17 Pro, et ce n'est pas encore sorti (preview développeur, lancement complet vers l'automne 2026 avec iOS 27, anglais d'abord, ni UE ni Chine au lancement). Sous le capot : modèles maison d'Apple, entraînés sur Gemini de Google et tournant en partie sur le cloud de Google (deal d'environ 1 Md$/an).
Les modèles open-source chinois sont incroyables maintenant — mais devriez-vous les utiliser ? Timing amusant : la semaine même où les États-Unis éteignent leur meilleur modèle, la Chine en livre trois excellents en open-weight. GLM-5.2 (Z.ai) : fenêtre de contexte utilisable d'un million de tokens, et sur un plan coding payant Z.ai, il se branche directement dans Claude Code via un simple changement de réglages (Z.ai a construit un endpoint exprès) — mais il consomme votre quota vite. Kimi K2.7 Code (Moonshot) : le cheval de trait open-weight du coding, conçu pour les longs travaux agentiques et inhabituellement économe (~30 % de tokens « thinking » en moins). MiniMax M3 : poids ouverts sur Hugging Face, #2 parmi les modèles open-weight, juste derrière GLM-5.2. Là où ils gagnent haut la main, c'est le prix : une tâche à ~1 $ sur le moins cher (MiniMax M3 au tarif de lancement) revient à ~21 $ sur Opus 4.8 et ~25 $ sur GPT-5.5 — 20 à 25× plus cher pour les modèles frontière US (au tarif normal de MiniMax, l'écart reste proche de 10×). Quand les utiliser ? Si vous gérez une entreprise avec des données très sensibles qui ne peuvent pas passer par le modèle d'un tiers (cannabis, peptides, fintech, legal), pouvoir posséder et auto-héberger le modèle compte énormément. Ils sont aussi bien moins chers, donc utiles pour faire tourner des agents (OpenClaw, Hermes) à budget serré — et on peut les router via OpenRouter sans les héberger soi-même. Mais l'auteur ne les utilise pas : Opus 4.8 et GPT-5.5 restent meilleurs en généralistes, et il préfère payer 200-300 $/mois pour le top.
Reve 2.0 : le modèle d'image bâti autour du contrôle (et il vient d'atteindre #2). Un petit labo indépendant (Reve AI, ~70 personnes à Palo Alto, fondé par d'anciens d'Adobe et de Stability) a sorti Reve 2.0 le 3 juin. Son truc : le « layout-first ». Au lieu de jouer aux dés sur une image finie, Reve planifie l'image comme une mise en page éditable, presque comme du code, avant de rendre les pixels. On peut donc déplacer, redimensionner, recolorer et réécrire chaque élément et continuer d'itérer sans tout régénérer. Les testeurs parlent d'« un fichier de travail qu'on itère, pas une machine à sous one-shot ». Plus : 4K natif, bonne fidélité au prompt, texte propre dans l'image. #2 sur le leaderboard de préférence à l'aveugle, derrière GPT Image 2 d'OpenAI et juste devant Nano Banana 2 de Google. Bémols : en retrait sur le photoréalisme, les visages et l'identité ; perd parfois de petits détails ; pas de vectoriel/SVG. Mais très bon marché (~0,0067 $ l'image) et peu censuré. On y accède via app.reve.com ou fal.ai.
Kickbacks : Claude Code a de la pub maintenant, et je suis payé. Le petit spinner qui tourne pendant que Claude Code réfléchit ? Andrew McCalip en a fait une régie publicitaire. Ça s'appelle Kickbacks : les annonceurs enchérissent pour afficher de courtes pubs texte dans le spinner, et les utilisateurs qui l'installent gardent 50 % des revenus. « Get paid to wait ». L'auteur l'a testé en consommateur (installation en ~30 s, 8,50 $ gagnés le premier jour puis ~1-2 $/jour) et en annonceur (~132 $ sur trois campagnes, 21 abonnés à ~3,70 $ pièce ; un gros achat one-shot montre surtout la même pub aux mêmes développeurs, achetant de la répétition, pas de la portée).
Aussi cette semaine. SpaceX rachète Cursor pour 60 Md$ (xAI a fusionné dans SpaceX, d'où l'achat d'une plateforme d'agent de code par une entreprise de fusées). Salesforce achète Fin (l'agent de support IA d'Intercom) : une fois toutes ses apps branchées à Claude, on n'ouvre plus les front-ends, tout se joue sur la qualité du backend/API pour qu'un agent puisse le piloter — terrain où Salesforce bat un rival plus joli comme HubSpot. Graphify : outil open-source gratuit donnant à Claude Code une mémoire de type graphe de connaissances du codebase, répondant aux questions repo pour ~40 % du coût habituel en tokens. Perplexity a donné une mémoire à son agent (Brain). Claude Design a reçu des améliorations (reste on-brand, édition sur le canvas, synchro avec Claude Code).
Builder's notes. Tout harnais d'agent est la même chose : Manus, Perplexity Computer, Claude Cowork, Claude Code, Codex — des agents capables qu'on pointe sur presque n'importe quelle tâche. Ce qui en fait un vrai « employé » tient en trois choses : le contexte (ce que vous faites, qui vous aidez, comment marche votre business), les outils (email, Notion, Slack, Stripe), les skills (des SOP pour l'IA, vos process répétables). Ouvrez n'importe quel harnais : c'est toujours les trois mêmes onglets. Lequel choisir ? Cela tient à deux critères : la customisabilité et la facilité d'usage. L'analogie : devenir AI-literate, c'est apprendre à conduire ; les harnais sont juste des voitures différentes. Work amplification vs work automation : l'amplification, c'est l'OS d'agents qu'on bâtit pour soi (Claude Code + VSCode, 10 à 100x de levier, on est dans le cockpit à diriger) ; l'automation, ce sont les agents faisant tourner de vrais process métiers qui ne devraient pas vivre dans votre écosystème perso (un agent de support client), sur du plus autonome (Hermes, OpenClaw). Le truc débloqué cette semaine : partager des skills en équipe. Construire de bons skills est la chose la plus importante à apprendre. Problème : pas de moyen propre pour qu'une équipe partage et collabore sur des skills (un fichier airdropé diverge, Drive/Dropbox sans synchro live, un vault Obsidian ingérable à plusieurs). Ce qui marche : créer un repo GitHub « skills » (ou un par département), le transformer en plugin marketplace ; toute l'équipe lance /plugin et obtient tous les skills du repo. Quelqu'un améliore un skill, dit à Claude Code de le mettre à jour, ça pousse sur le repo, et ça s'auto-met à jour chez tout le monde : pas de pull, pas de dérive de version, et un vrai contrôle de version (rollback possible).
Tools to try. drop.new (Vercel) : glisser un fichier/dossier dans le navigateur → URL de production live instantanée. here.now : hébergement web gratuit et instantané pour agents IA. primitive.dev : email pour vos agents IA. Flow : un petit minuteur Pomodoro.