Ce qui a changé dans les modèles d’IA cette semaine, et ce que ça change pour vous.
Recevoir le Radar chaque semaine
Ce qui a changé dans les modèles d’IA — sorties, prix, arrêts — et ce que ça change pour vous. Un courriel par semaine, en français, désabonnement en un clic.
L’API Sora (modèles sora-2 et sora-2-pro, et tous leurs snapshots) cesse de répondre le 24 septembre 2026. L’application et le site Sora ont déjà fermé le 26 avril 2026. OpenAI indique qu’il supprimera définitivement les données liées à Sora une fois la fenêtre d’export passée, et n’annonce aucun modèle de remplacement dans son API.
Ce que ça change pour toi
Si un script, une automatisation ou un produit appelle encore l’API Sora, il tombera en panne ce jour-là : migrez avant, vers un autre modèle vidéo, et exportez vos générations depuis la page de fermeture pendant qu’elle répond encore. Plus largement, c’est le rappel qu’un modèle est un service avec une date de fin : gardez vos appels derrière une couche à vous, pour qu’un changement de fournisseur soit un réglage et non une réécriture.
OpenAI publie GPT-6 Astra, déployé dans ChatGPT pour les abonnés Plus, Pro, Business et Enterprise, et dans l’API sous l’identifiant gpt-6-astra (aussi sur Azure et Amazon Bedrock). Tarif API : 10 $ par million de tokens en entrée, 50 $ en sortie, le même que Claude Fable 5.1 sorti deux jours plus tôt. Une déclinaison Astra Pro est réservée aux offres Pro, Business et Enterprise. OpenAI revendique notamment 72,6 % sur OSWorld (usage d’un ordinateur) et 57,9 % sur Terminal-Bench 4.0, contre 55,8 % pour Fable 5.1.
Ce que ça change pour toi
Deux modèles phares au même prix la même semaine : le choix se fait désormais sur votre cas d’usage, pas sur le tarif. Les écarts annoncés portent sur l’usage autonome d’un ordinateur et du terminal, c’est-à-dire les agents. Si vous n’avez pas encore de jeu d’évaluation maison, c’est la semaine pour en écrire un : dix tâches réelles de votre métier valent plus que n’importe quel benchmark public pour trancher entre Astra et Fable.
Google met à jour sa gamme rapide avec Gemini 3.8 Flash, le modèle pensé pour les appels à fort volume et à faible latence. Une variante Gemini 3.8 Flash Cyber, orientée sécurité offensive et défensive, est réservée aux organisations admises dans le Fairwind Program.
Ce que ça change pour toi
Les modèles « Flash » sont ceux que vous appelez des milliers de fois par jour : classification, extraction, résumés, agents à plusieurs étapes. Une nouvelle version change le rapport qualité / prix de tout ce qui tourne en production. Avant de basculer, rejouez vos jeux de tests : une version rapide qui répond mieux mais autrement peut casser un parseur ou un format de sortie attendu.
Un mois après la 1.2, Meta Superintelligence Labs publie Muse Spark 1.3, disponible dans Muse Code (son agent de programmation) et via la Meta Model API. L’argument central : environ 20 % d’appels d’outils et 25 % de tokens en moins que la 1.2 pour le même travail agentique, et une nette progression en récupération sur contexte long. Attention à la lecture des benchmarks : les scores publiés utilisent un mode « max reasoning » qui n’était pas accessible au lancement.
Ce que ça change pour toi
Pour un agent de code, la facture n’est pas le prix du token mais le nombre de tours : un modèle qui appelle moins d’outils pour arriver au même résultat coûte moins et finit plus vite. C’est le bon moment pour mesurer ce que coûte réellement une tâche type dans votre pipeline (tokens et appels), afin de comparer des modèles sur ce chiffre plutôt que sur un classement.
Anthropic publie Claude Fable 5.1, son nouveau modèle généraliste, avec une fenêtre de contexte de 1 million de tokens et jusqu’à 128 000 tokens en sortie. Tarif API : 10 $ par million de tokens en entrée, 50 $ en sortie, 0,25 $ en lecture de cache. Identifiant claude-fable-5-1 (et anthropic.claude-fable-5-1 sur Amazon Bedrock). Mythos 5.1, le modèle frère, reste réservé aux partenaires du Project Glasswing.
Ce que ça change pour toi
Un million de tokens, c’est un dépôt de code entier ou une documentation complète dans un seul appel : les stratégies de découpage et de RAG que vous aviez mises en place pour tenir dans 200 000 tokens deviennent optionnelles sur les cas moyens. Le prix, lui, n’a pas baissé : à 10 $ / 50 $, remplir la fenêtre coûte cher, et la lecture de cache à 0,25 $ devient l’outil qui rend le long contexte payable. Si vous suivez le cours sur la famille Claude, vérifiez l’identifiant de modèle dans vos exemples.
Quatrième lancement d’Anthropic en moins de deux mois (après Fable 5 et Mythos 5 le 9 juin, puis Sonnet 5 le 30 juin) : Claude Opus 5 est disponible partout, sous l’identifiant claude-opus-5, à 5 $ par million de tokens en entrée et 25 $ en sortie, le tarif d’Opus 4.8. Fenêtre de contexte de 1 million de tokens sans surcoût. Il devient le modèle par défaut de Claude Max et le plus puissant offert dans Claude Pro.
Ce que ça change pour toi
Anthropic présente Opus 5 comme « proche de Fable 5 à moitié prix » : pour la majorité des tâches de code et de rédaction, c’est lui qu’il faut essayer d’abord, et ne monter vers Fable que si vos tests montrent un écart. Réflexe utile : garder l’identifiant du modèle dans une variable de configuration, pour comparer les deux sur vos propres tâches sans toucher au code.
Moins de sept mois après le lancement de Sora 2 et de son application sociale (30 septembre 2025), OpenAI ferme l’expérience Sora web et mobile. L’arrêt avait été annoncé le 24 mars 2026. L’API reste disponible jusqu’au 24 septembre 2026. OpenAI propose un export du contenu depuis la page de fermeture et indique que les crédits non utilisés peuvent être dépensés sur Codex.
Ce que ça change pour toi
Un produit grand public d’un des trois premiers laboratoires du monde peut disparaître en moins d’un an. Pour vos propres projets : ne stockez jamais vos seuls exemplaires chez le fournisseur, exportez régulièrement, et traitez tout modèle génératif comme une dépendance à version et à date de fin, pas comme une infrastructure permanente.