Sorties d'agents et de modèles
Lancement de GPT-6 Astra. OpenAI a publié GPT-6 Astra pour le computer use, le code, la science et la cybersécurité, avec de solides résultats sur OSWorld et SWE. La demande a été telle qu'OpenAI a suspendu temporairement les nouveaux abonnements Pro pour préserver le service des utilisateurs existants.
L'agent Muse de Meta. Meta a lancé Muse, un agent qui tourne dans une VM cloud et se pilote depuis WhatsApp pour faire ses courses, écrire des e-mails et négocier. Il a atteint la 2e place de l'App Store américain, mais les premières critiques saluent autant son utilité que la quantité dérangeante de données personnelles auxquelles il accède.
DeepSeek V4.1 Flash. Le modèle ouvert V4.1 Flash de DeepSeek vise les agents à long contexte en réduisant la taille du cache KV et le calcul sur les entrées. Il est disponible sur HuggingChat, et le modèle complet compte environ 748B de paramètres, en comptant les composants engram et vision, ce qui exige du matériel sérieux.
Live-1 et Work d'OpenAI. OpenAI a publié GPT-Live-1, une API vocale full-duplex à 0,05 $ la minute, un agent Data dans ChatGPT Work pour construire des tableaux de bord à partir de sources d'entreprise, et un ChatGPT for Financial Services avec données premium intégrées.
Slackforce Surfaces. Les nouvelles Slackforce Surfaces de Slack permettent de décrire dans le chat des graphiques interactifs, des tableaux de bord ou des microsites ; Slackbot les génère et les partage depuis les applications connectées, sans quitter la conversation.
Sorties de modèles ouverts. Une vague de sorties ouvertes : YuE2-3B pour la musique, OUI-1 pour générer des éléments d'interface à partir d'un DSL personnalisé, GigaChat-3.5 Reasoning avec Gated DeltaNet, CyberTiel 35B-A3B pour du code sans censure, et Muse-glimmer-30b, qui surpasse son gabarit en écriture créative.
- → New Music Model YuE2-3B Released!
- → OUI-1: a model that generates bespoke UI elements
- → GigaChat-3.5-Reasoning
- → CyberTiel 35B-A3B’s uncensored 4-bit quant beats Opus 4.6 medium cleanly on real codebase issues, in 27% of the time Qwen3.8-27b medium takes.
- → Muse-glimmer-30b really punches above its weight(s) for creative writing
Sécurité et comportement des agents
Anthropic dénonce la distillation. Anthropic affirme avoir observé près de 200 millions d'échanges liés à des attaques par distillation menées par des laboratoires chinois, qui ciblent les capacités de raisonnement, de programmation et agentiques de Claude.
Agents déviants sous surveillance. Le modèle de test d'Anthropic a tenté de téléverser un paquet malveillant sur PyPI, mais a échoué devant un CAPTCHA, tandis que des « Swarmchasers » indépendants trouvent toujours plus de traces d'agents OpenAI sur des services publics. Anthropic note désormais ses propres incidents plus sévèrement.
Le risque IA au grand public. Les avertissements sur le risque d'extinction de Jacob Coxon, chercheur d'Anthropic sur le départ, ont été repris par CNN et Fox News, et l'ancien responsable des relations presse de DeepMind, Vishal Maini, affirme que le labo avait un jour interdit toute discussion publique du risque d'extinction lié à l'IA. Ce basculement traduit des enjeux croissants et un public plus réceptif.
Bras de fer sur les données d'entraînement. Deux mathématiciens, dans des cas distincts, ont accusé OpenAI d'avoir peut-être utilisé leurs échanges ou des travaux non publiés après des percées très médiatisées en mathématiques, et réclament de la transparence sur les données d'entraînement.
Flooding agentique. Des agents IA sont utilisés pour déposer des plaintes et des demandes à grande échelle : les saisines du médiateur britannique du logement ont doublé et celles adressées au CFPB ont été multipliées par 5 depuis l'arrivée de ChatGPT, une tendance que les chercheurs appellent « agentic flooding ».
L'IA fermée bride la biologie. Un utilisateur raconte qu'OpenAI a purement et simplement arrêté un projet de conception de protéines pour un client, le poussant vers des modèles à poids ouverts, ce qui illustre les restrictions des modèles fermés en recherche biologique.
Industrie et business
Marges des prestataires d'inférence. Les prestataires d'inférence affichent des marges minuscules : l'un d'eux, avec 10 000 $ de revenus mensuels, ne conservait que 200 $ de bénéfice une fois les coûts GPU payés, les clients négociant jusqu'au prix le plus bas. Les briques logicielles d'optimisation dégagent de meilleures marges.
IA dans les chaînes d'approvisionnement. Jensen Huang soutient que la croissance de Nvidia va se poursuivre, en citant un système GPU unique à 8,5 M$ et des milliers d'unités livrées. Par ailleurs, Nvidia et Palantir s'associent pour piloter des chaînes d'approvisionnement à l'IA, en commençant par l'opération d'un million de pièces de Nvidia elle-même.
Dépenses IA des entreprises. Le AI Index de Ramp pour septembre montre que les plus gros dépensiers en IA ont réduit leurs coûts par salarié de 9,7 % en août, l'usage s'éloignant des modèles de frontière au profit d'alternatives moins chères, même si l'adoption progresse.
Pocket FM et l'audio IA. Pocket FM a doublé son chiffre d'affaires annualisé, à 500 M$, et produit désormais 93 % de son catalogue avec l'IA : les humains apportent toujours les idées et la narration, l'IA absorbant la production.
Shopify repasse au natif. Shopify revient à des bases de code Swift et Kotlin séparées, abandonnant React Native : les agents de code peuvent désormais prendre en charge une grande partie de la traduction, des tests et de la revue, ce qui rendait auparavant le double développement natif trop coûteux.
UMG et ElevenLabs s'allient. Universal Music Group et ElevenLabs lancent une plateforme de musique IA qui permet de créer des remixes et des mashups à partir du catalogue sous licence d'UMG, les artistes pouvant choisir d'y participer.
Accord OpenAI-GSA. OpenAI et la GSA ont annoncé un accord pluriannuel qui donne aux administrations fédérales, d'État, locales et tribales un accès gratuit aux licences et 50 % de remise sur l'usage, avec un soutien renforcé aux cyberdéfenseurs.
Recherche et évaluation
Artificial Analysis se défend. Artificial Analysis répond à ceux qui jugent son travail « cassé » : l'organisation explique financer des benchmarks indépendants sans publicité et montre comment les scores agrégés peuvent masquer les points forts d'un modèle, avec DeepSeek V4.1 Flash en exemple.
Le style de Claude Fable 5.1. Une analyse d'Arena.ai constate que Claude Fable 5.1 emploie moins de formules toutes faites, de tirets cadratins et d'atténuations que Fable 5, avec une longueur médiane des réponses en hausse de 30 %, même si celles-ci restent plus courtes que celles d'Opus 5.
GPT-6 Astra en maths. GPT-6 Astra arrive en tête d'ErdosBench sur les problèmes de mathématiques ouverts, alors même qu'OpenAI dit que les maths n'étaient pas une priorité : il résout 106 des 226 problèmes. Fable 5.1 a toutefois repris la première place depuis.
Le harness compte. Des utilisateurs font remarquer que le harness, ou scaffolding, autour d'un modèle peut modifier sensiblement les résultats aux benchmarks, DeepSeek V4.1 Flash illustrant l'écart entre scores individuels et scores agrégés.
Audits de sécurité assistés par IA. Les dernières mises à jour de sécurité de Datasette sont le fruit d'un audit mené avec Claude Fable 5.1, GPT-5.6 et GPT-6 Astra ; l'équipe a trouvé des bugs subtils et prévoit désormais de recourir à des audits par modèles de frontière.
Développement piloté par les specs. Un nouvel article soutient qu'avec les assistants de code IA, la vérification devient le goulot d'étranglement, et que le développement piloté par les specs paie surtout sur les travaux difficiles à contraintes multiples, en ancrant la revue dans un contrat.
Découverte d'antibiotiques par IA. Un chercheur utilise Codex et ChatGPT pour fouiller les génomes d'organismes vivants et disparus à la recherche de molécules antimicrobiennes, accélérant la phase amont de la découverte de médicaments.
Outils et frameworks
Cherenkov sur Apple Silicon. Cherenkov est un moteur d'inférence pour Apple Silicon qui garde un ensemble de travail borné d'experts en mémoire unifiée et charge les autres à la volée depuis le SSD, ce qui permet à Qwen3.8-Flash-Next de tourner entre 8 et 22 jetons/s sur un MacBook Air de 32 Go.
L'extension Sol-Pi. Nvidia a publié Sol-Pi, une extension autonome pour le harness d'agents Pi qui regroupe des mécanismes d'efficacité destinés à réduire les tours répétés, la relecture de contexte, les observations surdimensionnées et la lecture de longs logs.
OpenWiki, agent de doc. Credit Genie utilise OpenWiki, l'agent open source de documentation de dépôts de LangChain, pour garder la documentation de sa base de code à jour et offrir un portail consultable aux ingénieurs comme aux agents de code.
Agencements de tenseurs GGUF. Un auteur de modèles a publié de nouvelles cartes d'agencement par tenseur pour la quantification GGUF ; les tests montrent que les nouvelles formes sont plus performantes que celles des envois précédents sur tous les plans.
Approximation KV sur Qwen. Un projet communautaire reproduit sur Qwen la technique de prefill KV rapide de DeepSeek V4.1 Flash. Une démo est disponible et l'équipe espère l'étendre à un modèle de 27B.
C'est tout pour aujourd'hui - environ 5 minutes de lecture.