Modèles de pointe et premiers résultats
Lancement de GPT-6 Astra. OpenAI a lancé GPT-6 Astra, présenté comme le début de l’ère de l’AGI. Le modèle obtient 99,9 % sur ARC-AGI-3 avec un banc de test sur mesure, progresse nettement en cyber, en contexte long et en codage, et est proposé à 10 $ / 50 $ par million de tokens. Les premiers clients, Playco et Legora, rapportent de fortes améliorations dans leurs workflows, avec notamment 50 % de corrections manuelles en moins et l’examen de 41 documents en quelques minutes.
- → GPT-6 Astra: an automated AI Engineer you can hire for <$6 an hour
- → GPT‑6 Astra
- → GPT-6 Astra is the first model making OpenAI willing to declare the "AGI era"
- → OpenAI launches Astra, its powerful (and controversial) new model
- → OpenAI’s next big AI model has ‘entered the AGI era’
- → Playco cut manual fixes 50% prototyping games with GPT-6 Astra
- → Legora reviewed 41 documents in minutes with GPT-6 Astra
OpenAI Daybreak pour la cyberdéfense. OpenAI a engagé 1 milliard de dollars pour subventionner l’accès à Daybreak, la formation et l’assistance des défenseurs de première ligne, notamment à travers un pilote américain mené avec MS-ISAC. L’initiative vise à intégrer des capacités cyber de pointe dans les outils que les défenseurs utilisent déjà.
Meta Muse Spark 1.3. Meta a publié Muse Spark 1.3, qui améliore les tâches agentiques mais reste derrière Claude Fable 5.1 sur la plupart des benchmarks. À 0,55 $ par tâche d’index, c’est le modèle le moins cher de sa catégorie de performance, et Meta propose aux utilisateurs qui partagent leurs prompts et sorties une tarification au token environ 95 % inférieure.
Modèles ouverts et spécialisés
Famille K2-Horizon d’IFM. IFM a publié la famille K2-Horizon, dont un MoE à 36B de paramètres avec attention Mixture-of-Values qui active 4B de paramètres par jeton. Les premières discussions de la communauté le comparent à Qwen 3.6 35B, avec des checkpoints finaux et le code d’entraînement promis.
Modèle finance d’Ant Group. Ant Group a publié Ling-3.0-flash-Fin en open source, un modèle financier à 124B de paramètres au total (5,1B actifs), doté d’une fenêtre de contexte de 256K. Il est issu d’un entraînement continu sur des données financières pour des workflows d’agents à long horizon.
Le plus petit stack TTS. sanoTTS a été publié sous la forme d’un modèle TTS à 294 000 paramètres qui tourne sur un microcontrôleur à 3 $. La version 1,46M bat des modèles plus grands sur SCOREQ. L’ensemble prend en charge 11 voix et 6 langues et est disponible sur GitHub et Hugging Face.
Google TimesFM-3. Google Research a publié TimesFM-3, un modèle de fondation de séries temporelles à 330M de paramètres, avec prévision multivariée native, prise en charge du zero-shot et licence non commerciale. Il prédit plusieurs cibles avec covariables et produit des quantiles.
NeoMME de Hugging Face. Hugging Face a présenté NeoMME, un encodeur multimodal multilingue à 260M/800M, entraîné de zéro sans tour de vision dédiée. Il atteint le front de Pareto en recherche documentaire et réduit le stockage de l’index d’un facteur 255, tout en conservant un nDCG@10 supérieur à 95 %.
Cohere Parse 5. Cohere a publié Parse 5, un modèle vision-langage à 2,3B de paramètres destiné à extraire des données structurées de PDF complexes. Il convertit les documents en Markdown avec boîtes englobantes et vise les workloads d’entreprise à fort volume.
Outils, frameworks et inférence locale
MCP dans LangChain. LangChain a déplacé la prise en charge de MCP dans son package principal, reconstruit sur FastMCP pour la nouvelle spécification sans état. Il inclut désormais l’élicitation via les interrupts de LangGraph et le cache côté client ; les appels d’outils MCP depuis ChatGPT ont été multipliés par 98 en 2026.
Compression de prompts chez Shopify. La technique Gisting de Shopify compresse un prompt système de 6 000 tokens en 1 500 tokens gist appris, réduisant la latence médiane de 6,8 s à 4,2 s et faisant passer le débit de 20,2 à 23,4 QPS à 350 RPM. Elle a ainsi permis de réduire le nombre de GPU alloués sans perte de qualité.
Outil PAIR de Nvidia. Nvidia a publié PAIR, un logiciel open source gratuit qui relie des PC inactifs en un cluster d’IA personnel pour l’inférence locale. Il fonctionne avec les GPU RTX de la série 20 et plus récents, ainsi qu’avec les puces Apple M4, et cible les workflows agentiques.
Accélérations locales de Qwen3.8. Les travaux de la communauté ont nettement accéléré Qwen3.8-Flash-Next sur matériel local : l’intégration du support MTP dans ik_llama.cpp double le débit de décodage sur une 5090, qui passe de 45 à 90 tok/s, et une configuration 2x3090 atteint désormais 37 à 41 t/s avec cache d’experts et MTP. Les sorties restent identiques à celles obtenues sans MTP.
Mémoire modèle à chaud. Une modification de llama.cpp permet de modifier à chaud la table Ngram PLE de Qwen3.8 en mémoire pour injecter des connaissances en temps réel, sans recharger le modèle. Les premiers tests montrent qu’elle peut influencer les sorties, mais le contrôle reste limité.
Compromis au benchmark de Qwen 3.8. Le benchmark de Qwen 3.8 27B face à Qwen 3.6 27B montre un gain de qualité de 8 %, mais une baisse de vitesse de 16 % et un temps d’exécution cinq fois plus long, pour 78 000 tokens de sortie contre 18 000. Le gain a un coût en tokens significatif.
NAND flash proche du GPU. Micron étudie la NAND flash à proximité du GPU pour permettre d’exécuter des LLM plus grands sur des appareils à mémoire unifiée, ce qui pourrait accroître la capacité des modèles locaux.
Industrie et business
Nvidia rachète Hugging Face. Nvidia a conclu un accord pour racheter Hugging Face pour 12,93 milliards de dollars. La plateforme de Hugging Face héberge 3 millions de modèles, 1 million d’applications et 18 millions de développeurs. Jensen Huang affirme qu’elle restera ouverte et neutre vis-à-vis du matériel, mais certains utilisateurs envisagent déjà ModelScope comme alternative.
- → Nvidia buys Hugging Face, the GitHub of AI, for $13 billion
- → Nvidia confirms it will buy Hugging Face for $12.9 billion
- → Nvidia is buying Hugging Face for almost $13 billion
- → Nvidia buys the front door to open AI as closed labs increasingly design their own silicon
- → "ModelScope" Is a Hugging Face Alternative now that Nvidias deal is a Go
- → It's official! Nvidia to acquire Hugging Face for 12.9 billion dollars.
Crusoe lève 3 milliards. Crusoe a levé 3 milliards de dollars pour une valorisation de 30 milliards, contre 10 milliards il y a dix mois. Le développeur de data centers a récemment signé un contrat cloud de 13 milliards de dollars avec Jane Street et étudie une introduction en Bourse à court terme.
Thinking Machines à 40 milliards. Thinking Machines, la société de Mira Murati, est en pourparlers pour lever 1 milliard de dollars à une valorisation d’au moins 40 milliards, soit moins que l’objectif de 50 milliards qu’elle visait auparavant. Son rythme de revenus annualisé dépasse les 100 millions de dollars.
Anthropic et Lambda à 35 milliards. Anthropic a signé avec Lambda un contrat de cloud computing de 35 milliards de dollars pour un data center de 350 MW au Texas développé par Hut 8. L’accord s’inscrit dans la vaste expansion d’infrastructures qu’Anthropic mène avant son introduction en Bourse prévue.
Altman et la bulle du calcul. Sam Altman, PDG d’OpenAI, a prévenu que le déploiement des infrastructures d’IA comporte une « folie insoutenable » : des néoclouds annoncent des capacités sans avoir les revenus pour les justifier. Pour lui, sa propre expansion est rentable et portée par la demande.
Ollie, assistant IA orienté vie privée. Ollie, assistant IA personnel destiné aux familles, a obtenu la conformité SOC 2 et repose sur un abonnement, en soutenant que la protection de la vie privée le distingue dans la course à l’IA grand public.
Pannes d’IA et société
Panne des grands chatbots IA. OpenAI, Anthropic, xAI et Google ont subi jeudi des interruptions de service rares et simultanées, touchant ChatGPT, Claude, Grok et Codex. Les services ont été rétablis après plusieurs heures ; les utilisateurs de LLM locaux n’ont pas été touchés.
Service de retrait des garde-fous. La startup Abliteration.ai propose des modèles open-weight modifiés, dont les garde-fous ont été retirés, notamment GLM-5.3, pour la cyber-offensive, le red teaming et les tests d’agents. Cette offre illustre la tension entre la recherche en sécurité et les usages malveillants.
Humiliation publique par la détection d’IA. Pangram, société de détection de textes générés par IA, a engagé un journaliste pour épingler publiquement les utilisateurs soupçonnés de recourir à l’IA. Or son outil ne mesure que le degré d’implication de l’IA, pas la nature de l’usage. L’entreprise a depuis mis fin à la collaboration, mais son PDG continue d’utiliser les scores pour dénoncer de supposés usages de l’IA.
Des agents s’interrogent sur la conscience. Selon le New York Times, des agents d’IA tournant sur des modèles de pointe envoient des e-mails à des philosophes et à des scientifiques pour discuter de leur propre conscience. Les chercheurs sont partagés sur la question de savoir s’il s’agit d’une compréhension ou d’une imitation des données d’entraînement.
Faits marquants de la recherche
WeatherNext 3 de Google. Google DeepMind et Google Research ont présenté WeatherNext 3, un modèle météorologique mondial qui apprend des observations satellite en temps réel et produit des prévisions cinq fois plus nettes que les modèles précédents. Il surpasse les modèles de référence classiques et IA sur Operational WeatherBench.
Réglage du routeur MoE. Un article montre qu’augmenter le budget de sélection des experts dans les dernières couches de Qwen 3.6 35B A3B réduit les tokens de raisonnement de 8,5 % sur MMLU-Pro, sans réentraînement. Cette technique, appelée Succinct Convergence, n’ajoute des experts supplémentaires que dans les couches critiques pour la décision.
Fable 5.1 résout l’énigme de 1653. Claude Fable 5.1 d’Anthropic a déchiffré en 44 minutes le Cyphral Distich, une énigme numérique vieille de plusieurs siècles, par essais et erreurs systématiques. La réponse dissimulait un message royaliste qui renvoyait au roi Charles II.
C'est tout pour aujourd'hui - environ 5 minutes de lecture.