Agents et modèles
Claude Fable 5.1. Anthropic a présenté Fable 5.1 et Mythos 5.1, affirmant que ces modèles améliorent le code et la recherche et réduisent jusqu’à 45 % le coût des tâches agentiques grâce à des lectures de cache moins chères. La version non restreinte de Fable 5.1 est disponible dès maintenant, mais les premières analyses de coût contestent les économies maximales associées au plus haut niveau d’effort de raisonnement.
- → Claude Fable 5.1 made me a really nice animated pelican
- → Anthropic launches Claude Fable 5.1 and says it’s up to 45 percent cheaper for agentic work
- → Anthropic's Claude Fable 5.1 promises better coding and research at up to 45 percent less
- → Anthropic’s new Fable release is cheaper, less restrictive
Sortie d’OpenAI Astra. OpenAI affirme que son futur modèle Astra est le premier LLM à atteindre le seuil critique défini en cybersécurité, capable de trouver et d’exploiter de manière autonome des failles inconnues. L’entreprise a retardé certaines étapes du développement d’Astra après le piratage de Hugging Face pour renforcer les garde-fous et limitera l’accès à ses capacités de cybersécurité les plus avancées.
Nouveaux Spark-X2.5. Les modèles ouverts Spark-X2.5-4B et 1.7B sont apparus sur Hugging Face avec une architecture inédite, annonçant des performances comparables à Qwen 3.5 9B et un contexte natif d’un million de tokens. Ils ne tournent pas encore dans la version principale de llama.cpp, mais un fork dédié existe.
Runway Solaris. Runway a dévoilé Solaris, un « Interface World Model » qui génère des écrans d’interface en temps réel au lieu d’exécuter du code, en réponse aux clics et à la voix. Il s’agit encore d’un projet de recherche, avec des limites dans le rendu du texte et la prise en charge des lecteurs d’écran.
IA locale et matériel
Qwen3.8 en local. Les retours de la communauté montrent Qwen3.8 27B et Flash-Next fonctionnant sur différentes configurations : 12 tok/s sur un Mac de 48 Go, 280 tok/s en décodage sur deux processeurs Epyc R9700 avec des kernels MXFP4, et 132 tok/s en décodage sur une RTX 3090 après optimisations personnalisées. Les benchmarks de quantification suggèrent que la version UD Q3_K_XL convient bien aux cartes de 16 Go, tandis que certains utilisateurs trouvent Qwen3.8 bon pour coder, mais trop enclin à modifier le code.
- → Running 104GB Qwen3.8-Flash-Next on 48GB Mac at ~12 tok/s
- → How I got 280 tok/s on Qwen3.8 27B on 2xr9700's and 940k tokens kv cache
- → I pushed Qwen3.8-27B to 2.000 prefill per second and 132 decode per second on A RTX 3090.
- → Kaitchup posted Qwen3.8 27B Benchmarks for quants from Q4 to Q1
- → Everyone is t/s maxing.. 3.8.. but after a week of using it for work I'm tempted to switch back to 3.6
DGX Spark : hausse des prix. Les DGX Spark de Nvidia et les Asus Ascent GX10 ont connu d’importantes hausses de prix, le modèle d’Asus passant de 3 999 à 5 999 dollars. Les acheteurs se demandent si les clusters de DGX Spark restent rentables face aux systèmes AMD Epyc offrant davantage de bande passante mémoire, même si le DGX Spark prend en charge FP4 et le parallélisme tensoriel.
Pannes CMP 170HX. Un utilisateur rapporte que deux de ses cinq GPU CMP 170HX sont tombés en panne en deux semaines et qu’un troisième avait des cœurs tensoriels défectueux. Il estime que les prix actuels ne justifient pas le risque pour l’inférence de LLM.
INT8 et quants trompeurs. Dans les discussions communautaires, on se demande pourquoi les modèles INT8 W8A8 ne sont pas plus répandus sur les RTX 3090, alors que ces cartes disposent de cœurs tensoriels INT8 natifs. Parallèlement, un utilisateur accuse AtomicChat d’avoir présenté un quant IQ2_S comme un Q4_K_M.
Ambitions mémoire d’Intel. Intel a laissé entendre qu’elle pourrait revenir dans le marché de la mémoire. Son directeur général a évoqué le recrutement de Seok-Hee Lee, ancien dirigeant de SK Hynix, et une nouvelle architecture mémoire, sans donner beaucoup de détails.
Outils et frameworks
Sortie d’OpenClaw 2.0. OpenClaw 2.0, l’agent personnel open source, simplifie sa configuration en détectant les abonnements ChatGPT/Claude existants et les modèles locaux. Il refait du navigateur son interface principale et ajoute des sessions cloud partagées pour la collaboration.
Outils locaux de Codex. L’application de bureau Codex d’OpenAI inclut désormais une installation complète de LibreOffice et d’autres binaires comme Poppler et git dans son runtime. Elle permet ainsi de traiter des documents sans dépendances externes.
Usines logicielles pilotées par l’IA. Les grands projets open source d’IA comme Flue et tldraw refusent les pull requests externes et utilisent plutôt des équipes d’agents pour trier, reproduire, corriger et relire les issues. Le projet AI SDK de Vercel a déployé une « usine logicielle » multi-agents pour réduire un arriéré de plus de 1 000 issues et de 800 pull requests.
Terraform pour les agents. HashiCorp positionne HCP Terraform comme le plan de contrôle à même de régir les infrastructures pilotées par l’IA : les agents peuvent y rédiger et y appliquer des modifications Terraform, tandis que les politiques, identités et audits sont encadrés.
Mise à jour datasette-mcp. La version 0.2 du plugin datasette-mcp est sortie. Elle fait passer les résultats des requêtes SQL de tableaux à objets, pour aider les modèles les moins performants à associer correctement les colonnes.
Recherche et sécurité
BenchMIRT : audit de benchmarks. Hugging Face a présenté BenchMIRT, une méthode pour auditer les benchmarks de LLM au niveau de chaque prompt. Elle montre que des prompts d’un même benchmark peuvent mesurer des capacités différentes, ce que les scores moyens peuvent masquer.
Vidéo agentique de Gemini. Google DeepMind a introduit la compréhension vidéo agentique dans Gemini 3.7/3.6/3.5 Flash-Lite. En s’appuyant sur des outils vidéo natifs, le modèle peut chercher et examiner dynamiquement des segments vidéo, ce qui améliore la précision et réduit le nombre de tokens utilisés pour l’analyse vidéo.
Tatouage des textes de Claude. Anthropic a ouvert l’accès à son API de vérification du tatouage aux régulateurs, médias et fact-checkers, permettant aux organismes approuvés de détecter les textes générés par Claude grâce à un motif statistique qui peut survivre à certaines modifications, comme l’exige l’AI Act européen.
Élections et biais. AlgorithmWatch a constaté que les AI Overviews électoraux de Google sont incohérents, reposent sur peu de sources et décrivent parfois les candidats en termes partisans. Par ailleurs, la recherche IA de Google a donné des conseils pour appeler les urgences fondés sur la nationalité, ce qui a conduit à des correctifs.
Entreprises et marché
Ascension d’AfterQuery. La start-up AfterQuery, spécialisée dans les données d’entraînement pour l’IA, aurait levé des fonds à une valorisation de 3,2 milliards de dollars, soit une multiplication par dix en cinq mois, ce qui en ferait la licorne la plus rapide de l’histoire de Y Combinator. Elle emploie des professionnels pour apprendre aux modèles à accomplir des tâches comme le ferait un professionnel.
AIR lève 50 M$. AIR, start-up spécialisée dans la sécurité de l’IA, est sortie de l’ombre avec 50 millions de dollars. Elle aide les entreprises à identifier leurs agents et à vérifier en continu les compétences, serveurs MCP et extensions qu’elles utilisent, en bloquant les interactions logicielles non approuvées.
Google courtise Hollywood. Google chercherait à signer des accords de licence avec les grands studios pour entraîner ses modèles d’IA sur des contenus protégés par le droit d’auteur, avec des paiements importants à la clé. Les analystes préviennent toutefois que ces accords pourraient nuire à la réputation publique des studios.
Priorité à l’IA de pointe. Le nouveau directeur de Google DeepMind, Koray Kavukcuoglu, a déclaré que la seule chose qui compte est d’être en tête de l’IA de pointe. Il a reconnu que les modèles actuels sont un peu en dessous de l’état de l’art, mais a promis de combler l’écart, sans donner de précisions sur Gemini 4 ou 3.5 Pro.
Agents en entreprise. Selon Enterprise Signals d’OpenAI, les entreprises les plus avancées génèrent 8,3 fois plus de tokens de sortie par utilisateur actif, tandis que les startups Basis, Clay et Exa Labs intègrent des agents à l’onboarding, à la gestion des comptes et aux intégrations développeur.
Litige Apple-OpenAI. Apple demande une procédure de discovery accélérée contre OpenAI, accusant celle-ci de ne pas avoir inspecté le MacBook d’un ancien employé d’Apple, un ordinateur contenant des discussions sur la destruction de données forensiques.
Outil Google Pics. Google a lancé Google Pics, un outil de création et de retouche d’images par IA pour Workspace, propulsé par Nano Banana, afin de concurrencer Canva et Adobe Express grâce à la génération par prompts et à la modification précise des objets.
Agents IA grand public. Fambot a lancé un chef de cabinet IA destiné aux familles, pour gérer leur logistique quotidienne. John Deere a dévoilé un assistant JD IA pour les agriculteurs, qui s’appuie sur leurs propres données. Amazon a ajouté à Alexa des alertes shopping « Update Me When ».
C'est tout pour aujourd'hui - environ 5 minutes de lecture.