Modèles locaux et matériel
Gains de vitesse de Qwen3.8-27B. Le décodage spéculatif DFlash2 propulse Qwen3.8-27B à 218 tok/s sur deux 3090, environ 200 sur une 5090, et 124 sur une seule 3090 avec un moteur optimisé. Les quants GGUF DFlash2 sont disponibles.
Prochain Qwen de taille moyenne. Le community manager de Qwen indique qu'un nouveau modèle open-weight de taille moyenne est attendu la semaine prochaine, probablement plus de 100B de paramètres, sans accès anticipé.
Prise en charge edge de Ling-3.0. llama.cpp prend désormais officiellement en charge Ling-3.0 (BailingMoE3). La variante tiny exécute un contexte complet de 128K sur un Orin Nano 8GB à 249 $ à 33 tok/s, tandis qu'un Arc B580 atteint ~114 tok/s.
Gains de vitesse de DeepSeek V4 Flash. Des kernels optimisés et le préchauffage du cache KV réduisent un tour de chat sur Mac Studio M3 Ultra de 6 à 20 secondes à 1,6 s. Une configuration 4x RTX 3060 traite les prompts à ~100 tok/s avec un quant de 144 GiB.
Tour d'horizon des modèles low-bit. Le ternaire Bonsai 27B fonctionne désormais sur CUDA/Vulkan grand public ; le Mach-1 Additive 35B tourne jusqu'à 120 t/s sur les ordinateurs portables grand public. De nouvelles variantes basées sur Qwen3.8-27B sont en développement.
Outils et frameworks d'agents
Évaluateurs d'agents ajustés. LangChain présente des évaluateurs ajustés (Tuned Evaluators) qui attachent automatiquement un retour d'erreur perçue aux traces de production. Cela utilise un modèle spécialisé, réduisant le coût d'évaluation jusqu'à 82 %.
Benchmark de recherche d'agents. Le Search Index d'Artificial Analysis classe Parallel, Exa, Firecrawl et d'autres par qualité, coût et vitesse pour les agents. Une meilleure qualité de recherche a réduit l'utilisation de tokens de plus de 40 %.
WriteGuard pour MCP. WriteGuard de Cloudflare, désormais en bêta privée, ajoute des politiques centralisées, l'attribution et des journaux d'audit pour les actions d'écriture via les serveurs MCP.
Usines logicielles Warp. Warp Factories est une couche d'infrastructure qui aide les petites entreprises à déployer des agents de codage IA en utilisant le modèle d'usine logicielle.
Maquettes Claude Code. La commande /design d'Anthropic dans Claude Code crée des maquettes d'interface dans le terminal, en accord avec le style de la base de code existante avant le développement.
Sécurité, sûreté et politique
Refonte de la sécurité d'OpenAI. Suite à l'incident Hugging Face et aux preuves qu'Astra pourrait atteindre une capacité critique en cybersécurité, OpenAI a suspendu le RL pendant deux semaines et renforcé les sandboxes. Sa plus grande campagne de RL de pointe prévue reste en attente.
Copilot révèle les garde-fous. Des chercheurs ont demandé à Microsoft 365 Copilot d'expliquer ses propres garde-fous de confirmation utilisateur, puis ont construit une exploitation par clic sur lien pour exfiltrer des données sans confirmation.
ChatGPT pour adolescents. ChatGPT pour adolescents s'applique automatiquement aux utilisateurs de moins de 18 ans, avec des restrictions de contenu plus strictes, un mode étude et des contrôles parentaux. Il vise à réduire la triche et les contenus nocifs.
Débat sur les modèles ouverts d'Amodei. Le PDG d'Anthropic, Dario Amodei, soutient que les modèles ouverts déplacent le pouvoir vers les propriétaires de puces et défend les propositions de réglementation de l'IA. Des critiques, dont LeCun et Sacks, l'accusent de semer la peur.
Industrie et entreprises
Cursor lance Origin. Cursor lance Origin, un rival de GitHub pour l'hébergement de code, avec des fonctionnalités natives pour agents et un écosystème d'applications prévu.
La valorisation d'Etched double. Etched a levé 700 M$ à une valorisation de 21 G$, doublant en un mois, après que Jane Street a testé ses puces d'inférence prefill/decode.
Demande de routage de modèles. L'achat d'OpenRouter pour 7 G$ par Stripe et le ARR de 300 M$ de Glean soulignent la demande croissante pour le routage de modèles à mesure que les modèles open-weight gagnent du terrain.
Recherche et études
Calibrage de la mémoire des agents. Une étude de Hugging Face montre que les effets de la mémoire agentique varient selon le niveau de modèle : gpt-oss-120b a gagné +16,1 points de pourcentage d'achèvement de tâche avec des directives complètes, tandis que les modèles plus faibles nécessitent une récupération compacte.
Données indépendantes sur l'utilisation de l'IA. L'AI Observatory de Stanford a agrégé des conversations réelles et a constaté que l'utilisation de l'IA diffère considérablement selon les modèles, les cas d'utilisation professionnelle étant moins courants que ce que les entreprises prétendent.
La compaction perd des instructions. Des chercheurs de Penn State constatent que seulement 17 % des contraintes de session survivent à la compaction du contexte ; un petit LLM additionnel récupère la plupart des instructions perdues.
L'auto-amélioration n'est pas imminente. Une étude menée par Princeton constate que les agents IA peuvent résoudre des problèmes d'ingénierie mais manquent de jugement pour la recherche IA ouverte, ce qui suggère que l'auto-amélioration récursive pourrait prendre plus de temps.
C'est tout pour aujourd'hui - environ 5 minutes de lecture.