Modèles locaux et workflows d'agents
Qwen3.8-27B low quant convaincant. Les utilisateurs trouvent que Qwen3.8-27B reste robuste pour le codage agentique même en Q3_xxs et Q6 ; les presets de raisonnement bas ou moyen obtiennent des scores élevés et réduisent les boucles, tandis que preserve_thinking empêche les raisonnements répétés.
Purgatoire : 16 Go de VRAM. Une configuration Windows avec 16 Go de VRAM exécute Qwen3.8-27B avec MTP désactivé, un cache quantifié et un contexte d'environ 100 000 tokens en déportant le module de vision vers la RAM.
Inférence locale plus rapide. vLLM sur deux RTX 3090 atteint 143 tok/s pour Qwen3.8-27B ; des recettes dédiées Strix Halo fournissent des options Q8/Q6/Q5 avec Unsloth Dynamic Quants.
Simulateur de vol MacBook 63 h. Un Qwen3.8-27B quantifié en 3 bits sur MacBook Air M2 a mis 63 heures mais a fini par produire un simulateur de vol HTML fonctionnel, prouvant que le codage agentique local est possible mais lent.
Harnesses et infrastructure d'agents
Le harness fait la différence. Le harness personnalisé de Nvidia, avec gestion de la mémoire et un composant superviseur, a fait passer Claude Opus 5 de 30 % à 100 % sur ARC-AGI-3, montrant que le wrapper d'agent compte plus que le choix brut du modèle.
DeepSeek Flash vision. DeepSeek-V4-Flash-Vision-Exp ajoute la compréhension d'images pour les workflows d'agents et se rapproche d'Opus 4.8 sur les benchmarks internes d'agents ; le harness mis à jour accepte les entrées d'images dans les commandes et MCP/ACP.
Cloudflare agents IA. Cloudflare a réduit d'environ 85 % les issues ouvertes d'Astro grâce à des agents GitHub Actions isolés qui reproduisent, diagnostiquent, vérifient et corrigent ; la société convertit également les standards d'ingénierie en contrôles appliqués par l'IA.
MCP Azure DevOps. Le serveur MCP hébergé par Microsoft pour Azure DevOps est généralement disponible, mais Claude Desktop, ChatGPT et Cursor ne peuvent pas encore s'y connecter, car l'enregistrement du client d'authentification Entra n'est pas pris en charge.
LLM CLI : mises à jour. llm 0.32.1 corrige un verrouillage de dépendance OpenAI défectueux, et llm-openrouter 0.7 ajoute les traces de raisonnement et les outils côté serveur Shell, WebFetch et WebSearch.
Sorties de modèles et sécurité
Jailbreak d'Opus 4.6. TechCrunch a constaté que Claude Opus 4.6 produit du contenu sexuel explicite dans 10 requêtes directes sur 10 ; les anciens modèles partagent un jailbreak en plusieurs tours, tandis que les versions récentes d'Opus résistent.
Claude Mythos 5 : sécurité. Anthropic utilise Claude Mythos 5 dans un scanner de sécurité de code destiné aux clients entreprises, propose des correctifs soumis à validation humaine et donne aux partenaires un accès sans interaction directe avec le modèle.
Génération d'images transparentes. Le GPT-Image-2 d'OpenAI peut désormais générer des PNG sans arrière-plan via l'API, utile pour les photos de produits et les icônes ; l'alpha est intégré lors de la génération.
Aperçu de dots3-note. llama.cpp ajoute la prise en charge de dots3-note, un modèle MoE de 280B avec 16B de paramètres actifs, un contexte de 512K et une compréhension multimodale du texte, des images, de la vidéo et de l'audio.
Recherche et benchmarks
SWE-bench Science. Un nouveau benchmark de 119 tâches de logiciels scientifiques montre que le meilleur agent, Claude Code avec Opus-5 max, obtient un score inférieur à 50 %, avec des modes d'échec courants dans les connaissances scientifiques, l'exploration, la généralisation et l'intégration.
Juge de traces économique. LangSmith a affiné un modèle Qwen avec Fireworks pour détecter les erreurs perçues dans les traces de production, égalant les performances de pointe à un coût jusqu'à 100 fois inférieur.
Loi d'échelle des simulations. Simile AI, avec une série B de 2 milliards de dollars, exécute des simulations de comportement humain pour les entreprises du Fortune 100 et revendique une précision de 85 à 99 % par rapport aux groupes de discussion ; le PDG Joon Sung Park aborde le passage des agents génératifs aux jumeaux numériques.
Industrie et business
Accord Nvidia-Poolside. Nvidia prend une licence sur la Model Factory de Poolside et embauche 109 employés pour 6 milliards de dollars, en plus d'investir 1 milliard ; l'accord n'est ni une acquisition ni un acqui-hire.
Investissements data centers. Nvidia prend une participation minoritaire dans Cloverleaf Infrastructure pour accélérer le développement de data centers, après avoir investi 1,5 milliard de dollars dans SB Energy.
Data centers : opposition. 75 % des Américains s'opposent désormais aux data centers près de chez eux, contre 42 % il y a un an, avec des inquiétudes concernant l'électricité, l'eau et l'utilisation des terres.
Course IA États-Unis-Chine. Les États-Unis rédigent une lettre demandant aux pays partenaires de choisir leur camp dans l'IA, avertissant que rejoindre l'initiative chinoise les exclurait du Pax Silica.
Revenus d'OpenAI en hausse. GPT-5.6 Sol a fait bondir les revenus trimestriels d'OpenAI de 35 % et ceux du segment entreprise de plus de 50 %, dépassant la croissance de l'API métier d'Anthropic au T3.
C'est tout pour aujourd'hui - environ 5 minutes de lecture.