Confrontation des modèles de pointe
Kimi K3 ébranle la frontière. Le Kimi K3 à poids ouverts de Moonshot AI rivalise avec les meilleurs modèles fermés, battant Claude Fable 5 sur certains benchmarks et relançant le débat ouvert vs fermé.
- → Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 while signaling the end of super cheap Chinese AI
- → Kimi K3, and what we can still learn from the pelican benchmark
- → [AINews] Kimi K3 2.8T-A50B: the largest open model ever released; Opus 4.8-class at Sonnet 5 pricing
- → Kimi K3 weights to be released on the 27th.
- → Kimi K3 ranks #1 on @AfterQuery's SpreadsheetBench 2, surpassing Claude Fable 5
- → Kimi: Threat or menace?
- → kimi.ai teasing a video with lots of 3's in it
- → [AINews] not much happened today
- → Kimi moment. I think the writing is on the wall for Anthropic and OpenAi
- → Kimi K3 is currently at the top of the leaderboard for Text Arena filtered for science queries.
- → Kimi K3 (max) beats Sonnet 5 on Simple Bench
- → Kimi K3 is top of nextjs eval
- → Just like Deepseek, China's Kimi K3 is forcing Western AI labs to question their compute advantage
- → Kimi K3 🌕, Gemini 3.5 delayed ⏳, crushing ARC-AGI 3 🤖
GPT-5.6 : Puissance et péril. La famille GPT-5.6 apporte l'appel d'outils programmatiques et des sous-agents parallèles, mais sa tendance à supprimer involontairement des fichiers et des bases de données souligne la nécessité d'un sandboxing.
- → The Sequence Radar #893: Last Week in AI: GPT-5.6, Grok 4.5, Muse Spark 1.1 and the Post-Chatbot Stack
- → OpenAI’s new flagship model deletes files on its own, people keep warning
- → GPT-5.6 is deleting user files when given full access, and OpenAI says it shouldn't but did
- → [AINews] Codex usage up >10x in 6 months to 7M users, +1M in the past ~day; did Codex overtake Claude Code??
Claude Fable 5 prolongé. Sous la pression de GPT-5.6 et Kimi K3, Anthropic a inversé ses plans et a maintenu Fable 5 sur les formules payantes, rivalisant directement sur l'accessibilité.
DeepSeek V4 se profile. DeepSeek taquine V4 avec une API à faible coût et des poids ouverts, tandis que les optimisations de la communauté permettent déjà à sa variante flash de fonctionner sur des GPU grand public à des vitesses utilisables.
Les agents entrent dans les flux de travail réels
Les agents de navigation arrivent. Anthropic a doté Claude Code d'un navigateur Web intégré avec des classificateurs de sécurité, et Cursor a lancé un agent général, faisant évoluer les assistants de codage vers l'exécution autonome de tâches.
Les agents gèrent des transactions réelles. L'architecture d'agent de DoorDash a augmenté les conversions de 24 %, et le benchmark de Stripe montre que les agents peuvent coder des intégrations mais échouent souvent à la validation, soulignant des lacunes de fiabilité.
Les agents de production trébuchent. La plupart des agents d'entreprise restent des chatbots ; 54 % des entreprises ont eu des incidents de sécurité liés aux agents, et les experts soutiennent que les agents ont besoin de primitives opérationnelles cloud-native comme les microservices.
- → How to Debug Coding Agents with LangSmith Traces
- → The agent security gap: 54% of enterprises have already had an AI agent incident, and most still let agents share credentials
- → The AI context gap: Enterprise AI organizations have a trust problem, not a retrieval problem — and most are still building the fix
- → The agent evaluation gap: Enterprise AI organizations have a reality-alignment problem, not a coverage problem — and most are shipping to production anyway
- → Cloud Native Infrastructure Emerges as the Foundation for Trustworthy Agentic AI
- → QCon AI Boston: Production AI Moves Beyond Prompts to Platforms, Harnesses, and Evals
Infrastructure IA, financement et course aux centres de données
Les centres de données rencontrent une résistance. S&P a dégradé Oracle en raison du risque lié aux dépenses d'investissement en IA, tandis que les protestations locales et le moratoire de New York sur les centres de données hyperscale reflètent une opposition croissante à l'infrastructure IA.
Le financement de l'IA explose. Databricks a levé des fonds à une valorisation de 188 milliards de dollars, Meta négocie un bail de centre de données de 10 milliards de dollars avec Anthropic, et Nous Research a obtenu 75 millions de dollars pour son agent open-source.
Paris sur l'énergie et le matériel. Les entreprises énergétiques ont levé le plus de fonds depuis l'ère dot-com pour alimenter l'IA, et un prêt de 400 millions de dollars adossé aux puces SambaNova signale un investissement croissant dans le matériel IA non-GPU.
Percées de l'IA sur appareil
Les modèles 1-bit arrivent sur les téléphones. Bonsai de PrismML compresse Qwen3.6-27B à 3,9 Go tout en conservant 90 % des scores de benchmark, permettant des agents d'appel d'outils sur l'appareil ; Apple serait en pourparlers.
- → Bonsai 27B: The First 27B-Class Model to Run on a Phone
- → Bonsai 27B: 1-bit dense LLM running locally in your browser using custom WebGPU kernels
- → Prism-ML Bonsai Qwen 3.6 27B
- → PrismML’s new Ternary Qwen3.6 27B runs near fp16 precision on 10GB of memory!!!
- → So what's the consensus on 1bit models? Is it still a pipe dream?
- → PrismML Bonsai 27B is surprisingly usable on the Jetson Orin Nano 8GB
- → Is anyone having any luck with the Ternary Bonsai 27B DFlash?
- → Can we get a "not base model" flair?
- → Bonsai 27B runs locally on an iPhone - a 27B model in 3.9GB
- → User experience of Bonsai-Ternary-27B on 4060Ti 16GB for KB management and productivity assistant use cases
- → Bonsai 27B is a full open reasoning model that fits on an iPhone
- → Bonsai-27B & Ternary-Bonsai-27B - Updates (on PRs)
- → Apple in talks with startup PrismML that shrinks AI models to run on an iPhone
Les laboratoires domestiques exécutent des modèles de pointe. Les optimisations de llama.cpp comme DFlash accélèrent les modèles MoE jusqu'à 6x, et un téléphone OnePlus a diffusé des experts depuis la mémoire flash pour exécuter un modèle de 60 Go à 1,3 tok/s.
- → I tested all llama.cpp's speculative decoding methods on Qwen 3.6 27B: MTP ~2.7x, DFlash ~3.7x, n-gram stack ~6x on real coding. Local AI win. My findings on RTX 6000 PRO.
- → DFlash makes Qwen3.6 27B 2.2x faster with no quality loss
- → GPT-OSS-120B, Qwen 30B and Gemma 26B on an Android phone at 1-5 tok/s: +60GB model, 11GB of RAM, CPU only
Politique, procès et impasse open-source
Bataille juridique Apple-OpenAI. Apple a poursuivi OpenAI pour secrets commerciaux, alléguant le débauchage de plus de 400 employés, dont le directeur du matériel, menaçant l'introduction en bourse d'OpenAI et la confiance dans le cloud.
- → Apple sues OpenAI after ex-engineer allegedly used bug to steal trade secrets
- → The wildest allegations in Apple’s trade secrets lawsuit against OpenAI
- → The 6 wildest claims in Apple’s lawsuit against OpenAI
- → OpenAI pushes back on Apple trade secret lawsuit
- → Sam Altman didn’t need another lawsuit
- → How Apple’s big lawsuit could disrupt OpenAI’s IPO plans
- → Apple’s plot to crush OpenAI
- → Apple’s lawsuit couldn’t come at a worse time for OpenAI
Essor de l'open-source chinois. Les modèles chinois représentent désormais 41 % des téléchargements sur HuggingFace, Kimi K3 rivalise avec les leaders occidentaux, et la Chine a lancé un organe de gouvernance de l'IA parallèle excluant l'Occident.
- → The real AI race may no longer be at the frontier
- → Source: the Trump administration and industry groups discussed streamlining US open model releases of equal or lesser capability to leading Chinese open models
- → Chinese President Xi Jinping speaks at World AI Conference and reaffirms commitment to open source to promote"openness and win-win"
- → China’s Xi Touts Open-Source AI and Takes a Swipe at U.S. Dominance
- → China's new World Artificial Intelligence Cooperation Organization is President Xi's clearest play yet for a parallel AI order
Les exigences de responsabilité augmentent. Les régulateurs allemands ont tenu les chatbots responsables du contenu, xAI a poursuivi un utilisateur pour avoir généré du CSAM, et Demis Hassabis a proposé un organe de type FINRA pour les examens de sécurité des modèles de pointe.
Voilà le bilan de la semaine - à dimanche prochain.