Modèles & Compétition
OpenAI a publié GPT-5.6 en trois niveaux de raisonnement et lancé ChatGPT Work pour des tâches autonomes de plusieurs heures, mais les limites d'utilisation et une interface confuse ont suscité des plaintes, promettant des corrections. OpenAI a publié GPT-5.6 en trois niveaux de raisonnement et lancé ChatGPT Work pour des tâches autonomes de plusieurs heures, mais les limites d'utilisation et une interface confuse ont suscité des plaintes, promettant des corrections.
- → OpenAI launches its new family of models with GPT-5.6
- → The new GPT-5.6 family: Luna, Terra, Sol
- → OpenAI rolls out GPT-5.6 after government greenlight — and announces ‘ChatGPT Work’
- → OpenAI says GPT 5.6 is the ‘preferred model’ for Microsoft Copilot 365 amid breakup chatter
- → OpenAI wants its new tool to do your work for you and with you
- → The ChatGPT browser is already dead
- → OpenAI is shutting down Atlas, but its AI browser ambitions are still growing
- → How did the government decide OpenAI’s frontier model was safe to release?
- → OpenAI pairs its GPT-5.6 public rollout with ChatGPT Work, a new agent that handles entire workflows
- → OpenAI's GPT-5.6 Sol autonomously post-trained the smaller Luna model with a "fairly underspecified prompt"
- → OpenAI kills its Atlas browser after just eight months and folds everything into ChatGPT
- → GPT-5.6 Sol nearly matches Fable 5 on aggregated benchmarks at one-third the cost
- → OpenAI staffer maps out which of GPT-5.6 Sol's five reasoning levels fits which task complexity
- → OpenAI admits it "didn't get everything quite right" with ChatGPT Work launch and scrambles to fix UX and costs
Claude Fable 5 domine les benchmarks. Claude Fable 5 d'Anthropic a dominé les benchmarks Artificial Analysis, mais son coût élevé a conduit l'entreprise à recommander de l'utiliser comme planificateur déléguant à des modèles moins chers, réduisant les dépenses d'environ 40% tout en conservant la plupart des capacités.
Blitz agentique de Meta et répercussions sur la vie privée. Meta a lancé Muse Spark 1.1, un modèle de codage à haut contexte sous-cotant ses rivaux, tandis que son générateur d'images Muse a été retiré après avoir permis une utilisation non autorisée de visages Instagram, relançant les débats sur le consentement.
- → Meta just launched a new AI generator, Muse Image, and users are already pushing back over use of their photos
- → Meta’s new Muse Image model can pull other Instagram users into AI photos
- → Muse Image is technically impressive, but Meta's use of Instagram photos raises questions
- → Meta wants its AI glasses to seem less creepy. Its AI strategy says otherwise.
- → Meta tests always-on AI glasses that capture your entire day
- → Meta enters the crowded AI coding battle with Muse Spark 1.1
- → Meta says its new AI model is ready to compete on coding
- → Meta are apparently working on an open source variant of Muse Spark.
- → Introducing Muse Spark 1.1
- → Meta's Muse Spark 1.1 API pricing squeezes OpenAI and Anthropic as the AI price war heats up
- → GPT-5.6 🚀, Muse Spark 1.1 ✨, ChatGPT Work 💼
- → Meta removes controversial AI feature on Instagram after backlash
- → Meta turns off the Instagram feature that let users make AI deepfakes of public accounts
Vague open source chinoise. Les modèles chinois représentent désormais plus de 30% du trafic OpenRouter ; HY3 de Tencent et GLM‑5.2 fonctionnent sur du matériel local, MiniMax prévoit une publication ouverte de 2,7 billions de paramètres, et la conception de puces DeepSeek signale une intégration verticale dans un contexte de préoccupations américaines.
- → This is what Hy3 is capable of. Mother of god.
- → llama.cpp: Hy3 PR + GGUFs
- → Chinese AI models regularly pass 30 percent on OpenRouter as cost gap widens
- → Chinese AI models are gaining ground with U.S. companies as OpenAI, Anthropic costs surge
- → Why the rise of open source AI isn’t hurting Anthropic … yet
- → Chinese AI startup MiniMax plans to open-source a 2.7 trillion parameter model later this year
- → 4-bit GLM-5.2 (753B MoE) on 4× DGX Spark: 70.8% on Terminal-Bench 2.1 vs 81.0% for the full model
- → Running GLM 5.2 on 4xGB10 with a 100G Switch, 330k ctx, ~25 t/s tg, ~650 t/s pp
- → I created a 140 GB IQ2_XXS REAP quant of GLM 5.2 for coding. Looking for testers.
- → Hy3 (295B MoE) and NVIDIA Nemotron-Labs-Audex-30B-A3B (audio-capable 30B MoE) GGUF quants
- → Tencent-HY3 is the real deal on 128GB!
- → The U.S. tech industry is increasingly anxious about the rising power and competitive price of open-source AI models from China — and whether the Trump administration will respond with yet another executive order | Politico
- → China's DeepSeek developing its own AI chip, sources say
Ingénierie des agents & Infrastructure
Bun réécrit par 64 agents. Claude Fable 5 a orchestré 64 instances parallèles pour réécrire Bun de Zig à Rust en 11 jours, produisant plus d'un million de lignes de code et corrigeant 128 bugs pour un coût de 165 000 $.
L'audit SWE‑Bench Pro échoue. OpenAI a constaté qu'environ 30% des tâches SWE‑Bench Pro étaient défectueuses et a retiré son approbation, faisant écho aux préoccupations antérieures d'Artificial Analysis et sapant l'évaluation du codage agentique.
Modal lève 355 millions de dollars. Modal a obtenu 355 millions de dollars pour construire une infrastructure cloud spécialement conçue pour les agents IA, axée sur des environnements sandboxés à itération rapide pour les logiciels autonomes.
Agents temporaires Cloudflare. Cloudflare a introduit des comptes temporaires permettant aux agents IA de déployer des Workers sans identifiants permanents, avec expiration si non réclamés, fluidifiant les flux de travail pilotés par agents.
Les agents atteignent les GPU locaux. De nouvelles techniques de quantification et des configurations GPU rentables permettent désormais d'exécuter des modèles MoE sur du matériel grand public, mais les benchmarks montrent que les quantifications de faible précision peuvent gravement dégrader les tâches agentiques, incitant à une sélection minutieuse des quantifications.
- → Qwen3.5 122B is the best?
- → Qwen3.6-27b does not understand software architechure.
- → Qwen 3.6 Q2-FP8 Terminal Bench 2 and GPQA Scores
- → Has anyone tested how quantization hits different capabilities separately? My results are surprising.
- → 2.5x faster Qwen3.6 NVFP4 Unsloth quants
- → Ultra budget 20GB vram with 448GB/s for $100 bucks.
- → I benched quad 5060Tis for code generation with Qwen3.6-27B so you don't have to (it's really good)
Sécurité, Juridique & Interprétabilité
Jacobian Lens cartographie l'esprit du modèle. Le Jacobian Lens d'Anthropic révèle un petit ensemble de représentations verbalisables qui capturent le raisonnement central d'un modèle, permettant la détection d'hallucinations, le contrôle des sorties et, comme le montrent les démonstrations communautaires, la création immédiate de variantes nuisibles.
- → Anthropic Research - "Verbalizable Representations Form a Global Workspace in Language Models"
- → Claude's hidden inner monologue is now readable thanks to Anthropic's new Jacobian Lens
- → I tested Anthropic’s new Jacobian Lens on open models, then it turned into a local-model hallucination router
- → Anthropic found a hidden space where Claude puzzles over concepts
- → I created a super harmful model ! :D (by tweaking it's J-Space!!!)
Ransomware piloté par un agent. Sysdig a documenté un agent IA qui a géré l'exécution technique d'une attaque par ransomware, bien qu'un humain ait mis en place l'opération, soulignant les capacités et limites actuelles des logiciels malveillants agentiques.
Crises d'usage abusif de l'IA. Un procès allègue que Grok de xAI a généré des images CSAM, tandis que Boko Haram utilise des chatbots pour planifier des attaques ; ces incidents soulignent le besoin urgent de garde-fous de sécurité alors que les capacités agentiques augmentent.
Apple poursuit OpenAI. Apple a déposé une plainte fédérale accusant OpenAI d'avoir débauché plus de 400 employés pour voler des secrets commerciaux matériels, potentiellement pour construire un smartphone IA rival, intensifiant les batailles juridiques dans l'industrie de l'IA.
Voilà le bilan de la semaine - à dimanche prochain.