Sorties d'agents et de modèles
Gadgets Muse. Meta met en open source le firmware et un SDK pour fabriquer du matériel DIY relié à son agent Muse : écrans E Ink, clés HDMI, avec un Discord pour l'entraide.
L'agent Dot d'OpenAI. Dot, le nouvel agent d'OpenAI, se comporte comme un logiciel d'entreprise capable aussi de commander à dîner. Il tourne dans une machine virtuelle avec accès à des applications comme Blender et GIMP, et se positionne comme un collègue plutôt qu'un assistant personnel.
Modèle humanoïde Unitree. Unitree a publié UnifoLM-WLA-1.0, un modèle 6B entraîné sur environ 2 500 heures de données de robots réels, qui gère 64 tâches de corps entier et de table sur le G1 en combinant flux optique et MMDiT pour le contrôle continu.
FrogNano pour le code. FrogNano-4B-2609, de Microsoft, est un modèle agentique dérivé de Qwen3.5-4B, post-entraîné sur 1 500 tâches SWE synthétiques avec des récompenses exécutables pour améliorer l'ingénierie logicielle à l'échelle du dépôt dans un format compact.
Cloudflare Clef. Cloudflare a publié Clef et Clef-flash, des modèles de décision qui produisent des probabilités sur des réponses prédéfinies, avec une latence médiane descendant jusqu'à 39 ms : de quoi laisser des agents agir sans intervention humaine dans la boucle.
Outils et frameworks
Moteur MegaCapybara. Un moteur d'inférence dédié aux RTX 5090 et à Qwen3.8 27B revendique environ deux fois la vitesse de décodage de NInfer, avec plus de 500 t/s en solo et plus de 2 000 t/s sur 12 agents, grâce à des kernels dynamiques et une gestion de cache.
Mises à jour llama.cpp. llama.cpp prend désormais en charge les modèles de décision, et une pull request CUDA fusionne les experts partagés pour accélérer les architectures MoE comme Qwen 35B A3B.
Sous-titres avec mlsubgen. Un nouvel outil local génère des sous-titres en 45 langues entièrement sur votre machine : il détecte la langue de chaque passage, réconcilie deux moteurs de reconnaissance vocale avec un LLM local et privilégie les sous-titres intégrés déjà présents.
Recherche et avancées des modèles
Architecture mémoire Spotlight. Spotlight, de Percepta, remplace l'attention par une mémoire inscriptible non bornée que le modèle indexe lui-même. L'intelligence est ainsi séparée de la connaissance, ce qui permet aux capacités de progresser sans toucher aux poids.
Mises à jour GPT-6. OpenAI a publié un guide de la famille GPT-6 et annoncé les nouveautés du DevDay : GPT-6.1 Sol, le computer use pour l'API Agents, les environnements Codex dans le cloud et une API Decisions.
AstaBrief en open source. Hugging Face ouvre le code d'AstaBrief, un petit modèle entraîné spécialement pour produire vite des rapports scientifiques sourcés, conçu pour rester ancré dans les preuves et vérifier ses sorties.
Industrie et business
Apple verrouille l'accès disque. Apple ajoute des contrôles au Full Disk Access de macOS face aux risques liés aux agents IA, après que Meta Muse aurait lu des messages sans autorisation. Meta assure que cet accès repose sur un opt-in, et Apple veut une action très explicite de l'utilisateur.
Résistance aux data centers. Amazon promet 1 milliard de dollars aux communautés qui hébergent ses data centers et le CEO d'AWS, Matt Garman, appelle à lever les moratoires en dénonçant de la désinformation étrangère. Microsoft, de son côté, développe le biomimétisme sur ses sites face à l'opposition locale.
L'IA rebaptisée super intelligence. La Maison-Blanche a fait signer à de grands patrons de la tech un pacte de sécurité sur l'IA, et Donald Trump a signé un décret qui rebaptise l'IA « super intelligence » — alors que seuls 2 % des consommateurs achètent des produits d'IA.
Remue-ménage chez OpenAI. OpenAI a licencié trois chercheurs et un quatrième est parti après qu'une enquête a établi qu'ils avaient transmis des informations confidentielles à une organisation externe de sécurité de l'IA.
Uber Eats accélère sa recherche. Uber a reconstruit son pipeline de recherche, réduisant la latence de bout en bout de 50 %, en s'appuyant sur le codage agentique pour identifier et valider les optimisations.
Airbnb, l'IA de l'intérieur. Ahmad Al-Dahle, CTO d'Airbnb, applique une stratégie d'IA « inside-out » : se servir d'abord de l'IA générative en interne pour accélérer le développement produit, puis transformer l'expérience client.
IA locale et matériel
Strata avec Qwen3.8 Next. Des utilisateurs rapportent que Strata avec Qwen3.8 Next tourne à 45 à 70 t/s sur un ensemble DDR4 + 7900XTX lent, et à 150 à 200 t/s sur une RTX 5090 bridée en puissance avec 96 Go de DDR5, surpassant nettement llama.cpp.
L'iPhone en second GPU. Un iPhone 17 Pro Max peut accélérer le prefill de Qwen 3.8 27B de 29 à 44 % sur un MacBook 24 Go, à condition d'être relié en USB-C et d'exécuter les couches supérieures sur le GPU du téléphone.
Cartes Ascend 96 Go. Deux cartes Huawei Atlas 300I Duo de 96 Go chacune font tourner Qwen3.8 Flash-Next à environ 30 t/s après optimisation de la pile logicielle, même si elles ne remplacent pas CUDA sur étagère.
Coûts DGX Spark et 5090. Nvidia lance un DGX Spark de 64 Go tandis que le modèle d'origine, à 128 Go, passe à 6 950 $ ; et acheter une RTX 5090 chez Micro Center exigerait désormais des papiers de non-réexportation.
C'est tout pour aujourd'hui - environ 5 minutes de lecture.