Sorties de modèles et d'agents
Grok 4.6 et Grok Bot. SpaceXAI a publié Grok 4.6, qui égalise le GPT-5.6 Sol d'OpenAI et ne se classe derrière que Claude Opus 5 sur l'indice Artificial Analysis tout en cassant les prix des modèles de pointe, et a présenté Grok Bot, un compagnon IA toujours actif qui travaille depuis son propre ordinateur cloud pour accomplir les tâches assignées.
Qwen 3.8 grande et petite. Qwen3.8-2.4T-A95B est désormais disponible, et une page pour Qwen3.8 27B est brièvement apparue sur ModelScope avant d'être retirée, indiquant une sortie imminente. Les amateurs d'exécution locale planifient déjà des découpages matériels pour le modèle 2.4T.
Mise à jour de DeepSeek V4 Pro. Le V4 Pro 0813 de DeepSeek est disponible via API sur OpenRouter, sans page d'annonce officielle pour l'instant ; les poids ouverts sont probables compte tenu des versions précédentes. Son comportement de raisonnement diffère sensiblement entre les niveaux de raisonnement faible, moyen et élevé.
Modèles de vision edge. Le LFM2.5-VL-3B de Liquid AI offre un ancrage UI beaucoup plus solide et peut fonctionner sur téléphones, tandis que le North Micro Vision de Cohere sous licence Apache-2.0 prend en charge les images en résolution native dans un format compact de 2,4 milliards de paramètres.
Le modèle à mille milliards de paramètres de Nvidia. Nvidia construirait Nemotron 4 avec au moins mille milliards de paramètres et triplerait ses dépenses de formation cloud à 28 milliards de dollars d'ici 2031, visant à concurrencer les modèles chinois à poids ouverts.
Développement d'agents et outils
Agents gérés et BYOC. LangChain a lancé Managed Deep Agents comme prochaine étape après les frameworks, et a rendu LangSmith BYOC généralement disponible sur AWS, permettant aux entreprises de conserver les traces et données des agents dans leur propre VPC.
Application ChatGPT sur Linux. OpenAI a publié une application de bureau Linux regroupant ChatGPT, ChatGPT Work et Codex, mais l'utilisation native de l'ordinateur n'est pas disponible au lancement.
Inférence locale et matériel
Prix du RTX PRO 6000 doublé. Nvidia a presque doublé le PDSF du RTX PRO 6000 Blackwell de 96 Go à 16 000 $, alors que les précommandes étaient inférieures à 8 000 $ l'année dernière.
Streaming DSpark sur un seul GPU. Un seul RTX PRO 6000 96 Go peut exécuter DeepSeek V4 Flash 284B à environ 31 tokens par seconde avec le drafter de DSpark en RAM système, environ 15 à 17 % plus rapide que la référence sans drafter à utilisation VRAM égale.
Muse Glimmer sur Mac. Le Muse Glimmer 30B de Meta fonctionne désormais jusqu'à environ 3,3 fois plus vite sur Apple Silicon avec mlx-dspark, offrant une qualité 8 bits à des vitesses proches du 4 bits sur un Mac de 48 Go.
Quantification du cache KV de Gemma 4. L'entraînement tenant compte de la quantification aide Gemma 4 31B à conserver sa qualité sous une quantification agressive du cache KV, rendant l'inférence à grand contexte plus pratique.
Industrie et affaires
Cognition lève des fonds à 40 milliards $. Le fabricant d'agents de codage IA Cognition serait en négociations pour lever des fonds à une valorisation de 40 milliards de dollars après avoir atteint un rythme de revenus annualisés d'un milliard de dollars, contre 492 millions il y a trois mois.
Lovable atteint 13,3 milliards $. La startup de vibe-coding Lovable a levé 400 millions de dollars à une valorisation de 13,3 milliards de dollars après avoir dépassé 500 millions de dollars de revenus annualisés, avec 60 millions de projets hébergés.
IA d'entreprise de Thrive Holdings. Thrive Holdings, soutenu par OpenAI, a levé 2 milliards de dollars à une valorisation de 12 milliards de dollars pour acquérir des entreprises traditionnelles et mettre en œuvre l'IA, s'étendant au-delà de la comptabilité et de l'informatique.
La part de Gemini chute. Les données de marché de Pangram, OpenRouter et Similarweb montrent un déclin de l'utilisation de Gemini, Pangram enregistrant une chute à 1,9 % de l'écriture IA tandis qu'OpenAI détient plus de 50 %.
Claude se lance dans le juridique. Anthropic a embauché Robert Mahari, fondateur de l'IA juridique, comme premier responsable de Claude pour le juridique, s'appuyant sur des plugins et partenariats juridiques antérieurs.
Politique, sécurité et société
Fuite dans la chaîne d'approvisionnement LiteLLM. Une attaque de la chaîne d'approvisionnement sur LiteLLM a exposé des téraoctets d'identifiants de plus de 2 500 organisations, dont Microsoft, Amazon et Samsung, via des paquets PyPI malveillants.
Filigranes de sortie Claude. Anthropic filigrane désormais les sorties de Claude pour se conformer à la loi européenne sur l'IA, mécontentant les utilisateurs qui craignent que cela révèle l'utilisation de l'IA au travail ou à l'école.
Twitch entraîne par défaut. Twitch entraînera les modèles IA d'Amazon sur le contenu des streamers par défaut, avec une option de désactivation désormais disponible ; la politique a suscité des réactions négatives.
ShieldFont remplace le texte. Des designers ont publié ShieldFont, une police qui affiche un texte normal aux utilisateurs mais substitue des mots dans le HTML sous-jacent pour empoisonner les scrapers.
Hinton, Li et Ng sur l'IA ouverte. Lors de l'Ai4, Geoffrey Hinton, Fei-Fei Li et Andrew Ng ont plaidé pour maintenir l'IA ouverte afin d'éviter que quelques entreprises contrôlent l'accès, malgré les préoccupations de sécurité concernant les poids ouverts.
Des livres rares détruits. Les libraires craignent que les entreprises d'IA achètent des livres rares et les détruisent pour l'entraînement, malgré des alternatives de numérisation non destructives.
Recherche et repères
Raisonnement topologique MindTopo. Le benchmark MindTopo de Microsoft Research montre que les modèles multimodaux sont bons en reconnaissance topologique statique mais ont du mal avec la planification interactive qui nécessite de maintenir des relations dans le temps.
Invites reconstruites à partir de la sortie. L'IIT Bombay et Adobe Research ont développé Previous-Token Prediction, qui peut reconstruire les invites des LLM à partir du texte de sortie avec une précision quasi parfaite sans les poids du modèle.
C'est tout pour aujourd'hui - environ 5 minutes de lecture.