Sorties d'agents et de modèles
Aperçu de Tencent Hy4. Tencent a publié Hy4 preview, une version nettement plus grosse que Hy3, avec un raisonnement élevé par défaut et un mode no_think. La communauté dispose déjà d'un quant officiel à ~2,38 bits et d'un GGUF d'environ 200 Go qui conserverait environ 98 % des performances BF16.
Inférence locale et matériel
Portage de FlashMLA sur sm_120. Un build communautaire étend FlashMLA aux GPU Blackwell grand public sm_120, avec des accélérations de 2 à 3× par rapport à PyTorch SDPA sur plusieurs workloads MLA épars, et une latence réduite de 8 % pour le décodage du cache KV en FP8.
Correctif Nemotron 16 Go. Les GGUF low-bit de Nemotron-3.5-Lightning étaient en réalité à ~4,70 bpw en raison d'une quantification par largeur de ligne ; un build corrigé de llama.cpp produit un vrai fichier à 3,07 bpw / 11,77 Gio qui gère un contexte de 262K sur 16 Go.
Qwen3.8-Flash-Next sur Mac. Un Qwen3.8-Flash-Next 2-bit de 79 Go a tourné sur un M5 Max de 128 Go avec une fenêtre de contexte de 350K via llama.cpp, y compris un prefill à froid de 333 s pour un prompt de 105K et un décodage spéculatif ngram-mod.
DeepSeek V4 Flash sur deux GPU. Sur des configurations 2x DGX Spark/GX10, DeepSeek V4 Flash 0731 atteint 67 à 84 tok/s en continu, avec un HumanEval Pass@1 local de 94,5 % contre 97,0 % pour GLM-5.3-Flash NVFP4. GLM a terminé le benchmark en à peu près la moitié du temps.
Contexte de 1M sur deux 5090. Un fork de NInfer ajoute le parallélisme tensoriel et un scaling YaRN ×4 pour exécuter Qwen3.8-27B NVFP4 avec un contexte de 1 048 576 tokens sur deux 5090. Il décode à 48–100 tok/s à 1M et maintient l'acceptation MTP là où vLLM tombe à zéro.
27B sur 16 Go. La quantification hybride et les paramètres de cache kvarn permettent à Qwen3.8-27B de tourner avec un contexte de 100K à 50 tok/s sur une RTX 4070 Ti SUPER de 16 Go, en utilisant le décodage spéculatif MTP et un cache KV à précision de queue.
Moteur MoE FreeToken. Des chercheurs de l'UC Berkeley et du MIT ont présenté FreeToken, un moteur open source qui coordonne dynamiquement les transferts d'experts MoE pour que les modèles épars de pointe puissent décoder sur des GPU grand public sans être bloqués par des cache misses PCIe/RAM.
Benchmarks et évaluations
Terminal Bench 4.0. Terminal Bench 4.0 est sorti avec un leaderboard mis à jour et un accent sur l'itération rapide pour lutter contre la saturation ; GLM-5.3 atteint un score au niveau de Fable 5, dans la marge d'erreur.
Transparence du benchmark finance. Une fiche de benchmark pour Ling-3.0-flash-Fin montre à quel point le scaffolding d'agent, les outils et les pipelines d'évaluation façonnent les résultats rapportés ; de nombreux runs ont utilisé ReAct avec recherche web et Python, et certains ensembles d'évaluation sont internes ou pas encore publics.
Recherche et infrastructure d'agents
Mémoire WikiSkill de Google. WikiSkill de Google Research donne aux agents une base de connaissances persistante, de type wiki, faite des échecs et succès passés, et regroupe des Agent Skills réutilisables qui guident le comportement sans modifier les poids du modèle.
Norme matérielle Anthropic. Anthropic développe MHS, une interface unifiée permettant aux agents de contrôler des dispositifs physiques comme des microscopes et des bras robotiques ; les premiers tests ont réduit l'intégration multi-machines de semaines à quelques heures, mais la supervision humaine reste nécessaire.
Couche de données pour agents. Une présentation de TOTVS soutient que les systèmes transactionnels et les data lakes ne sont pas optimisés pour le raisonnement des agents, gourmand en tokens et sensible à la latence, et décrit une évolution de l'accès aux données vers MCP et des modèles sémantiques.
LAION Big Video Dataset. LAION a publié BVD, un ensemble de données réservé à la recherche de 10 millions d'heures de vidéo, avec 55 millions de clips et 300 millions d'images fixes, reliant vidéo, audio et texte ; les modèles entraînés sur ces données ont surpassé les baselines InternVid de jusqu'à 2,1 points sur certains benchmarks.
Industrie et entreprises
Sony et Warner poursuivent Anthropic. Sony Music Publishing, Warner Chappell et d'autres éditeurs ont poursuivi Anthropic, l'accusant de torrenting et de scraping d'œuvres protégées pour entraîner Claude, et demandant des dommages-intérêts pouvant atteindre 150 000 $ par œuvre. Anthropic affirme qu'elle se défendra.
OpenAI rompt avec Cursor. OpenAI met fin à son contrat avec Cursor après le rachat de Cursor par SpaceX, invoquant l'historique des entreprises d'Elon Musk en matière de rupture de contrats. Anthropic a répondu en se positionnant comme le partenaire le plus fiable et s'est engagée à maintenir la puissance de calcul pour l'utilisation de Claude par Cursor.
Nvidia au-delà des GPU. Le discours de Nvidia sur ses résultats passe des parts de marché GPU à l'orchestration des datacenters et aux systèmes autour du GPU, un domaine où elle a développé du matériel de réseau et d'orchestration de pointe, alors que la puissance de calcul IA atteint l'échelle du gigawatt.
C'est tout pour aujourd'hui - environ 5 minutes de lecture.