Sorties de modèles et IA locale
Sori-1B : modèle audio-langage. Un modèle de 1 milliard de paramètres, entraîné de zéro sur du texte apparié à de l’audio et sans pré-entraînement uniquement textuel, vise à ancrer ses réponses dans l’audio. Il utilise l’encodeur Audio Flamingo Next figé de NVIDIA et un tokenizer personnalisé basé sur une ontologie auditive, et il est publié sous une licence non commerciale ou académique.
Qwen3.8 en local. Des retours de la communauté montrent Qwen3.8-27B et Flash Next fonctionnant sur des configurations allant d’un téléphone de 12 Go (3,5 tok/s) à quatre GPU R9700 (génération de 80 à 120 t/s, contexte de 700 000 jetons). Dans les tâches d’agents locaux, Flash Next est plus rapide et fiable en pratique, tandis que le 27B dense reste plus performant pour une utilisation soutenue en multi-tours ; certains utilisateurs les trouvent lourds, même si la qualité de traduction en allemand est saluée.
- → Qwen3.8-Flash-Next-NVFP4 vs Qwen3.8-27B-FP Test Results
- → Qwen 3.8 27B - Fantastic German capabilities
- → Unpopular opinion Qwen 3.8 is hard to understand
- → Qwen 3.8 Flash Next locally on simple mobile phone at 3.5 tok/s
- → Here my pretty good qwen3.8 27B setup, hope it helps
- → Qwen3.8-Flash-Next turns 4xR9700 into a local AI powerhouse! 120 t/s TG and 12k t/s PP single request with optimized vLLM
GGUF sans censure. Un utilisateur de Reddit a publié des GGUFs de LongCat-Flash-Lite-Sparse, un modèle à attention sparse de 69B-A3B avec un contexte de 1 million de jetons, ainsi que Qwen3.8-27B avec MTP, Qwen3.5-122B-A10B, Qwen3-Coder-Next et un modèle de vision. Le support de LongCat nécessite un fork personnalisé de llama.cpp.
Hardware IA de bureau. La DGX Station de bureau de NVIDIA offre des performances de niveau centre de données avec une bande passante mémoire de 7,1 To/s, tandis que Framework semble préparer une carte mère avec 192 Go de mémoire, attendue autour de 4 500 $.
Benchmarks et évaluations
Benchmark de pentest LLM. Un nouveau benchmark confronte les LLM à des infrastructures réelles qu’ils doivent attaquer, l’objectif étant d’identifier le meilleur modèle pour la sécurité offensive plutôt que de reproduire des CVE connues.
Indice de benchmarks de code. Un utilisateur de Reddit a regroupé les principaux benchmarks de codage agentique dans un « Agentic Coding Index » et a calculé une métrique de densité d’intelligence pour comparer les capacités des modèles par paramètre.
Évaluation VLM égocentrique. En utilisant HFlow sur un benchmark vidéo égocentrique, un VLM Gemma ouvert a égalé Gemini 2.5 Flash sur les métriques de visibilité des mains et de manipulation, tout en étant 19 fois moins cher, rendant viable le traitement privé auto-hébergé.
Outils et frameworks d’agents
Cloudflare AI Search. L’AI Search de Cloudflare propose désormais un pipeline de recherche de bout en bout pour des données personnalisées, avec intégration d’agents, recherche multimodale et mode découverte capable d’indexer des sites sans sitemaps.
AWS Kiro Crew. AWS a open-sourcé Kiro Crew, un espace de travail pour exécuter plusieurs agents de codage asynchrones avec mémoire partagée, compétences réutilisables et tâches planifiées ; il a été utilisé en interne par plus de 39 000 développeurs.
ChatGPT Work expliqué. Le ChatGPT Work d’OpenAI, disponible dans les offres payantes, se décline en version cloud via chatgpt.com et en version de bureau locale pouvant accéder aux fichiers et exécuter des programmes, mais ses limites avec Chat restent floues.
Claude Code : baisse de limite. La prochaine augmentation de 25 % de la limite de base d’Anthropic pour Claude Code se traduit en réalité par une réduction effective de 17 % par rapport au boost temporaire actuel de 50 %. Anthropic a également ajouté un outil de signalement automatique de bugs.
Recherche et analyses
Agents sans notion du temps. Une étude a constaté que Claude Code et Codex se trompent systématiquement sur la durée des tâches, surestimant les tâches courtes de 3 à 10 fois, ce qui est problématique pour les tâches d’agents de longue durée.
PILOT : auto-amélioration en direct. PILOT est un orchestrateur superviseur-travailleur qui ajoute un pilotage en direct et une auto-évolution en direct pour les agents à long horizon, surpassant les orchestrateurs équivalents jusqu’à 9,8 points sur Terminal-Bench 2.0.
GameWAM : modèle monde-action. GameWAM est le premier modèle monde-action pour le gameplay vidéo natif, générant conjointement les images futures et les actions clavier-souris via le flow matching, avec un contrôle de cycles de blocs à long horizon.
Next-chunk : RL vs SFT. Une étude contrôlée montre que le SFT mixte sur des données sans CoT et avec CoT long bat le RL de raisonnement next-chunk comme stratégie d’entraînement avant RLVR, avec plus de 60 fois moins de calcul.
Débat sur l’agentivité de l’IA. S’appuyant sur l’incident Hugging Face de juillet, un essai soutient que l’agentivité de l’IA — pas seulement la capacité — façonnera les résultats, et que la manière dont les utilisateurs accordent ou contraignent cette agentivité importe.
Industrie, politique et affaires
NVIDIA rachète Hugging Face. Un accord rapporté de 12,9 milliards de dollars pour le rachat de Hugging Face par NVIDIA combinerait l’infrastructure de calcul avec le principal hub de distribution de l’écosystème des modèles ouverts, accélérant le virage industriel de l’IA.
Robotique : barrières US. Washington a durci les restrictions et les droits de douane sur les drones et robots chinois, invoquant la sécurité nationale, même si l’échelle de fabrication et les avantages de coût de la Chine pourraient atténuer l’impact au niveau mondial.
Adoption de l’IA industrielle. Meta teste des robots de Watney, Kinova et ABB pour les réinitialisations de serveurs, les changements de câbles et le cyclage d’alimentation dans les centres de données ; Caterpillar applique les leçons de l’autonomie minière à la construction et utilise des assistants IA pour les techniciens.
Musk : turbines en interne. SpaceX construit une fonderie pour les aubes et ailettes de turbines à gaz ; Musk affirme que la coulée en interne pourrait faire gagner jusqu’à 18 mois sur le déploiement de l’énergie au gaz naturel pour les centres de données IA.
Salariés : défiance envers l’IA. Les données de Glassdoor montrent que le sentiment positif des travailleurs américains envers l’IA a chuté de 81 % en 2019 à 43 % à la mi-2026, les cadres étant les plus optimistes et les femmes de la génération Z, les rédacteurs et les travailleurs de l’assurance les plus négatifs.
Anthropic attaqué par les éditeurs. Sony Music, Warner Music et d’autres accusent Anthropic d’avoir illégalement téléchargé via torrent des dizaines de milliers de paroles protégées par le droit d’auteur pour entraîner Claude, citant nommément le PDG Dario Amodei et le cofondateur Benjamin Mann.
Texas : caméras Flock suspendues. Le gouverneur Abbott a gelé les dépenses de l’État pour les caméras de surveillance IA Flock après que plus de 30 millions de dollars ont été dépensés, dans un contexte de préoccupations bipartites sur la vie privée et d’incidents d’usage abusif par la police.
C'est tout pour aujourd'hui - environ 5 minutes de lecture.