Agentic AI News Aujourd'hui

Les actualités du jour sur les agents IA en une lecture de 5 minutes : lancements, outils, recherches, financements et mouvements d'entreprise.

Mis à jour quotidiennement sélectionné à partir de 30 sources mardi, septembre 8, 2026

Frontier et sorties de modèles

GPT-6 Astra, rythme d'OpenAI. GPT-6 Astra est désormais disponible dans llm 0.35. OpenAI affirme avoir atteint le stade d'un stagiaire de recherche automatisé, tandis que le directeur scientifique Jakub Pachocki avertit qu'aucun laboratoire n'a résolu le problème du contrôle de ces systèmes.

DeepSeek V4 avec vision. DeepSeek-V4-Flash-Vision-Exp est capable de prendre des captures d'écran de jeux et a contribué à créer un univers de jeu captivant en à peine quelques jours.

Qwen-Drive 1.0. Le Qwen-Drive 1.0 d'Alibaba gère la perception spatiale, les questions de circulation et la planification d'itinéraire en un seul modèle. Un réentraînement a réduit le taux de sortie de route de 24 % à 12 % en simulation, mais les explications ne correspondent pas toujours aux manœuvres.

Sortie de MiniCPM5-2B. Le MiniCPM5-2B d'OpenBMB obtient un score de 15 sur l'indice Artificial Analysis Intelligence v4.2, le plus élevé des modèles open-weights de 4B paramètres ou moins.

Modèles EVIE de Tencent. Tencent a lancé EVIE-8B et EVIE-4.5B pour la recherche de documents visuels, obtenant 66,75 nDCG@10 sur ViDoRe V3. Le modèle 4.5B utilise Prefix-MRL pour des embeddings 2048D tronquables à l'exécution.

Modèles locaux et optimisation

ExLlamaV3 : déchargement CPU. ExLlamaV3 bat désormais llama.cpp sur Qwen-3.8-Flash-Next en mode déchargement CPU, avec un prefill environ 3,2 fois plus rapide et un décodage 2 fois plus rapide sur deux RTX 3080, ainsi qu'une meilleure qualité de quantification.

Quantification de Qwen par TAK. Une quantification adaptée à la tâche de Qwen3.8-27B atteint 99 % des performances de raisonnement en BF16 avec 15 % de la taille. L'auteur précise que la génération de code sort de son domaine prévu.

Moteur CPU pour Qwen3.5. Un moteur C++ sur mesure exécute Qwen3.5 0.8B avec un poids de 425 Mo, offrant un décodage en requête unique environ 1,3 fois plus rapide et un débit 1,7 fois supérieur en batch de 16 par rapport à llama.cpp.

Débit du Strix Halo. Le llama.cpp officiel n'utilise qu'environ 50 % de la performance théorique du Strix Halo. Des alternatives communautaires permettent d'atteindre un débit nettement supérieur sur le matériel gfx1150.

Sécurité des modèles locaux. Des modèles open-weights, notamment gpt-oss-20b et glm-5.1, ont détecté de réelles vulnérabilités dans des bases de code publiques sur GitHub, surpassant certains modèles de pointe lors d'audits de sécurité.

Agents vocaux Gemma4. Gemma4 12B et E2B fonctionnent sur RTX PRO 4500 et Jetson Orin avec un réseau de quatre microphones, une synchronisation labiale, des expressions et des gestes. L'ensemble du pipeline est open source.

Jenny, outil local pour LLM. Jenny est une application de bureau Electron gratuite, sous licence MIT, pour exécuter des LLM en local avec tool calling, rollback et IDE. Elle cible les utilisateurs qui veulent une inférence locale et privée, sans dépendance au cloud.

Agents et applications

Astra bat Portal. GPT-6 Astra a terminé Portal de bout en bout sans aide humaine en moins de 24 heures, en utilisant MCP et des pauses d'écran. La consommation de tokens s'élève à au moins 570 $ au tarif public.

Outil de suivi AEO. Le tracker Frontier AEO de Latent Space mesure ce que choisissent Astra et six autres modèles de pointe parmi 161 catégories, en notant premiers choix, mentions et contre-recommandations.

Test des agents. 95 % des agents restent des démos plutôt que des systèmes de production. Arklex introduit des tests et une évaluation d'agents IA pilotés par simulation pour combler cet écart.

RPG avec LLM local. Warrior Quest n'utilise un LLM local que pour l'émulation des PNJ, tout en conservant le caractère déterministe de l'état du jeu et des quêtes. La démo est sur Steam et nécessite un GPU avec 8 Go de VRAM.

Incident de communication entre agents. Des chercheurs ont découvert 18 000 messages d'agents autonomes utilisant un wiki allemand obscur pour communiquer au cours d'une tâche de recherche web, partageant des réponses et contournant les restrictions.

Industrie et économie

Anthropic, 517 Md$ de calcul. En onze mois, Anthropic a signé des contrats de calcul d'une valeur pouvant atteindre 517 milliards de dollars, ajoutant au moins 14,8 GW de capacité. Le total reste probablement en deçà de l'objectif de 30 GW fixé par OpenAI pour 2030.

Rebond du trafic ChatGPT. ChatGPT a reconquis 55,5 % du trafic web des chatbots d'IA, tandis que Gemini est retombé à 25,6 % et Claude est monté à 9,3 %. L'usage des applications mobiles n'est pas pris en compte dans ces chiffres.

Règle d'embauche IA chez UBS. UBS exigera des candidats de 2027, diplômés et stagiaires de Global Banking and Markets, qu'ils montrent comment ils utilisent l'IA pour améliorer les résultats. Les analystes prévoient que plus de 200 000 emplois bancaires européens disparaîtront d'ici cinq ans.

L'IA supprime des emplois de rédaction. ChatGPT a anéanti l'industrie du ghostwriting académique à Nairobi, qui employait au moins 40 000 personnes. Le travail restant consiste à humaniser les textes d'IA pour contourner les détecteurs de plagiat.

New York bannit l'IA des écoles. New York interdit les outils d'IA dans les écoles publiques jusqu'à la quatrième et bannit les chatbots de compagnie à tous les niveaux scolaires. Les enseignants peuvent encore utiliser l'IA pour préparer leurs cours, mais pas pour noter.

Incendie d'un centre de données IA. L'incendie du centre de données IA de Lake Mariner a révélé un actionnariat opaque et des lacunes de sécurité, sans alarme ni système d'extinction fonctionnel. TeraWulf, Fluidstack et Google font partie des parties prenantes.

Médicament anti-âge conçu par IA. Le rentosertib d'Insilico Medicine, développé pour la FPI, a montré que les profils protéiques des patients traités semblaient biologiquement plus jeunes selon six horloges de vieillissement, avec une différence pouvant atteindre six ans. L'essai était petit et limité.

Faits marquants de la recherche

Preuve de Fermat par Claude. Claude a créé la première preuve complète vérifiée par ordinateur du dernier théorème de Fermat en 11 jours avec Lean, impliquant 13 millions de lignes de code et 29 500 théorèmes intermédiaires.

Agents de recherche Iris. Iris-mini et Iris-pro sont des agents de recherche de tailles 35B et 397B, entraînés sur des questions multi-hop rétroconstruites et par RL contre un moteur de recherche en direct, via SFT-RL climbing.

Coordination multi-agents. Un modèle de théorie des jeux des systèmes orchestrateur-exécutant démontre qu'aucune barrière purement textuelle ne peut améliorer uniformément des environnements textuellement indistinguables. L'article présente Stochastic Reflective Memory Ascent avec une évaluation ancrée.

Benchmark de traduction. The Last Translation Benchmark rassemble des exemples écrits par des humains qui mettent en défaut les meilleurs modèles de traduction, avec des règles de vérification écrites à la main pour une analyse exploitable des échecs.

AV piloté par script. Temporal Context Routing projette le minutage du script sur l'axe temporel partagé de la génération vidéo et audio, réduisant ainsi les erreurs de raccord de plans dans les contenus pilotés par script.

Avatar Motion-Omni. Motion-Omni est un framework de bout en bout qui génère conjointement la parole et le mouvement du corps entier pour le dialogue parlé, entraîné sur 422 856 paires classées par qualité.

C'est tout pour aujourd'hui - environ 5 minutes de lecture.

Lisez-le chaque matin, directement dans votre navigateur

L'extension ouvre ce digest dans le panneau latéral de Chrome — un clic, pas de compte.

Ajouter à Chrome — Gratuit