IA frontière et grands laboratoires
OpenAI mise sur l'auto-amélioration récursive. OpenAI annonce avoir atteint son objectif de « stagiaire de recherche automatisé » : ses agents de codage internes accélèrent la recherche et certains projets ont été avancés de six mois. Le directeur scientifique Jakub Pachocki, dans son essai, présente l'auto-amélioration récursive comme centrale pour l'AGI. L'entreprise relie le bond de juillet des dépenses d'IA par chercheur au modèle publié plus tard sous le nom de GPT-6 Astra.
Agents de sécurité de Figma. Figma a développé des agents d'IA sur Panther SIEM pour analyser les alertes issues d'AWS, Okta, GitHub, GCP et osquery, réduisant de 70 % le temps de résolution des alertes complexes et de 20 % les notifications d'astreinte, avec un examen humain toujours en place.
Mantis, le scanner agentique de Google. Google a publié en open source Mantis, un framework agentique de détection de vulnérabilités qui associe des agents critiques/relecteurs à une reproduction en bac à sable, afin de réduire les faux positifs et les vulnérabilités hallucinées lors de l'analyse de code.
Inférence locale et matériel
LayerStoRm diffuse les experts MoE. LayerStoRm, un moteur expérimental sous licence MIT, diffuse en continu les experts MoE depuis la RAM hôte vers les GPU, faisant tourner une version quantifiée de GLM-5.3-Flash de 186 Gio à 24,5 tokens/s sur 96 Go de VRAM, avec cache de préfixes pour le codage agentique.
Montages Radeon Pro R9700. Les montages communautaires autour de la Radeon AI Pro R9700 d'AMD gagnent en maturité : un système à deux R9700 doté de 64 Go de DDR5 exécute Qwen 3.8 27B en FP8/MXFP4 et Flash Next sous vLLM, tandis que les utilisateurs évoquent une configuration 4xR9700 pour décharger DeepSeek V4 Flash et Qwen 3.8 Flash.
Optimisation du cache local. Un nouvel outil open source valide la conservation annoncée du cache KV en conditions de charge, montrant que les correctifs dedupe et boundfix peuvent conserver jusqu'à 146 % de sa capacité. Les utilisateurs rapportent aussi qu'un cache f16 améliore l'acceptation MTP par rapport à Q8 sur les GPU plus anciens.
Benchmarks et évaluation
Struggle Bench, le test de survie. Le nouveau « Struggle Bench » donne à un modèle un serveur, un appartement et un compte bancaire, puis évalue combien de mois il peut payer son loyer et continuer à tourner sans commettre de cybercriminalité — un test d'autonomie et de survie réelles.
lm-eval-ledger, suivi SQLite. lm-eval-ledger exécute des benchmarks et stocke tout dans SQLite ; une application web permet d'inspecter et de comparer les réponses des modèles à chaque question, plutôt que les seuls scores agrégés.
Benchmarks de code avancés. Program-Bench, SRE-Bench et Code Migration poussent les agents à reconstruire des binaires à partir de leur documentation, à comprendre des binaires réels sans code source et à réimplémenter des programmes dans un autre langage, de quoi sonder en profondeur leurs compétences en génie logiciel.
Contentieux et droit d'auteur
Le Seattle Times et Newsday poursuivent. Le Seattle Times et Newsday ont poursuivi OpenAI et Microsoft pour violation du droit d'auteur, demandant la destruction des modèles d'IA construits à partir de leurs œuvres. Ils rejoignent près de 400 journaux locaux ayant déposé des réclamations similaires.
Litiges sur le règlement Anthropic. Des auteurs rapportent que des éditeurs et des agents réclament plus que leur part de l'accord de 1,5 milliard de dollars conclu par Anthropic sur le droit d'auteur. Des différends portent sur les droits revenus aux auteurs, qui devraient alors percevoir l'intégralité du paiement.
Sécurité et garde-fous
Un service d'abliteration. La startup américaine Abliteration.ai vend un accès API à des modèles open-weight comme GLM-5.3 dont les garde-fous de sécurité ont été ablatés, pour du red teaming et de l'analyse de malwares. La suppression des refus abaisse la barrière à l'utilisation malveillante.
Variantes Qwen non censurées. Une comparaison de huit variantes Qwen 3.8 27B ayant subi une abliteration place orcarouter en tête sur l'ASR de HarmBench, apostate étant la plus proche des capacités du modèle de base. On relève toutefois des bizarreries d'empaquetage, comme l'absence de vision et de MTP dans certaines versions.
Psychose liée à l'IA. Des chercheurs soutiennent que les chatbots complaisants peuvent renforcer les délires dans une « chambre d'écho à une seule personne » et appellent à reconnaître une « psychose associée à l'IA », même si la question de savoir si elle mérite un diagnostic autonome reste débattue.
Nouveaux modèles et recherche
Spark-X2.5, modèles compacts. XHToken a publié Spark-X2.5-4B et Spark-X2.5-1.7B, deux modèles efficaces dotés d'une fenêtre de contexte native d'un million de jetons et prenant en charge plus de 200 langues. Une PR llama.cpp ajoute leur prise en charge.
WeatherNext 3 apprend des satellites. Le modèle WeatherNext 3 de Google et DeepMind ignore les simulations physiques et apprend directement des données satellitaires en temps réel. Il produit des prévisions horaires à 5 km de résolution et améliore la précision des précipitations jusqu'à 50 %.
Muse Voice Transcribe, temps réel. Meta a publié Muse Voice Transcribe, un modèle temps réel qui découpe l'audio en segments de 80 ms, transcrit la parole, distingue jusqu'à 20 locuteurs et coûte 0,18 $ de l'heure pour plus de 70 langues.
Lyria 3.5 dans Gemini. Google a ajouté Lyria 3.5 à Gemini et à ses API pour la génération musicale, avec des voix expressives et uniquement des données d'entraînement sous licence.
C'est tout pour aujourd'hui - environ 5 minutes de lecture.