Sorties d'agents et de modèles
Scores de Qwen 3.8 27B. Qwen 3.8 27B obtient un score de 52 sur l'Artificial Analysis Intelligence Index, égalant GPT-5.6 Luna Max et un point derrière les GLM-5.2 et DeepSeek V4 Pro, pourtant bien plus grands. Il est livré avec le raisonnement xhigh par défaut, probablement pour maximiser la visibilité des benchmarks.
Codage agentique de Qwen. Sur 16 Go de VRAM, le Qwen 3.8 27B quantifié avec décodage spéculatif MTP gère un contexte de 73k à 30-50 tps. Les benchmarks locaux montrent que le mode de raisonnement moyen correspond presque à DeepSeek V4 Flash avec moins de tokens, tandis que xhigh n'améliore pas clairement le codage agentique.
- → Optimizing Qwen3.6 / Qwen3.8-27B on 16GB VRAM: Complete Benchmark Results and Setup Guide (~30-50tps at 32k to 72k context)
- → After pushing 1M+ tokens through Qwen 3.8 27B, here is my optimal llama.cpp config for 16GB VRAM (73k Context, Agentic Coding)
- → Local agentic coding Benchmark : Qwen 3.8 27B (in many weights quants / cache quants / engine / reasoning effort) vs others.
35B-A3B toujours incertain. Un développeur de Qwen dit de ne pas attendre le 35B-A3B, même si la demande de la communauté pour le 35B-A3B et le 122B reste forte, sans signe officiel de sortie.
Vitesse de Ling 3.0 Tiny. Ling 3.0 Tiny 8B avec 1,3 milliard de paramètres actifs fonctionne à 36 tokens/seconde sur 4 Go de VRAM et offre des performances proches de Qwen 3.5 9B et Gemma 12.
Post-entraînement de GLM-5.3. Z.ai a publié GLM-5.3 avec une amélioration provenant uniquement d'un post-entraînement plus poussé, offrant de meilleures performances en codage complexe et en tâches à long horizon.
Agents Grok Bot. SpaceXAI a présenté Grok Bot, des agents IA persistants sur des ordinateurs cloud dédiés qui gèrent des flux de travail en plusieurs étapes, mémorisent les préférences et se coordonnent en groupes.
Outils et frameworks
llama.cpp v0.1.0. llama.cpp a publié sa première version sémantique, v0.1.0, et une PR ajoute un MTP adaptatif qui choisit dynamiquement la profondeur du MTP, améliorant la génération de code de 10 à 15 % et le rappel jusqu'à 100 % plus rapide.
Middleware de paiement pour agents. Le middleware AgentCore Payments pour les agents LangChain ajoute des budgets déterministes au niveau de la session et la prise en charge des portefeuilles, LangSmith enregistrant ce que les agents ont acheté et pourquoi.
Fonctions de fitness agentiques. Un nouvel article soutient que les fonctions de fitness agentiques peuvent étendre l'architecture évolutive en gérant les risques liés au jugement, tandis que les portes déterministes restent pour les invariants mesurables.
Ordonnancement GPU tenant compte des contraintes. Hugging Face a construit un allocateur GPU tenant compte des contraintes qui a amélioré l'utilisation de jusqu'à 33 points de pourcentage et la sortie pondérée par priorité de jusqu'à 105 % sur un matériel identique.
Industrie et entreprise
Accord Stripe-OpenRouter. Stripe aurait l'intention d'acquérir la startup de routage de modèles IA OpenRouter pour plus de 7 milliards de dollars, après sa série B de 1,3 milliard de dollars ; OpenRouter compte 8 millions d'utilisateurs et 250T tokens/mois.
Hausse des revenus d'Anthropic. Le chiffre d'affaires annualisé d'Anthropic a dépassé 65 milliards de dollars en juillet, contre 47 milliards en mai et 9 milliards à la fin de 2025, avec une introduction en bourse attendue cet automne à une valorisation de plus de 2 billions de dollars.
Relay ferme. La startup d'automatisation de flux de travail IA Relay cesse ses activités ; son fondateur et certains membres du personnel rejoignent l'équipe Chrome de Google pour travailler sur l'IA dans Chrome.
Wispr lève 280 M$. Wispr a levé 280 millions de dollars en série B pour une valorisation de 2 milliards de dollars afin de passer de la dictée IA à la prise de notes et aux réunions, avec le lancement du modèle Canto.
Rebond du marché de la vidéo IA. La vidéo générée par IA attire les studios hollywoodiens et des milliards de dollars après le faux départ de Sora, avec des startups comme Promise utilisant Seedance 2.5 pour des arrière-plans en temps réel.
Agents IA de Grab. Grab a réduit le travail d'analyse mécanique de 44 % à 30 % grâce à un modèle d'autonomie des agents à cinq niveaux, les analystes conservant les décisions finales.
Infrastructure et calcul
Centre de données d'OpenAI dans l'Ohio. OpenAI a signé un bail de 20 ans pour une capacité informatique de 8 GW à PORTS-Pike dans l'Ohio avec SB Energy ; Nvidia soutient jusqu'à 105 milliards de dollars et est le seul fournisseur de puces.
Pivot neocloud de Groq. Groq a levé 350 millions de dollars pour une valorisation de 3,5 milliards de dollars alors qu'il passe des puces IA à l'exploitation d'une infrastructure neocloud basée sur Nvidia après un accord de licence avec Nvidia.
Hausse du prix de la RTX Pro 6000. CDW a augmenté le prix conseillé de la RTX Pro 6000 de 16 000 à 19 999 dollars, et les prix sur le marché de l'occasion montent également, ce qui comprime les développeurs d'IA locaux.
Données d'entraînement et politique
Numérisation de livres rares par Amazon. Un AirTag a suivi une commande en gros de livres rares jusqu'à une installation d'entraînement IA d'Amazon où des travailleurs détruisent les livres pour les numériser ; Amazon affirme qu'il achète les livres par des canaux commerciaux.
Filigranage de Claude par Anthropic. Anthropic intégrera des filigranes SynthID-Text dans les sorties de Claude pour se conformer à l'EU AI Act ; les critiques craignent des problèmes de qualité de choix des mots et de transparence.
C'est tout pour aujourd'hui - environ 5 minutes de lecture.