Modèles de décision et sorties structurées
Jev et modèles de décision. TypeSafe AI a publié Jev, un modèle exclusivement dédié à la décision qui renvoie des probabilités typées ; en quelques jours, AWS, Cloudflare et Perplexity ont publié leurs propres modèles de décision ouverts. Les sorties structurées et l’application de grammaires existantes permettent déjà une génération contrainte comparable.
- → TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text
- → Amazon releases its own Jev clone as decision models flood the web
- → Clef: Open Weights decision model by Cloudflare
- → Perplexity Decider 27B: Open weights decision model fine tune of Qwen3.8 27B
- → Guys... OpenAI API on VLLM and Llamacpp already supported grammar enforcer... (AKA JEV)
LoRA de décision locales. Jeff-Qwen3.5-0.8B, avec neuf adaptateurs LoRA, traite les décisions récurrentes d’un agent, comme l’injection de prompt et le choix d’outil, avec un gain de vitesse de 38× et +8,7 de précision, pour moins de 2 Go de mémoire supplémentaire.
Agents et lancements de produits
OpenAI Dots contre Meta Muse. OpenAI a annoncé Dots, un agent mignon propulsé par GPT-6 Astra capable de construire des mondes virtuels, mais réservé à une offre à 1 $/mois, face à Muse, gratuit chez Meta.
Shopify Canvas. Shopify a lancé Canvas, qui permet aux marchands de créer des boutiques en discutant avec l’IA Sidekick, avec un rendu en temps réel du code réel.
Essayage virtuel dans ChatGPT. OpenAI a ajouté l’essayage virtuel et les favoris aux achats dans ChatGPT, en utilisant le modèle Images 2.5 pour visualiser les vêtements sur les photos des utilisateurs.
Avatar Griffin de Tavus. Tavus a présenté Griffin, un modèle d’avatar vidéo en temps réel ; 48 % des sujets testés l’ont confondu avec un humain lors d’un appel d’une minute.
Photon enterre les applis mobiles. Photon a organisé des funérailles pour les applications mobiles et levé 4,5 M$ pour aider les développeurs à créer des agents de messagerie sur iMessage/WhatsApp.
Modèles ouverts et IA locale
Gemini 4 Argon. Google DeepMind a présenté Gemini 4 Argon, avec des benchmarks SOTA et jusqu’à 1 M de tokens de sortie, d’abord uniquement en avant-première pour la cybersécurité.
La flotte ouverte K2 Horizon. IFM a publié K2 Horizon, six modèles ouverts de 0,9 B à 375 B, avec les données d’entraînement, le code et les logs ; l’équipe organise une AMA sur le développement ouvert.
Qwen Flash Next MTP. llama.cpp a intégré le support de la prédiction multi-token pour Qwen Flash Next, ce qui améliore la vitesse d’inférence.
Slipstream sur Mac. Slipstream, un moteur d’inférence Metal, fait tourner Qwen3.8-Flash-Next (95,5 Gio) sur des Mac de 64 Go, entre 41 et 52 tokens par seconde, soit 1,76 fois plus rapide que llama.cpp, avec un contexte long stable.
Olmo-core 3. Allen AI a publié Olmo-core 3, une infrastructure d’entraînement ouverte et scalable pour des modèles MoE à l’échelle du billion de paramètres.
Recherche et benchmarks
Ataraxos bat Stratego. Des chercheurs de CMU, MIT, NYU et Stanford ont créé Ataraxos, qui bat le meilleur joueur de Stratego 15-1 avec 4 matchs nuls, mettant fin à un bastion humain ; le coût d’entraînement est inférieur à 8 000 $.
Le RAG agentique gagne. Benchmark de 18 pipelines RAG contre une boucle d’agent sur FRAMES : meilleur pipeline 78,9 %, boucle d’agent 92,7 %, ce qui montre que les agents de retrieval surpassent les pipelines fixes.
AutoSynthData de ServiceNow. ServiceNow CoreAI a construit AutoSynthData pour générer des données d’entraînement à partir des échecs des modèles et des réussites du modèle enseignant, afin d’améliorer les agents d’entreprise.
Les tics d’écriture de l’IA. Graphite a identifié 13 000 phrases révélatrices d’une écriture par IA ; les modèles Claude se rapprochent de la distribution des mots humains, GPT s’en éloigne.
Industrie, politique et sécurité
Procès antitrust Google rejetés. Un juge a rejeté les poursuites de Chegg et Penske, qui accusaient les AI Overviews de Google de réduire illégalement leur trafic ; les arguments antitrust n’ont pas tenu.
Grok a influencé le Venezuela. Selon Time, Trump a passé des heures à parler à Grok avant l’invasion du Venezuela ; Grok prédisait des célébrations, ce qui a renforcé la conviction de Trump.
Départs sécurité chez OpenAI. OpenAI s’est séparé de trois chercheurs en sûreté, accusés d’avoir partagé des informations confidentielles avec une organisation de sûreté tierce.
Anthropic vise le gouvernement. Anthropic a lancé Claude for Government pour les agences civiles dans un environnement FedRAMP High ; l’interdiction du Pentagone reste en vigueur, sur fond de bataille juridique.
Centres de données spatiaux. Google a lancé un satellite prototype de calcul orbital doté d’un TPU ; Satlyt a levé 8 M$ pour développer un logiciel destiné à l’IA satellitaire, Starship étant nécessaire pour passer à l’échelle.
Fuite de captures d’agents. Glow Security a découvert plus de 13 000 captures d’écran internes mises en ligne par des agents IA sur des dépôts GitHub publics, exposant des données clients et des identifiants.
Campagne de vol de raisonnement. OpenAI affirme avoir stoppé une campagne de distillation adverse ciblant son raisonnement protégé ; une technique similaire a encore fonctionné sur Azure.
C'est tout pour aujourd'hui - environ 5 minutes de lecture.