Decision models en gestructureerde output
Jev en decision models. TypeSafe AI bracht Jev uit, een model dat alleen beslissingen neemt en getypeerde kansen teruggeeft; binnen enkele dagen kwamen AWS, Cloudflare en Perplexity met hun eigen open decision models. Bestaande structured output en grammar enforcement bieden al vergelijkbare constrained generation.
- → TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text
- → Amazon releases its own Jev clone as decision models flood the web
- → Clef: Open Weights decision model by Cloudflare
- → Perplexity Decider 27B: Open weights decision model fine tune of Qwen3.8 27B
- → Guys... OpenAI API on VLLM and Llamacpp already supported grammar enforcer... (AKA JEV)
Lokale decision-LoRA's. Jeff-Qwen3.5-0.8B met negen LoRA-adapters handelt terugkerende agentbeslissingen af, zoals prompt injection en de keuze van tools, met 38x snelheidswinst en +8,7 accuracy, en dat met minder dan 2 GB extra geheugen.
Agents en productlanceringen
OpenAI's Dots tegen Meta's Muse. OpenAI kondigde Dots aan, een schattige agent op GPT-6 Astra die virtuele werelden kan bouwen, maar het blijft beperkt tot het abonnement van $1 per maand en moet het opnemen tegen Meta's gratis Muse.
Shopify Canvas. Shopify lanceerde Canvas, waarmee webwinkeliers via een chat met AI Sidekick een winkel bouwen, met realtime weergave van de echte code.
Virtueel passen in ChatGPT. OpenAI voegde virtueel passen en favorieten toe aan ChatGPT Shopping, met het model Images 2.5 om kleding op foto's van gebruikers te visualiseren.
Tavus' Griffin-avatar. Tavus introduceerde Griffin, een realtime video-avatarmodel; 48% van de testpersonen zag het tijdens een gesprek van een minuut aan voor een mens.
Photon begraaft mobiele apps. Photon hield een begrafenis voor mobiele apps en haalde $4,5 miljoen op om ontwikkelaars te helpen messaging-agents te bouwen bovenop iMessage en WhatsApp.
Open modellen en lokale AI
Gemini 4 Argon. Google DeepMind introduceerde Gemini 4 Argon met state-of-the-art benchmarks en tot 1 miljoen outputtokens, in eerste instantie alleen als preview voor cybersecurity.
K2 Horizon open modellen. IFM bracht K2 Horizon uit: zes open modellen van 0,9B tot 375B, inclusief trainingsdata, code en logs; het team houdt een AMA over open development.
Qwen Flash Next MTP. llama.cpp heeft multi-token prediction voor Qwen Flash Next samengevoegd, wat de inferencesnelheid verbetert.
Slipstream voor de Mac. Slipstream, een Metal-inference-engine, draait Qwen3.8-Flash-Next van 95,5 GiB op Macs met 64 GB aan 41-52 tok/s, 1,76x sneller dan llama.cpp en met een stabiele lange context.
Olmo-core 3. Allen AI bracht Olmo-core 3 uit, een open en schaalbare trainingsinfrastructuur voor MoE-modellen met biljoen parameters.
Onderzoek en benchmarks
Ataraxos verslaat Stratego. Onderzoekers van CMU, MIT, NYU en Stanford bouwden Ataraxos, dat de beste Stratego-speler met 15-1 en 4 remises versloeg en zo een menselijk bolwerk doorbrak; de training kostte minder dan $8.000.
Agentic RAG wint. Een benchmark van 18 RAG-pipelines tegen een agent-loop op FRAMES: de beste pipeline haalt 78,9%, de agent-loop 92,7%. Retrieval-agents presteren dus beter dan vaste pipelines.
AutoSynthData van ServiceNow. ServiceNow CoreAI bouwde AutoSynthData om trainingsdata te genereren uit modelfouten en successen van het teacher-model, om zo enterprise-agents te verbeteren.
AI-tells in teksten. Graphite vond 13.000 zinsneden die verraden dat een tekst door AI is geschreven; Claude-modellen naderen de menselijke woordverdeling, GPT zit er verder van af.
Industrie, beleid en beveiliging
Google wint rechtszaken. De rechter wees de zaken van Chegg en Penske af, die stelden dat Google AI Overviews illegaal verkeer wegsluisden; de antitrustclaims hielden geen stand.
Grok beïnvloedde Venezuela. Time meldt dat Trump uren met Grok sprak voor de invasie in Venezuela; Grok voorspelde feestvieringen, wat Trumps beeld versterkte.
Drie veiligheidsonderzoekers weg bij OpenAI. OpenAI en drie veiligheidsonderzoekers gingen uit elkaar omdat ze vertrouwelijke informatie zouden hebben gedeeld met een externe veiligheidsorganisatie.
Anthropic naar de overheid. Anthropic lanceerde Claude for Government voor civiele overheidsdiensten in een FedRAMP High-omgeving; het verbod van het Pentagon blijft van kracht, midden in een juridische strijd.
Datacenters in de ruimte. Google lanceerde een prototype van een orbitale compute-satelliet met TPU; Satlyt haalde $8 miljoen op om software voor satelliet-AI te bouwen. Voor opschaling is Starship nodig.
Screenshots lekken via agents. Glow Security vond ruim 13.000 interne screenshots die AI-agents naar publieke GitHub-repo's hadden geüpload, waardoor klantgegevens en inloggegevens op straat kwamen te liggen.
Diefstal van reasoning. OpenAI zegt dat het een campagne voor adversariële distillatie heeft gestopt die gericht was op beschermde reasoning; een vergelijkbare truc werkte nog wel op Azure.
Dat was het voor vandaag - ongeveer 5 minuten leestijd.