Agent- en modelreleases
Claude Fable 5.1. Anthropic heeft Fable 5.1 en Mythos 5.1 uitgebracht en claimt betere codeer- en onderzoeksprestaties en tot 45 procent lagere kosten voor agentische taken door goedkopere cachereads. De onbeperkte Fable 5.1 is nu beschikbaar, al trekken vroege kostenanalyses de maximale besparing bij de hoogste redeneerinspanning in twijfel.
- → Claude Fable 5.1 made me a really nice animated pelican
- → Anthropic launches Claude Fable 5.1 and says it’s up to 45 percent cheaper for agentic work
- → Anthropic's Claude Fable 5.1 promises better coding and research at up to 45 percent less
- → Anthropic’s new Fable release is cheaper, less restrictive
Uitrol OpenAI Astra. OpenAI stelt dat het aanstaande Astra-model de eerste LLM is die aan OpenAIs eigen kritieke cybersecuritydrempel voldoet. Het kan onbekende kwetsbaarheden autonoom vinden en exploiteren. Het bedrijf stelde na de hack bij Hugging Face delen van de ontwikkeling van Astra uit om de beveiliging te versterken en zal de toegang tot de meest geavanceerde cybersecuritymogelijkheden beperken.
Nieuwe Spark-X2.5-modellen. De open modellen Spark-X2.5-4B en 1.7B zijn verschenen op Hugging Face met een nieuwe architectuur en claimen prestaties die wedijveren met Qwen 3.5 9B en een native context van 1M. Ze draaien nog niet in mainline llama.cpp, maar er is een eigen fork.
Runway Solaris-interfacemodel. Runway heeft Solaris onthuld, een zogeheten Interface World Model dat in realtime UI-frames genereert in plaats van code uit te voeren en reageert op klikken en spraak. Het blijft een onderzoeksproject, met beperkingen op het gebied van tekstweergave en ondersteuning voor schermlezers.
Lokale AI en hardware
Qwen3.8 lokaal getest. Uit de community komen berichten dat Qwen3.8 27B en Flash-Next op uiteenlopende hardware draaien: 12 tok/s op een Mac met 48 GB, 280 tok/s bij decoderen op twee Epyc R9700's met MXFP4-kernels, en 132 tok/s bij decoderen op één RTX 3090 na maatwerkoptimalisaties. Quantbenchmarks suggereren dat UD Q3_K_XL goed past bij 16GB-kaarten; sommige gebruikers vinden Qwen3.8 goed in coderen, maar te gretig om zaken aan te passen.
- → Running 104GB Qwen3.8-Flash-Next on 48GB Mac at ~12 tok/s
- → How I got 280 tok/s on Qwen3.8 27B on 2xr9700's and 940k tokens kv cache
- → I pushed Qwen3.8-27B to 2.000 prefill per second and 132 decode per second on A RTX 3090.
- → Kaitchup posted Qwen3.8 27B Benchmarks for quants from Q4 to Q1
- → Everyone is t/s maxing.. 3.8.. but after a week of using it for work I'm tempted to switch back to 3.6
Prijsstijgingen DGX Spark. De DGX Spark van Nvidia en de Asus Ascent GX10 zijn fors in prijs gestegen; het Asus-model ging van 3.999 naar 5.999 dollar. Kopers vragen zich af of clusters van DGX Sparks kosteneffectief zijn vergeleken met AMD Epyc-systemen met meer geheugenbandbreedte, al biedt de DGX wel FP4-ondersteuning en tensorparallelisme.
CMP 170HX-uitval. Een gebruiker meldt dat 2 van de 5 CMP 170HX-GPU's binnen twee weken uitvielen en dat een derde defecte tensorcores had. Daarmee zijn de huidige prijzen het risico voor LLM-inferentie niet waard, vindt hij.
INT8 en misleidende quants. Een communitydiscussie vraagt zich af waarom INT8 W8A8-modellen niet vaker op RTX 3090's draaien, aangezien die kaarten native INT8-tensorcores hebben. Een andere gebruiker beschuldigt AtomicChat ervan een IQ2_S-quant verkeerd te hebben gelabeld als Q4_K_M.
Intels geheugenambities. Intel suggereerde dat het bedrijf mogelijk terugkeert in de geheugenbusiness. De ceo verwees daarbij naar de aanstelling van voormalig SK Hynix-topman Seok-Hee Lee en naar een nieuwe geheugenarchitectuur, maar details zijn schaars.
Tools en frameworks
OpenClaw 2.0 uitgebracht. OpenClaw 2.0, de open-source persoonlijke AI-agent, vereenvoudigt de installatie door bestaande ChatGPT/Claude-abonnementen en lokale modellen te herkennen. Ook bouwt het de browser om tot primaire interface en biedt het gedeelde cloudsessies voor samenwerking.
Lokale tools in Codex. De Codex-desktopapp van OpenAI bevat nu een volledige LibreOffice-installatie en andere binaries zoals Poppler en git in de runtime. Daardoor kunnen documentverwerkingsskills zonder externe afhankelijkheden draaien.
AI-softwarefabrieken. Toonaangevende open-source AI-projecten zoals Flue en tldraw wijzen externe PR's af; in plaats daarvan zetten ze agentteams in voor triage, reproductie, fixes en reviews. Vercel nam voor zijn AI SDK-project een softwarefabriek met meerdere agents in gebruik om een achterstand van meer dan 1.000 issues en 800 PR's weg te werken.
Terraform voor agents. HashiCorp positioneert HCP Terraform als het control plane met governance voor AI-gestuurde infrastructuur: agents kunnen Terraform-wijzigingen schrijven en toepassen, terwijl policy, identity en auditcontroles worden afgedwongen.
Update datasette-mcp. De datasette-mcp-plugin bracht versie 0.2 uit en verandert SQL-queryresultaten van arrays naar objecten, zodat zwakkere modellen kolommen correct kunnen koppelen.
Onderzoek en veiligheid
Auditmethode BenchMIRT. Hugging Face introduceerde BenchMIRT, een methode om LLM-benchmarks te controleren op individueel promptniveau. Daaruit blijkt dat prompts binnen een benchmark verschillende vaardigheden kunnen meten en dat gemiddelde scores dat kunnen maskeren.
Gemini agentische videoanalyse. Google DeepMind heeft agentische video-analyse uitgerold voor Gemini 3.7, 3.6 en 3.5 Flash-Lite. Met native videotools worden videosegmenten dynamisch doorzocht en geïnspecteerd, wat de nauwkeurigheid verbetert en het tokenverbruik voor videoanalyse verlaagt.
Watermerk voor Claude-tekst. Anthropic heeft zijn watermerk-verificatie-API opengesteld voor toezichthouders, media en factcheckers. Goedgekeurde organisaties kunnen daarmee door Claude gegenereerde tekst detecteren via een statistisch patroon dat sommige bewerkingen kan overleven, zoals de EU AI Act vereist.
Verkiezings- en biasproblemen. AlgorithmWatch constateert dat de AI Overviews van Google over verkiezingen inconsistent zijn, op weinig bronnen steunen en kandidaten soms in partijdige termen beschrijven. Daarnaast gaf de AI-zoekfunctie van Google advies over noodoproepen op basis van nationaliteit, wat tot aanpassingen leidde.
Industrie en bedrijfsleven
Snelle opmars AfterQuery. AI-trainingsdatastartup AfterQuery heeft naar verluidt geld opgehaald tegen een waardering van 3,2 miljard dollar, een vertienvoudiging in vijf maanden. Daarmee is het de snelste unicorn in de geschiedenis van Y Combinator. Het bedrijf zet professionals in om modellen te trainen in het uitvoeren van taken zoals professionals dat doen.
50 mln dollar voor AIR. AI-securitystartup AIR komt uit de stealthmodus met 50 miljoen dollar. Het bedrijf helpt bedrijven agents te ontdekken en continu de skills, MCP-servers en add-ons te controleren die ze gebruiken, en blokkeert niet-goedgekeurde software-interacties.
Google toenadering tot Hollywood. Google probeert naar verluidt licentieovereenkomsten te sluiten met grote studio's om AI-modellen te trainen op auteursrechtelijk beschermd materiaal, tegen forse betalingen. Analisten waarschuwen dat zulke deals risico's voor hun publieke imago kunnen opleveren.
Focus frontier-AI. De nieuwe topman van Google DeepMind, Koray Kavukcuoglu, zegt dat leiderschap in frontier-AI het enige is dat telt. Hij geeft toe dat de huidige modellen iets onder het frontier-niveau zitten, maar belooft de achterstand in te lopen. Concrete updates over Gemini 4 of 3.5 Pro kwamen er niet.
AI-agents in operations. Uit Enterprise Signals van OpenAI blijkt dat koplopers 8,3 keer zoveel outputtokens per actieve gebruiker genereren. Ondertussen verwerken startups als Basis, Clay en Exa Labs agents in hun onboarding, accountbeheer en ontwikkelaarsintegraties.
Juridische strijd Apple-OpenAI. Apple wil een versnelde discoveryprocedure tegen OpenAI en stelt dat OpenAI heeft nagelaten de MacBook van een voormalig Apple-werknemer te onderzoeken. Op die laptop stonden gesprekken over het vernietigen van forensische gegevens.
Google Pics-designtool. Google lanceerde Google Pics, een AI-tool voor het genereren en bewerken van afbeeldingen voor Workspace, mogelijk gemaakt door Nano Banana. Met promptgestuurd ontwerpen en nauwkeurige objectbewerking moet het concurreren met Canva en Adobe Express.
AI-agents voor consumenten. Fambot introduceerde een AI-chief of staff die voor gezinnen de logistiek regelt. John Deere lanceerde een JD AI-assistent voor boeren die gebruikmaakt van hun eigen data. Amazon voegde 'Update Me When'-winkelmeldingen toe aan Alexa.
Dat was het voor vandaag - ongeveer 5 minuten leestijd.