Lokale modellen en hardware
Qwen3.8-27B snelheidswinsten. DFlash2 spec-decoding duwt Qwen3.8-27B naar 218 tok/s op dubbele 3090's, rond 200 op een 5090, en 124 op een enkele 3090 met een geoptimaliseerde engine. DFlash2 GGUF-quants zijn beschikbaar.
Volgende Qwen middelgroot. De communitymanager van Qwen zegt dat er volgende week een nieuw middelgroot open-weight model wordt verwacht, waarschijnlijk meer dan 100B parameters, zonder vroege toegang.
Ling-3.0 edge-ondersteuning. llama.cpp ondersteunt nu officieel Ling-3.0 (BailingMoE3). De tiny-variant draait volledige 128K context op een $249 Orin Nano 8GB met 33 tok/s, terwijl een Arc B580 ~114 tok/s bereikt.
DeepSeek V4 Flash snelheid. Geoptimaliseerde kernels en KV-cache warming verlagen een chatbeurt op Mac Studio M3 Ultra van 6-20 seconden naar 1,6s. Een 4x RTX 3060-opstelling verwerkt prompts met ~100 tok/s en een 144GiB quant.
Laag-bit modeloverzicht. Bonsai 27B ternair werkt nu op mainline CUDA/Vulkan; Mach-1 Additive 35B draait tot 120 t/s op consumentenlaptops. Er worden nieuwe varianten op basis van Qwen3.8-27B ontwikkeld.
Agenttools en -frameworks
Afgestemde agent-evaluatoren. LangChain introduceert Tuned Evaluators die automatisch Perceived Error-feedback koppelen aan productietraces. Het gebruikt een gespecialiseerd model, waardoor de evaluatiekosten tot 82% dalen.
Agentzoekbenchmark. De Search Index van Artificial Analysis rangschikt Parallel, Exa, Firecrawl en andere op kwaliteit, kosten en snelheid voor agents. Betere zoekkwaliteit verminderde het tokenverbruik met meer dan 40%.
WriteGuard voor MCP. WriteGuard van Cloudflare, nu in private bèta, voegt gecentraliseerd beleid, attributie en audittlogs toe voor schrijfacties via MCP-servers.
Warp-softwarefabrieken. Warp Factories is een infrastructuurlaag die kleinere bedrijven helpt AI-codeeragents te implementeren met behulp van het softwarefabriekmodel.
Claude Code-mockups. Het /design-commando van Anthropic in Claude Code maakt UI-mockups in de terminal, die de bestaande codestijl volgen vóór ontwikkeling.
Veiligheid, beveiliging en beleid
OpenAI beveiligingsrevisie. Na het Hugging Face-incident en bewijs dat Astra kritieke cybersecuritycapaciteiten kan bereiken, pauzeerde OpenAI RL voor twee weken en verhardde sandboxen. De grootste geplande frontier-RL-run blijft in de wacht.
Copilot onthult beveiligingsrichtlijnen. Onderzoekers vroegen Microsoft 365 Copilot om zijn eigen gebruikersbevestigingsrichtlijnen uit te leggen en bouwden daarna een linkklik-exploit om gegevens te exfiltreren zonder bevestiging.
ChatGPT voor tieners. ChatGPT voor tieners wordt automatisch toegepast op gebruikers onder 18, met strengere inhoudsbeperkingen, Studiomodus en ouderlijk toezicht. Het is bedoeld om spieken en schadelijke inhoud te verminderen.
Amodei-debat over open modellen. Anthropic-CEO Dario Amodei stelt dat open modellen de macht verschuiven naar chipeigenaren en verdedigt voorstellen voor AI-regulering. Critici zoals LeCun en Sacks beschuldigen hem van bangmakerij.
Industrie & bedrijfsleven
Cursor lanceert Origin. Cursor lanceert Origin, een rivaal van GitHub voor codehosting, met agent-native functies en een gepland app-ecosysteem.
Waardering Etched verdubbelt. Etched haalde $700M op tegen een waardering van $21B, die in een maand verdubbelde, nadat Jane Street de prefill/decode-inferentiechips had getest.
Vraag naar modelroutering. De aankoop van OpenRouter door Stripe voor $7B en de $300M ARR van Glean benadrukken de toenemende vraag naar modelroutering nu open-weight modellen terrein winnen.
Onderzoek & studies
Geheugenkalibratie voor agents. Een studie van Hugging Face toont aan dat agentische geheugeneffecten variëren per modelniveau: gpt-oss-120b boekte +16,1 procentpunt taakvoltooiing met volledige richtlijnen, terwijl zwakkere modellen compacte retrieval nodig hebben.
Onafhankelijke AI-gebruiksgegevens. Stanford's AI Observatory verzamelde echte gesprekken en ontdekte dat AI-gebruik aanzienlijk verschilt per model, waarbij werkgerelateerde use cases minder vaak voorkomen dan bedrijven beweren.
Compaction verliest instructies. Onderzoekers van Penn State ontdekken dat slechts 17% van de sessiebeperkingen contextcompaction overleeft; een kleine add-on LLM herstelt de meeste verloren instructies.
Zelfverbetering niet op komst. Een studie onder leiding van Princeton vindt dat AI-agents technische problemen kunnen oplossen, maar geen oordeelsvermogen hebben voor open AI-onderzoek, wat suggereert dat recursieve zelfverbetering langer kan duren.
Dat was het voor vandaag - ongeveer 5 minuten leestijd.