Agentic AI News Vandaag

Het nieuws over AI-agents van de dag in één leesmoment van 5 minuten: releases, tools, onderzoek, financiering en bedrijfsontwikkelingen.

Dagelijks bijgewerkt samengesteld uit 30 bronnen zondag, augustus 23, 2026

Lokale modellen & agent-workloads

Qwen3.8 27B lokaal. Communitytests tonen aan dat Qwen3.8 27B sterker is dan Qwen3.6 in het opvolgen van instructies en werk met lange context; een enkele RTX 5090 draait een NVFP4-versie met 262K context op 77 tok/s bij korte context en 65 tok/s bij 128K.

Speculatieve decodering. DFlash 2 met een n-gram-drafter leverde 2,26x op LiveCodeBench-prompts voor Qwen3.8 27B en tot 4,68x in lange codeersessies; een vaste MTP-head op Ornith 35B reduceerde de doorlooptijd met een derde.

Recursief contextbeheer. Bouwers koppelen een snelle 64K-hoofdagent aan recursieve subagenten en kleine compressormodellen om veel langere taken aan te kunnen zonder voor 300K context te betalen.

Tool-calling Gemma-tune. Een Gemma 4 12B-finetune voor tool calling en CLI-gebruik verbeterde het toolgebruik met 2,7x en verhoogde het aantal tool-call-pogingen met 15,7%, gericht op setups met 16GB VRAM.

DGX Spark-cluster. Een DGX Spark-cluster met 36 nodes wordt gebruikt als agent-capabilitycluster, waarbij nodes tegelijk worden verdeeld over SOTA-modellen, rerank/embeddings, video-, beeld- en audiowerk.

Tools & frameworks

llama.cpp 0.2.0. llama.cpp versie 0.2.0 is uitgebracht met pre-builds en de laatste upstream-wijzigingen voor lokale inferentie.

Cloudflare Kitesurf. Kitesurf is een browserengine voor agents, gebouwd op WebAssembly/Rust-Workers met geïsoleerde DOM per pagina; het ondersteunt CDP, zodat Playwright en Puppeteer het kunnen aansturen met minder overhead dan volledig Chromium.

llm 0.33. Simon Willisons llm 0.33 voegt per-call API-sleutels voor embeddingmodellen toe, herbruikbare templates om modelconfiguraties en prompts te combineren, en reasoning_summary-opties voor reasoningmodellen.

Coding agents in de praktijk. Simon Willison stelt dat de belangrijkste vaardigheid voor coding agents is om wijzigingen zelfverzekerd te instrueren en te verifiëren; Linus Torvalds beschrijft een AI die in een lastige debugsessie het vuile werk deed, maar een zetje nodig had omdat hij steeds beweerde dat het probleem onoplosbaar was.

Onderzoek & methoden

Skills als playbook. In 8.135 testruns hielpen agent-skills vooral door betrouwbare processen te bieden, niet door feiten; procedurele grounding was verantwoordelijk voor 65,7% van de winst, en skills faalden wanneer taken afweken van het aangeleerde proces.

Mentale wereldmodellen. Nieuw onderzoek voegt menselijke overtuigingen en intenties toe aan AI-wereldmodellen met MENTIS; het modelleren van fysieke, mentale en sociale plausibiliteit verbetert het voorspellen van menselijk gedrag aanzienlijk.

Psychometrie van safety-benchmarks. Psychometrische analyse van acht safety-benchmarks toont aan dat één score afwegingen verbergt tussen de striktheid van weigeringen, waarheidsgetrouwheid en contextuele schade; modellen kunnen safety-scores opblazen door overmatig te blokkeren.

Omkeerbare CoT. Een voorstel voor ongeveer omkeerbare redeneerstappen met checks op cyclusconsistentie en uncomputation zou hallucinaties kunnen opvangen en KV-cachegeheugen in edge-LLM's verminderen.

Alles simuleren. Latent Space stelt dat synthetische data, rubrics en omgevingen ervoor zorgen dat elk onderdeel van de ML-pijplijn door modellen wordt gemaakt, waarmee menselijke simulatie wordt benaderd: 10% slechter, maar 100x goedkoper en 10.000x sneller.

Industrie & toepassingen

Inherent Faraday. De DeepMind-alumni-startup Inherent zegt dat de Faraday-agent beter presteerde dan modellen van Anthropic en OpenAI bij het onafhankelijk reproduceren van gepubliceerde wetenschappelijke bevindingen, terwijl hij een fractie van de omvang gebruikte.

LinkedIn AI-reviews. LinkedIn bouwde een multi-agentplatform voor AI-codebeoordelingen dat feedback verankert in diffs en codebaseconventies om hallucinaties en weinigzeggende opmerkingen te verminderen.

Netflix GenRec. Netflix' aanbevelingssysteem GenRec, dat op taalmodellen is gebaseerd, zet gebruikersgedrag om in tekst en versloeg in offline en live A/B-tests de handmatig gebouwde feature-engine van het bedrijf met veel minder data.

DoorDash SafeChat. DoorDash gaf details over SafeChat, een op schaal gebouwd veiligheidssysteem voor de marketplace, en verving het door een krachtigere architectuur toen het eenmaal werkte.

AI-avatars in het onderwijs. De Foundry-bootcamp van Harvard Business School (699 dollar) gebruikt HeyGen AI-avatars voor feedback op pitches en boardmeetings; deelnemers waarderen de begeleide ervaring, al vindt de echte instructeur de kopie een beetje griezelig.

Modelnieuws. Liquid AI peilt de interesse in een 100B LFM-model, terwijl een mysterieus model genaamd Ox Alpha aandacht trekt met sterke codeer- en agentprestaties; speculatie wijst op een afgeleide uit de GLM-familie.

Beleid, veiligheid & vertrouwen

OpenAI SB 53. OpenAI zegt nu dat Californië SB 53 zou moeten wijzigen om tijdens frontier-training monitoring en sterkere cybersecurity toe te voegen, nadat het zich eerder tegen de wet had verzet.

Inperkingsplannen. Een studie van Guidelight beoordeelde vijf frontier-labs op het inperken van rogue-modellen; OpenAI scoorde het hoogst, Anthropic en Meta het laagst, en weinig labs publiceren aangetoonde responsplannen.

Claude-watermerken. Anthropics nieuwe watermerktechniek voor Claude-tekstuitvoer wordt in detail uitgelegd: hoe het watermerk wordt toegepast en wat het wel en niet kan.

Vertrouwen in gesloten modellen. Een Reddit-thread in r/LocalLLaMA stelt dat OpenAI bij schoolwerk opzettelijk slechter presteert en afstand neemt van het empoweren van gebruikers, waardoor beoefenaars voor agentic loops terugkeren naar lokale modellen.

Dat was het voor vandaag - ongeveer 5 minuten leestijd.

Lees het elke ochtend, direct in je browser

De extensie opent deze samenvatting in het zijpaneel van Chrome — één klik, geen account.

Toevoegen aan Chrome — Gratis