Agentic AI News Vandaag

Het nieuws over AI-agents van de dag in één leesmoment van 5 minuten: releases, tools, onderzoek, financiering en bedrijfsontwikkelingen.

Dagelijks bijgewerkt samengesteld uit 30 bronnen maandag, september 7, 2026

Frontier-modellen & grote labs

OpenAI zet in op RSI. OpenAI zegt dat het doel van een “geautomatiseerde onderzoeksstagiair” is bereikt. Interne codeeragenten versnellen het onderzoek en sommige plannen zijn daardoor zes maanden naar voren gehaald. In een essay plaatst chief scientist Jakub Pachocki recursieve zelfverbetering centraal in AGI. Het bedrijf koppelt de stijging van de AI-uitgaven per onderzoeker in juli aan het model dat later als GPT-6 Astra is uitgebracht.

Figma security-agenten. Figma bouwde AI-agenten op Panther SIEM om meldingen in AWS, Okta, GitHub, GCP en osquery te onderzoeken. De agenten brengen de oplostijd voor complexe meldingen met 70% terug en het aantal on-call-meldingen met 20%. Menselijke controle blijft daarbij gehandhaafd.

Mantis-harness van Google. Google heeft Mantis open-source gemaakt, een agentisch kwetsbaarheidsscanframework. Het combineert critic/reviewer-agenten met reproductie in een sandbox om fout-positieven en gehallucineerde kwetsbaarheden bij het scannen van code te verminderen.

Lokale inferentie & hardware

LayerStoRm streamt MoE-experts. LayerStoRm, een experimentele engine met MIT-licentie, streamt continu MoE-experts vanuit het host-RAM naar gpu's. Een gekwantiseerde GLM-5.3-Flash van 186 GiB draait op die manier op 96 GB VRAM met 24,5 tok/s, met prefixcaching voor agentisch coderen.

Radeon Pro R9700-builds. De community-builds rond de Radeon AI Pro R9700 van AMD worden volwassener: een systeem met twee R9700's en 64 GB DDR5 draait Qwen 3.8 27B FP8/MXFP4 en Flash Next met vLLM. Gebruikers bespreken daarnaast 4xR9700-opstellingen voor het offloaden van DeepSeek V4 Flash en Qwen 3.8 Flash.

Lokale cache-tuning. Een nieuwe open-source-tool valideert de beloofde KV-cache-retentie onder belasting. Daaruit blijkt dat patches voor dedupe en boundfix tot 146% van de capaciteit kunnen vasthouden. Gebruikers melden daarnaast dat een f16-cache op oudere gpu's de MTP-acceptatie verbetert ten opzichte van Q8.

Benchmarks & evaluatie

Struggle Bench. Een nieuwe “Struggle Bench” geeft een model een server, een appartement en een bankrekening, en meet vervolgens hoeveel maanden het de huur kan betalen en operationeel kan blijven zonder gebruik te maken van cybercriminaliteit. Het is een test van echte autonomie en overleving.

lm-eval-ledger-harness. lm-eval-ledger voert benchmarks uit en slaat alles op in SQLite. Een webapp toont en vergelijkt hoe modellen elke vraag hebben beantwoord, in plaats van alleen de eindcijfers te tonen.

Diepere codebenchmarks. Program-Bench, SRE-Bench en Code Migration dagen agenten uit om binaries te reconstrueren op basis van documentatie, om praktijkbinaries zonder broncode te doorgronden en om programma's in een andere taal te herimplementeren. Daarmee peilen ze diepgaande software-engineeringkwaliteiten.

Juridisch & auteursrecht

Aanklacht Seattle Times en Newsday. The Seattle Times en Newsday hebben OpenAI en Microsoft aangeklaagd wegens inbreuk op het auteursrecht. Ze eisen vernietiging van de AI-modellen die op hun werk zijn getraind. Daarmee sluiten ze zich aan bij bijna 400 lokale kranten die vergelijkbare claims hebben ingediend.

Geschillen rond Anthropic-schikking. Auteurs melden dat uitgevers en agenten meer opeisen dan hun deel van de auteursrechtschikking van Anthropic, die 1,5 miljard dollar bedraagt. Verder is er onenigheid over teruggevallen rechten, waarbij auteurs volledige betaling zouden moeten krijgen.

Veiligheid & guardrails

Abliteration als service. De Amerikaanse startup Abliteration.ai verkoopt API-toegang tot safety-abliterated open-weight-modellen zoals GLM-5.3 voor red teaming en malware-analyse. Door weigeringen weg te halen verlaagt het bedrijf de drempel voor misbruik.

Ongecensureerde Qwen-varianten. Een vergelijking van acht Qwen 3.8 27B-varianten waarop abliteration is toegepast, wijst uit dat orcarouter het hoogst scoort op HarmBench ASR, terwijl apostate het dichtst bij de basismogelijkheden blijft. De pakketten kennen wel eigenaardigheden, zoals ontbrekende vision- en MTP-ondersteuning in sommige releases.

Debat over AI-psychose. Onderzoekers betogen dat vleierige chatbots wanen kunnen versterken in een “echokamer van één” en pleiten voor erkenning van “AI-gerelateerde psychose”. Of die een zelfstandige diagnose verdient, blijft echter omstreden.

Modelreleases & onderzoek

Compacte Spark-X2.5-modellen. XHToken heeft twee modellen uitgebracht: Spark-X2.5-4B en Spark-X2.5-1.7B. De efficiënte modellen hebben een native context van 1M tokens en ondersteunen meer dan 200 talen. Een pull request voor llama.cpp voegt ondersteuning toe.

WeatherNext 3 leert van satellietdata. WeatherNext 3 van Google en DeepMind slaat fysicasimulaties over en leert rechtstreeks van realtime-satellietdata. Het model produceert elk uur verwachtingen op 5-km-schaal en verbetert de nauwkeurigheid van neerslagvoorspellingen met tot 50%.

Meta's realtime-audiomodel. Meta heeft Muse Voice Transcribe uitgebracht, een realtimemodel dat audio opdeelt in segmenten van 80 ms, spraak transcibeert en tot 20 sprekers onderscheidt. Het kost 0,18 dollar per uur en ondersteunt meer dan 70 talen.

Muziekmodel Lyria 3.5 van Google. Google heeft Lyria 3.5 toegevoegd aan Gemini en de API's voor muziekgeneratie met expressieve vocalen en uitsluitend gelicentieerde trainingsdata.

Dat was het voor vandaag - ongeveer 5 minuten leestijd.

Lees het elke ochtend, direct in je browser

De extensie opent deze samenvatting in het zijpaneel van Chrome — één klik, geen account.

Toevoegen aan Chrome — Gratis