Modelreleases en lokale AI
Sori-1B audio-taalmodel. Een model met 1B parameters dat vanaf nul is getraind op aan audio gekoppelde tekst, zonder pretraining op alleen tekst, moet antwoorden in audio verankeren. Het gebruikt de frozen Audio Flamingo Next-encoder van NVIDIA en een eigen tokenizer op basis van een auditieve ontologie, en is uitgebracht onder een niet-commerciële/academische licentie.
Lokale Qwen3.8-golf. Volgens communityrapporten draaien Qwen3.8-27B en Flash Next op uiteenlopende hardware, van een telefoon met 12 GB geheugen (3,5 tok/s) tot vier R9700-GPU's (80-120 t/s generatie, 700k context). In lokale agent-workloads is Flash Next sneller en technisch betrouwbaar, terwijl de dense 27B sterker blijft voor langdurig multi-turn gebruik. Sommige gebruikers vinden de modellen dense; wel wordt de kwaliteit van Duitse vertalingen geprezen.
- → Qwen3.8-Flash-Next-NVFP4 vs Qwen3.8-27B-FP Test Results
- → Qwen 3.8 27B - Fantastic German capabilities
- → Unpopular opinion Qwen 3.8 is hard to understand
- → Qwen 3.8 Flash Next locally on simple mobile phone at 3.5 tok/s
- → Here my pretty good qwen3.8 27B setup, hope it helps
- → Qwen3.8-Flash-Next turns 4xR9700 into a local AI powerhouse! 120 t/s TG and 12k t/s PP single request with optimized vLLM
Ongecensureerde GGUF-releases. Een Reddit-gebruiker heeft GGUF's gepubliceerd van LongCat-Flash-Lite-Sparse, een sparse-attentionmodel met 69B-A3B en 1M context, plus Qwen3.8-27B met MTP's, Qwen3.5-122B-A10B, Qwen3-Coder-Next en een visiemodel. Ondersteuning voor LongCat vereist een aangepaste fork van llama.cpp.
Desktop-AI-hardware. NVIDIA's DGX Station-desktop levert prestaties van datacenterklasse met een geheugenbandbreedte van 7,1 TB/s, terwijl Framework een moederbord met 192 GB geheugen lijkt voor te bereiden dat naar verwachting rond de 4.500 dollar gaat kosten.
Benchmarks en evaluaties
Pentesting-benchmark voor LLM's. Een nieuwe benchmark test LLM's tegen live infrastructuur die ze moeten aanvallen. Het doel is het beste model voor offensief beveiligingswerk te vinden, in plaats van bekende CVE's te reproduceren.
Codeerbenchmark-index. Een Reddit-gebruiker heeft de belangrijkste agentic codeerbenchmarks samengebracht in een 'Agentic Coding Index' en een metriek voor intelligentiedichtheid berekend om modelcapaciteit per parameter te vergelijken.
Egocentrische VLM-evaluatie. Met HFlow op een egocentrische videobenchmark evenaarde een open Gemma-VLM Gemini 2.5 Flash op de metrieken voor handzichtbaarheid en manipulatie, terwijl hij 19x goedkoper was. Dat maakt private self-hosted verwerking haalbaar.
Tools en agentframeworks
Cloudflare AI Search. Cloudflare AI Search biedt nu een end-to-end zoekpipeline voor eigen data, met agentintegratie, multimodaal zoeken en een discover-modus die sites zonder sitemaps kan indexeren.
AWS Kiro Crew. AWS heeft Kiro Crew als open source uitgebracht, een werkruimte voor het draaien van meerdere asynchrone coding agents met gedeeld geheugen, herbruikbare skills en geplande taken. Intern werd het door meer dan 39.000 ontwikkelaars gebruikt.
ChatGPT Work uitgelegd. ChatGPT Work van OpenAI, onderdeel van betaalde abonnementen, is er als cloudversie via chatgpt.com en als lokale desktopversie die bestanden kan openen en programma's kan uitvoeren. De afbakening met Chat blijft echter verwarrend.
Claude Code-limiet verlaagd. De aanstaande verhoging van de basislimiet met 25% voor Claude Code blijkt in de praktijk een effectieve verlaging van 17% ten opzichte van de huidige tijdelijke boost van 50%. Anthropic heeft ook een automatische bugreport-tool toegevoegd.
Onderzoek en analyse
Agents zonder tijdsbesef. Uit een onderzoek blijkt dat Claude Code en Codex de duur van taken stelselmatig verkeerd inschatten: korte taken overschatten ze 3 tot 10 keer, wat problematisch is voor langlopende agent-taken.
PILOT live zelfverbetering. PILOT is een supervisor-worker-harness die live sturing en live zelfevolutie toevoegt voor long-horizon agents. Op Terminal-Bench 2.0 presteert hij tot 9,8 punten beter dan vergelijkbare harnesses.
GameWAM wereld-actiemodel. GameWAM is het eerste world-action model voor native video-gameplay. Het genereert via flow matching gelijktijdig toekomstige frames en toetsenbord-muisacties, met long-horizon block-cycle control.
Next-chunk reasoning: RL versus SFT. Uit een gecontroleerde studie blijkt dat Mixed SFT op no-CoT- en long-CoT-data beter presteert dan next-chunk reasoning RL als pre-RLVR-trainingsstrategie, met meer dan 60x minder rekenkracht.
AI-agency-debat. In een essay dat verwijst naar het Hugging Face-incident van juli, wordt betoogd dat AI-agency – niet alleen capaciteit – de uitkomsten bepaalt. Ook hoe gebruikers die agency toestaan of beperken, doet ertoe.
Industrie, beleid en bedrijfsleven
NVIDIA neemt Hugging Face over. Volgens berichten zou NVIDIA Hugging Face overnemen in een deal van 12,9 miljard dollar. Die combinatie zou rekeninfrastructuur samenbrengen met de belangrijkste distributiehub van het open-model-ecosysteem en de industriële omslag van AI versnellen.
VS-handelsbarrières voor robots. Washington heeft de beperkingen en invoerheffingen op Chinese drones en robots aangescherpt, met een beroep op de nationale veiligheid. Toch kunnen de productieschaal en kostenvoordelen van China de impact wereldwijd afzwakken.
Industriële AI-adoptie. Meta test robots van Watney, Kinova en ABB voor serverresets, kabelwissels en powercyclen in datacenters. Caterpillar past lessen uit autonome mijnbouw toe op de bouwsector en zet AI-assistenten in voor technici.
Musk: turbineonderdelen in eigen huis. SpaceX bouwt een gieterij voor gasturbinebladen en -schoepen. Musk zegt dat in-house gieten de stroomopwekking uit aardgas voor AI-datacenters met maximaal 18 maanden kan versnellen.
AI-sentiment onder werknemers daalt. Uit cijfers van Glassdoor blijkt dat de positieve stemming over AI onder Amerikaanse werknemers is gedaald van 81% in 2019 naar 43% medio 2026. Managers zijn het meest optimistisch; Gen Z-vrouwen, schrijvers en verzekeringsmedewerkers het meest negatief.
Muziekuitgevers klagen Anthropic aan. Sony Music, Warner Music en anderen beweren dat Anthropic illegaal tienduizenden auteursrechtelijk beschermde songteksten via torrents heeft gedownload om Claude te trainen. Daarbij worden CEO Dario Amodei en medeoprichter Benjamin Mann persoonlijk genoemd.
Texas blokkeert Flock-camera's. Gouverneur Abbott heeft de staatsuitgaven aan Flock AI-bewakingscamera's bevroren, nadat er meer dan 30 miljoen dollar was besteed. Aanleiding zijn privacyzorgen van beide partijen en incidenten met misbruik door politieagenten.
Dat was het voor vandaag - ongeveer 5 minuten leestijd.