Modelreleases
Qwen 3.8 27B. Het Qwen-team van Alibaba heeft Qwen3.8-27B en de grotere Qwen3.8-2.4T-A95B uitgebracht onder Apache 2.0. Het 27B dichte model deelt dezelfde architectuur als Qwen3.6-27B, maar verbetert coderen, kantoortaken en agentplanning door trainingswijzigingen. Het ondersteunt 262k native context, uitbreidbaar tot 1M tokens.
GLM-5.3 van Zhipu. Zhipu AI heeft GLM-5.3 uitgebracht, dat gebruikmaakt van hetzelfde basismodel als GLM-5.2 maar met uitgebreide post-training. Het bedrijf claimt dat het het sterkste open-weights codeermodel is, met opmerkelijke verbeteringen in agentische codering en het ontdekken van cybersecuritykwetsbaarheden. De gewichten worden over twee weken op Hugging Face verwacht.
Meta's Muse Glimmer. Meta heeft Muse Glimmer als open source uitgebracht, een 30B agentisch model onder Apache 2.0, gericht op lokale workflows op consumenten-GPU's. Het distilleert redeneer- en tool-call-vaardigheden van het grotere Muse Spark en was kortstondig de frontier in de 30B-klasse.
Chinese open-modelgolf. In minder dan een maand hebben Chinese labs Kimi K3, Qwen3.8, DeepSeek-V4-Pro-0813 en GLM-5.3 uitgebracht, wat de snelle vooruitgang van open-weights frontier modellen onderstreept.
Lokale implementatie & community
Apple Silicon versnelling. Een nieuwe mlx-dspark-release brengt speculatieve decodering naar Qwen3.8-27B op Apple Silicon, met tot ongeveer 3× snellere generatie op een M4 Pro, terwijl identieke output-tokens worden geproduceerd.
Kwantisatie en gewichten. Unsloth heeft gekwantiseerde gewichten voor Qwen3.8-27B uitgebracht, en Tim Dettmers hintte op een nieuwe kwantisatiemethode die GLM-5.3 op een enkele DGX Spark zou kunnen draaien met 7 tokens/s.
Vroege Qwen 3.8-tests. Communitytests tonen sterke one-shot codeerdemo's en agentisch gedrag in Qwen3.8-27B, maar sommige gebruikers melden merkbaar bijgesneden algemene kennis en extreem lange denksporen bij xhigh reasoning-inspanning. Aanbevolen samplingparameters zijn beschikbaar op de modelkaart.
- → Qwen 3.8 - 27B is a game changer
- → A hunch: Qwen3.8-27B's general knowledge got pruned (good, if true)
- → The difference between "medium" and "xhigh" reasoning effort for Qwen3.8-27B is actually insane.
- → Qwen 3.8 27B - Aquarium Burst Sample Test
- → RetroCraft - Qwen 3.8 27B Q8, one shot with exact performance data on dual 3090s.
Ongecensureerde lokale variant. Een community-'heretic'-versie van Qwen3.8-27B verwijdert weigeringen en beveiligingen, met als doel een lokaal ongecensureerd alternatief te bieden op het niveau van een frontiermodel zoals Opus 4.6.
AI-transparantie & veiligheid
Anthropic-watermerkdetectie. Anthropic zal een watermerkdetectie-API aanbieden zodat externe ontwikkelaars tekst kunnen detecteren die waarschijnlijk door Claude is gegenereerd. De methode maakt gebruik van SynthID Text en is minder betrouwbaar bij korte, feitelijke of zwaar herschreven tekst.
Google maakt watermerk optioneel. Google stelt gebruikers in staat zichtbare watermerken uit te schakelen op AI-gegenereerde afbeeldingen, video's en muziek van Nano Banana, Omni en Lyria. Onzichtbare SynthID- en C2PA-metagegevens zullen nog steeds worden ingebed voor verificatie.
Prompt-injectie in de rechtszaal. Een rechter in Connecticut documenteerde wat de eerste Amerikaanse rechtbankindiening lijkt te zijn met verborgen tekst die bedoeld was om AI-systemen die de zaak beoordelen te manipuleren. De verborgen instructies hadden geen effect, maar de rechter noemde de tactiek gevaarlijk.
Agents in productie
Claude Code-onderhoudstaak. Anthropic zegt dat Claude Code dagelijks onderhoud uitvoert op zijn eigen apps, met 388 pull-verzoeken en een mergepercentage van 46 procent na menselijke beoordeling. Routines omvatten crash-fuzzing, het opschonen van dubbele abstracties en afhankelijkheidscontroles.
OpenAI Computer History. OpenAI's Computer History vervangt het Chronicle-screenshotprototype en registreert klikken, toetsaanslagen en app-wisselingen op macOS om een doorzoekbare tijdlijn op te bouwen. Het kan terugkerende workflows detecteren en herbruikbare vaardigheden voor ChatGPT en Codex voorstellen.
Industrie & bedrijfsleven
VS-China prijzenoorlog. OpenAI en Anthropic verlagen de prijzen terwijl Chinese open modellen terrein winnen; Google's Gemini 3.7 Flash debuteert met een introductiekorting van 50 procent gericht op coderen en agents. Tokenprijzen van toonaangevende Amerikaanse labs zijn sinds half juli met bijna een kwart gedaald.
GPT-5.6 Sol Ultrafast. OpenAI heeft een preview van Ultrafast-modus voor GPT-5.6 Sol gelanceerd, mogelijk gemaakt door Cerebras, met tot 750 output-tokens per seconde. De API-service is aanvankelijk beperkt tot geselecteerde klanten en gericht op realtime analyse tijdens incidenten of marktgebeurtenissen.
Meta's AI voor iedereen. Meta combineerde de Glimmer-release met een lange brief van Zuckerberg waarin wordt betoogd dat AI voor iedereen open zou moeten zijn, maar podcastdekking merkt op dat het bedrijf zijn krachtigste Muse Spark achter API's houdt. Dezelfde discussies wijzen op een mislukte overname van 250 miljoen dollar.
Apple-Alibaba China-model. Apple heeft naar verluidt een op maat gemaakt AI-model getraind voor de Chinese markt met hulp van Alibaba, vóór de introductie van Apple Intelligence op Chinese apparaten. Het partnerschap is een zeldzame Amerikaans-Chinese AI-samenwerking.
Kog inferentie-push. Het Franse startup Kog gebruikt softwareoptimalisatie om meer snelheid uit conventionele GPU's zoals AMD MI300X en Nvidia H200 te halen, gericht op snellere single-request-decoding voor software-engineering-workloads.
Aardgasprijsrisico. Een nieuwe Noreva-voorspelling waarschuwt dat aardgasprijzen in delen van de VS kunnen verdrievoudigen, terwijl hyperscalers zoals Amazon, Google, Meta en Microsoft gasstroom voor AI-datacenters vastleggen.
Onderzoekshoogtepunten
150M ARC-model. Een 150M-parameter recurrent latent redeneringsmodel scoort 29,5% op ARC-AGI-1 voor $0,0007 per taak, buiten de gepubliceerde kosten-nauwkeurigheidsgrens. Het draait op minimale hardware, hoewel opschaling naar miljarden parameters nog nodig is.
Twijfels over autonoom onderzoek. Een studie van Princeton en UK AISI, die gebruikmaakt van ongepubliceerde NeurIPS-papers, ontdekte dat huidige frontiermodellen onderzoeksengineering aankunnen, maar falen bij de delen van onderzoek die er echt toe doen, wat in tegenspraak is met labclaims over autonoom AI-onderzoek.
DarwinX-harness-evolutie. DarwinX evolueert agent-harnesses door natuurlijke selectie over prompts, tools, vaardigheden en control flow, terwijl de modelgewichten bevroren blijven. Het voegt gemiddeld ongeveer 17 punten toe over vier benchmarks en gaat ongewijzigd over naar SWE-bench Verified.
PlayWorld-benchmark. PlayWorld benchmarkt video-wereldmodellen met behulp van multimodale agent-spelers die 171 langetermijndoelen nastreven, waarbij geometrieconsistentie, interactiegetrouwheid, evolutie buiten het zicht en inzicht-evolutie worden gemeten.
Dat was het voor vandaag - ongeveer 5 minuten leestijd.