Agent- en modelreleases
Tencent Hy4-preview. Tencent heeft Hy4 preview uitgebracht, een flinke omvangstoename ten opzichte van Hy3 met standaard hoge redeneerkracht en een no_think-modus. De community heeft al een officiële quant van ca. 2,38 bit en een GGUF van circa 200 GB die volgens berichten ongeveer 98% van de BF16-prestaties behaalt.
Lokale inferentie en hardware
FlashMLA sm_120-port. Een community-build breidt FlashMLA uit naar consumenten-Blackwell-sm_120-GPU's en laat 2–3x snelheidswinst zien ten opzichte van PyTorch SDPA bij diverse sparse MLA-workloads en 8% lagere latentie bij FP8-KV-cache-decode.
Nemotron 16GB-fix. Low-bit-GGUFs van Nemotron-3.5-Lightning bleken stilletjes circa 4,70 bpw te zijn door rijbrede kwantisatie; een gepatchte llama.cpp-build produceert een echt 3,07-bpw-bestand van 11,77 GiB dat 262K context draait op 16 GB.
Qwen3.8-Flash-Next op Mac. Een 79 GB 2-bit Qwen3.8-Flash-Next draaide op een 128 GB M5 Max met een contextslot van 350K via llama.cpp, inclusief een koude prefill van 333 s bij een prompt van 105K en ngram-gemoduleerde speculatieve decoding.
DeepSeek V4 Flash dual GPU's. Op 2x DGX Spark/GX10-opstellingen haalt DeepSeek V4 Flash 0731 een aanhoudende 67–84 tok/s, met lokale HumanEval Pass@1 van 94,5% tegenover 97,0% voor GLM-5.3-Flash NVFP4. GLM voltooide de benchmark in ongeveer de helft van de tijd.
1M context op dual 5090's. Een NInfer-fork voegt tensorparallelisme en YaRN ×4-schaling toe om Qwen3.8-27B NVFP4 met 1.048.576 tokens context op twee 5090's te draaien, met decodeersnelheden van 48–100 tok/s bij 1M en behoud van MTP-acceptatie waar vLLM naar nul zakt.
27B op 16 GB. Hybride kwantisatie plus kvarn-cache-instellingen laten Qwen3.8-27B draaien met 100K context op 50 tok/s op een 16 GB RTX 4070 Ti SUPER, met MTP-speculatieve decoding en KV-cache met staartprecisie.
FreeToken MoE-engine. Onderzoekers van UC Berkeley en MIT introduceerden FreeToken, een open-source engine die MoE-experttransfers dynamisch co-scheduleert zodat frontier sparse modellen op consumenten-GPU's kunnen decoderen zonder te stagneren op PCIe/RAM-misses.
Benchmarks en evaluaties
Terminal Bench 4.0. Terminal Bench 4.0 is uitgebracht met een ververst leaderboard en een focus op snelle iteratie om verzadiging tegen te gaan; GLM-5.3 scoort op Fable 5-niveau binnen de foutmarge.
Financiële benchmarkdisclosure. Een benchmarkkaart voor Ling-3.0-flash-Fin laat zien hoeveel agent-scaffolding, tools en evaluatiepijplijnen de gerapporteerde resultaten bepalen; veel runs gebruikten ReAct met webzoekopdrachten en Python, en sommige evalsets zijn intern of nog niet openbaar.
Onderzoek en agentinfrastructuur
Google WikiSkill-geheugen. Google Research's WikiSkill geeft agents een persistente wiki-achtige kennisbank van eerdere mislukkingen en successen, met herbruikbare Agent Skills die het gedrag sturen zonder modelgewichten te wijzigen.
Anthropic Model Hardware Standard. Anthropic bouwt MHS, een uniforme interface waarmee agents fysieke apparaten zoals microscopen en robotarmen kunnen aansturen; vroege tests verkleinden multi-machine-integratie van weken naar uren, maar menselijk toezicht blijft noodzakelijk.
Datalaag voor agents. Een TOTVS-presentatie stelt dat transactionele systemen en datalakes niet zijn geoptimaliseerd voor token-hongerige, latentiegevoelige agent-redenering, en beschrijft hoe data-toegang evolueert naar MCP en semantische modellen.
LAION Big Video Dataset. LAION bracht BVD uit, een onderzoeksdataset van 10 miljoen uur video met 55 miljoen clips en 300 miljoen stilstaande beelden, die video, audio en tekst koppelt; modellen die erop trainden versloegen InternVid-baselines met tot 2,1 punten op sommige benchmarks.
Industrie en bedrijfsleven
Sony en Warner dagen Anthropic voor de rechter. Sony Music Publishing, Warner Chappell en andere uitgevers hebben Anthropic aangeklaagd wegens het vermeend torrenten en scrapen van auteursrechtelijk beschermde werken om Claude te trainen, en eisen schadevergoeding tot $150.000 per werk. Anthropic zegt zich te zullen verdedigen.
OpenAI breekt met Cursor. OpenAI beëindigt na de overname door SpaceX het contract met Cursor, verwijzend naar de geschiedenis van Elon Musk-bedrijven met het verbreken van contracten. Anthropic reageerde door zichzelf als de betrouwbaardere partner te positioneren en toegezegde compute voor Cursors Claude-gebruik te blijven leveren.
Nvidia verder dan GPU's. Het earningsverhaal van Nvidia verschuift van GPU-aandeel naar datacenterorkestratie en systemen rond de GPU, waar het state-of-the-art netwerk- en orkestratiehardware heeft gebouwd nu AI-compute naar gigawattschaal groeit.
Dat was het voor vandaag - ongeveer 5 minuten leestijd.