Modelreleases & infrastructuur
Nvidia’s snelheidsgerichte model. Nvidia heeft Nemotron 3.5 Lightning uitgebracht, een open-weight 30B Mamba-Transformer-model dat op benchmarks GPT-OSS-120B evenaart en tegelijkertijd is geoptimaliseerd voor snelle inferentie met slechts 3,6B actieve parameters.
DeepSeek V4 draait lokaal. Community-quants van DeepSeek V4 verhelpen conversieproblemen voor bit-exacte baselines, en DeepSeek V4 Flash bereikt 27+ t/s op Strix Halo-APU's met speculatieve decodering, wat levensvatbare lokale implementatie aantoont.
Unsloth-desktopapp. Unsloth heeft een open-source desktopapp uitgebracht voor het draaien en trainen van lokale modellen op GPU's, met sandboxed code-uitvoering, RAG, modelexports en geen telemetrie.
River AI's $1,1B seedronde. Opgericht door ex-xAI-medeoprichter Igor Babuschkin, heeft River AI $1,1B opgehaald om persoonlijk trainbare AI-assistenten te bouwen door de hele stack van training tot hardware te heroverwegen.
Daybreak Cyber op AWS. OpenAI's Daybreak-cyberbeveiligingsmodellen zijn nu beschikbaar via Amazon Bedrock, waardoor verdedigers toegang krijgen tot geavanceerde cybermogelijkheden binnen hun bestaande AWS-omgevingen.
Zuck's open-sourcemanifest. Meta-CEO pleit voor meer open-weight-releases en nodigt overheden uit om samen te werken aan veiligheidstests, terwijl het bedrijf modellen zoals Muse Glimmer blijft publiceren.
Ling-3.0-ondersteuning. Een pull request voegt Ling-3.0 toe aan llama.cpp, met een kleine variant die al goed werkt voor spraaktaken van thuisassistenten vanwege de eerlijke weigering bij onzekerheid.
Tools & lokale AI
MCP-broker verlaagt context. Een DIY-agentraamwerk gebruikt een MCP-broker om tools achter een proxy te verbergen, waardoor de opstartcontext van 20K tokens naar bijna nul wordt teruggebracht, en voegt temporeel bewustzijn toe voor betere lokale uitvoering.
Mining-GPU's voor LLM's. 8GB CMP170HX-miningkaarten kunnen worden uitgebreid tot 64GB per stuk, waarmee grote modellen of meerdere kleine modellen tegelijkertijd draaien, en bieden goedkope maar verouderde Ampere-klasse prestaties.
366 t/s op V100. Aangepaste CUDA-kernels (v100-skinny) maken tot 366 t/s mogelijk op Qwen3.6 27B in NVFP4 op Volta-GPU's, waardoor oude hardware nieuw leven wordt ingeblazen voor lokale inferentie.
TinyTitle-model. Een GRU-model met 1,8M parameters genereert chattitels in minder dan 5 MiB RAM, wat ultra-lichte on-device-samenvatting aantoont die in een paar milliseconden draait.
Private e-reader-AI. Een e-reader-app integreert Gemma 4B-modellen lokaal voor privé-vragen en antwoorden over boeken in de app, met spoiler-toggles en automatische taalmatching.
AI-server met laag vermogen. Een build die een Intel N100 combineert met een RTX 5060Ti levert een stille, efficiënte llama.cpp-server die recente modellen zoals Qwen 3.5 kan draaien voor dagelijks gebruik.
Inferentiekosten verlaagd. De CEO van Doubleword legt uit hoe het ontwerpen van inferentiestacks voor niet-real-time gebruik de tokkenkosten met meer dan een orde van grootte kan verlagen in vergelijking met algemene opstellingen.
Slimme modelroutering. NVIDIA's Switchyard-bibliotheek routeert slechts 7% van de agentoproepen naar een frontier-model, waardoor de kosten met 74% dalen met minimaal verlies aan nauwkeurigheid, en biedt een formule om de kosten-baten te evalueren.
Private AR-brillen. Een blinde gebruiker vraagt om Meta-achtige AR-brillen die lokale modellen draaien om te voorkomen dat visuele gegevens naar Meta worden gestuurd, wat de vraag naar privacy in ondersteunende technologie benadrukt.
Frontieronderzoek
AI pakt Riemann aan. Een niet-uitgebracht Anthropic-model boekte vooruitgang op de Riemann-hypothese door 650 ideeën te testen met 60 subagenten gedurende 36 uur, waardoor het debat over de rol van AI in wiskundige ontdekkingen opnieuw werd aangewakkerd.
AMIE's videodiagnose. Google's AMIE-onderzoekssysteem demonstreerde klinische videoconsultaties op expertsniveau, met behulp van Gemini en een multi-agentopstelling om visuele, auditieve en contextuele signalen te interpreteren.
CARE-X AI voor thoraxfoto's. Microsoft's CARE-X is een uniforme thoraxfoto-VLM die generatie en gestructureerde voorspelling combineert, met behulp van reinforcement learning om klinische correctheid te belonen.
Strijd om agentisch geheugen. ACE en ALTK-Evolve zetten beide agenttrajecten om in herbruikbare lessen; ACE bouwt een uitgebreid draaiboek, terwijl ALTK-Evolve individuele richtlijnen ophaalt.
Logprobs detecteren hallucinaties. Het analyseren van tokenwaarschijnlijkheidsverdelingen bij de eerste feitelijke herinnering in chain-of-thought kan onbetrouwbare kennis onthullen, wat een potentieel vroeg hallucinatiesignaal biedt.
Waarschuwing over AI-schrijven. S. Alpert betoogt dat geen enkele herschrijving verliesloos is, dus AI-ondersteunde tekst moet persoonlijk worden geverifieerd om vervorming van de beoogde betekenis van de auteur te voorkomen.
Zaken & Financiën
Mijlpaal van 1B gebruikers. Zowel ChatGPT als Gemini bereikten 1B maandelijkse actieve gebruikers, waarbij Gemini Google's snelste product is om die schaal te bereiken; ChatGPT had eerder dit jaar al 900M wekelijkse gebruikers bereikt.
ChatGPT-advertenties gaan wereldwijd. OpenAI heeft ChatGPT-advertenties uitgebreid naar vijf extra landen, en meldt geen impact op het gebruikersvertrouwen en lage afwijzingspercentages, terwijl het streeft naar duurzame monetarisatie.
OpenAI-prijsverhoging. Nieuwe ChatGPT Business Premium Seats kosten $125 per gebruiker per maand met vijf keer de capaciteit en geen uurlijkse limieten, wat het zware tokenverbruik van agentische workloads weerspiegelt.
Lightcap vertrekt. Brad Lightcap, voormalig COO en leider van speciale projecten bij OpenAI, vertrekt na acht jaar om iets nieuws te beginnen, waarmee een reeks vertrekken van leidinggevenden wordt voortgezet.
Anthropic's $9,1B-lease. Anthropic heeft een 20-jarige datacenterdeal van $9,1B getekend met Bitcoin-miner Riot Platforms voor 191 MW in Texas, die vanaf 2027 de volgende generatie modellen van stroom moet voorzien.
Anthropic-IPO-hobbels. Voorafgaand aan een mogelijke IPO van $965B stellen investeerders de groei van Anthropic ter discussie te midden van goedkope Chinese modellen en politieke tegenwind, hoewel het bedrijf toekomstige gezondheids- en biologie-apps aanprijst.
Nvidia's $500B-impuls. Nvidia werkt samen met zes financiële bedrijven om $500B te mobiliseren voor AI-infrastructuur door tot 25% van de restwaarde van zijn chips te garanderen, waarmee het afschrijvingsangsten tegengaat.
Accel's India-AI-inzet. Accel heeft een overtekend India-fonds van $550M afgesloten, met de verwachting dat AI de basis zal vormen voor consumenten-, fintech- en productiestartups, in plaats van een op zichzelf staande categorie te zijn.
OpenAI-medewerkers cashen uit. Een aandeleninkoop van $7B bij een waardering van $852B stelt huidige en voormalige OpenAI-werknemers in staat om aandelen te liquideren, waardoor de druk voorafgaand aan een mogelijke IPO wordt verlicht.
Beveiliging & transparantie
EU verplicht AI-watermerken. Onder de EU AI Act verplichten Anthropic en OpenAI zich om gegenereerde inhoud te markeren; Claude zal onzichtbare watermerken in tekst en afbeeldingen verwerken, en ondersteuning voor oudere modellen is in ontwikkeling.
Apple-fotoherkomst. iOS 27 introduceert mogelijk 'Apple Reference Image' om herkomstmetagegevens in te sluiten bij het vastleggen, zodat gebruikers kunnen bewijzen dat iPhone-foto's geen deepfakes zijn.
Spotify markeert AI-artiesten. Spotify zal door AI gegenereerde artiestenprofielen labelen en uitsluiten van aanbevelingen, met zowel zelfrapportage als detectie, voordat de wijziging half september wordt uitgerold.
AI-schrijfgeschil. Game-studio Saber ontkent dat het schrijvers heeft vervangen door ChatGPT voor Rideshare Stimulator, maar de voormalige lead-schrijver beweert dat AI is gebruikt voor schrijfwerk en stemmen, zonder Steam-openbaarmaking.
AI-gestuurde Zoom-exploit. Een kritieke Zoom-kwetsbaarheid die apparaat-overname via de annotatiefunctie mogelijk maakt, werd gevonden met minder dan 20 prompts naar openbare AI-modellen, wat AI-versneld beveiligingsonderzoek aantoont.
Diefstal van redeneersporen. Onderzoekers speelden versleutelde chain-of-thought-tokens van frontier-modellen af in zwakkere zustermodellen, jailbreakten ze en herstelden verborgen redeneringen, waardoor wachtwoorden en API-sleutels in openbare sessies werden blootgelegd.
Vertrouwen op AI-gegenereerde code. IBM en Red Hat breiden Lightwell uit om verifieerbare softwareleverketens te creëren voor het AI-tijdperk, waarmee herkomst en beleidsnaleving voor zowel menselijke als AI-gegenereerde code worden gewaarborgd.
Dat was het voor vandaag - ongeveer 5 minuten leestijd.