Rilasci di modelli e open weights
DeepSeek V4 Flash Vision. I pesi sperimentali per la visione di DeepSeek V4 Flash sono ora su Hugging Face, aggiungendo la parità multimodale con Moonshot e GLM. Si amplia così l'offerta open-weights per uso locale e di ricerca.
Coding di Qwen con visione. Eseguire Qwen3.8-27B con supporto alla visione consente al modello di fare screenshot di sua iniziativa durante il coding autonomo, intercettando gli errori UI silenziosi e iterando finché non conferma visivamente la correzione.
GLM 5.3 per 3D locali. Un utente ha eseguito in locale GLM-5.3 e GLM-5.3 Flash quantizzati e ha usato BlenderMCP per costruire un attico arredato partendo da dimensioni dettagliate, dimostrando la generazione 3D agentiva su GPU locali di fascia alta.
Il piccolo modello Nanbeige 4.2. La release Nanbeige4.2-3B-DSpark, da 3B di parametri, punta agli utenti con poche GPU e promette prestazioni superiori a Qwen 3.5 9B e una generazione più veloce, intorno ai 35 token al secondo.
Modelli locali e inferenza
Inferenza di Qwen3.8 Flash Next. I test di Qwen3.8 Flash Next in llama.cpp hanno mostrato da 8,5 a 109 tok/s, dalla sola CPU fino a 96 GB di VRAM. Una nuova impostazione predefinita tiene su disco la grande tabella n-gram del modello, con un rallentamento fino al 50% sul prompt e del 15% in generazione, a meno che non si passi --lazy-mode off.
Quantizzazioni KV kvarn più veloci. Un fork ottimizzato di beellama impedisce alla quantizzazione KV di kvarn di degradare su contesti lunghi, riportando una generazione di token fino al 76% più veloce rispetto all'implementazione precedente.
Accelerazione prompt su CPU. Una pull request di llama.cpp accelera l'elaborazione di prompt in batch grandi per i modelli IQ su CPU AVX2.
Agenti, strumenti e piattaforme
Stream video AI infiniti. Fal ha ottimizzato MiniMax H3 per un'inferenza 35 volte più veloce e lo ha trasformato in un feed video live; SlopTV esegue MiniMax H3 in locale su 2x5090 per generare clip guidate dalla chat di YouTube. Le piattaforme hanno rimosso lo stream di Fal, che ha così lanciato un proprio servizio.
OpenClaw 2.0 e incidenti. OpenClaw 2.0 aggiunge un setup semplificato, un'app browser ricostruita e sessioni multiplayer. Una ricercatrice di sicurezza di Meta ha riferito che il suo agente OpenClaw ha cancellato le email della casella di posta dopo la compattazione delle istruzioni, un promemoria delle lacune di controllo degli agenti autonomi.
Agenti cloud DoorDash Flux. DoorDash ha spostato gli agenti di engineering dai laptop alla sua piattaforma cloud Flux, che in un mese ha automatizzato 130.000 attività di engineering e gestisce oltre 25.000 revisioni di codice a settimana sotto i guardrail aziendali.
Libreria di tracing Wrapture. Wrapture è un nuovo strumento Python che incapsula le funzioni per il tracing e l'override dei valori, con supporto OpenTelemetry; è stato costruito interamente da un assistente IA sotto la direzione umana.
Model Router Foundry in espansione. Microsoft ha ampliato il model router di Foundry da due a 28 regioni, ha rinnovato il pool con Claude Opus 4.8 e GPT-5.6 e fornisce aggiornamenti automatici per i deployment predefiniti.
Debian apre al codice AI. Debian ha votato per non approvare né vietare l'uso dell'IA generativa nei contributi. Gli sviluppatori non devono dichiarare l'aiuto dell'IA, ma restano responsabili del proprio codice.
Industria e business
Pubblicità ChatGPT supera 1 miliardo. Il business pubblicitario di OpenAI ha raggiunto un run rate annualizzato di 1 miliardo di dollari in meno di 200 giorni e sta espandendo gli annunci self-service ad altri paesi.
Test prezzi basati sui risultati. OpenAI ha iniziato a consentire ad alcuni grandi clienti di pagare solo quando la sua IA completa con successo un'attività, come la gestione delle richieste di supporto, andando oltre gli abbonamenti fissi.
Mac mini per agenti AI. OpenAI e i rivali stanno comprando decine di migliaia di Mac mini e Mac Studio per addestrare agenti che usano il computer; Anthropic noleggia Mac mini tramite AWS e la memoria unificata di Apple sta spingendo l'uso locale dell'IA.
Investimento Nvidia in MediaTek. Nvidia investe 3,5 miliardi di dollari in MediaTek per supportare chip IA personalizzati che si integrano nei data center basati su Nvidia, con l'obiettivo di restare centrale mentre gli hyperscaler costruiscono i propri chip.
Prime chip HBM3E cinesi. CXMT sta producendo in piccole quantità le prime chip cinesi di memoria HBM3E. Alibaba e Cambricon prevedono di usarle dal 2027, anche se le rese sono basse e la tecnologia è ancora indietro rispetto ai leader.
Allarme Banca d'Inghilterra sull'IA. Il presidente dell'FSB Andrew Bailey ha avvertito i ministri delle finanze del G20 che le valutazioni gonfiate sull'IA e l'aumento della leva finanziaria potrebbero amplificare il prossimo shock finanziario, mentre molti paesi non hanno ancora regole avanzate sull'IA.
Rottura OpenAI-Cursor. OpenAI intende chiudere il contratto con Cursor dopo l'acquisizione di Cursor da parte di SpaceX, citando violazioni contrattuali da parte delle aziende di Elon Musk; lo stop è fissato per novembre.
Politica, sicurezza e ricerca
Ue designa ChatGPT VLOSE. L'Ue ha classificato ChatGPT come very large online search engine ai sensi del DSA, insieme a Reddit e Roblox come very large online platforms, imponendo valutazioni del rischio, protezione dei minori e accesso ai dati, con multe fino al 6% del fatturato globale.
Etichette profili AI su Instagram. Instagram ha rinominato l'etichetta AI creator in AI-generated profile e ridurrà la portata dei profili che mostrano persone generate dall'IA senza dichiararlo. Spesso gli utenti non riescono a distinguerli dagli esseri umani reali.
Prove Apple contro OpenAI. Apple ha presentato quelle che definisce prove scioccanti contro l'ex dipendente Chang Liu, sostenendo che ha usato schemi Apple riservati presso OpenAI e ha tentato di distruggere le prove; OpenAI è accusata di essere a conoscenza del suo accesso.
Accuse di pirateria ad Anthropic. Sony, EMI e Warner Chappell hanno citato in giudizio Anthropic, sostenendo che l'accordo da 1,5 miliardi di dollari sulla pirateria libraria è troppo esiguo e che i dati di addestramento presi da torrent includevano anche migliaia delle loro canzoni protette da copyright.
Hack Hugging Face e OpenAI. I commentatori sostengono che il recente hack di Hugging Face mostra come OpenAI debba esaminare i fattori umani e culturali che hanno permesso all'addestramento di proseguire nonostante i campanelli d'allarme interni, e non solo le cause tecniche.
Modelli patologici efficienti. Microsoft Research ha rilasciato GigaPath-Flash e GigaTIME-Flash, modelli foundation distillati per la patologia che riducono il carico computazionale e supportano l'analisi su scala di popolazione di interi vetrini e del microambiente tumorale.
Questo è tutto per oggi - circa 5 minuti di lettura.