Rilasci di modelli e AI locale
Modello audio-linguistico Sori-1B. Un modello da 1B di parametri, addestrato da zero su testo associato ad audio e senza pretraining su solo testo, punta ad ancorare le risposte al contenuto audio. Utilizza l'encoder congelato Audio Flamingo Next di NVIDIA e un tokenizer personalizzato basato su ontologia uditiva, ed è distribuito con licenza non commerciale/accademica.
Onda locale Qwen3.8. Le segnalazioni della community mostrano Qwen3.8-27B e Flash Next in esecuzione su hardware che va da uno smartphone con 12GB di RAM (3,5 tok/s) a quattro GPU R9700 (generazione a 80-120 tok/s, contesto da 700k). Nei carichi di lavoro locali con agenti, Flash Next è più veloce e stabile, mentre il denso 27B resta più forte per l'uso multi-turno prolungato; alcuni utenti li trovano però poco svegli, anche se la qualità della traduzione in tedesco è lodata.
- → Qwen3.8-Flash-Next-NVFP4 vs Qwen3.8-27B-FP Test Results
- → Qwen 3.8 27B - Fantastic German capabilities
- → Unpopular opinion Qwen 3.8 is hard to understand
- → Qwen 3.8 Flash Next locally on simple mobile phone at 3.5 tok/s
- → Here my pretty good qwen3.8 27B setup, hope it helps
- → Qwen3.8-Flash-Next turns 4xR9700 into a local AI powerhouse! 120 t/s TG and 12k t/s PP single request with optimized vLLM
Rilasci GGUF non censurati. Un utente di Reddit ha pubblicato i GGUF di LongCat-Flash-Lite-Sparse, un modello sparse-attention da 69B-A3B con contesto da 1M, oltre a Qwen3.8-27B con MTP, Qwen3.5-122B-A10B, Qwen3-Coder-Next e un modello vision. Il supporto per LongCat richiede un fork personalizzato di llama.cpp.
Hardware desktop AI. Il desktop DGX Station di NVIDIA offre prestazioni da data center con una larghezza di banda di memoria di 7,1 TB/s, mentre Framework sembra avere in preparazione una scheda madre con 192 GB di memoria, attesa a circa 4.500 dollari.
Benchmark e valutazioni
Benchmark di pentesting per LLM. Un nuovo benchmark mette alla prova gli LLM contro infrastrutture live che devono attaccare, con l'obiettivo di individuare il modello migliore per il lavoro di sicurezza offensiva, piuttosto che riprodurre CVE note.
Indice di benchmark per il coding. Un utente di Reddit ha aggregato i principali benchmark di coding agentico in un 'Agentic Coding Index' e ha calcolato una metrica di densità di intelligenza per confrontare la capacità dei modelli per parametro.
Valutazione egocentrica di un VLM open. Usando HFlow su un benchmark video egocentrico, un VLM Gemma open ha eguagliato Gemini 2.5 Flash nelle metriche di visibilità e manipolazione delle mani, risultando 19 volte più economico e rendendo fattibile l'elaborazione privata self-hosted.
Strumenti e framework per agenti
Cloudflare AI Search. Il servizio AI Search di Cloudflare ora offre una pipeline di ricerca end-to-end per dati propri, con integrazione per agenti, ricerca multimodale e una modalità discover in grado di indicizzare siti senza sitemap.
AWS Kiro Crew. AWS ha reso open source Kiro Crew, uno spazio di lavoro per eseguire più agenti di coding asincroni con memoria condivisa, skill riutilizzabili e job pianificati; internamente è stato usato da oltre 39.000 sviluppatori.
ChatGPT Work spiegato. ChatGPT Work di OpenAI, disponibile nei piani a pagamento, è offerto in una versione cloud su chatgpt.com e in una versione desktop locale che può accedere ai file ed eseguire programmi, ma i suoi confini con Chat restano poco chiari.
Taglio al limite di Claude Code. Il prossimo aumento del 25% del limite base di Claude Code da parte di Anthropic è in realtà una riduzione effettiva del 17% rispetto all'attuale incremento temporaneo del 50%; Anthropic ha anche aggiunto uno strumento automatico di segnalazione bug.
Ricerca e analisi
Agenti senza percezione del tempo. Uno studio ha rilevato che Claude Code e Codex sbagliano sistematicamente la stima della durata delle attività, sovrastimando quelle brevi di 3-10 volte, un problema per i job degli agenti a lunga esecuzione.
PILOT, auto-miglioramento live. PILOT è un harness supervisor-worker che aggiunge controllo live e auto-evoluzione live per agenti a lungo orizzonte, superando gli harness concorrenti fino a 9,8 punti su Terminal-Bench 2.0.
GameWAM, modello world-action. GameWAM è il primo modello world-action per il gameplay video nativo: genera congiuntamente frame futuri e azioni tastiera-mouse tramite flow matching, con controllo a lungo orizzonte dei cicli di blocco.
Next-chunk reasoning: RL vs SFT. Uno studio controllato mostra che la Mixed SFT su dati no-CoT e long-CoT batte la RL per il reasoning next-chunk come strategia di training pre-RLVR, con oltre 60 volte meno compute.
Dibattito su AI agency. Citando l'incidente di Hugging Face di luglio, un saggio sostiene che sarà l'AI agency—non solo la capacità—a plasmare i risultati, e che conta come gli utenti concedono o limitano tale agency.
Industria, politica e business
NVIDIA verso l'acquisizione di Hugging Face. Un accordo da 12,9 miliardi di dollari per l'acquisizione di Hugging Face da parte di NVIDIA combinerebbe l'infrastruttura di calcolo con il principale hub di distribuzione dell'ecosistema dei modelli open, accelerando la svolta industriale dell'AI.
Barriere commerciali USA sulla robotica. Washington ha inasprito restrizioni e dazi su droni e robot cinesi, citando la sicurezza nazionale, anche se la scala produttiva e i vantaggi di costo della Cina potrebbero attenuare l'impatto a livello globale.
Adozione dell'AI nell'industria. Meta sta testando robot di Watney, Kinova e ABB per ripristini di server, sostituzioni di cavi e cicli di accensione e spegnimento nei data center; Caterpillar sta applicando le lezioni dell'autonomia mineraria all'edilizia e usa assistenti AI per i tecnici.
Parti turbine in-house per Musk. SpaceX sta costruendo una fonderia per palette e alette di turbine a gas; Musk afferma che la fusione in-house potrebbe accelerare fino a 18 mesi l'adozione del gas naturale per i data center AI.
Sentiment dei lavoratori sull'AI in calo. I dati di Glassdoor mostrano che il sentiment positivo dei lavoratori statunitensi verso l'AI è sceso dall'81% del 2019 al 43% entro metà 2026, con i manager tra i più ottimisti e le donne della Gen Z, gli scrittori e gli addetti alle assicurazioni tra i più negativi.
Case discografiche citano Anthropic. Sony Music, Warner Music e altre società sostengono che Anthropic abbia scaricato illegalmente via torrent decine di migliaia di testi protetti da copyright per addestrare Claude, citando personalmente l'amministratore delegato Dario Amodei e il cofondatore Benjamin Mann.
Texas blocca le telecamere Flock. Il governatore Abbott ha congelato la spesa statale per le telecamere di sorveglianza AI di Flock dopo che erano stati spesi oltre 30 milioni di dollari, in un clima di preoccupazioni bipartisan sulla privacy e di episodi di uso improprio da parte degli agenti di polizia.
Questo è tutto per oggi - circa 5 minuti di lettura.