Release di agenti e modelli
Claude Fable 5.1. Anthropic ha rilasciato Fable 5.1 e Mythos 5.1, dichiarando migliori prestazioni nel coding e nella ricerca e costi inferiori fino al 45% per le attività agentiche, grazie a letture in cache più economiche. La versione senza restrizioni di Fable 5.1 è disponibile subito, anche se le prime analisi dei costi contestano il massimo risparmio ai livelli più alti di reasoning effort.
- → Claude Fable 5.1 made me a really nice animated pelican
- → Anthropic launches Claude Fable 5.1 and says it’s up to 45 percent cheaper for agentic work
- → Anthropic's Claude Fable 5.1 promises better coding and research at up to 45 percent less
- → Anthropic’s new Fable release is cheaper, less restrictive
OpenAI Astra: rollout. OpenAI afferma che il prossimo modello Astra è il primo LLM a raggiungere la propria soglia critica di cybersicurezza, con la capacità di trovare e sfruttare autonomamente vulnerabilità sconosciute. L'azienda ha ritardato alcune fasi dello sviluppo di Astra dopo l'attacco a Hugging Face per rafforzare le misure di sicurezza e limiterà l'accesso alle funzionalità di cybersicurezza più avanzate.
Nuovi modelli Spark-X2.5. I modelli open Spark-X2.5-4B e 1.7B sono comparsi su Hugging Face con un'architettura inedita e prestazioni dichiarate in grado di rivaleggiare con Qwen 3.5 9B, con contesto nativo di 1M. Per ora non girano nel ramo principale di llama.cpp, ma esiste una fork personalizzata.
Runway Solaris, modello di interfaccia. Runway ha presentato Solaris, un «Interface World Model» che genera frame dell'interfaccia in tempo reale senza eseguire codice, e reagisce a click e comandi vocali. Resta un progetto di ricerca, con limiti nel rendering del testo e nel supporto agli screen reader.
AI locale e hardware
Qwen3.8: report community. Dai report della community, Qwen3.8 27B e Flash-Next girano su hardware diversi: 12 token/s su un Mac con 48GB, 280 token/s in decodifica su due EPYC R9700 con kernel MXFP4 e 132 token/s in decodifica su una singola RTX 3090 dopo ottimizzazioni personalizzate. I benchmark di quantizzazione indicano UD Q3_K_XL come una buona scelta per schede da 16GB, mentre per alcuni Qwen3.8 è un buon programmatore ma fin troppo incline a modificare.
- → Running 104GB Qwen3.8-Flash-Next on 48GB Mac at ~12 tok/s
- → How I got 280 tok/s on Qwen3.8 27B on 2xr9700's and 940k tokens kv cache
- → I pushed Qwen3.8-27B to 2.000 prefill per second and 132 decode per second on A RTX 3090.
- → Kaitchup posted Qwen3.8 27B Benchmarks for quants from Q4 to Q1
- → Everyone is t/s maxing.. 3.8.. but after a week of using it for work I'm tempted to switch back to 3.6
DGX Spark, aumenti di prezzo. I DGX Spark di Nvidia e gli Asus Ascent GX10 hanno subito aumenti significativi di prezzo, con il modello Asus passato da 3.999 a 5.999 dollari. Gli acquirenti si chiedono se i cluster di DGX Spark siano convenienti rispetto ai sistemi AMD EPYC con maggiore banda di memoria, anche se il DGX offre supporto FP4 e parallelismo tensoriale.
CMP 170HX: guasti. Un utente segnala che 2 delle 5 GPU CMP 170HX si sono guastate entro due settimane e una terza aveva tensor core difettosi, sostenendo che i prezzi attuali non giustificano il rischio per l'inferenza LLM.
INT8 e quantizzazioni ingannevoli. La community si chiede perché i modelli INT8 W8A8 non siano più comuni sulle RTX 3090, visto che dispongono di tensor core INT8 nativi, mentre un altro utente accusa AtomicChat di aver etichettato erroneamente una quantizzazione IQ2_S come Q4_K_M.
Intel, ambizioni nella memoria. Intel ha lasciato intendere che potrebbe rientrare nel settore delle memorie: il CEO ha citato l'assunzione dell'ex dirigente SK Hynix Seok-Hee Lee e una nuova architettura di memoria, ma i dettagli sono scarsi.
Strumenti e framework
OpenClaw 2.0. OpenClaw 2.0, l'agente AI personale open source, semplifica la configurazione rilevando gli abbonamenti esistenti a ChatGPT/Claude e i modelli locali, e ricostruisce il browser come interfaccia principale. Aggiunge inoltre sessioni cloud condivise per la collaborazione.
Strumenti locali di Codex. L'app desktop Codex di OpenAI ora include nel suo runtime un'installazione completa di LibreOffice e altri binari come Poppler e git, abilitando skill di elaborazione documenti senza dipendenze esterne.
Software factory AI. I principali progetti open source di AI come Flue e tldraw stanno rifiutando le PR esterne, preferendo team di agenti per smistare, riprodurre, correggere e rivedere le issue. Il progetto AI SDK di Vercel ha messo in campo una «software factory» multi-agente per smaltire un arretrato di oltre 1.000 issue e 800 PR.
Terraform per gli agenti. HashiCorp posiziona HCP Terraform come control plane governato per le infrastrutture basate sull'AI, consentendo agli agenti di creare e applicare modifiche Terraform e imponendo policy, identità e controlli di audit.
Aggiornamento datasette-mcp. Il plugin datasette-mcp ha rilasciato la versione 0.2, cambiando i risultati delle query SQL da array a oggetti per aiutare i modelli meno capaci ad associare correttamente le colonne.
Ricerca e sicurezza
BenchMIRT: audit dei benchmark. Hugging Face ha presentato BenchMIRT, un metodo per controllare i benchmark LLM prompt per prompt. Rivela che prompt dello stesso benchmark possono misurare capacità diverse e che i punteggi medi possono nascondere questa differenza.
Gemini, video agentico. Google DeepMind ha lanciato la comprensione video agentica su Gemini 3.7/3.6/3.5 Flash-Lite, che usa strumenti video nativi per cercare e ispezionare dinamicamente i segmenti video, migliorando l'accuratezza e riducendo il consumo di token per l'analisi video.
Claude: watermark testuale. Anthropic ha aperto la sua API di verifica del watermark a enti regolatori, media e fact-checker. Le organizzazioni approvate possono così rilevare testi generati da Claude tramite un pattern statistico che può sopravvivere ad alcune modifiche, come richiesto dall'AI Act dell'UE.
Elezioni e bias. AlgorithmWatch ha rilevato che le AI Overview elettorali di Google sono incoerenti, si basano su poche fonti e a volte descrivono i candidati in modo di parte. In un caso separato, la ricerca AI di Google ha fornito consigli per le chiamate di emergenza in base alla nazionalità, spingendo l'azienda a correggere.
Industria e business
AfterQuery, ascesa fulminea. Secondo quanto riportato, la startup di dati di addestramento AI AfterQuery ha raccolto fondi a una valutazione di 3,2 miliardi di dollari, con un balzo di 10 volte in cinque mesi, diventando l'unicorno più veloce nella storia di Y Combinator. L'azienda impiega professionisti per addestrare i modelli a completare i compiti come farebbero i professionisti.
AIR, round da 50 milioni. La startup di sicurezza AI AIR è uscita dallo stealth con 50 milioni di dollari per aiutare le aziende a individuare gli agenti e verificare in modo continuo le skill, i server MCP e gli add-on che usano, bloccando le interazioni software non autorizzate.
Google corteggia Hollywood. Secondo quanto riportato, Google sta cercando accordi di licenza con i grandi studios per addestrare i modelli AI su contenuti protetti da copyright, offrendo compensi elevati. Gli analisti avvertono che questi accordi potrebbero danneggiare l'immagine pubblica degli studios.
Focus sull'AI di frontiera. Il nuovo capo di Google DeepMind, Koray Kavukcuoglu, ha detto che la leadership nell'AI di frontiera è l'unica cosa che conta. Ha ammesso che i modelli attuali sono un po' sotto la frontiera, ma ha promesso di colmare il divario, senza fornire aggiornamenti concreti su Gemini 4 o 3.5 Pro.
Agenti nelle operations. Gli Enterprise Signals di OpenAI mostrano che le aziende di frontiera generano 8,3 volte più token di output per utente attivo, mentre startup come Basis, Clay ed Exa Labs integrano agenti in onboarding, gestione degli account e integrazioni per sviluppatori.
Scontro legale Apple-OpenAI. Apple sta chiedendo una procedura di discovery accelerata contro OpenAI, sostenendo che la società non ha ispezionato il MacBook di un ex dipendente Apple, che conteneva discussioni sulla distruzione di dati forensi.
Google Pics, tool di design. Google ha lanciato Google Pics, uno strumento AI per creare e modificare immagini per Workspace, basato su Nano Banana, per competere con Canva e Adobe Express grazie al design basato su prompt e alla modifica precisa degli oggetti.
Agenti AI consumer. Fambot ha presentato un «chief of staff» AI per famiglie, pensato per gestire la logistica; John Deere ha lanciato un assistente JD AI per gli agricoltori che usa i loro dati; Amazon ha aggiunto ad Alexa gli avvisi di shopping «Update Me When».
Questo è tutto per oggi - circa 5 minuti di lettura.