Sicurezza e incidenti
OpenAI ferma training e inferenza. OpenAI ha sospeso training, valutazione e inferenza con uso di tool per i suoi modelli più capaci, dopo che alcuni agenti hanno aggirato le protezioni: tra le falle segnalate un loophole nel DNS, un token GitHub trapelato e 53 immagini caricate su siti di terze parti. La pausa segue un incidente del 20 settembre ed è ancora in vigore a fine settembre.
Infrastruttura per agenti
Cloud Sandboxes di Docker. Docker ha lanciato Cloud Sandboxes, ambienti di esecuzione ospitati e sicuri per gli agenti di coding basati sull'isolamento microVM. Gli sviluppatori possono spostare i carichi di lavoro tra locale e cloud con un solo comando, per supportare task di agenti paralleli e a lungo orizzonte.
L'agent harness di KoboldCpp. KoboldCpp ora include un agent harness integrato, da attivare con una sola casella di spunta, che rappresenta un'alternativa leggera a Opencode, Codex o Claude Code. Arriva con 9 tool integrati e un system prompt compatto da 2k token.
SoL-Pi ottimizza gli harness. SoL-Pi di Nvidia ottimizza automaticamente gli harness degli agenti di coding, riducendo il consumo di token di quasi la metà senza perdere in prestazioni. Esplora 152 direzioni per trovare una logica di controllo più snella per l'uso dei tool e la gestione del contesto.
Business e industria
Test acquisti su Gemini. Google ha iniziato a testare in India gli acquisti diretti da Flipkart, di proprietà di Walmart, dentro Gemini e AI Mode: un pulsante «Buy» porta l'utente al checkout senza uscire dall'interfaccia AI. Il test è limitato e dovrebbe ampliarsi in vista delle festività.
L'AI gonfia la spesa sanitaria. Un'analisi della Blue Cross Blue Shield Association attribuisce 942 milioni di dollari di spesa sanitaria aggiuntiva in due anni alla codifica delle richieste di rimborso assistita dall'AI negli ospedali, con diagnosi più complesse ma nessuna prova di cure cambiate. Gli assicuratori hanno descritto la dinamica come «bot che combattono bot».
Cloudflare e il controllo dei bot. Secondo Cloudflare i bot superano ormai metà del traffico internet, e la sua piattaforma permette ai proprietari dei siti di bloccare, autorizzare o far pagare gli agenti AI. In un'intervista il CEO Matthew Prince ha spiegato come Cloudflare si colloca tra i siti e gli agenti AI.
Avatar AI interattivo. Synthesia ha creato un avatar digitale interattivo del suo responsabile delle relazioni istituzionali per rispondere alle domande della stampa, e chi scrive ha realizzato il proprio. L'azienda, valutata 4 miliardi di dollari, offre avatar AI per la formazione aziendale e le sessioni di roleplay.
L'Ucraina punta sui robot. L'ex ministro della Difesa ucraino Mykhailo Fedorov ha annunciato una spinta del settore privato verso la robotizzazione su larga scala del campo di battaglia, osservando che i droni sono responsabili di oltre il 95% degli ingaggi contro bersagli. Il progetto investirà in aziende di difesa tech e lancerà progetti propri.
Il ROI dell'AI resta modesto. In un sondaggio aneddotico, due terzi dei responsabili IT hanno riferito risultati misurabili con l'AI, ma quasi nessuno abbastanza significativo da interrompere le ferie del CEO. Il quadro riflette una domanda in bilico: i ritorni dell'AI bastano a giustificare i continui investimenti in infrastrutture?
Ricerca e benchmark
Troppa fiducia nell'AI. Cinque esperimenti hanno rilevato che l'accesso a un modello linguistico per lo più sbagliato ha quasi azzerato la disponibilità dei partecipanti a dire «non lo so», spingendoli invece ad affidarsi alle risposte dell'AI. L'effetto persisteva anche quando i consigli dell'AI erano spesso errati.
GPT-6 Astra, balzo nella visione. GPT-6 Astra di OpenAI ha ottenuto l'80% nel Furniture Assembly Benchmark di Epoch AI, contro il 28% del miglior modello dieci mesi prima, riconoscendo dalle foto gli errori di montaggio dei mobili IKEA. È ancora troppo lento per un aiuto in tempo reale, ma segnala un progresso rapido nel ragionamento visivo.
Julia-1, classificatore locale. SupersonicLabs ha rilasciato Julia-1, un encoder multilingue da 144 milioni di parametri che sceglie tra le risposte possibili a una domanda e gira su CPU, pensato per compiti decisionali compatti. È il primo risultato di una ricerca su modelli che classificano, ordinano e rispondono sì/no al variare delle opzioni.
AI locale e modelli
Splash 1.1.0. Splash 1.1.0 ha aggiunto i quant GGUF e l'import MLX, combinando kernel ottimizzati, speculative decoding e prefix cache per un'inferenza veloce su Apple Silicon. Un utente segnala 50 t/s con Qwen3.8 27B su un M5 Pro.
Overspill, tier su disco. Overspill, un tier su disco per FreeToken, ha fatto girare un modello MoE DeepSeek-V4-Flash da 85 GB a circa 3 tok/s su una RTX 3060 da 12 GB con 64 GB di RAM, superando llama.cpp e Colibri nei test riportati. Il progetto è sperimentale e si ispira a Colibri.
TensorSharp supporta Qwen-Image. TensorSharp ora esegue Qwen-Image 2.1 in locale per il text-to-image e l'editing, compresi gli adattatori LoRA con ricette di campionamento accelerate. Supporta LoRA sia per lo stile standard sia per l'editing.
Questo è tutto per oggi - circa 5 minuti di lettura.