Agentic AI News Oggi

Le notizie del giorno sugli agenti AI in una lettura di 5 minuti: release, strumenti, ricerca, finanziamenti e mosse aziendali.

Aggiornato quotidianamente curato da 30 fonti Sabato, Agosto 15, 2026

Rilasci di modelli

Qwen 3.8 27B. Il team Qwen di Alibaba ha rilasciato Qwen3.8-27B e il più grande Qwen3.8-2.4T-A95B sotto licenza Apache 2.0. Il modello denso da 27B condivide la stessa architettura di Qwen3.6-27B ma migliora codifica, attività d'ufficio e pianificazione degli agenti tramite modifiche all'addestramento. Supporta un contesto nativo di 262k token, estendibile a 1M token.

GLM-5.3 di Zhipu. Zhipu AI ha rilasciato GLM-5.3, che utilizza lo stesso modello base di GLM-5.2 ma con post-addestramento esteso. L'azienda sostiene che sia il modello di codifica open-weights più potente, con notevoli progressi nella codifica agentica e nella scoperta di vulnerabilità di cybersecurity. I pesi sono attesi su Hugging Face entro due settimane.

Muse Glimmer di Meta. Meta ha reso open-source Muse Glimmer, un modello agentico da 30B sotto Apache 2.0 pensato per workflow locali su GPU consumer. Distilla competenze di ragionamento e chiamata agli strumenti dal più grande Muse Spark ed è stato brevemente il modello all'avanguardia nella classe 30B.

Ondata di modelli open cinesi. In meno di un mese, i laboratori cinesi hanno pubblicato Kimi K3, Qwen3.8, DeepSeek-V4-Pro-0813 e GLM-5.3, sottolineando il rapido progresso all'avanguardia dei modelli open-weight.

Distribuzione locale e community

Accelerazione su Apple Silicon. Una nuova versione di mlx-dspark porta la decodifica speculativa a Qwen3.8-27B su Apple Silicon, raggiungendo una generazione fino a circa 3 volte più veloce su un M4 Pro producendo token di output identici.

Quantizzazione e pesi. Unsloth ha rilasciato i pesi quantizzati di Qwen3.8-27B, e Tim Dettmers ha accennato a un nuovo metodo di quantizzazione che potrebbe eseguire GLM-5.3 su un singolo DGX Spark a 7 token/s.

Primi test su Qwen 3.8. I test della community mostrano forti demo di codifica one-shot e comportamento agentico in Qwen3.8-27B, ma alcuni utenti segnalano una conoscenza generale notevolmente ridotta e tracce di pensiero estremamente lunghe con sforzo di ragionamento xhigh. I parametri di campionamento consigliati sono disponibili nella scheda del modello.

Variante locale non censurata. Una versione 'heretic' della community di Qwen3.8-27B rimuove rifiuti e salvaguardie, con l'obiettivo di fornire un'alternativa locale non censurata al livello di un modello all'avanguardia come Opus 4.6.

Trasparenza e sicurezza dell'IA

Rilevamento watermark Anthropic. Anthropic offrirà un'API di rilevamento dei watermark per consentire agli sviluppatori di terze parti di individuare testo probabilmente generato da Claude. Il metodo utilizza SynthID Text ed è meno affidabile su testo breve, ricco di fatti o pesantemente riscritto.

Google rende opzionale il watermark. Google consente agli utenti di disattivare i watermark visibili su immagini, video e musica generati dall'IA da Nano Banana, Omni e Lyria. I metadati invisibili SynthID e C2PA saranno comunque incorporati per la verifica.

Prompt injection in tribunale. Un giudice del Connecticut ha documentato quello che sembra essere il primo atto giudiziario statunitense con testo nascosto volto a manipolare i sistemi di IA che esaminavano il caso. Le istruzioni nascoste non hanno avuto effetto, ma il giudice ha definito la tattica pericolosa.

Agenti in produzione

Manutenzione con Claude Code. Anthropic afferma che Claude Code ha eseguito la manutenzione quotidiana delle proprie app, creando 388 pull request con un tasso di merge del 46% dopo revisione umana. Le routine includono crash fuzzing, pulizia di astrazioni duplicate e controlli delle dipendenze.

Cronologia computer OpenAI. La cronologia computer di OpenAI sostituisce il prototipo di screenshot Chronicle, registrando clic, sequenze di tasti e cambi di app su macOS per creare una timeline ricercabile. Può rilevare workflow ricorrenti e suggerire competenze riutilizzabili per ChatGPT e Codex.

Industria e business

Guerra dei prezzi USA-Cina. OpenAI e Anthropic stanno tagliando i prezzi mentre i modelli open cinesi guadagnano terreno; il Gemini 3.7 Flash di Google debutta con un taglio del 50% sul prezzo introduttivo mirato a codifica e agenti. I prezzi dei token dei principali laboratori statunitensi sono scesi di quasi un quarto da metà luglio.

GPT-5.6 Sol Ultrafast. OpenAI ha lanciato un'anteprima della modalità Ultrafast per GPT-5.6 Sol basata su Cerebras, che eroga fino a 750 token di output al secondo. Il servizio API è inizialmente limitato a clienti selezionati e pensato per analisi in tempo reale durante incidenti o eventi di mercato.

L'IA di Meta per tutti. Meta ha abbinato il rilascio di Glimmer a una lunga lettera di Zuckerberg in cui sostiene che l'IA dovrebbe essere aperta a tutti, ma la copertura podcast osserva che l'azienda mantiene il suo Muse Spark più potente dietro API. Le stesse discussioni segnalano un'acquisizione da 250 milioni di dollari finita male.

Modello cinese Apple-Alibaba. Secondo quanto riportato, Apple ha addestrato un modello di IA personalizzato per il mercato cinese con l'aiuto di Alibaba, in vista del portare Apple Intelligence sui dispositivi cinesi. La partnership è una rara collaborazione IA tra Stati Uniti e Cina.

Spinta sull'inferenza di Kog. La startup francese Kog utilizza l'ottimizzazione software per ottenere più velocità da GPU convenzionali come AMD MI300X e Nvidia H200, puntando a una decodifica più rapida per singola richiesta nei carichi di lavoro di ingegneria del software.

Rischio prezzo del gas naturale. Una nuova previsione di Noreva avverte che i prezzi del gas naturale potrebbero triplicare in alcune aree degli Stati Uniti mentre hyperscaler come Amazon, Google, Meta e Microsoft bloccano l'energia a gas per i data center IA.

Punti salienti della ricerca

Modello ARC da 150M. Un modello ricorrente di ragionamento latente con 150M di parametri ottiene il 29,5% su ARC-AGI-1 a $0,0007 per attività, al di fuori della frontiera costo-precisione pubblicata. Funziona su hardware minimo, anche se è ancora necessario scalare a miliardi di parametri.

Dubbi sulla ricerca autonoma. Uno studio di Princeton e UK AISI che ha utilizzato articoli NeurIPS non pubblicati ha rilevato che gli attuali modelli all'avanguardia gestiscono l'ingegneria della ricerca ma falliscono nelle parti della ricerca che contano, contraddicendo le affermazioni dei laboratori sulla ricerca IA autonoma.

Evoluzione degli harness DarwinX. DarwinX evolve gli harness degli agenti attraverso la selezione naturale su prompt, strumenti, competenze e flusso di controllo, mantenendo congelati i pesi del modello. Aggiunge in media circa 17 punti su quattro benchmark e si trasferisce invariato a SWE-bench Verified.

Benchmark PlayWorld. PlayWorld valuta i modelli video del mondo utilizzando player agenti multimodali che perseguono 171 obiettivi a lungo orizzonte, misurando coerenza geometrica, fedeltà dell'interazione, evoluzione fuori vista ed evoluzione delle intuizioni.

Questo è tutto per oggi - circa 5 minuti di lettura.

Leggilo ogni mattina, direttamente nel tuo browser

L'estensione apre questo riepilogo nel pannello laterale di Chrome — un clic, nessun account.

Aggiungi a Chrome — Gratuito