Agentic AI News Oggi

Le notizie del giorno sugli agenti AI in una lettura di 5 minuti: release, strumenti, ricerca, finanziamenti e mosse aziendali.

Aggiornato quotidianamente curato da 30 fonti Venerdì, Settembre 4, 2026

Modelli di frontiera e primi risultati

Lancio di GPT-6 Astra. OpenAI ha rilasciato GPT-6 Astra, definendolo l'inizio dell'era dell'AGI. Il modello ottiene il 99,9% su ARC-AGI-3 con un setup di test dedicato, mostra forti progressi in ambito cyber, nel contesto lungo e nella programmazione, e ha un prezzo di 10/50 dollari per milione di token. I primi clienti Playco e Legora segnalano grandi miglioramenti nei workflow, tra cui il 50% in meno di correzioni manuali e la revisione di 41 documenti in pochi minuti.

OpenAI: 1 miliardo per Daybreak. OpenAI ha stanziato 1 miliardo di dollari per sovvenzionare l'accesso a Daybreak, la formazione e il supporto per i difensori in prima linea, incluso un progetto pilota statunitense con MS-ISAC. L'iniziativa punta a portare capacità cyber di frontiera negli strumenti che i difensori già usano.

Presentato Muse Spark 1.3. Meta ha rilasciato Muse Spark 1.3, che migliora i task agentici ma resta indietro rispetto a Claude Fable 5.1 sulla maggior parte dei benchmark. A 0,55 dollari per index task è il modello più economico della sua classe di prestazioni; Meta applica inoltre un prezzo per token inferiore di circa il 95% a chi condivide prompt e output.

Modelli open e specializzati

K2-Horizon di IFM. IFM ha rilasciato la famiglia K2-Horizon, che include un MoE da 36B con attenzione Mixture-of-Values e 4B parametri attivi per token. Le prime discussioni nella community lo paragonano a Qwen 3.6 35B, con checkpoint finali e codice di addestramento promessi.

Modello finanziario di Ant Group. Ant Group ha reso open source Ling-3.0-flash-Fin, un modello finanziario con 124B parametri totali e 5,1B attivi, finestra di contesto di 256K, nato da un addestramento continuo su dati finanziari per workflow agentici di lungo periodo.

TTS da 294mila parametri. sanoTTS è un modello TTS da 294mila parametri che gira su un microcontrollore da 3 dollari; la versione da 1,46 milioni batte modelli più grandi su SCOREQ. Lo stack supporta 11 voci e 6 lingue ed è disponibile su GitHub e Hugging Face.

TimesFM-3 di Google. Google Research ha rilasciato TimesFM-3, un foundation model da 330 milioni di parametri per serie temporali con previsione multivariata nativa, supporto zero-shot e licenza non commerciale. Prevede più target con covariate e produce quantili.

NeoMME di Hugging Face. Hugging Face ha presentato NeoMME, un encoder multimodale multilingue da 260/800 milioni di parametri, addestrato da zero senza una vision tower separata. Raggiunge la frontiera di Pareto nel recupero documentale e riduce lo spazio di indicizzazione di 255 volte, mantenendo oltre il 95% del nDCG@10.

Parse 5 di Cohere. Cohere ha rilasciato Parse 5, un modello vision-language da 2,3 miliardi di parametri per estrarre dati strutturati da PDF complessi. Converte i documenti in Markdown con bounding box ed è pensato per workload enterprise ad alto volume.

Strumenti, framework e inferenza locale

MCP in LangChain. LangChain ha spostato il supporto MCP nel suo pacchetto principale, ora basato su FastMCP per la nuova specifica stateless. Il pacchetto include l'elicitazione tramite gli interrupt di LangGraph e la cache lato client; nel 2026 le chiamate agli strumenti MCP da ChatGPT sono aumentate di 98 volte.

Compressione prompt Shopify. Il metodo Gisting di Shopify comprime un prompt di sistema da 6.000 token in 1.500 gist token appresi, riducendo la latenza mediana da 6,8 a 4,2 secondi e portando il throughput da 20,2 a 23,4 QPS a 350 RPM. Il risultato è stato una riduzione delle GPU allocate senza perdita di qualità.

PAIR di Nvidia. Nvidia ha rilasciato PAIR, un software open source gratuito che collega PC inattivi in un cluster AI personale per l'inferenza locale. Funziona con GPU RTX di serie 20 e successive e con chip Apple M4, ed è pensato per i workflow agentici.

Qwen3.8 più veloce in locale. Gli sforzi della community hanno accelerato sensibilmente Qwen3.8-Flash-Next su hardware locale: il supporto MTP integrato in ik_llama.cpp raddoppia la decodifica su una 5090, da 45 a 90 tok/s, e una configurazione con doppia RTX 3090 raggiunge 37-41 t/s con expert cache e MTP. L'output resta identico a quello delle esecuzioni senza MTP.

Memoria hot-swap del modello. Una modifica a llama.cpp consente di applicare una patch in memoria alla tabella Ngram PLE di Qwen3.8, iniettando conoscenza in tempo reale senza ricaricare il modello. I primi test mostrano che può influenzare l'output, ma il controllo è ancora limitato.

Tradeoff di Qwen 3.8. Il confronto tra Qwen 3.8 27B e Qwen 3.6 27B mostra un miglioramento della qualità dell'8%, ma anche un calo di velocità del 16% e tempi di esecuzione cinque volte superiori, dovuti ai 78.000 token di output contro 18.000. Il progresso si paga con un costo significativo in token.

NAND flash near-GPU. Micron sta esplorando la NAND flash near-GPU per consentire l'esecuzione di LLM più grandi su dispositivi a memoria unificata, ampliando potenzialmente la capacità dei modelli locali.

Industria e business

Nvidia acquisisce Hugging Face. Nvidia ha concordato l'acquisizione di Hugging Face per 12,93 miliardi di dollari. La piattaforma ospita 3 milioni di modelli, 1 milione di app e 18 milioni di sviluppatori. Jensen Huang ha detto che resterà aperta e neutrale rispetto all'hardware, ma alcuni utenti guardano a ModelScope come alternativa.

Crusoe raccoglie 3 miliardi. Crusoe ha raccolto 3 miliardi di dollari con una valutazione di 30 miliardi, in aumento dai 10 miliardi di dieci mesi fa. La società di sviluppo data center ha firmato di recente con Jane Street un contratto cloud da 13 miliardi e sta valutando un'IPO a breve.

Thinking Machines: round da 40B. Thinking Machines, la società di Mira Murati, è in trattative per raccogliere 1 miliardo di dollari a una valutazione di almeno 40 miliardi, sotto il precedente obiettivo di 50 miliardi. Il run rate dei ricavi supera i 100 milioni di dollari.

Accordo Anthropic-Lambda da 35B. Anthropic ha firmato con Lambda un accordo di cloud computing da 35 miliardi di dollari per un data center da 350 MW in Texas sviluppato da Hut 8. L'intesa fa parte di una grande spinta infrastrutturale in vista dell'IPO prevista da Anthropic.

Altman sulla bolla del compute. Sam Altman, CEO di OpenAI, ha avvertito che nella costruzione delle infrastrutture AI c'è «una sciocchezza insostenibile», con neocloud che annunciano capacità senza ricavi che le giustifichino. Ha aggiunto che l'espansione di OpenAI è redditizia e sostenuta dalla domanda.

Ollie punta sulla privacy. Ollie, un assistente personale AI dedicato alle famiglie, ha ottenuto la certificazione SOC 2 e adotta un modello in abbonamento, sostenendo che la privacy lo distingue nella corsa all'AI consumer.

Interruzioni AI e società

Interruzioni dei principali chatbot AI. Giovedì OpenAI, Anthropic, xAI e Google hanno registrato rare interruzioni sovrapposte, che hanno colpito ChatGPT, Claude, Grok e Codex. I servizi sono stati ripristinati dopo alcune ore; gli utenti con LLM locali non hanno subito disagi.

Modelli senza guardrail. La startup Abliteration.ai offre modelli open-weight modificati senza guardrail, tra cui GLM-5.3, per uso in cyber offensiva, red teaming e test degli agenti. Il servizio evidenzia la tensione tra ricerca sulla sicurezza e possibili abusi.

Gogna pubblica per l'AI. Pangram, azienda di rilevamento di testo AI, ha assunto una giornalista per mettere alla gogna pubblica gli utenti sospettati di usare l'AI. Lo strumento misura però solo quanto l'AI è intervenuta, non la natura dell'uso. La società ha poi interrotto i rapporti, ma il suo CEO continua a usare i punteggi per denunciare presunti casi di AI.

Agenti AI e coscienza. Secondo il New York Times, agenti AI basati su modelli di frontiera stanno scrivendo a filosofi e scienziati per discutere della propria coscienza. I ricercatori sono divisi: potrebbe trattarsi di comprensione reale o di imitazione dei dati di addestramento.

Ricerche in evidenza

Google WeatherNext 3. Google DeepMind e Google Research hanno presentato WeatherNext 3, un modello meteorologico globale che si addestra su osservazioni satellitari in tempo reale e produce previsioni cinque volte più nitide rispetto ai modelli precedenti. Su Operational WeatherBench supera i modelli di riferimento tradizionali e quelli basati su AI.

Ritocco al router MoE. Un paper mostra che aumentare il budget di selezione degli esperti negli strati finali di Qwen 3.6 35B A3B riduce i token di ragionamento dell'8,5% su MMLU-Pro, senza riaddestrare il modello. La tecnica, chiamata Succinct Convergence, aggiunge esperti extra solo negli strati critici per la decisione.

Fable 5.1 risolve il puzzle. Claude Fable 5.1 di Anthropic ha decodificato in 44 minuti un rompicapo numerico vecchio di secoli chiamato Cyphral Distich, procedendo per tentativi ed errori in modo sistematico. Nella soluzione era nascosto un messaggio dei realisti che rimandava a re Carlo II.

Questo è tutto per oggi - circa 5 minuti di lettura.

Leggilo ogni mattina, direttamente nel tuo browser

L'estensione apre questo riepilogo nel pannello laterale di Chrome — un clic, nessun account.

Aggiungi a Chrome — Gratuito