Agentic AI News Oggi

Le notizie del giorno sugli agenti AI in una lettura di 5 minuti: release, strumenti, ricerca, finanziamenti e mosse aziendali.

Aggiornato quotidianamente curato da 30 fonti Domenica, Agosto 30, 2026

Rilasci di agenti e modelli

Hy4 in anteprima. Tencent ha rilasciato Hy4 preview, un aumento dimensionale significativo rispetto a Hy3, con ragionamento elevato di default e una modalità no_think. La community ha già una quantizzazione ufficiale a ~2,38 bit e una GGUF da ~200 GB che a quanto riferito mantiene circa il 98% delle prestazioni BF16.

Inferenza locale e hardware

FlashMLA su sm_120. Una build della community estende FlashMLA alle GPU consumer Blackwell sm_120, mostrando speedup di 2-3x rispetto a PyTorch SDPA in diversi workload MLA sparsi e una latenza inferiore dell'8% per il decode della KV cache FP8.

Fix Nemotron su 16GB. I GGUF a bassa bit di Nemotron-3.5-Lightning erano in realtà a ~4,70 bpw per via della quantizzazione per righe; una build corretta di llama.cpp produce un file reale da 3,07 bpw / 11,77 GiB che esegue 262K di contesto su 16GB.

Qwen3.8-Flash-Next su Mac. Una Qwen3.8-Flash-Next da 79GB in 2 bit è stata eseguita su un M5 Max da 128GB con uno slot di contesto da 350K usando llama.cpp, incluso un cold prefill di 333 secondi di un prompt da 105K e decodifica speculativa basata su ngram.

DeepSeek V4 Flash su doppia GPU. Su configurazioni 2x DGX Spark/GX10, DeepSeek V4 Flash 0731 raggiunge 67-84 tok/s sostenuti, con HumanEval Pass@1 locale del 94,5% contro il 97,0% di GLM-5.3-Flash NVFP4. GLM ha completato il benchmark in circa la metà del tempo.

1M di contesto su doppia 5090. Un fork di NInfer aggiunge parallelismo tensoriale e scaling YaRN x4 per eseguire Qwen3.8-27B NVFP4 con contesto di 1.048.576 token su due 5090, decodificando a 48-100 tok/s a 1M e mantenendo l'accettazione MTP dove vLLM scende a zero.

27B su 16GB. Quantizzazione ibrida e impostazioni della cache kvarn consentono a Qwen3.8-27B di girare con 100K di contesto a 50 tok/s su una RTX 4070 Ti SUPER da 16GB, usando decodifica speculativa MTP e KV cache a precisione di coda.

FreeToken, motore MoE. Ricercatori di UC Berkeley e MIT hanno presentato FreeToken, un motore open source che co-schedula dinamicamente i trasferimenti degli esperti MoE, consentendo ai modelli sparsi di frontiera di decodificare su GPU consumer senza bloccarsi su miss PCIe/RAM.

Benchmark e valutazioni

Terminal Bench 4.0. Terminal Bench 4.0 è stato rilasciato con una leaderboard aggiornata e un focus sull'iterazione rapida per contrastare la saturazione; GLM-5.3 ottiene un punteggio al livello di Fable 5 entro il margine di errore.

Trasparenza benchmark finance. La scheda del benchmark di Ling-3.0-flash-Fin mostra quanto scaffolding degli agenti, strumenti e pipeline di valutazione influenzino i risultati riportati; molti run usavano ReAct con ricerca web e Python, e alcuni dataset di valutazione sono interni o non ancora pubblici.

Ricerca e infrastruttura per agenti

WikiSkill di Google. WikiSkill di Google Research offre agli agenti una base di conoscenza persistente, simile a un wiki, di fallimenti e successi passati, impacchettando Agent Skills riutilizzabili che guidano il comportamento senza modificare i pesi del modello.

Anthropic MHS. Anthropic sta costruendo MHS, un'interfaccia unificata per consentire agli agenti di controllare dispositivi fisici come microscopi e bracci robotici; i primi test hanno ridotto l'integrazione multi-macchina da settimane a ore, ma resta necessaria la supervisione umana.

Data layer per agenti. Una presentazione di TOTVS sostiene che i sistemi transazionali e i data lake non sono ottimizzati per il ragionamento degli agenti, affamato di token e sensibile alla latenza, e descrive l'evoluzione dell'accesso ai dati verso MCP e modelli semantici.

LAION BVD. LAION ha rilasciato BVD, un dataset solo per ricerca di 10 milioni di ore di video con 55 milioni di clip e 300 milioni di immagini fisse, che collega video, audio e testo; i modelli addestrati su di esso hanno superato i baseline InternVid fino a 2,1 punti su alcuni benchmark.

Industria e business

Sony e Warner contro Anthropic. Sony Music Publishing, Warner Chappell e altri editori hanno citato in giudizio Anthropic, accusandola di torrenting e scraping di opere protette da copyright per addestrare Claude e chiedendo danni fino a 150.000 dollari per opera. Anthropic dice che si difenderà.

OpenAI scarica Cursor. OpenAI sta chiudendo il contratto con Cursor dopo l'acquisizione da parte di SpaceX, adducendo l'abitudine delle aziende di Elon Musk di violare i contratti. Anthropic ha risposto posizionandosi come il partner più affidabile e ha promesso di continuare a fornire potenza di calcolo per l'uso di Claude da parte di Cursor.

Nvidia oltre le GPU. La narrazione degli utili di Nvidia si sta spostando dalla quota di GPU verso l'orchestrazione dei datacenter e i sistemi attorno alla GPU, dove ha costruito hardware di rete e orchestrazione all'avanguardia mentre il calcolo AI scala fino ai gigawatt.

Questo è tutto per oggi - circa 5 minuti di lettura.

Leggilo ogni mattina, direttamente nel tuo browser

L'estensione apre questo riepilogo nel pannello laterale di Chrome — un clic, nessun account.

Aggiungi a Chrome — Gratuito