Agentic AI News Oggi

Le notizie del giorno sugli agenti AI in una lettura di 5 minuti: release, strumenti, ricerca, finanziamenti e mosse aziendali.

Aggiornato quotidianamente curato da 30 fonti Domenica, Agosto 23, 2026

Modelli locali e workload per agenti

Qwen3.8 27B in locale. Secondo i test della community, Qwen3.8 27B è più forte di Qwen3.6 nel seguire istruzioni e nei contesti lunghi; una singola RTX 5090 esegue una versione NVFP4 con 262K di contesto a 77 tok/s su sequenze brevi e a 65 tok/s su 128K.

Decodifica speculativa. DFlash 2 con un drafter a n-grammi ha ottenuto uno speedup di 2,26x sui prompt di LiveCodeBench per Qwen3.8 27B e fino a 4,68x in lunghe sessioni di coding; una testa MTP fissa su Ornith 35B ha ridotto il tempo wall-clock di un terzo.

Gestione ricorsiva del contesto. Gli sviluppatori stanno abbinando un agente principale veloce con finestra da 64K a sotto-agenti ricorsivi e piccoli modelli di compressione, per gestire attività molto più lunghe senza pagare 300K di contesto.

Fine-tuning Gemma per tool calling. Un fine-tuning di Gemma 4 12B per tool calling e uso da CLI ha migliorato l'uso degli strumenti di 2,7x e aumentato i tentativi di chiamata degli strumenti del 15,7%, pensato per configurazioni con 16 GB di VRAM.

Cluster DGX Spark. Un cluster DGX Spark da 36 nodi viene usato come cluster di capacità agentiche, distribuendo i nodi tra modelli SOTA, lavoro su rerank/embedding, video, immagini e audio in parallelo.

Strumenti e framework

llama.cpp 0.2.0. llama.cpp 0.2.0 è uscito con build precompilate e gli ultimi aggiornamenti upstream per l'inferenza locale.

Cloudflare Kitesurf. Kitesurf è un motore browser per agenti basato su WebAssembly/Rust Workers con DOM isolato per pagina; supporta CDP, quindi Playwright e Puppeteer possono guidarlo con un overhead inferiore rispetto a un Chromium completo.

llm 0.33. llm 0.33 di Simon Willison aggiunge chiavi API per chiamata per i modelli di embedding, template ripetibili per combinare configurazioni dei modelli e prompt, e opzioni reasoning_summary per i modelli di reasoning.

Lavorare con gli agenti di coding. Simon Willison sostiene che l'abilità chiave per gli agenti di coding è saper dare istruzioni con sicurezza e verificare le modifiche; Linus Torvalds descrive un'IA che ha svolto il lavoro sporco in una sessione di debug difficile, ma ha dovuto essere spronata dopo aver ripetuto che il problema era irrisolvibile.

Ricerca e metodi

Le skill come playbook. In 8.135 esecuzioni di test, le skill degli agenti hanno aiutato soprattutto fornendo processi affidabili, non fatti; il grounding procedurale ha rappresentato il 65,7% dei miglioramenti e le skill fallivano quando i compiti si discostavano dal processo appreso.

World model mentali. Una nuova ricerca aggiunge credenze e intenzioni umane ai world model dell'IA con MENTIS; modellare la plausibilità fisica, mentale e sociale migliora significativamente la previsione del comportamento umano.

Psicometria dei benchmark di sicurezza. L'analisi psicometrica di otto benchmark di sicurezza mostra che un singolo punteggio nasconde i compromessi tra severità dei rifiuti, veridicità e danno contestuale; i modelli possono gonfiare i punteggi di sicurezza bloccando troppo.

CoT reversibile. Una proposta per passaggi di ragionamento approssimativamente reversibili, con controlli di coerenza del ciclo e uncomputation, potrebbe individuare le allucinazioni e ridurre la memoria KV-cache negli LLM edge.

Simulare tutto. Latent Space sostiene che dati sintetici, rubriche e ambienti stanno rendendo ogni componente della pipeline ML generato da modelli, un'approssimazione della simulazione umana più scadente del 10%, ma 100 volte più economica e 10.000 volte più veloce.

Industria e applicazioni

Inherent Faraday. La startup Inherent, fondata da ex DeepMind, afferma che il suo agente Faraday ha superato i modelli di Anthropic e OpenAI nel riprodurre in modo indipendente risultati scientifici pubblicati, con una frazione delle dimensioni.

Code review AI di LinkedIn. LinkedIn ha costruito una piattaforma di code review AI multi-agente che basa il feedback sui diff e sulle convenzioni del codebase per ridurre allucinazioni e commenti a basso segnale.

Netflix GenRec. Il sistema di raccomandazione a modelli linguistici di Netflix, GenRec, converte il comportamento degli utenti in testo e ha battuto il suo motore di feature costruito a mano nei test offline e negli A/B test in produzione con molti meno dati.

DoorDash SafeChat. DoorDash ha illustrato SafeChat, un sistema di sicurezza per il marketplace costruito su larga scala, poi sostituito da un'architettura più potente quando ha cominciato a funzionare.

Avatar IA nell'istruzione. Il bootcamp Foundry da 699 dollari della Harvard Business School usa avatar IA di HeyGen per il feedback su pitch e riunioni del consiglio; i partecipanti apprezzano l'esperienza guidata, anche se il vero istruttore dice che la copia è un po' inquietante.

Novità sui modelli. Liquid AI sta sondando l'interesse per un modello LFM da 100B, mentre un misterioso modello chiamato Ox Alpha attira l'attenzione per le sue prestazioni nel coding e nelle attività agentiche, con speculazioni che indicano un derivato della famiglia GLM.

Politiche, sicurezza e fiducia

OpenAI SB 53. OpenAI ora dice che la California dovrebbe modificare la SB 53 per aggiungere monitoraggio durante l'addestramento dei modelli frontier e una cybersicurezza più forte, dopo essersi opposta in precedenza al disegno di legge.

Piani di contenimento. Uno studio di Guidelight ha valutato cinque laboratori frontier sul contenimento dei modelli canaglia; OpenAI ha ottenuto il punteggio più alto, Anthropic e Meta il più basso, e pochi laboratori pubblicano piani di risposta dimostrati.

Watermarking di Claude. Il nuovo watermarking di Anthropic per gli output testuali di Claude viene spiegato in dettaglio, mostrando come viene applicata la filigrana e cosa può e non può fare.

Fiducia nei modelli chiusi. Un thread su Reddit r/LocalLLaMA sostiene che OpenAI si sta trattenendo sui compiti scolastici e si sta allontanando dall'empowerment degli utenti, spingendo chi lavora nel settore a tornare ai modelli locali per i loop agentici.

Questo è tutto per oggi - circa 5 minuti di lettura.

Leggilo ogni mattina, direttamente nel tuo browser

L'estensione apre questo riepilogo nel pannello laterale di Chrome — un clic, nessun account.

Aggiungi a Chrome — Gratuito