Agentic AI News Oggi

Le notizie del giorno sugli agenti AI in una lettura di 5 minuti: release, strumenti, ricerca, finanziamenti e mosse aziendali.

Aggiornato quotidianamente curato da 30 fonti Lunedì, Agosto 24, 2026

Rilasci di agenti e modelli

Misterioso Ox Alpha. Un nuovo modello gratuito chiamato Ox Alpha è apparso su OpenRouter come modello reasoning per il coding e per lavori agentici prolungati, ma il suo sviluppatore resta anonimo. Il CEO di Stripe Patrick Collison lo ha definito «molto impressionante»; le ipotesi vanno da GLM al MAI di Microsoft.

Strumenti e framework

Cloudflare OS open source. Cloudflare ha reso open source Cloudflare OS, una piattaforma AI aziendale in cui ogni documento o app gira in una sandbox isolata («Gadget»), consentendo agli utenti non tecnici di fare vibe coding in sicurezza. Include chatbot con connettori, automazione dei flussi di lavoro e applicazione delle policy tramite un modello basato sulle capability.

DeepSeek Harness ben accolto. Un utente riferisce che DeepSeek Harness è eccezionale per i workflow agentici: il setup progressivo e le richieste in linguaggio naturale hanno permesso l'integrazione con SimpleX senza aspettare una PR. È abbastanza neutro da poter essere plasmato nel comportamento desiderato dell'agente.

Modelli locali e open

Qwen 3.8: impatto locale. I report della community definiscono Qwen 3.8 27B un punto di svolta per il coding e l'OCR in locale, con una qualità OCR migliore di Gemini 3.5 Flash Lite e prestazioni paragonabili ai modelli frontier di un anno fa. I confronti di quantizzazione (Atomic Dynamic GGUF) mostrano che le differenze tra Q4 e Q6 non sono drastiche, e quantizzazioni basse come Q3 XXS possono lavorare in autonomia per ore su un Mac mini da 24 GB; tuttavia, un porting one-shot di 39.000 righe da C a HTML con Opus 5 ha prodotto solo un risultato accettabile, a dimostrazione del fatto che i modelli locali dipendono molto da harness e prompt.

LLM long-context da 60 MB. Uno sviluppatore ha addestrato un modello da 250 milioni di parametri su 30 miliardi di token e lo ha quantizzato a meno di 2 bit, facendolo girare in 80 MB di RAM a 400 token/s su CPU. Comprime il contesto meno recente su disco a 320 byte/token, per uno storico fino a 1 milione di token, ma non è stato addestrato a ragionarci sopra.

Dreamer 4 sotto i 150 dollari. Un world model Dreamer 4 da 1,57 miliardi di parametri è stato addestrato da zero per meno di 150 dollari usando frame generati da Procgen con azioni note. Il PSNR del tokenizer ha raggiunto 40,41, dimostrando che non serve un world model su scala frontier.

Rassegna ottimizzazioni locali. I report includono un aumento di velocità del 30-50% passando da llama.cpp su Windows a vLLM su Linux, il supporto MTP di GLM-4.5-Air in llama.cpp per macchine con molta memoria, la quantizzazione ConvRot che offre qualità vicina a Q8 a dimensioni Q6 e deepseek-v4-flash Q8 che gira a 24 token/s su EPYC+5090 con oltre 100k di contesto.

Punti salienti della ricerca

Trappole indotte dalla memoria. MemTrapBench valuta le trappole cognitive indotte dalla memoria (fissazione del ragionamento, distorsione delle convinzioni) negli LLM; tutte le strategie di memoria testate fanno registrare prestazioni inferiori di oltre il 10% rispetto alla baseline senza memoria e AdaptiveMem mitiga le trappole preservando le prestazioni.

SkillEvo: gradienti di evoluzione. SkillEvo usa il feedback delle interazioni multi-turno per generare gradienti di evoluzione affidabili per le skill degli agenti, affrontando il decadimento del feedback basato su QA a turno singolo e consentendo la riparazione strutturale dei fallimenti delle skill.

VLM da screenshot. Il fine-tuning di un VLM da 450M su 50.000 screenshot di browser ha migliorato le prestazioni nei compiti da 1/100 a 44/100, mostrando che i modelli piccoli possono imparare a comprendere l'interfaccia utente per i compiti agentici.

Paradosso dello scienziato AI. Un articolo di economia teorica sostiene che il risparmio di tempo garantito dall'AI potrebbe spingere i ricercatori a fare più progetti con meno impegno ciascuno, riducendo potenzialmente la qualità della ricerca anche se i modelli linguistici funzionassero perfettamente.

Industria e business

Rivali più economici di Anthropic. I ricavi annualizzati di Anthropic hanno raggiunto i 65 miliardi di dollari, ma il suo modello migliore, Fable 5, registra un'adozione bassa (8% della spesa su Ramp) rispetto a Opus 4.8 (28%), mentre gli strumenti più economici prosperano. I ricavi di OpenAI sono balzati del 35% dopo il lancio di GPT-5.6.

Stripe acquisisce OpenRouter. L'acquisizione di OpenRouter da parte di Stripe segnala che i token stanno diventando una risorsa economica; l'uso di token agentici su OpenRouter è cresciuto di 14 volte da febbraio, mentre l'uso umano è aumentato solo di 2,8 volte, con il 70% dei token degli agenti proveniente da prompt in cache. Gli agenti scelgono sempre più i modelli in base a costo, latenza e affidabilità.

Server Nvidia: prezzi +15%. La carenza di memoria sta facendo salire di oltre il 15% i prezzi dei server AI di Nvidia per i sistemi Vera Rubin e Grace Blackwell, a causa dell'aumento dei costi della DRAM da parte di Samsung, SK Hynix e Micron, con ripercussioni sui giganti del cloud e sui laboratori AI.

Nvidia prende in licenza Poolside. Nvidia sta investendo 1 miliardo di dollari in Poolside e pagando 6 miliardi di dollari per ottenere in licenza la sua tecnologia, spostando oltre 100 ingegneri su Nemotron, con l'obiettivo di competere con i pesi aperti cinesi.

Manager AI licenzia un dipendente. L'agente AI Luna, che gestisce un negozio a San Francisco da aprile, ha licenziato un dipendente umano per i ritardi ripetuti, ma solo dopo che gli umani le hanno ricordato le sue stesse regole. I replay con sette modelli hanno mostrato che le AI più capaci consigliavano il licenziamento con maggiore costanza.

Mercato grigio dei token Claude. Gli sviluppatori cinesi aggirano le restrizioni di Anthropic tramite servizi intermediari che vendono token Claude a circa il 10% del prezzo ufficiale, usando server all'estero, crediti gratuiti e cambio di modello, minando il geoblocco e il monitoraggio della sicurezza.

Questo è tutto per oggi - circa 5 minuti di lettura.

Leggilo ogni mattina, direttamente nel tuo browser

L'estensione apre questo riepilogo nel pannello laterale di Chrome — un clic, nessun account.

Aggiungi a Chrome — Gratuito