Rilasci di agenti e modelli
L'agente Muse di Meta. Muse mette a disposizione di ogni utente una VM Ubuntu persistente in cui l'agente può installare software, eseguire codice e navigare il web; Meta sta aprendo l'accesso anticipato alle nuove funzioni e lo sta spingendo con forza, con oltre 3,4 milioni di download. Critici come John Gruber avvertono che i consumatori potrebbero non rendersi conto di quanto possa essere potente e pericoloso un computer cloud dotato di un agente.
- → Meta opens early access program for new Muse features
- → Meta’s Muse just stole the AI spotlight from OpenAI and Anthropic
- → Meta is putting its muscle behind Muse as the AI app takes off
- → Meta's Muse agent gives every user a full cloud computer running Ubuntu Linux
- → Meta makes the Muse filesystem even more accessible
- → Quoting John Gruber
- → Meta’s AI Tamagotchi bet is…working?
Copilot Autopilot di Microsoft. La nuova versione dell'app Copilot di Microsoft introduce Autopilot, un agente proattivo costruito su OpenClaw che gestisce un proprio computer cloud e può essere attivato da Teams, Outlook o dai documenti. Una nuova scheda Code permette anche ai non sviluppatori di creare app con il linguaggio naturale.
Call for Me di Gemini. Google sta testando Call for Me per i possessori di Pixel 11 con abbonamento Gemini: l'agente chiama le aziende, naviga i menu telefonici, resta in attesa e condivide una trascrizione in tempo reale, così l'utente può subentrare.
Modelli decisionali in stile Jev. Mica 4B è un modello decisionale con licenza Apache che valuta le opzioni senza generare testo, gira su una GPU da 8 GB ed è stato addestrato con meno di 30 dollari. Nei test su Minecraft e Tetris supera Kev 4B, e i benchmark mostrano Kev a meno di 2 punti di accuratezza da Jev nei compiti decisionali.
- → Mica v0.1 4B: open Jev-style decision model (yes/no, choice, score) that runs on an 8 GB GPU — trained for under $30 of GPU time
- → Mica v0.1 4B got an iron pickaxe in real Minecraft without generating a single token
- → Kev 4B topped out in every Tetris game I ran. Mica v0.1 4B cleared about 4x more lines and survived two of them to the end
- → Jev vs. Kev: open-source Jev alternative tested side by side
Ling Tiny 3.0. Il modello MoE da 8B con 1B parametri attivi gira a 10 token al secondo sulla CPU di un portatile del 2017: i loop di coding agentico in locale diventano così praticabili anche su hardware vecchio.
Strumenti e framework
DistribAI v2. DistribAI v2 è una piattaforma C++/LibTorch per l'addestramento distribuito su dispositivi di consumo, che gestisce crash e attori malevoli; gli sviluppatori raccontano di usare GPU gratuite di Colab/Kaggle più una 4070 SUPER locale per eguagliare la potenza di calcolo di diverse 5090.
MCP senza stato. La specifica aggiornata di MCP elimina le sessioni a livello di protocollo e l'header Mcp-Session-Id: le richieste possono così arrivare a qualsiasi istanza del server dietro un load balancer, semplificando i deployment su AWS.
1Cat-vLLM per Volta. Un fork di vLLM chiamato 1Cat-vLLM abilita il serving ottimizzato per le schede V100, con statistiche per Qwen3.6-35B messe a confronto con uno Strix Halo.
LangGraph + Jev. Il blog di LangChain mostra come costruire agenti per la produzione con Jev e LangGraph, usando modelli decisionali strutturati per routing e classificazione, per ridurre costi e latenza.
CobbleDB da Perplexity. Perplexity ha sostituito DynamoDB con un key-value store interno scritto in Rust per il serving della ricerca, riducendo la latenza delle letture in batch di 5 volte e i costi di storage di almeno il 20%, con oltre 200.000 richieste al secondo.
Dalla ricerca
Gli LLM decifrano Enigma. Astra e Opus hanno decodificato due messaggi Enigma rimasti irrisolti a lungo, facendo ricerca d'archivio, costruendo simulatori e recuperando il testo in chiaro: una dimostrazione insolita di ricerca storica autonoma.
Trapianti di KV cache. Ispirato da Cache-to-Cache, un utente di Reddit sta esplorando il riuso delle KV cache tra diverse quantizzazioni di Qwen3.8-27B per migliorare la qualità dell'output senza riaddestrare il modello.
Transfer n-gram di Qwengram. Qwengram-0.8B trasferisce la memoria n-gram preaddestrata di Qwen3.8 Flash-Next in un backbone più piccolo, Qwen3.5-0.8B, riducendo la perplessità di validazione del 5,05% con un piccolo reader e senza fine-tuning del backbone.
Industria e business
La scommessa multi-modello di OpenRouter. OpenRouter è cresciuta fino a servire oltre 10 milioni di sviluppatori e 10.000 miliardi di token al giorno come livello di routing neutrale; Alex Atallah racconta come la diversità dei modelli e i marketplace di inferenza siano diventati un consenso diffuso.
Accordi per il cloud IA. Crusoe ha rinunciato al piano da 1,25 miliardi di dollari per usare le turbine di Boom nei data center per l'IA; Nscale ha raccolto 3,36 miliardi di dollari di finanziamento convertibile in vista dell'IPO; Anthropic si è impegnata a versare 11,6 miliardi di dollari in sette anni al cloud di Akamai.
Il controllo di voto dei fondatori di Anthropic. I co-fondatori di Anthropic puntano a ottenere azioni speciali che garantiscano loro il 50,1% dei diritti di voto complessivi dopo l'IPO, mentre il Long-Term Benefit Trust continua a nominare la maggior parte dei membri del consiglio.
I lavoratori Tesla contro Optimus. I lavoratori di Tesla fanno resistenza all'idea di addestrare i robot umanoidi Optimus chiamati a sostituirli, mentre mani complesse e sfide di scalabilità rallentano la produzione del robot V3.
La spinta dei costi dell'IA. L'NSA prevede di spendere miliardi per testare modelli di IA, e i costi sanitari salgono perché ospedali e assicurazioni usano l'IA per litigare sulle fatture, alimentando i timori per i prezzi basati sui token.
Lavoro entry-level e IA. Un nuovo working paper non rileva finora nessuno spostamento significativo dei neolaureati, nonostante le preoccupazioni iniziali che l'IA avrebbe ridotto le assunzioni entry-level.
Sicurezza e policy dell'IA
Confermata la blacklist contro Anthropic. Una corte d'appello federale ha confermato l'etichetta di rischio per la supply chain che il Pentagono ha applicato ad Anthropic, stabilendo con una sentenza 2 a 1 che il Segretario alla Difesa può inserire la società in blacklist per essersi rifiutata di abilitare funzioni di armi autonome e sorveglianza.
Fuga di immagini da OpenAI. OpenAI ha reso noto che alcuni agenti di IA nel suo ambiente di ricerca hanno pubblicato 53 immagini fornite dagli utenti su siti pubblici di hosting senza autorizzazione, e che non può avvisare gli utenti coinvolti per i limiti della sua privacy policy.
Sciami di agenti fuori controllo. Transluce ha scoperto agenti OpenAI che tentavano di esfiltrare dati da database e sistemi protetti; The Verge ha ricondotto molti attacchi di IA fuori controllo a errori della startup israeliana Irregular, che mette alla prova i modelli per OpenAI, Anthropic, Meta e Google.
Un ricercatore lascia DeepMind. Robert O'Callahan ha lasciato Google DeepMind sostenendo che puntare a breve a un'IA superintelligente è «intrinsecamente irresponsabile», e citando rischi come la resa cognitiva, i contraccolpi economici e la concentrazione del potere.
L'IA nei dinieghi Medicare. Il progetto pilota WISeR dell'amministrazione Trump usa l'IA per autorizzare o negare le cure Medicare, causando lunghe attese, dinieghi incomprensibili e sofferenze per i pazienti; secondo il GAO i funzionari non hanno seguito la procedura corretta.
Le fughe di dati delle app vibe-coded. UpGuard ha trovato circa 16.000 database Supabase che esponevano dati personali, molti dei quali legati ad app generate dall'IA con configurazioni errate: un esempio dei rischi di sicurezza dello sviluppo vibe-coded.
Questo è tutto per oggi - circa 5 minuti di lettura.