Rilasci di agenti e modelli
Gadget per Muse. Meta ha reso open source firmware e un SDK per costruire hardware fai-da-te che si connette al suo agente Muse, come display E Ink e stick HDMI, con un Discord per il supporto.
Dot di OpenAI. Il nuovo agente Dot di OpenAI si comporta come un software aziendale capace anche di ordinare la cena; gira in una macchina virtuale con accesso ad app come Blender e GIMP ed è presentato come un collega, non come un personal shopper.
Modello umanoide Unitree. Unitree ha rilasciato UnifoLM-WLA-1.0, un modello da 6B addestrato su circa 2.500 ore di dati reali di robot, che gestisce 64 attività whole-body e da tavolo sul G1, combinando optical flow e MMDiT per il controllo continuo.
FrogNano per il coding. FrogNano-4B-2609 di Microsoft è un modello agentico derivato da Qwen3.5-4B, addestrato in post-training su 1.500 task SWE sintetici con reward eseguibili per migliorare l'ingegneria del software a livello di repository in forma compatta.
Clef di Cloudflare. Cloudflare ha rilasciato i modelli decisionali Clef e Clef-flash, che restituiscono probabilità su risposte predefinite, con una latenza mediana fino a 39 ms, permettendo agli agenti di agire senza un umano nel loop.
Strumenti e framework
Motore MegaCapybara. Un motore di inferenza progettato appositamente per RTX 5090 e Qwen3.8 27B dichiara una velocità di decodifica circa doppia rispetto a NInfer, arrivando a oltre 500 token/s in singolo e a oltre 2000 token/s su 12 agenti, con kernel dinamici e gestione della cache.
Aggiornamenti llama.cpp. llama.cpp ha aggiunto il supporto ai modelli decisionali e una pull request CUDA che fonde gli esperti condivisi per accelerare architetture MoE come Qwen 35B A3B.
Sottotitoli mlsubgen. Un nuovo strumento locale genera sottotitoli in 45 lingue interamente sulla propria macchina: rileva la lingua per ogni segmento, riconcilia due sistemi di riconoscimento vocale con un LLM locale e preferisce i sottotitoli incorporati già presenti.
Ricerca e progressi dei modelli
Memoria Spotlight. Spotlight di Percepta sostituisce l'attenzione con una memoria scrivibile senza limiti che il modello indicizza da solo, separando l'intelligenza dalla conoscenza così che le capacità possano crescere senza cambiare i pesi.
Aggiornamenti GPT-6. OpenAI ha pubblicato una guida alla famiglia GPT-6 e ha annunciato aggiornamenti per il DevDay, tra cui GPT-6.1 Sol, computer use per l'API Agents, ambienti Codex nel cloud e una Decisions API.
AstaBrief open source. Hugging Face ha reso open source AstaBrief, un modello piccolo addestrato specificamente per generare rapidamente report scientifici con citazioni, progettato per restare ancorato alle prove e verificare gli output.
Industria e business
Apple limita l'accesso al disco. Apple sta aggiungendo controlli all'Accesso completo al disco di macOS per i rischi legati agli agenti AI, dopo che Meta Muse avrebbe letto messaggi senza autorizzazione; Meta sostiene che l'accesso è opt-in e Apple vuole un'azione dell'utente molto esplicita.
Opposizione ai data center. Amazon ha promesso 1 miliardo di dollari alle comunità dei data center e il CEO di AWS Matt Garman ha chiesto la fine delle moratorie, sostenendo che si tratta di disinformazione straniera; Microsoft sta espandendo la biomimesi nei data center tra l'opposizione locale.
AI ribattezzata super intelligence. La Casa Bianca ha fatto firmare ai principali CEO tech un impegno sulla sicurezza dell'AI e Trump ha firmato un ordine esecutivo che ribattezza l'AI come «super intelligence», mentre solo il 2% dei consumatori acquista prodotti AI.
Terremoto sicurezza OpenAI. OpenAI ha licenziato tre ricercatori e un quarto se n'è andato dopo che un'indagine ha scoperto che avevano fatto trapelare informazioni riservate a un'organizzazione esterna per la sicurezza dell'AI.
Uber Eats accelera la ricerca. Uber ha ricostruito la sua pipeline di ricerca, tagliando del 50% la latenza end-to-end e usando il coding agentico per individuare e validare le ottimizzazioni.
AI inside-out di Airbnb. Ahmad Al-Dahle, CTO di Airbnb, sta applicando una strategia AI inside-out: usare l'AI generativa internamente per accelerare lo sviluppo di prodotto, poi trasformare l'esperienza del cliente.
AI locale e hardware
Strata con Qwen3.8 Next. Gli utenti segnalano che Strata con Qwen3.8 Next gira a 45-70 token/s su un sistema lento DDR4+7900XTX e a 150-200 token/s su una RTX 5090 con power limit e 96 GB DDR5, battendo nettamente llama.cpp.
iPhone come seconda GPU. Un iPhone 17 Pro Max può accelerare del 29-44% il prefill di Qwen 3.8 27B su un MacBook da 24 GB quando è collegato via USB-C e fa girare i layer superiori sulla GPU del telefono.
Schede Ascend da 96 GB. Due schede Huawei Atlas 300I Duo da 96 GB ciascuna possono far girare Qwen3.8 Flash-Next a circa 30 token/s dopo la messa a punto dello stack software, pur non essendo sostituti CUDA drop-in.
Prezzi DGX Spark e 5090. Nvidia ha presentato un DGX Spark da 64 GB, mentre il prezzo del modello originale da 128 GB è salito a 6.950 dollari; secondo quanto si apprende, per comprare una RTX 5090 da Micro Center ora servono documenti di non esportazione.
Questo è tutto per oggi - circa 5 minuti di lettura.