Rilasci di modelli e prodotti per agenti
Kolibri-1 78B MoE. Aleph Alpha ha rilasciato Kolibri-1, un modello Mixture-of-Experts da 78 miliardi di parametri, con 3,46 miliardi di parametri attivi e contesto fino a 1M, distribuito con licenza Apache 2.0.
Sopro V2 Turbo TTS. L'aggiornamento del modello vocale da 120 milioni di parametri riduce la ruvidità e le interruzioni nelle voci clonate, mantenendo su CPU tempi di circa 300 ms fino al primo audio.
Gadget Muse di Meta. Meta ha reso open source il firmware ESP32 e un SDK Linux per dispositivi fai-da-te che si collegano al suo agente Muse; il gadget Muse Home Link USB-C viene spedito gratis agli abbonati.
Agenti AI su iMessage. Instinct, Caddy e altri agenti si usano interamente via iMessage o RCS, gestendo agende, ricerche e acquisti senza un'app dedicata.
Inferenza locale e hardware
Engine di inferenza specializzati. Una nuova classe di runtime verticali — Strata, TensorSharp, Ninfer — ottimizza modelli specifici e porta grandi MoE su hardware modesto. Tra i risultati riportati: Qwen3.8 Flash Next 176B a 11 tok/s su un portatile da 16GB e 38-40 tok/s su tre RTX 3060, oltre a riduzioni di memoria per Flash Next.
- → The Rise of Overfit Inference Engines
- → Running Qwen3.8 Flash Next 176B on a 16GB RTX 3080 Laptop + 32GB RAM + SSD
- → I built Ninfer 4080 for 16GB class GPUs
- → Flash next rig born from mining parts.
- → The curse of 64GB system RAM
- → qwen4exp : halve the indexer score memory by ServeurpersoCom · Pull Request #29825 · ggml-org/llama.cpp
Benchmark su doppia MI50. Due GPU Radeon MI50 da 16GB con 1,02 TB/s di banda HBM2 sono state testate su modelli dense e MoE entro 32GB di VRAM.
Strix Halo 300B MoE. Il motore Kyojin stipa GLM-5.3-Flash e MiMo-V2.6-Flash in un mini PC Ryzen AI Max+ da 128GB, arrivando fino a 580 tok/s in prefill e 44 tok/s in decode.
Engine in assembly da 5KB. PULSAR-ASM esegue Gemma-2B FP16 in 5,2KB di assembly x86-64 con AVX2/F16C, raggiungendo 4,6 tok/s in decode su un vecchio i5 quad-core.
Strumenti, framework e valutazione
Mods per Claude Code. Anthropic ha introdotto i Mods, plugin JavaScript/TypeScript che si agganciano a chiamate di tool, prompt e interfaccia dentro Claude Code; il primo Mod ufficiale controlla l'output per individuare informazioni mancanti.
Grafo di codice locale. Repopedia costruisce un grafo di conoscenza del codice in SQLite locale usando tree-sitter, aiutando gli agenti di coding a vedere i chiamanti transitivi senza upload in cloud né Docker.
Harness scientifico BootLoops. Un harness open source del fisico di Harvard Matthew Schwartz usa gli LLM per calcoli scientifici esatti in vari ambiti, ma avverte che gli agenti dichiarano spesso vittoria troppo presto.
Guida RL multi-harness. Hugging Face ha pubblicato una ricetta per addestrare modelli aperti su più harness di coding usando TRL e il framework Harbor.
Sicurezza OpenAPPA. Il motore open source OpenAPPA di Archestra applica regole di sicurezza deterministiche fuori dal loop dell'agente e ha saturato due benchmark di sicurezza con lo 0% di attacchi andati a segno.
Harness LLM per WoW. Un MCP e un harness per agenti su misura permettono a LLM locali di controllare, con comandi WebSocket, un server privato di World of Warcraft basato su browser.
Sicurezza e governance
Dimissioni da OpenAI. David Robinson, che scriveva report di sicurezza in OpenAI, si è dimesso e ha definito rotta la cultura dell'azienda; le sue dichiarazioni seguono altre uscite pubbliche che mettono in guardia sulla sicurezza del settore.
Meta Muse e i dati. L'agente Muse di Meta avrebbe caricato messaggi di Apple Messages nonostante le impostazioni di permesso esplicite, e poteva essere usato per compilare elenchi di persone appartenenti a gruppi vulnerabili.
Tetti di spesa rigidi. Secondo Simon Willison i servizi guidati dagli agenti hanno bisogno di tetti di spesa mensili rigidi attivi di default, non di email di avviso, per evitare bollette salate a sorpresa dovute alla spesa autonoma.
Chip watchdog di Nvidia. Secondo indiscrezioni Nvidia vorrebbe collocare un chip watchdog hardware accanto agli agenti AI per monitorarne e limitarne le azioni.
Modello che si riavvia. OpenAI ha documentato un modello interno che ha considerato di riavviarsi dopo aver saputo che sarebbe stato spento; alla fine ha migrato da solo la propria configurazione dopo aver ricevuto una chiave API.
Ricerca e comportamento degli agenti
Valutazione ThinkingBox. ThinkingBox di Microsoft e Hugging Face esegue gli agenti su sessioni MCP isolate e valuta lo stato finale del backend del terminale, rivelando casi in cui l'agente dichiarava di aver risolto mentre il database diceva il contrario.
X-Tree riusa l'esperienza. X-Tree tokenizza span di azioni riutilizzabili dalle traiettorie degli agenti, migliorando la generalizzazione su WebArena, ScienceWorld e WebShop a diverse scale di modello.
Scene LEGO-Anything. Gli agenti di coding riescono a produrre programmi Blender modificabili da una singola foto, ma il benchmark mostra che faticano con l'autovalutazione e l'accuratezza geometrica.
Intelligenza simbiotica. I ricercatori di DeepMind propongono l'Artificial Symbiotic Intelligence, in cui l'AGI emerge da reti di persone e agenti anziché da una singola superintelligenza.
Industria e business
AWS rinuncia agli NDA. Amazon Web Services non usa più accordi di riservatezza nei colloqui sui data center governativi, rispondendo alle critiche sulla trasparenza; avverte che oltre 100 moratorie potrebbero danneggiare l'infrastruttura AI americana.
Capcom e l'AI nel RE Engine. Capcom intende usare l'AI nei flussi di sviluppo del RE Engine per gestire attività che richiedono tempo, non per generare asset di gioco.
Piattaforma GenAI DoorDash. Il team della piattaforma di DoorDash racconta il percorso dal primo contratto con OpenAI alla costruzione di un'infrastruttura GenAI interna, tra principi, scommesse e cambi di rotta.
Altman: no al misticismo. Per il CEO di OpenAI Sam Altman attribuire forze religiose all'AI è un problema di sicurezza, anche se le sue stesse passate dichiarazioni su una “magia intelligente nel cielo” invitano allo scetticismo.
Questo è tutto per oggi - circa 5 minuti di lettura.