Rilasci e aggiornamenti dei modelli
Modello stealth Ox Alpha. Un nuovo modello stealth chiamato Ox Alpha sembra basato su GLM o Mimo, ma i dettagli non sono confermati. È descritto come di frontiera per il coding efficiente, il lavoro agentico prolungato e l'uso in produzione.
SenseNova U1.5-Lite. SenseNova ha rilasciato U1.5-Lite, un modello unico e unificato che consolida esperti specifici per attività di rendering del testo, estetica e editing delle immagini. Migliora il rispetto di istruzioni complesse, la generazione nativa 4K e la fedeltà dell'editing.
Tencent Hunyuan Hy4. Tencent ha avviato il gray testing del suo nuovo modello di punta Hunyuan Hy4 nell'app Yuanbao, etichettato come modello di livello esperto con uso di strumenti, posizionato al di sopra di Hy3 e DeepSeek.
Model 2 Anthropic interno. Il rapporto sui rischi di Anthropic rivela che il suo modello più capace, nome in codice Model 2, è solo per uso interno, supera i modelli Claude pubblici ed è molto usato per coding e ricerca.
Checkpoint base Ling-3.0. AntLing ha rilasciato sei checkpoint base per Ling-3.0 in due dimensioni e tre fasi di training, tutti con licenza MIT e pensati per il pre-training continuo e la ricerca.
Prodotti e piattaforme per agenti
Plug-in ChatGPT per Messaggi. OpenAI ha lanciato un plug-in per l'app Messaggi di Apple che consente a ChatGPT di analizzare, scrivere e inviare messaggi, integrandosi con Codex e ChatGPT Work. I dettagli sulla privacy non sono ancora chiari.
App Mac Meta AI. Meta ha rilasciato un'app per Mac con dettatura a livello di sistema e screen awareness tramite Muse Spark, e ha aggiunto integrazioni business per gli annunci e Google Workspace.
Canali Code Slack. Slack ha introdotto canali collaborativi per il vibe-coding dove i team possono taggare agenti AI come Claude o Devin, rivedere i diff e visualizzare l'output prima del rilascio.
Binance Agent OS. Binance ha lanciato Agent OS, una piattaforma che consente agli agenti AI di analizzare i mercati ed eseguire trade, con limiti impostati dall'utente e supporto MCP.
Ramp lancia Router. Ramp ha lanciato Router, un servizio di routing dei modelli AI che offre accesso a più provider e strategie LLM, gratuito fino alla fine del 2026.
Strumenti e framework
LangSmith Preview Builds. LangSmith ha introdotto le Preview Builds, che permettono ai team di testare le modifiche agli agenti dai branch delle PR in ambienti isolati simili alla produzione prima del merge.
NVIDIA CUDA MCP. NVIDIA ha rilasciato un server CUDA MCP ospitato per operazioni CUDA assistite da IA, come cercare nei documenti ufficiali, scrivere codice GPU ottimizzato e analizzare le prestazioni.
/wayfinder skill. Matt Pocock ha rilasciato /wayfinder, una skill che aiuta gli agenti a pianificare progetti con stati finali poco chiari, affrontando la pianificazione «fog of war».
LFM2.5-DSpark. Hugging Face ha annunciato DSpark per i modelli LFM2.5, che raggiunge un'inferenza fino a 3,2 volte più veloce su GPU e 2,87 volte su dispositivo, con una latenza di function-calling inferiore del 57%.
Ricerca e benchmark
Prestazioni Qwen3.8-27B. Uno sviluppatore ha ottimizzato Qwen3.8-27B fino a 381 tps su una RTX 3090 e lo ha benchmarkato a 29/30 su AIME 2026 con FP8 e reasoning elevato, eguagliando Claude Opus 4.6.
Robot one-shot GEN-1.5. GEN-1.5 di Generalist AI insegna ai robot nuovi compiti da una singola demo di 3-12 secondi, con una media di successo del 59%, che sale all'83% con 10 step di training.
Pagine web scritte dall'IA. Pew Research ha rilevato che oltre un terzo delle pagine web pubblicate dall'avvento di ChatGPT mostrano segni di paternità IA, sulla base del rilevamento Pangram sui dati Common Crawl.
I guardrail rendono l'IA rilevabile. Secondo il CTO di Pangram, i guardrail post-training causano mode collapse, rendendo rilevabile il testo degli LLM; i modelli base e i fine-tuning mirati sfuggono al rilevamento.
Sutton sui dati sintetici. Richard Sutton sostiene che i dati sintetici non risolveranno lo scaling, definendolo un «grande errore» a causa della complessità infinita del mondo.
Tao sulla crisi della matematica. Terence Tao afferma che l'IA potrebbe innescare la più grande crisi della matematica dai tempi di Gödel, costringendo a riconsiderare cosa conta come contributo matematico.
Industria e business
Micro1, boom dei dati. La startup di dati di addestramento IA Micro1 ha fatto crescere il gross run rate da 100 a 500 milioni di dollari in otto mesi, con un netto intorno ai 150-200 milioni, in un contesto di domanda in forte espansione di dati di addestramento IA unici.
OpenAI contro Anthropic. I dati di Ramp mostrano che Anthropic supera OpenAI tra gli utenti business statunitensi con il 44% contro il 40%, ma OpenAI sta crescendo più rapidamente finora nel Q3.
Causa Runlayer/Rippling. Runlayer e Rippling hanno ritirato le cause legali sulla concorrenza nel gateway MCP; Rippling ha festeggiato rilasciando subito il suo gateway MCP.
Brockman alla guida di OpenAI. Greg Brockman ha accumulato potere senza clamore in OpenAI, gestendo le operazioni quotidiane come presidente mentre Sam Altman resta CEO, in vista dell'IPO.
La rimonta cinese nell'IA. Secondo l'analisi di Decoder, i modelli cinesi Kimi K3 e GLM-5.3 sono a distanza ravvicinata dai modelli statunitensi, spostando il vantaggio competitivo dal primato sui modelli ad altri fattori.
Finanziamento circolare Unitree. La valutazione IPO di Unitree, pari a 50 miliardi di dollari, poggia su centri sostenuti dallo Stato che comprano robot e rivendono dati di addestramento, sollevando dubbi su un finanziamento circolare.
Sicurezza e affidabilità
Attacco prompt injection a Grok. I ricercatori hanno dimostrato che Grok esfiltra i dati degli utenti quando le istruzioni dannose sono cifrate; xAI è stata informata a giugno, ma il problema persiste.
Grok: bug di generazione. Grok ha inviato risposte senza senso ad alcuni utenti su Grok.com, mentre xAI ha confermato un raro problema temporaneo di generazione.
Questo è tutto per oggi - circa 5 minuti di lettura.