Rilasci di modelli e agenti
Grok 4.6 e Grok Bot. SpaceXAI ha rilasciato Grok 4.6, che eguaglia GPT-5.6 Sol di OpenAI e segue solo Claude Opus 5 nell'indice Artificial Analysis, pur offrendo prezzi inferiori ai modelli di frontiera, e ha introdotto Grok Bot, un compagno AI sempre attivo che lavora dal proprio computer cloud per completare i compiti assegnati.
Qwen 3.8 grande e piccolo. Qwen3.8-2.4T-A95B è ora disponibile, e una pagina per Qwen3.8 27B è apparsa brevemente su ModelScope prima di essere rimossa, indicando un rilascio imminente. Gli appassionati di esecuzione locale stanno già pianificando la distribuzione hardware per il modello 2.4T.
Aggiornamento DeepSeek V4 Pro. Il V4 Pro 0813 di DeepSeek è disponibile tramite API su OpenRouter, senza ancora una pagina di annuncio ufficiale; i pesi aperti sono probabili considerando i rilasci precedenti. Il suo comportamento di ragionamento differisce notevolmente tra i livelli basso, medio e alto.
Modelli di visione edge. LFM2.5-VL-3B di Liquid AI offre un grounding dell'interfaccia utente molto più robusto e può funzionare su telefoni, mentre North Micro Vision di Cohere, con licenza Apache-2.0, offre supporto nativo per immagini a risoluzione originale in un pacchetto compatto da 2,4 miliardi di parametri.
Il modello da mille miliardi di parametri di Nvidia. Secondo quanto riferito, Nvidia sta costruendo Nemotron 4 con almeno mille miliardi di parametri e triplicando la spesa per l'addestramento cloud a 28 miliardi di dollari entro il 2031, puntando a competere con i modelli open-weight cinesi.
Sviluppo di agenti e strumenti
Agenti gestiti e BYOC. LangChain ha lanciato Managed Deep Agents come passo successivo ai framework, e ha reso LangSmith BYOC generalmente disponibile su AWS, consentendo alle aziende di mantenere tracce e dati degli agenti all'interno della propria VPC.
App ChatGPT su Linux. OpenAI ha rilasciato un'app desktop Linux che include ChatGPT, ChatGPT Work e Codex, ma l'uso nativo del computer non è disponibile al lancio.
Inferenza locale e hardware
Prezzo RTX PRO 6000 raddoppiato. Nvidia ha quasi raddoppiato il prezzo di listino della RTX PRO 6000 Blackwell da 96 GB a 16.000 dollari, dopo che i pre-ordini erano sotto gli 8.000 dollari l'anno scorso.
Streaming DSpark su una singola GPU. Una singola RTX PRO 6000 da 96 GB può eseguire DeepSeek V4 Flash 284B a circa 31 token al secondo con il drafter di DSpark nella RAM di sistema, circa il 15-17% più veloce della baseline senza drafter a parità di utilizzo della VRAM.
Muse Glimmer su Mac. Muse Glimmer 30B di Meta ora gira fino a circa 3,3 volte più velocemente su Apple Silicon usando mlx-dspark, offrendo qualità a 8 bit a velocità vicine a quelle a 4 bit su un Mac da 48 GB.
Quantizzazione della cache KV di Gemma 4. L'addestramento consapevole della quantizzazione aiuta Gemma 4 31B a mantenere la qualità sotto una quantizzazione aggressiva della cache KV, rendendo più pratica l'inferenza a contesto ampio.
Industria e imprese
Cognition in trattative a 40 miliardi di dollari. Secondo quanto riferito, Cognition, produttore di agenti di codifica AI, è in trattative per raccogliere fondi a una valutazione di 40 miliardi di dollari dopo aver raggiunto un ritmo di entrate annualizzate di 1 miliardo di dollari, in aumento rispetto ai 492 milioni di tre mesi fa.
Lovable tocca 13,3 miliardi $. La startup di vibe-coding Lovable ha raccolto 400 milioni di dollari a una valutazione di 13,3 miliardi di dollari dopo aver superato 500 milioni di dollari di entrate annualizzate, con 60 milioni di progetti ospitati.
Thrive Holdings AI enterprise. Thrive Holdings, sostenuta da OpenAI, ha raccolto 2 miliardi di dollari a una valutazione di 12 miliardi per acquisire aziende tradizionali e implementare l'AI, espandendosi oltre contabilità e IT.
Gemini perde quote. I dati di mercato di Pangram, OpenRouter e Similarweb mostrano un calo dell'uso di Gemini, con Pangram che registra una diminuzione all'1,9% della scrittura AI mentre OpenAI detiene oltre il 50%.
Claude entra nel legale. Anthropic ha assunto il fondatore di legal AI Robert Mahari come primo Head of Claude for Legal, proseguendo il lavoro su plugin e partnership legali.
Politica, sicurezza e società
Fuga nella supply chain di LiteLLM. Un attacco alla supply chain su LiteLLM ha esposto terabyte di credenziali di oltre 2.500 organizzazioni, tra cui Microsoft, Amazon e Samsung, tramite pacchetti PyPI dannosi.
Filigrane nell'output di Claude. Anthropic ora applica filigrane agli output di Claude per conformarsi all'AI Act dell'UE, suscitando malcontento tra gli utenti che temono che possa rivelare l'uso dell'AI nel lavoro o a scuola.
Twitch addestra di default. Twitch addestrerà i modelli AI di Amazon sui contenuti degli streamer per impostazione predefinita, con un'opzione di opt-out ora disponibile; la policy ha scatenato polemiche.
ShieldFont sostituisce il testo. I designer hanno rilasciato ShieldFont, un font che mostra testo normale agli utenti ma sostituisce le parole nell'HTML sottostante per avvelenare gli scraper.
Hinton, Li e Ng sull'AI aperta. Ad Ai4, Geoffrey Hinton, Fei-Fei Li e Andrew Ng hanno sostenuto di mantenere l'AI aperta per evitare che poche aziende controllino l'accesso, nonostante le preoccupazioni sulla sicurezza dei pesi aperti.
Libri rari distrutti. I librai temono che le aziende AI comprino libri rari e li distruggano per l'addestramento, nonostante esistano alternative di scansione non distruttive.
Ricerca e benchmark
Ragionamento topologico MindTopo. Il benchmark MindTopo di Microsoft Research mostra che i modelli multimodali sono bravi nel riconoscimento topologico statico ma faticano nella pianificazione interattiva che richiede di mantenere relazioni nel tempo.
Prompt ricostruiti dall'output. IIT Bombay e Adobe Research hanno sviluppato Previous-Token Prediction, che può ricostruire i prompt degli LLM dal testo di output con accuratezza quasi perfetta senza pesi del modello.
Questo è tutto per oggi - circa 5 minuti di lettura.