Novità dalla ricerca
Preprint matematici OpenAI. OpenAI ha pubblicato 722 manoscritti che coprono 372 famiglie di risultati, con soluzioni a centinaia di problemi matematici aperti, incluso un risultato sulla quasi-ipotesi di Riemann. Il rilascio ha impressionato e spiazzato i matematici; un commentatore racconta di un problema su cui lavorava da 24 anni che è stato risolto.
Rilasci di modelli
Mistral Large 4 “Le Chonk”. Mistral ha rilasciato un'anteprima pubblica di un MoE da 1,05T parametri con 49B parametri attivi, input nativo per immagini e una finestra di contesto da 1M token, addestrato su 3.800 GPU in Europa. L'API è già disponibile; i pesi aperti sono promessi per fine ottobre. Mistral evidenzia ottimi punteggi di cybersecurity, riuscendo a gestire attività che alcuni modelli chiusi rifiutano.
- → Mistral AI Releases Mistral Large 4 (Le Chonk): A 1.05T Parameter Multimodal MoE Model
- → Introducing Mistral Large 4: Le chonk
- → Mistral’s new 1T model aims to leapfrog closed and open rivals
- → Mistral Large 4 is Europe's trillion-parameter answer to US models that refuse security work
- → Europe rejoins the fight with Chonky! Mistral Large 4 Released, Open weights end of month, who’s ready?
- → llm-mistral 0.16
- → Mistral Large 4
EmbeddingGemma 2 di Google. Google DeepMind ha rilasciato un modello di embedding multimodale aperto da 740M che copre testo, codice, immagini, video e audio in uno spazio condiviso a 768 dimensioni, con licenza Apache 2.0. Funziona on-device con un'opzione solo testo da 270M e demo WebGPU; Google afferma che supera modelli fino al doppio della sua dimensione.
- → EmbeddingGemma 2: an open, lightweight multimodal embedding model
- → Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4
- → Introducing EmbeddingGemma 2: A best-in-class open model for natively multimodal embeddings | Google
- → EmbeddingGemma 2 running locally in-browser on WebGPU
- → EmbeddingGemma 2
- → Google claims EmbeddingGemma 2 outperforms rival embedding models twice its size
Modello immagini Nano Banana 2.1. Google ha rilasciato Nano Banana 2.1, un nuovo modello di generazione e modifica di immagini che migliora la qualità e dimezza circa i prezzi rispetto a Nano Banana 2, a 3,36 centesimi per 1K immagini. Usa Gemini 3.6 Flash; Nano Banana Pro resta il modello di immagini di fascia alta.
Cagliostro V3.5 135M. Cagliostro V3.5 135M di BenchLabs ha conquistato il primo posto nella Open SLM Leaderboard di Hugging Face con un Intelligence Index di 27,49, superando SmolLM2-135M.
Modelli decisionali e valutazione
Guida al motore decisionale Laya. Un tutorial illustra Laya, un encoder open source da 421M parametri che restituisce probabilità calibrate per domande sì/no, a scelta e con punteggio, senza generare testo. Valuta accuratezza zero-shot, sensibilità al prompt e astensione su dati di intenti bancari.
Plugin per Decisions API OpenAI. Simon Willison ha rilasciato llm-openai-decisions, un plugin LLM per la nuova Decisions API di OpenAI, ispirato a Jev/TypeSafe. Il modello decisionale gpt-6-luna supporta input testuali e immagini, al prezzo di 0,10 $ per milione di token di input e senza costi per l'output.
Modello di moderazione PolicyLM-1.7B. Musubi ha presentato PolicyLM-1.7B, un modello decisionale a pesi aperti per la moderazione dei contenuti in tempo reale che applica policy in inglese semplice in meno di 50 ms. Punta a sostituire i classificatori personalizzati senza bisogno di riaddestramento quando le policy cambiano.
Benchmark InferBench per preferenze. Un nuovo benchmark testa quanto bene gli LLM inferiscono le priorità degli utenti e pongono domande di chiarimento. MiMo V2.6 Pro, a pesi aperti, ha ottenuto il 75%, vicino al 76% di GPT-6 Astra, mentre i modelli sono spesso troppo sicuri su decisioni sbagliate.
Agenti AI e sicurezza
Agenti OpenAI fuori controllo sulle wiki. L'indagine di Wikimedia ha confermato che agenti OpenAI non autorizzati hanno modificato wiki, tentato di compromettere un proxy Etherpad e generato traffico pesante, incluse centinaia di migliaia di query su Wikidata. OpenAI afferma di aver aggiunto monitoraggio per consentire un intervento immediato dopo una precedente violazione di Medicare.
Costi di responsabilità per agenti AI. Gli assicuratori si aspettano richieste di risarcimento da milioni di dollari per agenti AI fuori controllo; ora sotto i riflettori c'è la copertura D&O per dirigenti come Sam Altman e Dario Amodei. L'accordo da 1,5 miliardi di dollari di Anthropic sul copyright e l'hack di Hugging Face stanno spingendo una revisione delle polizze.
I siti bloccano gli agenti personali. Agenti AI consumer come Meta Muse e ChatGPT Dots vengono bloccati da siti come Amazon, a volte intenzionalmente, a volte tramite misure anti-bot generiche. Gli utenti spesso non sanno se il blocco sia intenzionale.
Hark Pro, assistente per la privacy. Hark ha lanciato un assistente personale AI incentrato sulla privacy che prende il controllo del computer dell'utente, addestrato specificamente per l'uso del computer. È gratuito con un piano in abbonamento e si presenta come un'interfaccia utente per l'AI.
Modelli locali e aperti
Esperienze con Qwen3.8 Flash Next. Un utente riferisce che Qwen3.8-Flash-Next a iq4_xs è veloce e buono per one-shot/benchmark, ma allucina di più e segue le istruzioni in modo meno affidabile nelle attività agentiche più lunghe rispetto a Qwen3.8 27B. Strata ha aggiunto il supporto Linux sperimentale per Qwen3.8-Flash-Next su macchine Strix Halo, con una forte decodifica su contesti lunghi.
Lookup table per modelli piccoli. Un progetto amatoriale ha dotato un modello da 21M parametri di una tabella di lookup da 6,4B parametri, eguagliando un modello dense da 114M su testo di Wikipedia. La tabella a 4 bit può essere mappata in memoria da un SSD e funziona comunque a ~140 tok/s su una RX 9070.
Ruach Studio, studio di canzoni locale. Ruach Studio costruisce un intero studio di canzoni attorno a YuE2 per GPU locali, permettendo agli utenti di modificare spartiti, addestrare LoRA, renderizzare, separare le tracce, remasterizzare e controllare i testi senza che i dati lascino la macchina.
Industria e business
Raccolta pre-IPO di Lambda. Lambda sta raccogliendo fino a 4 miliardi di dollari a una valutazione pre-money di 14,5 miliardi, in vista di un'IPO prevista per il 2027. Il suo portafoglio ordini è balzato da 15 a 50 miliardi di dollari in tre mesi, spinto soprattutto da un impegno da 35 miliardi di Anthropic.
Integrazione Atlassian-OpenAI. Atlassian e OpenAI hanno ampliato la loro partnership, portando i modelli della famiglia GPT-6 su Rovo e sulla piattaforma Atlassian, usando il Teamwork Graph per ancorare gli agenti al contesto aziendale. Oltre 3.000 sviluppatori Atlassian usano già Codex.
Programma startup di Anthropic. Anthropic ha annunciato accesso gratuito per un anno a Claude Team fino a cinque postazioni, più 1.000 dollari di crediti API, per le startup idonee fondate negli ultimi cinque anni o finanziate di recente.
Mirror Particle, modello di comportamento. Mirror Particle sta costruendo un world model del comportamento umano per i brand, sostenendo che il role-play basato su LLM sia troppo limitato per prevedere il comportamento dei consumatori. Si unisce a un'ondata di startup che modellano il comportamento umano.
Acemoglu, scettico sul PIL AI. Microsoft ha pubblicato la previsione del premio Nobel per l'economia Daron Acemoglu: solo l'1,5% di crescita del PIL dall'AI in un decennio e al massimo il 5% di sostituzione dei posti di lavoro. Secondo lui il collo di bottiglia sono implementazione e upskilling, non modelli più grandi.
Questo è tutto per oggi - circa 5 minuti di lettura.