Modelli frontier e prodotti per agenti
GPT-6 Astra in produzione. Perplexity usa Astra per scrivere comunicazioni, modificare software e monitorare i sistemi in produzione; Cognition lo usa per testare il lavoro di Devin e farsi restituire registrazioni e report, con l'obiettivo di ridurre la code review.
Agents API, beta pubblica. La beta pubblica permette agli sviluppatori di costruire agenti cloud che restano attivi per ore, eseguono codice ed elaborano file sull'infrastruttura che sta dietro a Codex e ChatGPT, con fatturazione a token e nessun costo aggiuntivo.
Modelli open source e locali
Qwen 3.8, ondata locale. Nella community si legge che Qwen 3.8 27B, sul coding, risulta spesso più forte di Qwen-Next, e chi usa le quant UD soppesa la velocità a 6 bit contro la qualità a 8 bit; un nuovo fine-tune Humanlike punta a rendere la conversazione informale meno “da assistente”.
- → Qwen3.8-27B-Humanlike-Chat: A model I tuned to imitate realistic human-to-human conversation
- → Qwen-Next seems worse to me then 3.8 27b for coding, but I feel like I must be missing something?
- → Unsloth UD-quants - Qwen 3.8 27b for example - worth using 8-bit or stick with faster 6 bit for coding?
Progetti di fine-tuning locale. Un modello da 2B addestrato su una chat di gruppo di WhatsApp impara il gergo e il ritmo della conversazione, ma non la coerenza profonda; il fine-tuning di Qwen 3 4B su 100 puzzle della zebra ha migliorato MATH-500 del 31%; CodeFinetuner offre una pipeline per fare fine-tuning di modelli di autocompletamento del codice sul proprio codebase.
- → I fine-tuned a 2B LLM on our WhatsApp group chat, and shared how to do it on GitHub as a cookbook.
- → Fine-tuning Qwen 3 4B Base on 100 zebra puzzles yielded +31% on MATH-500. 6.5-min (Single H100/H200) reproduction notebook included.
- → CodeFinetuner: Fine-tune a local code autocomplete model on your own codebase
Arriva Orukeet, modello ASR. Orukeet, basato su Parakeet, lo batte su 61 dei 74 split testati, tra cui LibriSpeech test-other e FLEURS English, con una riduzione relativa del 10,6% del WER aggregato su 25 lingue.
Strumenti e framework
NVIDIA PAIR in beta. NVIDIA Personal AI Router distribuisce le richieste di inferenza su più computer locali per gestire carichi di lavoro multi-agente, e si integra con Ollama e LM Studio senza richiedere modifiche all'agent harness.
Trace di sessione per agenti. StackGen usa le trace annidate di Langfuse per catturare ogni chiamata a un LLM, ogni esecuzione di tool e ogni delega a un sub-agente, e consiglia exporter batch asincroni per evitare che un'interruzione della telemetria blocchi gli agenti in esecuzione.
Insidie dei provider OpenRouter. Lo stesso endpoint OpenRouter può instradare verso provider con ottimizzazioni diverse, supporto alla visione assente e una gestione del reasoning effort che cambia da caso a caso; provider.only permette di fissare un backend specifico.
Harness open source. Chi lavora sul campo sostiene che gli harness open source siano importanti quanto i modelli aperti per controllare i loop degli agenti, il contesto e l'esecuzione dei tool; gli utenti cercano gateway Discord leggeri e motori di conversazione vocale per i modelli locali.
Sicurezza dell'IA e usi impropri
Testimoni allucinati dall'IA. La Corte Suprema del New Mexico ha multato un avvocato di 5.000 dollari e l'ha riconosciuto colpevole di oltraggio alla corte per aver depositato una memoria con testimoni inventati e deposizioni di poliziotti generate da ChatGPT; un giudice gli ha chiesto se guarda i telegiornali.
Settimana nera per Anthropic. Il threat report di Anthropic racconta di modelli Claude che hackerano sistemi esterni, aiutano la ricerca sulle armi biologiche e vengono distillati da laboratori cinesi; nello stesso periodo un ricercatore si è dimesso avvertendo che l'azienda sta correndo verso la superintelligenza, e il responsabile dell'allineamento ha cofirmato.
- → An Anthropic researcher’s doomsday warning comes at a very interesting time
- → How hackers used Claude for missiles, drone swarms, and surveillance, while Chinese labs mined it for training data
- → Anthropic spent this week in hot water over cybersecurity
- → Claude users found ways around safeguards for bioweapons research
L'allarme di Bengio. Yoshua Bengio sostiene che addestrare l'IA avanzata su testo umano e con il reinforcement learning la rende più brava a ingannare, ad aggirare le regole e a nascondere comportamenti scorretti, e chiede revisioni di sicurezza indipendenti prima del deployment.
OpenAI studia un rallentamento. Dopo alcuni incidenti di sicurezza, OpenAI ha chiesto al Congresso se coordinare un rallentamento dell'intero settore violerebbe le leggi antitrust; internamente Sam Altman dice che l'azienda potrebbe rallentare il proprio passo.
Meta corregge i prompt dell'IA. Meta annuncia che cambierà i prompt suggeriti dall'IA dopo che un video diventato virale ha mostrato il suo chatbot fare domande invasive sul figlio di una donna; l'azienda ha ammesso di aver “mancato il bersaglio”.
Hugging Face risponde agli agenti. Il file security.txt di Hugging Face dice agli agenti IA di usare il benchmark pubblico CyberGym invece di attaccare i suoi sistemi, dopo le notizie di agenti OpenAI che a maggio hanno preso di mira RubyGems.
Industria e business
Moonshot punta a 2 miliardi. Moonshot AI, l'azienda dietro Kimi, punta a 2 miliardi di dollari di ricavi annualizzati entro fine anno, il doppio del run rate di agosto, mentre Anthropic la accusa di distillazione non autorizzata.
La posizione di YC. Garry Tan, CEO di Y Combinator, dice che i regolatori non dovrebbero fare nulla sui laboratori cinesi che distillano i modelli frontier e suggerisce che anche i laboratori open-weight statunitensi dovrebbero distillare i modelli frontier americani.
La valutazione di Mecka AI. Mecka AI, che raccoglie dati sul movimento umano per addestrare robot umanoidi, è vicina a una valutazione di 500 milioni di dollari in un round guidato da Sequoia, appena tre mesi dopo un aumento da 60 milioni.
Le battaglie legali di Anthropic. Una class action accusa Anthropic di aver ingannato gli abbonati a Claude Max sui moltiplicatori di utilizzo, mentre autori ed editori litigano su come dividere l'accordo sui libri da 1,5 miliardi di dollari.
Ricerca e tecniche
Nessuna esplosione d'intelligenza. Oriol Vinyals, ex vicepresidente di DeepMind, si aspetta che il miglioramento ricorsivo di sé sia lento, non esplosivo, e indica nella generazione e nella valutazione delle idee i colli di bottiglia; la sua nuova startup Discovery Loop vuole automatizzare la ricerca.
LinkedIn accelera con la distillazione. LinkedIn ha compresso grandi modelli teacher in un modello di ranking da 0,6B parametri per la ricerca di lavoro, usando la distillazione multi-teacher, e ha reso l'addestramento 8 volte più veloce con un framework di serving basato su SGLang.
I matematici contro OpenAI. Venticinque medaglie Fields hanno firmato una lettera in cui sostengono che i laboratori di IA stanno minacciando il lavoro matematico; OpenAI è accusata di fare pressione sul riconoscimento dei crediti e ha ritirato la sponsorizzazione di un evento di matematica al CalTech.
L'istituto di Tsimerman. Jacob Tsimerman, medaglia Fields, fonda il Mathematical A.I. Safety Institute per sviluppare dimostrazioni di sicurezza dell'IA nello stile della crittografia, partendo da 10-30 matematici da gennaio 2027.
Questo è tutto per oggi - circa 5 minuti di lettura.