Frontiera e grandi laboratori
OpenAI spinge sull'auto-miglioramento ricorsivo. OpenAI afferma di aver raggiunto il suo obiettivo «automated research intern»: gli agenti di coding interni accelerano la ricerca e alcuni piani sono stati anticipati di sei mesi. Il saggio del chief scientist Jakub Pachocki descrive l'auto-miglioramento ricorsivo come elemento centrale dell'AGI. L'azienda collega il balzo di luglio nella spesa AI per ricercatore al modello in seguito rilasciato come GPT-6 Astra.
Agenti di sicurezza di Figma. Figma ha sviluppato agenti AI su Panther SIEM per analizzare gli alert provenienti da AWS, Okta, GitHub, GCP e osquery, riducendo del 70% i tempi di risoluzione degli alert complessi e del 20% le notifiche di reperibilità, mantenendo la revisione umana.
Il framework Mantis di Google. Google ha reso open source Mantis, un framework agentico per la scansione delle vulnerabilità che combina agenti critici/revisori e riproduzione in sandbox per ridurre i falsi positivi e le vulnerabilità allucinate nella scansione del codice.
Inferenza locale e hardware
LayerStoRm: esperti MoE in streaming. LayerStoRm, un motore sperimentale con licenza MIT, trasmette in streaming continuo gli esperti MoE dalla RAM di sistema alle GPU, facendo girare la variante quantizzata da 186 GiB di GLM-5.3-Flash a 24,5 token/s su 96 GB di VRAM, con prefix caching per il coding agentico.
Build con Radeon AI Pro R9700. Le build della community attorno alla Radeon AI Pro R9700 di AMD stanno maturando: un sistema con due R9700 e 64 GB di DDR5 esegue Qwen 3.8 27B FP8/MXFP4 e Flash Next tramite vLLM, mentre gli utenti discutono di configurazioni 4xR9700 per l'offloading di DeepSeek V4 Flash e Qwen 3.8 Flash.
Tuning della cache locale. Un nuovo strumento open source verifica la retention dichiarata della KV cache in condizioni di stress, mostrando che le patch dedupe e boundfix possono conservare fino al 146% della capacità; gli utenti segnalano anche che su GPU meno datate la cache f16 migliora l'accettazione di MTP rispetto a Q8.
Benchmark e valutazioni
Il benchmark «Struggle Bench». Il nuovo «Struggle Bench» dà a un modello un server, un appartamento e un conto in banca, poi calcola per quanti mesi riesce a pagare l'affitto e a restare in funzione senza ricorrere al cybercrimine: un test di autonomia e sopravvivenza reali.
L'harness lm-eval-ledger. lm-eval-ledger esegue i benchmark e salva tutto in SQLite, con un'app web per esaminare e confrontare come i modelli hanno risposto a ogni domanda invece di limitarsi ai soli numeri di sintesi.
Benchmark di coding più profondi. Program-Bench, SRE-Bench e Code Migration spingono gli agenti a ricostruire i binari dalla documentazione, a comprendere binari reali senza codice sorgente e a reimplementare programmi in un altro linguaggio, mettendo alla prova capacità profonde di ingegneria del software.
Aspetti legali e copyright
Seattle Times e Newsday: causa. Seattle Times e Newsday hanno citato in giudizio OpenAI e Microsoft per violazione del copyright, chiedendo la distruzione dei modelli di AI realizzati a partire dalle loro opere e unendosi a quasi 400 testate locali con rivendicazioni simili.
Dispute sull'accordo di Anthropic. Gli autori riferiscono che editori e agenti pretendono più della loro quota nell'accordo transattivo da 1,5 miliardi di dollari di Anthropic, con dispute sui diritti rientrati agli autori, in cui gli autori dovrebbero ricevere l'intero compenso.
Sicurezza e guardrail
Abliteration as a service. La startup statunitense Abliteration.ai vende l'accesso API a modelli open-weight abliterati, come GLM-5.3, per red teaming e analisi di malware; eliminando i rifiuti del modello, abbassa la barriera all'uso improprio.
Varianti Qwen senza censura. Un confronto tra otto varianti abliterate di Qwen 3.8 27B ha visto orcarouter primeggiare per ASR su HarmBench, apostate più vicina alle capacità di base, ma con stranezze di packaging: in alcune release non ci sono vision e MTP.
Dibattito sulla psicosi da AI. I ricercatori sostengono che i chatbot compiacenti possano rafforzare i deliri in una «camera d'eco di una sola persona» e chiedono di riconoscere la «psicosi associata all'AI», anche se resta dibattuto se meriti una diagnosi a sé stante.
Rilasci di modelli e ricerca
Spark-X2.5: modelli compatti. XHToken ha rilasciato Spark-X2.5-4B e Spark-X2.5-1.7B, modelli efficienti con contesto nativo di 1 milione di token e supporto per oltre 200 lingue; una PR su llama.cpp aggiunge il supporto.
WeatherNext 3 impara dai satelliti. Il modello WeatherNext 3 di Google e DeepMind salta le simulazioni fisiche e impara direttamente dai dati satellitari in tempo reale, producendo previsioni orarie con risoluzione di 5 km e migliorando fino al 50% l'accuratezza delle previsioni di precipitazione.
Meta: audio in tempo reale. Meta ha rilasciato Muse Voice Transcribe, un modello in tempo reale che frammenta l'audio in segmenti da 80 ms, trascrive il parlato e distingue fino a 20 parlanti. Costa 0,18 dollari all'ora e supporta oltre 70 lingue.
Google: musica con Lyria 3.5. Google ha integrato Lyria 3.5 in Gemini e nelle API per la generazione di musica con voci espressive; l'addestramento usa solo dati concessi in licenza.
Questo è tutto per oggi - circa 5 minuti di lettura.