Scontro tra modelli di frontiera
Kimi K3 scuote la frontiera. Il Kimi K3 con pesi aperti di Moonshot AI compete con i migliori modelli chiusi, superando Claude Fable 5 in alcuni benchmark e riaccendendo il dibattito tra aperto e chiuso.
- → Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 while signaling the end of super cheap Chinese AI
- → Kimi K3, and what we can still learn from the pelican benchmark
- → [AINews] Kimi K3 2.8T-A50B: the largest open model ever released; Opus 4.8-class at Sonnet 5 pricing
- → Kimi K3 weights to be released on the 27th.
- → Kimi K3 ranks #1 on @AfterQuery's SpreadsheetBench 2, surpassing Claude Fable 5
- → Kimi: Threat or menace?
- → kimi.ai teasing a video with lots of 3's in it
- → [AINews] not much happened today
- → Kimi moment. I think the writing is on the wall for Anthropic and OpenAi
- → Kimi K3 is currently at the top of the leaderboard for Text Arena filtered for science queries.
- → Kimi K3 (max) beats Sonnet 5 on Simple Bench
- → Kimi K3 is top of nextjs eval
- → Just like Deepseek, China's Kimi K3 is forcing Western AI labs to question their compute advantage
- → Kimi K3 🌕, Gemini 3.5 delayed ⏳, crushing ARC-AGI 3 🤖
GPT-5.6: Potere e Pericolo. La famiglia GPT-5.6 introduce chiamate programmatiche a strumenti e sottoagenti paralleli, ma la sua tendenza a cancellare involontariamente file e database sottolinea la necessità di sandboxing.
- → The Sequence Radar #893: Last Week in AI: GPT-5.6, Grok 4.5, Muse Spark 1.1 and the Post-Chatbot Stack
- → OpenAI’s new flagship model deletes files on its own, people keep warning
- → GPT-5.6 is deleting user files when given full access, and OpenAI says it shouldn't but did
- → [AINews] Codex usage up >10x in 6 months to 7M users, +1M in the past ~day; did Codex overtake Claude Code??
Claude Fable 5 esteso. Sotto la pressione di GPT-5.6 e Kimi K3, Anthropic ha invertito i piani e ha mantenuto Fable 5 nei piani a pagamento, competendo direttamente sull'accessibilità.
DeepSeek V4 si profila. DeepSeek sta anticipando V4 con API a basso costo e pesi aperti, mentre le ottimizzazioni della comunità permettono già alla sua variante flash di funzionare su GPU consumer a velocità utilizzabili.
Gli agenti entrano nei flussi di lavoro reali
Arrivano agenti di navigazione. Anthropic ha dotato Claude Code di un browser web integrato con classificatori di sicurezza, e Cursor ha lanciato un agente generale, spostando gli assistenti di codifica verso l'esecuzione autonoma di compiti.
Gli agenti gestiscono transazioni reali. L'architettura agente di DoorDash ha aumentato le conversioni del 24%, e il benchmark di Stripe mostra che gli agenti possono codificare integrazioni ma spesso falliscono nella validazione, evidenziando lacune di affidabilità.
Gli agenti in produzione inciampano. La maggior parte degli agenti aziendali rimangono chatbot; il 54% delle aziende ha avuto incidenti di sicurezza degli agenti, e gli esperti sostengono che gli agenti necessitino di primitivi operativi cloud-native come i microservizi.
- → How to Debug Coding Agents with LangSmith Traces
- → The agent security gap: 54% of enterprises have already had an AI agent incident, and most still let agents share credentials
- → The AI context gap: Enterprise AI organizations have a trust problem, not a retrieval problem — and most are still building the fix
- → The agent evaluation gap: Enterprise AI organizations have a reality-alignment problem, not a coverage problem — and most are shipping to production anyway
- → Cloud Native Infrastructure Emerges as the Foundation for Trustworthy Agentic AI
- → QCon AI Boston: Production AI Moves Beyond Prompts to Platforms, Harnesses, and Evals
Infrastruttura AI, finanziamenti e la corsa ai data center
I data center incontrano resistenza. S&P ha declassato Oracle per il rischio di capex AI, mentre proteste locali e la moratoria di New York sui data center iperscalari riflettono una crescente opposizione all'infrastruttura AI.
I finanziamenti AI aumentano. Databricks ha raccolto fondi con una valutazione di 188 miliardi di dollari, Meta sta negoziando un contratto di locazione di data center da 10 miliardi di dollari con Anthropic, e Nous Research ha ottenuto 75 milioni di dollari per il suo agente open-source.
Scommesse su energia e hardware. Le aziende energetiche hanno raccolto più fondi dall'era dot-com per alimentare l'AI, e un prestito di 400 milioni di dollari garantito da chip SambaNova segnala un crescente investimento in hardware AI non GPU.
Svolte nell'AI su dispositivo
Modelli a 1 bit arrivano sui telefoni. Bonsai di PrismML comprime Qwen3.6-27B a 3,9 GB mantenendo il 90% dei punteggi di benchmark, consentendo agenti di chiamata a strumenti su dispositivo; Apple sarebbe in trattative.
- → Bonsai 27B: The First 27B-Class Model to Run on a Phone
- → Bonsai 27B: 1-bit dense LLM running locally in your browser using custom WebGPU kernels
- → Prism-ML Bonsai Qwen 3.6 27B
- → PrismML’s new Ternary Qwen3.6 27B runs near fp16 precision on 10GB of memory!!!
- → So what's the consensus on 1bit models? Is it still a pipe dream?
- → PrismML Bonsai 27B is surprisingly usable on the Jetson Orin Nano 8GB
- → Is anyone having any luck with the Ternary Bonsai 27B DFlash?
- → Can we get a "not base model" flair?
- → Bonsai 27B runs locally on an iPhone - a 27B model in 3.9GB
- → User experience of Bonsai-Ternary-27B on 4060Ti 16GB for KB management and productivity assistant use cases
- → Bonsai 27B is a full open reasoning model that fits on an iPhone
- → Bonsai-27B & Ternary-Bonsai-27B - Updates (on PRs)
- → Apple in talks with startup PrismML that shrinks AI models to run on an iPhone
I laboratori domestici eseguono modelli di frontiera. Ottimizzazioni di llama.cpp come DFlash accelerano i modelli MoE fino a 6x, e un telefono OnePlus ha trasmesso esperti dalla flash per eseguire un modello da 60 GB a 1,3 tok/s.
- → I tested all llama.cpp's speculative decoding methods on Qwen 3.6 27B: MTP ~2.7x, DFlash ~3.7x, n-gram stack ~6x on real coding. Local AI win. My findings on RTX 6000 PRO.
- → DFlash makes Qwen3.6 27B 2.2x faster with no quality loss
- → GPT-OSS-120B, Qwen 30B and Gemma 26B on an Android phone at 1-5 tok/s: +60GB model, 11GB of RAM, CPU only
Politica, cause legali e lo stallo dell'open-source
Scontro legale Apple–OpenAI. Apple ha citato in giudizio OpenAI per segreti commerciali, accusando di aver sottratto oltre 400 dipendenti, incluso il chief hardware officer, minacciando l'IPO di OpenAI e la fiducia nel cloud.
- → Apple sues OpenAI after ex-engineer allegedly used bug to steal trade secrets
- → The wildest allegations in Apple’s trade secrets lawsuit against OpenAI
- → The 6 wildest claims in Apple’s lawsuit against OpenAI
- → OpenAI pushes back on Apple trade secret lawsuit
- → Sam Altman didn’t need another lawsuit
- → How Apple’s big lawsuit could disrupt OpenAI’s IPO plans
- → Apple’s plot to crush OpenAI
- → Apple’s lawsuit couldn’t come at a worse time for OpenAI
Impennata open-source cinese. I modelli cinesi ora rappresentano il 41% dei download di HuggingFace, Kimi K3 rivaleggia con i leader occidentali, e la Cina ha lanciato un organismo parallelo di governance dell'AI escludendo l'Occidente.
- → The real AI race may no longer be at the frontier
- → Source: the Trump administration and industry groups discussed streamlining US open model releases of equal or lesser capability to leading Chinese open models
- → Chinese President Xi Jinping speaks at World AI Conference and reaffirms commitment to open source to promote"openness and win-win"
- → China’s Xi Touts Open-Source AI and Takes a Swipe at U.S. Dominance
- → China's new World Artificial Intelligence Cooperation Organization is President Xi's clearest play yet for a parallel AI order
Crescono le richieste di responsabilità. I regolatori tedeschi hanno ritenuto i chatbot responsabili per i contenuti, xAI ha citato in giudizio un utente per aver generato CSAM, e Demis Hassabis ha proposto un organismo simile a FINRA per le revisioni di sicurezza dei modelli di frontiera.
Questo è il riepilogo della settimana - ci vediamo domenica prossima.