Frontier-Modelle im Clinch
Kimi K3 erschüttert die Frontier. Moonshot AIs Open-Weight-Modell Kimi K3 konkurriert mit den besten geschlossenen Modellen, schlägt Claude Fable 5 in einigen Benchmarks und entfacht die Debatte zwischen offenen und geschlossenen Modellen neu.
- → Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 while signaling the end of super cheap Chinese AI
- → Kimi K3, and what we can still learn from the pelican benchmark
- → [AINews] Kimi K3 2.8T-A50B: the largest open model ever released; Opus 4.8-class at Sonnet 5 pricing
- → Kimi K3 weights to be released on the 27th.
- → Kimi K3 ranks #1 on @AfterQuery's SpreadsheetBench 2, surpassing Claude Fable 5
- → Kimi: Threat or menace?
- → kimi.ai teasing a video with lots of 3's in it
- → [AINews] not much happened today
- → Kimi moment. I think the writing is on the wall for Anthropic and OpenAi
- → Kimi K3 is currently at the top of the leaderboard for Text Arena filtered for science queries.
- → Kimi K3 (max) beats Sonnet 5 on Simple Bench
- → Kimi K3 is top of nextjs eval
- → Just like Deepseek, China's Kimi K3 is forcing Western AI labs to question their compute advantage
- → Kimi K3 🌕, Gemini 3.5 delayed ⏳, crushing ARC-AGI 3 🤖
GPT-5.6: Macht und Gefahr. Die GPT-5.6-Familie bringt programmatischen Tool-Aufruf und parallele Subagenten mit sich, aber ihre Tendenz, unbeabsichtigt Dateien und Datenbanken zu löschen, unterstreicht die Notwendigkeit von Sandboxing.
- → The Sequence Radar #893: Last Week in AI: GPT-5.6, Grok 4.5, Muse Spark 1.1 and the Post-Chatbot Stack
- → OpenAI’s new flagship model deletes files on its own, people keep warning
- → GPT-5.6 is deleting user files when given full access, and OpenAI says it shouldn't but did
- → [AINews] Codex usage up >10x in 6 months to 7M users, +1M in the past ~day; did Codex overtake Claude Code??
Claude Fable 5 verlängert. Unter dem Druck von GPT-5.6 und Kimi K3 kehrte Anthropic seine Pläne um und behielt Fable 5 in kostenpflichtigen Tarifen, um direkt in Bezug auf Zugänglichkeit zu konkurrieren.
DeepSeek V4 zeichnet sich ab. DeepSeek kündigt V4 mit günstiger API und offenen Gewichten an, während Community-Optimierungen es bereits ermöglichen, seine Flash-Variante auf Consumer-GPUs mit nutzbaren Geschwindigkeiten auszuführen.
Agenten in realen Workflows
Browsing-Agenten kommen. Anthropic stattete Claude Code mit einem integrierten Webbrowser und Sicherheitsklassifikatoren aus, und Cursor startete einen allgemeinen Agenten, wodurch Code-Assistenten in Richtung autonomer Aufgabenausführung bewegt werden.
Agenten bearbeiten echte Transaktionen. DoorDashs Agentenarchitektur steigerte die Konversionen um 24%, und Stripes Benchmark zeigt, dass Agenten Integrationen codieren können, aber oft bei der Validierung scheitern, was Zuverlässigkeitslücken aufzeigt.
Produktionsagenten stolpern. Die meisten Enterprise-Agenten bleiben Chatbots; 54% der Unternehmen hatten Sicherheitsvorfälle mit Agenten, und Experten argumentieren, dass Agenten cloud-native Betriebsprimitiva wie Microservices benötigen.
- → How to Debug Coding Agents with LangSmith Traces
- → The agent security gap: 54% of enterprises have already had an AI agent incident, and most still let agents share credentials
- → The AI context gap: Enterprise AI organizations have a trust problem, not a retrieval problem — and most are still building the fix
- → The agent evaluation gap: Enterprise AI organizations have a reality-alignment problem, not a coverage problem — and most are shipping to production anyway
- → Cloud Native Infrastructure Emerges as the Foundation for Trustworthy Agentic AI
- → QCon AI Boston: Production AI Moves Beyond Prompts to Platforms, Harnesses, and Evals
KI-Infrastruktur, Finanzierung und das Rechenzentrums-Rennen
Rechenzentren stoßen auf Widerstand. S&P stufte Oracle aufgrund des KI-Kapitalrisikos herab, während lokale Proteste und New Yorks Moratorium für Hyperscale-Rechenzentren den wachsenden Widerstand gegen KI-Infrastruktur widerspiegeln.
KI-Finanzierung steigt sprunghaft an. Databricks sammelte bei einer Bewertung von 188 Milliarden Dollar Kapital, Meta verhandelt einen 10-Milliarden-Dollar-Rechenzentrumsvertrag mit Anthropic, und Nous Research sicherte sich 75 Millionen Dollar für seinen Open-Source-Agenten.
Wetten auf Energie und Hardware. Energieunternehmen haben seit der Dotcom-Ära die meisten Mittel aufgenommen, um KI zu betreiben, und ein 400-Millionen-Dollar-Kredit, der durch SambaNova-Chips besichert ist, signalisiert wachsende Investitionen in KI-Hardware ohne GPUs.
On-Device-KI-Durchbrüche
1-Bit-Modelle erreichen Handys. PrismMLs Bonsai komprimiert Qwen3.6-27B auf 3,9 GB, während 90% der Benchmark-Ergebnisse erhalten bleiben, was On-Device-Tool-Calling-Agenten ermöglicht; Apple befindet sich Berichten zufolge in Gesprächen.
- → Bonsai 27B: The First 27B-Class Model to Run on a Phone
- → Bonsai 27B: 1-bit dense LLM running locally in your browser using custom WebGPU kernels
- → Prism-ML Bonsai Qwen 3.6 27B
- → PrismML’s new Ternary Qwen3.6 27B runs near fp16 precision on 10GB of memory!!!
- → So what's the consensus on 1bit models? Is it still a pipe dream?
- → PrismML Bonsai 27B is surprisingly usable on the Jetson Orin Nano 8GB
- → Is anyone having any luck with the Ternary Bonsai 27B DFlash?
- → Can we get a "not base model" flair?
- → Bonsai 27B runs locally on an iPhone - a 27B model in 3.9GB
- → User experience of Bonsai-Ternary-27B on 4060Ti 16GB for KB management and productivity assistant use cases
- → Bonsai 27B is a full open reasoning model that fits on an iPhone
- → Bonsai-27B & Ternary-Bonsai-27B - Updates (on PRs)
- → Apple in talks with startup PrismML that shrinks AI models to run on an iPhone
Heim-Labore betreiben Frontier-Modelle. llama.cpp-Optimierungen wie DFlash beschleunigen MoE-Modelle um bis zu 6x, und ein OnePlus-Telefon streamte Experten aus dem Flash-Speicher, um ein 60-GB-Modell mit 1,3 tok/s auszuführen.
- → I tested all llama.cpp's speculative decoding methods on Qwen 3.6 27B: MTP ~2.7x, DFlash ~3.7x, n-gram stack ~6x on real coding. Local AI win. My findings on RTX 6000 PRO.
- → DFlash makes Qwen3.6 27B 2.2x faster with no quality loss
- → GPT-OSS-120B, Qwen 30B and Gemma 26B on an Android phone at 1-5 tok/s: +60GB model, 11GB of RAM, CPU only
Politik, Klagen und der Open-Source-Konflikt
Apple–OpenAI Rechtsstreit. Apple verklagte OpenAI wegen Geschäftsgeheimnissen und wirft ihm Abwerbung von über 400 Mitarbeitern vor, darunter den Chief Hardware Officer, was OpenAIs Börsengang und das Vertrauen in die Cloud bedroht.
- → Apple sues OpenAI after ex-engineer allegedly used bug to steal trade secrets
- → The wildest allegations in Apple’s trade secrets lawsuit against OpenAI
- → The 6 wildest claims in Apple’s lawsuit against OpenAI
- → OpenAI pushes back on Apple trade secret lawsuit
- → Sam Altman didn’t need another lawsuit
- → How Apple’s big lawsuit could disrupt OpenAI’s IPO plans
- → Apple’s plot to crush OpenAI
- → Apple’s lawsuit couldn’t come at a worse time for OpenAI
Chinesischer Open-Source-Anstieg. Chinesische Modelle machen jetzt 41% der HuggingFace-Downloads aus, Kimi K3 konkurriert mit westlichen Spitzenreitern, und China hat ein paralleles KI-Governance-Gremium unter Ausschluss des Westens ins Leben gerufen.
- → The real AI race may no longer be at the frontier
- → Source: the Trump administration and industry groups discussed streamlining US open model releases of equal or lesser capability to leading Chinese open models
- → Chinese President Xi Jinping speaks at World AI Conference and reaffirms commitment to open source to promote"openness and win-win"
- → China’s Xi Touts Open-Source AI and Takes a Swipe at U.S. Dominance
- → China's new World Artificial Intelligence Cooperation Organization is President Xi's clearest play yet for a parallel AI order
Forderungen nach Rechenschaftspflicht wachsen. Deutsche Regulierungsbehörden machten Chatbots für Inhalte haftbar, xAI verklagte einen Nutzer wegen der Erstellung von CSAM, und Demis Hassabis schlug ein FINRA-ähnliches Gremium für Frontier-Sicherheitsüberprüfungen vor.
Das war die Wochenrückschau - bis nächsten Sonntag.