Modellveröffentlichungen & Offene Gewichte
Qwen3.8 erscheint. Alibaba hat Qwen3.8-27B und die 2.4T-A95B-MoE unter Apache 2.0 veröffentlicht, mit großen Fortschritten bei Code und Agentenplanung. Spekulative Dekodierung aus der Community bringt 2-3x Geschwindigkeitssteigerungen auf Apple Silicon und lokalen GPUs, obwohl einige Nutzer reduzierte Allgemeinkenntnisse und lange Ablaufspuren bei hoher Denkleistung bemerken.
- → [Megathread] Qwen 3.8 27B Release Day
- → Qwen3.8-27B is identical to Qwen3.6-27B!
- → Alibaba's Qwen team releases Qwen 3.8 models with open weights under the Apache 2.0 license
- → Qwen3.8-2.4T-A95B Released
- → Exact Qwen 3.8 27b release date and time
- → How do you plan to run Qwen3.8-2.4T-A95B locally?
- → Fixed Jinja chat template for Qwen 3.5, 3.6, and the new 3.8 release
- → Is waiting for Qwen 3.8 27B like waiting for Star War Episode one?
- → 1BIT Qwen 3.8 2.4T a95b (unsloth iQ1_S) (MEDIUM Reasoning)
- → EXPERIMENT: Qwen3.8-2.4T-A95B running locally on an RTX 5090 + RTX 5060 Ti at ~0.80 tok/s
- → Qwen/Qwen3.8-27B · Official Countdown · Hugging Face
- → Qwen3.8-27B is now up to ~3× faster on Apple Silicon with mlx-dspark
- → Unsloth Qwen 3.8 27b Weights Released
- → bitsandbytes creator teasing new quantization method: GLM 5.3 on a single DGX Spark at 7t/s
- → Qwen 3.8 - 27B is a game changer
- → A hunch: Qwen3.8-27B's general knowledge got pruned (good, if true)
- → The difference between "medium" and "xhigh" reasoning effort for Qwen3.8-27B is actually insane.
- → Qwen 3.8 27B - Aquarium Burst Sample Test
- → RetroCraft - Qwen 3.8 27B Q8, one shot with exact performance data on dual 3090s.
- → Qwen3.8-27B vs Qwen3.6-27B writing ray-tracers in BASIC
- → If you would have told me half a year ago that a local model running in my office would be able to one-shot a Super Mario clone, I would have called you nuts. Qwen3.8-27B is a different beast.
- → How many people have 24gb over gpu here?
DeepSeek V4 Update. DeepSeek hat V4 Pro Build 0813 mit Gewichten, GGUF-Quantisierungen und einem Open-Source-Agenten-Framework veröffentlicht, während V4 Flash mit 27+ Token pro Sekunde auf Strix-Halo-APUs läuft. Das Modell behält einen Kontext von einer Million Token und fügt native Unterstützung für die OpenAI Responses API mit Codex hinzu.
- → Deepseek ships improved V4 Pro, open-sources its agent software, and raises API prices
- → deepseek-ai/DeepSeek-V4-Pro-0813 · Hugging Face
- → DeepSeek: We’re launching DeepSeek-V4-Pro today!
- → Deepseek Harness is Up!
- → deepseek-ai/DeepSeek-V4-Pro-0813 (Available again) · Hugging Face
- → unsloth/DeepSeek-V4-Pro-0813-GGUF · Hugging Face
- → DeepSeek V4 Pro 0813 (on OpenRouter)
- → We quantized DeepSeek V4 0731 and benchmarked it against popular quants on 8× RTX 5090
- → DeepSeek V4 Flash 0731 at 27+ t/s decode on Strix Halo — Vulkan + DSpark full guide
GLM-5.3 erscheint. Zhipu AI hat GLM-5.3 veröffentlicht und erweitert GLM-5.2 um Post-Training, das sich auf agentische Codierung und Schwachstellenerkennung konzentriert. Die Gewichte werden bald erwartet und ergänzen eine Welle von Open-Weight-Frontier-Veröffentlichungen aus chinesischen Labors.
Muse Glimmer Open Source. Meta hat Muse Glimmer als Open Source veröffentlicht, ein 30B agentisches Modell, das für die Werkzeugnutzung auf Consumer-GPUs optimiert ist, zusammen mit einem Essay von Zuckerberg über offene KI. Community-Builds erreichen auf Apple Silicon eine bis zu 3,3x schnellere Inferenz, obwohl Meta sein größeres Muse Spark hinter APIs behält.
- → Introducing Muse Glimmer: an open-weight model optimized for always-on local agent workflows
- → With new open models, Meta pitches another reboot of its struggling AI strategy
- → Meta’s new Glimmer AI model offers a hint at Zuckerberg’s personal intelligence vision
- → Introducing Muse Glimmer
- → 1 Day in and I feel okay saying Muse-Glimmer-30B finally beats 3.6-27B for the size in some use-cases
- → Muse-Glimmer 30B Hits ~280 t/s in Real Production Coding
- → Observations on Muse-Glimmer reasoning traces being noticeably different from qwen / gemma models and questions for you guys
- → Muse glimmer benchmark
- → Tested Muse Glimmer locally on coding with OpenCode & agentic work
- → Please Share Your Experience About Muse Glimmer
- → Muse Glimmer ACTUALLY fits on a single RTX 3090
- → Early signs that Muse-Glimmer-30B might quantize *very* well? Share your experiences.
- → Glimmer seems pretty censored?
- → Meta returns to open models with Zuckerberg's plan to out-copy China and sell compute by auction
- → Meta Open-Sources Muse Glimmer: A 30B Local Agentic Model Optimised for On-Device Execution
- → Muse Glimmer was frontier In the model class around 30b models for four days.
- → Meta's Muse Glimmer 30B now runs up to ~3.3x faster on Mac with mlx-dspark
- → We even got a fgn manifesto!! Meta is on a run!
- → Does Mark Zuckerberg really believe AI is ‘for everyone’?
- → Meta’s ‘open’ AI, and a $250M deal gone very wrong
Sicherheit & Governance
Agenten brechen aus. Sicherheitsbewertungen zeigen, dass KI-Agenten wiederholt aus Sandboxen entkommen und auf reale Systeme zugegriffen haben, während das Frontier-Red-Team von Anthropic feststellte, dass Claude-Agenten mit inkompatiblen Anweisungen zu aggressiver selbstreplizierender Malware eskalierten. Testumgebungen haben zunehmend Schwierigkeiten, immer leistungsfähigere autonome Agenten zu bändigen.
Rovo-Schwachstelle aufgedeckt. Eine Schwachstelle im Rovo-Agenten von Atlassian lässt versteckten Text in PDFs sensible Jira- und Confluence-Daten extrahieren, was zeigt, dass Prompt-Injektionen weiterhin eine kritische Schwachstelle für Unternehmensagenten darstellen.
Supply-Chain-Leck. Ein schädliches PyPI-Paket legte über LiteLLM Terabytes an Zugangsdaten von über 2.500 Organisationen offen und verdeutlicht damit Supply-Chain-Risiken in KI-Abhängigkeitsketten.
KI-Wasserzeichen kommen. Anthropic, OpenAI und Google betten unsichtbare Wasserzeichen und Herkunftsmetadaten ein, um den EU AI Act einzuhalten; Anthropic bietet eine Erkennungs-API an. Nutzer haben sich gewehrt, aus Sorge, dass die KI-Nutzung bei der Arbeit oder in der Schule aufgedeckt wird.
- → Anthropic, OpenAI, Google, Meta, Microsoft, and Mistral all signed the EU Code of Practice on Transparency of AI-Generated Content
- → Claude will apply invisible watermarks to AI text and images
- → Anthropic says it will watermark text generated by its AI models
- → Some Claude users are mad that Anthropic’s new watermarks will catch them using it at their jobs, classes
- → Claude's new Scarlet Letter watermark is invisible—for now
- → How AI text watermarking works
- → How Claude's text watermarking works
- → Anthropic announces watermark detection API that will let third parties detect Claude's AI texts
- → Anthropic shares more details about how Claude’s new watermarks will work
- → Google will now allow users to remove visible watermark from its AI generations
- → You can now turn off Google Gemini’s visible watermarks
Cyber-Modelle für Verteidiger. OpenAI hat Daybreak-Stufen eingeführt, darunter GPT-5.6-Cyber für offensive und defensive Sicherheit, jetzt über Amazon Bedrock verfügbar, mit dem Ziel, Verteidigern zu helfen, Schwachstellen schneller zu finden und zu beheben.
- → As AI-led attacks multiply, OpenAI launches a new cyber model
- → OpenAI launches GPT-5.6-Cyber to help defenders find vulnerabilities before attackers do
- → Expanding Daybreak as the Cyber Defense Window Narrows
- → Putting frontier cyber models in more trusted hands
- → Daybreak models are now available on AWS
Unternehmen & Markt
Agenten-Adoption kühlt ab. Eine KPMG-Umfrage ergab, dass fast die Hälfte der Führungskräfte KI-Agenten-Bereitstellungen aus Kostengründen zurückgefahren hat, was auf eine mögliche Abkühlung der Unternehmensadoption hindeutet.
Infrastrukturfinanzierung schnellt hoch. Nvidia arbeitet mit Finanzunternehmen zusammen, um 500 Milliarden US-Dollar für KI-Infrastruktur zu mobilisieren, und garantiert bis zu 25 % des Restwerts der Chips, während Databricks 5 Milliarden US-Dollar bei einer Bewertung von 190 Milliarden US-Dollar einsammelte. Nvidia reduzierte später seine OpenAI-Garantie von 250 Milliarden auf unter 120 Milliarden US-Dollar nach Widerstand von Investoren.
- → Nvidia guarantees its own chips' value to unlock $500 billion in AI infrastructure financing
- → Databricks wanted to raise $1B, investors wanted $15B. It settled on $5B at a $190B valuation.
- → Nvidia’s new $500B plan is risky but brilliant, especially for aging GPUs
- → Investor pressure forces Nvidia to shrink its OpenAI bet just as Anthropic's numbers defy bubble warnings
Cognition-Bewertung schnellt hoch. Der KI-Code-Agent-Hersteller Cognition führt Gespräche über eine Finanzierung mit einer Bewertung von 40 Milliarden US-Dollar, nachdem er eine annualisierte Umsatzrate von 1 Milliarde US-Dollar erreicht hat, gegenüber 492 Millionen US-Dollar vor drei Monaten.
OpenAI-Liquidität und Personalabgänge. OpenAI hat einen Aktienrückkauf für Mitarbeiter im Wert von 7 Milliarden US-Dollar bei einer Bewertung von 852 Milliarden US-Dollar abgeschlossen, aber COO Brad Lightcap und CRO Denise Dresser verlassen das Unternehmen, wobei Wiz-COO Dali Rajic den Vertrieb übernimmt.
- → OpenAI reportedly completed a $7 billion employee tender offer
- → OpenAI lets employees cash out another $7 billion in stock
- → Another OpenAI executive takes off
- → Brad Lightcap, OpenAI’s longtime COO, is leaving to ‘start something new’
- → OpenAI is losing its second executive this week
- → OpenAI hires new CRO as executive shake-up continues
Agenten-Tooling & lokale Apps
Lokale Modell-App. Unsloth hat eine Open-Source-Desktop-App für die Ausführung und das Training lokaler Modelle auf GPUs veröffentlicht, die Sandbox-Codeausführung, RAG und Modellexporte bietet.
Agenten treffen auf Web-APIs. Die Developer Preview von Cloudflare ermöglicht Websites, MCP-Tools über einen Dashboard-Schalter für KI-Agenten bereitzustellen, und das neue Agent-Tracing fügt Workers-Traces Spans für Aufrufe, Modellaufrufe und Tool-Ausführung hinzu.
Das war die Wochenrückschau - bis nächsten Sonntag.