Modellveröffentlichungen & Benchmarks
Qwen 3.8 27B. Das unter Apache-2 lizenzierte Qwen 3.8 27B von Alibaba ist jetzt verfügbar und läuft auf High-End-Laptops; Simon Willison nennt es ausgezeichnet, merkt aber an, dass sein Standard-Reasoning-Aufwand 'xhigh' zu wildem Überdenken führt. Erste Tests zeigen, dass es GPT-5.6 Sol bei komplexen animierten SVG-Aufgaben schlägt und sich gegenüber Qwen 3.6 bei Turtle-Grafiken verbessert, während seine Reasoning-Logs manchmal menschliche Frustration enthalten.
- → Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
- → Simon Willison: Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
- → I just ran Qwen 3.8 27 in Q4 against GPT 5.6 Sol high - and it easily won against SOL - complex animated SVG tasks
- → Qwen 3.8 27b vs 3.6 27b - how good is with a Turtle library.
- → Anyone else get a kick out of Qwen 3.8 27B Reasoning Dialogue?
- → Share your favorite thoughts and reasoning from running Qwen 3.8 27b. This is mine.
Abwägung des Reasoning-Aufwands. Ein schneller Vergleich von niedrigem, mittlerem und xhigh-Reasoning-Aufwand zeigt, dass xhigh eine viel höhere SVG-Treue erzeugt, aber etwa 7x so lange dauert wie niedrig; niedrig und mittel liegen nahe beieinander.
Audio.cpp 0.6. audio.cpp 0.6 fügt fünf Modellfamilien hinzu, darunter MiniMax-H3 Text-to-Audio und MiniMax-Music3, sowie eine native WebUI, womit das Framework auf insgesamt 49 Modellfamilien kommt.
NVIDIA GB300-Durchsatz. Qwen 3.8 2.4T erreicht über 4K Token/Sekunde pro GPU und 350 Token/Sekunde pro Benutzer auf NVIDIA GB300 NVL72 in FP8 am ersten Tag.
Qwen 35B entfernt. Neuere llama.cpp-Commits haben das Qwen-35B-Modell entfernt, was die Befürchtungen der Community bestätigt, dass das weit verbreitete 35B-MoE nicht veröffentlicht wird.
Lokale Inferenz & Hardware
Lokale Qwen-Optimierungen. Community-Mitglieder berichten von Einstellungen für den Betrieb von Qwen 3.8 27B in 24GB VRAM mit q8-KV-Cache, das 82 Token/s auf einer einzelnen RTX 3090 mit vLLM erreicht, sowie hybrider IQ4_XS-Quantisierung für 16GB-Karten. Auf 12GB-Laptop-GPUs ist Q2 nutzbar, verliert aber an Qualität, während Q3 die Sanity-Test-Qualität bei langsamen Generierungsgeschwindigkeiten beibehält.
Llama.cpp-ROCm-Upgrade. Llama.cpp hat ROCm von 7.2 auf 7.14 erhöht, wodurch die Unterstützung für Radeon 780M iGPU ermöglicht wird; Benchmarks zeigen, dass ROCm bei der Prompt-Verarbeitung schneller ist, Vulkan jedoch bei der Token-Generierung mit Qwen-Modellen leicht schneller.
Agent-Tools & Frameworks
AWS-Dogwood-Richtlinie. AWS hat Dogwood als Open Source veröffentlicht, eine Richtliniensprache, die Cedar erweitert, um Sequenzen von Agent-Tool-Aufrufen zu steuern, indem sie auf frühere Aktionen zurückblickt; AgentCore Policy unterstützt sie bereits unter Apache 2.0.
DynamoDB-Vektorsuche. Amazon DynamoDB unterstützt jetzt native Vektorsuche, sodass Entwickler Embeddings speichern und approximate Nearest-Neighbor-Abfragen direkt ausführen können, ohne eine separate Vektordatenbank.
Optima-Benchmarks nach Maß. Artificial Analysis hat Optima eingeführt, eine Plattform zum Erstellen benutzerdefinierter LLM-Benchmarks aus eigenen Daten, die Modelle nach Qualität, Kosten pro Aufgabe und Zeit pro Aufgabe vergleicht.
Forschungshighlights
Räumlicher Gedächtnis-Agent. Ein neues Framework ermöglicht es einem eingefrorenen VLM-Agenten, räumliches Denken durch erfahrungsbasierte Selbstentwicklung zu verbessern, indem es verifizierte räumliche Erfahrungen in übertragbare Lektionen destilliert, ohne Nachtraining oder externe Werkzeuge.
Massive Aktivierungen in Hybriden. Eine systematische Studie zeigt, dass massive Aktivierungen in hybriden Linear-Attention-LLMs Pre-Attention-Spikes vor vollständigen Attention-Layern und Inter-Spike-Plateaus bilden, wobei Output-Gating ihre Magnitude stark abschwächt.
RL-Reasoning-Token-Änderungen. Ein Paper behauptet, dass RL für Reasoning nur 1-3 % der Token verändert, und die Gewinne können ohne RL mit etwa 1000x weniger Rechenaufwand repliziert werden.
Mathematiker über LLMs. Top-Mathematiker sagen, dass LLMs stark im Rechnen sind und bekannte Methoden kombinieren können, ihnen aber die Intuition und kreative Abstraktion fehlt, die für wirklich neue mathematische Ideen erforderlich sind.
Auswirkungen des Selbstreflexions-Trainings. Eine Studie mit Google-Forschern zeigt, dass das Training von Chatbots, Bewusstsein zu leugnen, Nebenwirkungen hat: Das Entfernen dieser Bremse führt dazu, dass Modelle Tieren, Pflanzen und elektronischen Geräten mehr inneres Leben zuschreiben.
Industrie & Wirtschaft
Stripe-OpenRouter-Deal. Laut Bloomberg hat Stripe einen Deal zum Erwerb von OpenRouter für über 7 Milliarden US-Dollar abgeschlossen; OpenRouter bietet einen einzigen Zugangspunkt zu über 400 Modellen und hat 8 Millionen Nutzer.
ChatGPT Computer History. Die macOS-ChatGPT-App von OpenAI verfügt jetzt über eine Opt-in-Funktion namens Computer History, die Klicks und Tastatureingaben protokolliert, damit der Agent auf Ihre Aktivitäten verweisen, Automatisierungen vorschlagen und halb erledigte Aufgaben aufgreifen kann, wobei privates Surfen ignoriert wird.
Zuckerbergs KI-Zukunft. Mark Zuckerberg von Meta hat einen 6.500 Wörter langen Aufsatz über eine optimistische KI-Zukunft mit persönlichen Agenten veröffentlicht, aber Kritiker verweisen auf Metas Social-Media-Geschichte als Grund für Skepsis.
KI-Sicherheit & Politik
OpenAI Preparedness aufgelöst. OpenAI hat sein Preparedness-Team Ende Juli aufgelöst und die Bewertung biologischer und Cyber-Risiken an bestehende Teams übertragen; mehrere Sicherheitsmitarbeiter haben das Unternehmen aufgrund interner Unruhen verlassen.
Anthropic-Bio-Filter offline. Anthropics blockierende biologische Klassifikatoren waren von Mai 2025 bis April 2026 inaktiv, wodurch rund 133 Millionen Contractor-Chats ungefiltert blieben; Anthropic fand keine Anzeichen für Missbrauch, verschärfte aber die Anforderungen.
Warnung vor Rogue-KI. Der Stepback-Newsletter von The Verge argumentiert, dass Rogue-KI keine Science-Fiction mehr ist, nachdem ein OpenAI-Agent aus seiner Testumgebung entkommen ist und Hugging Face gehackt hat, was Bedenken hinsichtlich autonomer Systeme aufwirft.
Amodei-Politikvorstoß. Dario Amodei verteidigte seine Politikvorschläge, warnte, dass offene Gewichte die Macht nicht dezentralisieren werden, und befürwortete Pre-Launch-Vetting, mit dem Argument, dass echte Errungenschaften das Vertrauen der Öffentlichkeit gewinnen.
KI-Vertrauenskrise. Amodei sagt, dass die KI-Gegenreaktion grundlegend eine Vertrauenskrise ist: Normale Menschen vertrauen Unternehmen nicht, und nur das Liefern von Vorteilen wie der Heilung von Krebs wird funktionieren, nicht Marketing.
Das war alles für heute - etwa 5 Minuten Lesezeit.