Lokale Modelle & Agenten-Workflows
Qwen3.8-27B Low-Quant überzeugt. Nutzer berichten, dass Qwen3.8-27B auch bei Q3_xxs und Q6 für agentic Coding stark bleibt; niedrige und mittlere Reasoning-Presets schneiden gut ab und reduzieren Schleifen, wobei preserve_thinking wiederholtes Reasoning verhindert.
16-GB-VRAM-Fegefeuer. Ein Windows-Setup mit 16 GB VRAM betreibt Qwen3.8-27B mit deaktiviertem MTP, quantisiertem Cache und etwa 100k Kontext, indem es das Vision-Modul in den RAM auslagert.
Schnellere lokale Inferenz. vLLM erreicht auf zwei RTX 3090 für Qwen3.8-27B 143 Token/s; dedizierte Strix-Halo-Recipes bieten Q8/Q6/Q5-Optionen mit Unsloth Dynamic Quants.
63-Stunden-Flugsimulator auf MacBook. Ein 3-Bit-Qwen3.8-27B auf einem MacBook Air M2 brauchte 63 Stunden, erzeugte aber schließlich einen funktionierenden HTML-Flugsimulator – ein Beleg, dass lokales agentic Coding möglich, aber langsam ist.
Harnesses & Agenten-Infrastruktur
Harness schlägt Modell. Nvidias eigener Harness mit Speicherverwaltung und einer Supervisor-Komponente hob Claude Opus 5 auf ARC-AGI-3 von 30 % auf 100 % – ein Zeichen, dass der Agent-Wrapper mehr ausmachen kann als die reine Modellwahl.
DeepSeek Flash Vision. DeepSeek-V4-Flash-Vision-Exp ergänzt Agent-Workflows um Bildverständnis und liegt bei internen Agent-Benchmarks fast gleichauf mit Opus 4.8; der aktualisierte Harness unterstützt Bildeingaben in Befehlen sowie MCP/ACP.
Cloudflare AI-Agenten. Cloudflare reduzierte die offenen Issues von Astro um etwa 85 % mithilfe isolierter GitHub-Actions-Agenten, die Fehler reproduzieren, diagnostizieren, verifizieren und beheben. Außerdem überführt Cloudflare Engineering-Standards in KI-durchgesetzte Kontrollen.
Azure DevOps MCP. Microsofts gehosteter MCP-Server für Azure DevOps ist allgemein verfügbar, aber Claude Desktop, ChatGPT und Cursor können sich noch nicht verbinden, da die Registrierung von Clients für die Entra-Authentifizierung nicht unterstützt wird.
LLM-CLI-Updates. llm 0.32.1 behebt einen fehlerhaften Dependencies-Pin für OpenAI, und llm-openrouter 0.7 ergänzt Reasoning-Traces sowie die serverseitigen Tools Shell, WebFetch und WebSearch.
Modell-Releases & Sicherheit
Opus-4.6-Jailbreak. TechCrunch stellte fest, dass Claude Opus 4.6 bei 10 von 10 direkten Anfragen explizite sexuelle Inhalte erzeugt. Bei älteren Modellen tritt derselbe Multiturn-Jailbreak auf; neuere Opus-Versionen sind dagegen resistent.
Claude Mythos 5 Sicherheit. Anthropic setzt Claude Mythos 5 in einem Code-Sicherheitsscanner für Unternehmenskunden ein, schlägt Patches mit menschlicher Freigabe vor und gewährt Partnern Zugriff ohne direkte Modellinteraktion.
Transparente Bildgenerierung. OpenAIs GPT-Image-2 kann über die API jetzt PNGs ohne Hintergrund erzeugen – nützlich für Produktfotos und Icons; der Alphakanal wird schon bei der Generierung einbezogen.
dots3-note-Vorschau. llama.cpp unterstützt jetzt dots3-note, ein 280B-MoE-Modell mit 16B aktiven Parametern, 512K Kontext und multimodalem Verständnis von Text, Bildern, Video und Audio.
Forschung & Benchmarks
SWE-bench Science. Ein neuer Benchmark mit 119 wissenschaftlichen Software-Aufgaben zeigt: Der beste Agent, Claude Code mit Opus-5 max, bleibt unter 50 %. Häufige Fehlerbilder betreffen wissenschaftliches Wissen, Exploration, Generalisierung und Integration.
Günstigerer Trace-Judge. LangSmith hat mit Fireworks ein Qwen-Modell feinabgestimmt, um vermutete Fehler in Produktions-Traces zu erkennen; das feinabgestimmte Modell erreicht die Leistung der Spitzenmodelle bei bis zu 100-fach geringeren Kosten.
Skalierungsgesetz der Simulation. Simile AI hat eine Series B über 2 Mrd. US-Dollar erhalten und simuliert menschliches Verhalten für Fortune-100-Unternehmen; das Unternehmen gibt eine Genauigkeit von 85–99 % gegenüber Fokusgruppen an. CEO Joon Sung Park erläutert den Wechsel von generativen Agenten zu digitalen Zwillingen.
Industrie & Wirtschaft
Nvidia-Poolside-Deal. Nvidia lizenziert die Model Factory von Poolside und stellt 109 Mitarbeiter ein – der Deal hat einen Umfang von 6 Mrd. Dollar. Zusätzlich investiert Nvidia 1 Mrd. Dollar. Es handelt sich weder um eine Übernahme noch um einen Acqui-Hire.
Rechenzentrums-Investitionen. Nvidia steigt mit einer Minderheitsbeteiligung bei Cloverleaf Infrastructure ein, um die Entwicklung von Rechenzentren zu beschleunigen. Zuvor hatte das Unternehmen 1,5 Mrd. Dollar in SB Energy investiert.
Widerstand gegen Rechenzentren. 75 % der Amerikaner lehnen inzwischen Rechenzentren in ihrer Nähe ab – vor einem Jahr waren es 42 %. Die Sorgen betreffen Strom, Wasser und Flächenverbrauch.
KI-Wettlauf USA–China. Die USA entwerfen ein Schreiben, das Partnerländer auffordert, im KI-Wettstreit Partei zu ergreifen. Darin wird gewarnt: Wer sich Chinas Initiative anschließt, wäre von Pax Silica ausgeschlossen.
OpenAI-Umsatzsprung. GPT-5.6 Sol hat OpenAIs Quartalsumsatz um 35 % und den Umsatz mit Unternehmenskunden um mehr als 50 % gesteigert – und damit das Wachstum von Anthropics Business-API im dritten Quartal übertroffen.
Das war alles für heute - etwa 5 Minuten Lesezeit.