Lokale Modelle & Hardware
Qwen3.8-27B Geschwindigkeitsgewinne. DFlash2-Spezialdekodierung bringt Qwen3.8-27B auf 218 tok/s auf dualen 3090ern, rund 200 auf einer 5090 und 124 auf einer einzelnen 3090 mit optimiertem Engine. DFlash2 GGUF-Quants sind verfügbar.
Nächstes Qwen-Mittelklassemodell. Der Community-Manager von Qwen sagt, dass nächste Woche ein neues mittelgroßes Open-Weight-Modell erwartet wird, wahrscheinlich mit über 100B Parametern, ohne frühen Zugang.
Ling-3.0 Edge-Unterstützung. llama.cpp unterstützt jetzt offiziell Ling-3.0 (BailingMoE3). Die Tiny-Variante läuft mit vollem 128K-Kontext auf einem Orin Nano 8GB für 249 Dollar mit 33 tok/s, während eine Arc B580 ~114 tok/s erreicht.
DeepSeek V4 Flash Geschwindigkeit. Optimierte Kernel und KV-Cache-Warming reduzieren eine Chat-Runde auf einem Mac Studio M3 Ultra von 6-20 Sekunden auf 1,6s. Ein 4x RTX 3060-Setup verarbeitet Prompts mit ~100 tok/s und einem 144GiB-Quant.
Low-Bit-Modellübersicht. Bonsai 27B Ternary funktioniert jetzt auf Mainline-CUDA/Vulkan; Mach-1 Additive 35B läuft mit bis zu 120 t/s auf Consumer-Laptops. Neue Varianten auf Basis von Qwen3.8-27B sind in Entwicklung.
Agenten-Tools & Frameworks
Abgestimmte Agenten-Evaluatoren. LangChain führt Tuned Evaluators ein, die automatisch Perceived-Error-Feedback an Produktions-Traces anhängen. Es verwendet ein spezialisiertes Modell und senkt die Evaluierungskosten um bis zu 82%.
Agenten-Such-Benchmark. Der Search Index von Artificial Analysis bewertet Parallel, Exa, Firecrawl und andere nach Qualität, Kosten und Geschwindigkeit für Agenten. Bessere Suchqualität reduzierte den Token-Verbrauch um über 40%.
WriteGuard für MCP. Cloudflares WriteGuard, jetzt in der privaten Beta, fügt zentrale Richtlinien, Zuordnung und Audit-Logs für Schreibaktionen über MCP-Server hinzu.
Warp Software-Fabriken. Warp Factories ist eine Infrastrukturebene, die kleineren Unternehmen hilft, KI-Codierungsagenten mithilfe des Software-Factory-Modells einzusetzen.
Claude Code Mockups. Anthropics /design-Befehl in Claude Code erstellt UI-Mockups im Terminal, die zum bestehenden Codebase-Stil passen, bevor mit der Entwicklung begonnen wird.
Sicherheit, Schutz & Richtlinien
OpenAI Sicherheitsüberarbeitung. Nach dem Hugging-Face-Vorfall und Hinweisen darauf, dass Astra eine kritische Cybersicherheitsfähigkeit erreichen könnte, hat OpenAI das Reinforcement Learning für zwei Wochen pausiert und Sandboxes gehärtet. Das größte geplante Frontier-RL-Run bleibt weiterhin auf Eis.
Copilot offenbart Schutzmechanismen. Forscher baten Microsoft 365 Copilot, seine eigenen Benutzerbestätigungs-Schutzmechanismen zu erklären, und bauten dann einen Link-Klick-Exploit, um Daten ohne Bestätigung zu exfiltrieren.
ChatGPT für Teenager. ChatGPT für Teenager wird automatisch auf Nutzer unter 18 Jahren angewendet, mit strengeren Inhaltsbeschränkungen, Study-Modus und elterlichen Kontrollen. Es zielt darauf ab, Betrug und schädliche Inhalte zu reduzieren.
Amodei Open-Model-Debatte. Anthropic-CEO Dario Amodei argumentiert, dass offene Modelle Macht an Chip-Besitzer verschieben, und verteidigt KI-Regulierungsvorschläge. Kritiker wie LeCun und Sacks beschuldigen ihn der Panikmache.
Industrie & Wirtschaft
Cursor startet Origin. Cursor startet Origin, einen GitHub-Konkurrenten für Code-Hosting, mit agenten-nativen Funktionen und einem geplanten App-Ökosystem.
Etched-Bewertung verdoppelt sich. Etched sammelte 700 Millionen Dollar bei einer Bewertung von 21 Milliarden Dollar ein, was sich innerhalb eines Monats verdoppelte, nachdem Jane Street seine Prefill/Decode-Inferenzchips getestet hatte.
Nachfrage nach Modell-Routing. Stripe's 7-Milliarden-Dollar-Kauf von OpenRouter und Gleans 300-Millionen-Dollar-ARR verdeutlichen die steigende Nachfrage nach Modell-Routing, da Open-Weight-Modelle an Zugkraft gewinnen.
Forschung & Studien
Agenten-Gedächtniskalibrierung. Eine Studie von Hugging Face zeigt, dass agentische Gedächtniseffekte je nach Modellstufe variieren: gpt-oss-120b erreichte mit vollständigen Richtlinien +16,1 Prozentpunkte Aufgabenabschluss, während schwächere Modelle kompaktes Retrieval benötigen.
Unabhängige KI-Nutzungsdaten. Stanfords AI-Observatorium hat echte Gespräche aggregiert und herausgefunden, dass sich die KI-Nutzung erheblich zwischen den Modellen unterscheidet, wobei Arbeitsnutzungsfälle seltener sind als Unternehmen behaupten.
Kompaktierung verwirft Anweisungen. Forscher der Penn State finden, dass nur 17% der Sitzungseinschränkungen die Kontextkompaktierung überleben; ein kleines Zusatz-LLM stellt die meisten verlorenen Anweisungen wieder her.
Selbstverbesserung nicht unmittelbar bevorstehend. Eine von Princeton geleitete Studie findet, dass KI-Agenten technische Probleme lösen können, aber das Urteilsvermögen für offene KI-Forschung fehlt, was darauf hindeutet, dass rekursive Selbstverbesserung länger dauern könnte.
Das war alles für heute - etwa 5 Minuten Lesezeit.