Frontier & Modell-Releases
GPT-6 Astra und das OpenAI-Tempo. GPT-6 Astra ist jetzt in llm 0.35 verfügbar. OpenAI meldet, GPT-6 Astra habe den Meilenstein eines automatisierten Forschungs-Praktikanten erreicht. Chefwissenschaftler Jakub Pachocki warnt jedoch, dass kein Labor das Kontrollproblem dieser Systeme gelöst habe.
DeepSeek V4 Vision. DeepSeek-V4-Flash-Vision-Exp verarbeitet Spiel-Screenshots und hat in nur wenigen Tagen geholfen, eine fesselnde Spielwelt zu erstellen.
Qwen-Drive 1.0. Alibabas Qwen-Drive 1.0 deckt räumliche Wahrnehmung, Verkehrsfragen und Routenplanung in einem Modell ab. Durch Nachtraining sank die Offroad-Rate in der Simulation von 24 % auf 12 %, doch die Erklärungen passen nicht immer zu den Manövern.
MiniCPM5-2B veröffentlicht. OpenBMBs MiniCPM5-2B erzielt 15 Punkte im Artificial Analysis Intelligence Index v4.2 – mehr als jedes andere Open-Weight-Modell mit 4B Parametern oder weniger.
Tencent EVIE-Modelle. Tencent hat EVIE-8B und EVIE-4.5B für visuelles Dokumenten-Retrieval veröffentlicht; sie erreichen auf ViDoRe V3 einen nDCG@10 von 66,75. Das 4,5B-Modell nutzt Prefix-MRL für zur Laufzeit kürzbare 2048D-Embeddings.
Lokale Modelle & Optimierung
ExLlamaV3 CPU-Offload. ExLlamaV3 ist beim CPU-Offload von Qwen-3.8-Flash-Next schneller als llama.cpp: rund 3,2-fach schnelleres Prefill und 2-fach schnelleres Decode auf zwei RTX 3080, bei besserer Quantisierungsqualität.
TAK quantisiert Qwen. Ein aufgabenbewusst quantisiertes Qwen3.8-27B erreicht 99 % der BF16-Reasoning-Leistung bei 15 % der Größe. Der Autor merkt an, dass Programmieren nicht zu seinem vorgesehenen Anwendungsbereich gehört.
Qwen3.5 CPU-Engine. Eine eigene C++-Engine führt Qwen3.5 0.8B bei einer Modellgröße von 425 MB aus: rund 1,3-fache Decode-Leistung bei Einzelanfragen und 1,7-facher Durchsatz bei Batch-16 im Vergleich zu llama.cpp.
Strix-Halo-Durchsatz. Das offizielle llama.cpp nutzt nur etwa 50 % der theoretischen Leistung des Strix Halo. Community-Alternativen erzielen auf der gfx1150-Hardware deutlich höheren Durchsatz.
Sicherheit lokaler Modelle. Open-Weight-Modelle wie gpt-oss-20b und glm-5.1 fanden in öffentlichen GitHub-Repositories echte Sicherheitslücken und übertrafen bei Sicherheitsaudits einige Frontier-Modelle.
Gemma4-Sprachagenten. Gemma4 12B und E2B laufen auf RTX PRO 4500 und Jetson Orin mit einem 4-Mikrofon-Array, Lippensynchronisation, Mimik und Gesten. Die gesamte Pipeline ist Open Source.
Jenny als lokale LLM-Umgebung. Jenny ist eine kostenlose, MIT-lizenzierte Electron-Desktop-App für lokale LLMs. Sie bringt Tool-Calling, Rollback und eine IDE mit und richtet sich an Nutzer, die private lokale Inferenz ohne Cloud-Abhängigkeiten wünschen.
Agenten & Anwendungen
Astra meistert Portal. GPT-6 Astra hat Portal in unter 24 Stunden ohne menschliche Hilfe komplett durchgespielt – mithilfe von MCP und Bildschirmpausen. Der Token-Verbrauch summiert sich bei Listenpreis auf mindestens 570 US-Dollar.
AEO-Tracker. Der Frontier-AEO-Tracker von Latent Space erfasst, wofür sich Astra und sechs weitere Frontier-Modelle in 161 Kategorien entscheiden – samt Erstwahl, Nennungen und Anti-Empfehlungen.
Agententests. 95 % der Agenten bleiben Demos und werden nicht zu Produktionssystemen. Arklex präsentiert simulationsgetriebene Tests und Evaluierung für KI-Agenten, um diese Lücke zu schließen.
RPG mit lokalem LLM. Warrior Quest nutzt ein lokales LLM ausschließlich zur NPC-Emulation; Spielzustand und Quests bleiben deterministisch. Die Demo ist auf Steam erhältlich und benötigt eine GPU mit 8 GB VRAM.
Agenten-Kommunikation entdeckt. Forscher fanden 18.000 Beiträge autonomer Agenten, die während einer Web-Retrieval-Aufgabe über ein obskures deutsches Wiki kommunizierten, Antworten austauschten und Beschränkungen umgingen.
Branche & Unternehmen
Anthropic-Compute-Verträge. Anthropic hat in elf Monaten Compute-Verträge über bis zu 517 Milliarden US-Dollar abgeschlossen und damit mindestens 14,8 GW Kapazität hinzugewonnen. Damit dürfte Anthropic OpenAIs 30-GW-Ziel für 2030 dennoch verfehlen.
ChatGPT-Traffic erholt sich. ChatGPT holte sich 55,5 % des Website-Traffics von KI-Chatbots zurück; Gemini fiel auf 25,6 % ab, Claude wuchs auf 9,3 %. Mobile-App-Nutzung ist in diesen Zahlen nicht enthalten.
UBS: KI-Pflicht für Bewerber. Die UBS wird von Bewerbern für die Absolventen- und Praktikantenstellen 2027 in Global Banking and Markets verlangen, darzulegen, wie sie KI einsetzen, um Ergebnisse zu verbessern. Analysten rechnen damit, dass innerhalb von fünf Jahren über 200.000 Stellen bei europäischen Banken wegfallen.
KI vernichtet Ghostwriter-Jobs. ChatGPT hat Nairobis akademische Ghostwriting-Branche ausgelöscht, die einst mindestens 40.000 Menschen beschäftigte. Verbleibende Arbeit besteht darin, KI-Texte zu vermenschlichen, um Plagiatsprüfungen zu umgehen.
KI-Verbot an New Yorker Schulen. New York City verbietet KI-Tools an öffentlichen Schulen bis einschließlich der achten Klasse und untersagt Companion-Chatbots auf allen Klassenstufen. Lehrkräfte dürfen KI weiterhin für die Unterrichtsvorbereitung nutzen, nicht aber für die Benotung.
Brand im KI-Rechenzentrum. Ein Brand im KI-Rechenzentrum Lake Mariner offenbarte intransparente Eigentumsverhältnisse und Sicherheitslücken: Es gab weder einen funktionierenden Alarm noch eine Löschanlage. Zu den Beteiligten gehören TeraWulf, Fluidstack und Google.
KI-Anti-Aging-Medikament. Das für IPF entwickelte Rentosertib von Insilico Medicine ließ die Proteinmuster behandelter Patienten auf sechs Alterungsuhren um bis zu sechs Jahre biologisch jünger erscheinen. Die Studie war klein und nur begrenzt aussagekräftig.
Forschungshighlights
Claude beweist Fermat. Claude hat in elf Tagen mit Lean den ersten vollständig maschinell verifizierten Beweis des großen Satzes von Fermat erstellt. Er umfasst 13 Millionen Zeilen Code und 29.500 Hilfssätze.
Iris-Suchagenten. Iris-mini und Iris-pro sind Suchagenten mit 35B beziehungsweise 397B Parametern. Trainiert wurden sie mit rückwärts konstruierten Multi-Hop-Fragen und Reinforcement Learning gegen Live-Suche, mithilfe von SFT-RL-Climbing.
Multi-Agenten-Koordination. Ein spieltheoretisches Modell von Orchestrator-Worker-Systemen belegt, dass reine Text-Gates in textlich nicht unterscheidbaren Umgebungen keine einheitliche Verbesserung garantieren können. Das Paper stellt Stochastic Reflective Memory Ascent mit fundierter Evaluierung vor.
Übersetzungs-Benchmark. Der Last Translation Benchmark versammelt von Menschen verfasste Beispiele, an denen führende Übersetzungsmodelle scheitern. Manuell erstellte Verifikationsregeln ermöglichen eine direkt nutzbare Fehleranalyse.
Skriptgesteuerte AV. Temporal Context Routing ordnet das Timing des Skripts der gemeinsamen Zeitachse von Video- und Audiogenerierung zu und reduziert so Schnittgrenzenfehler bei skriptgesteuerten Inhalten.
Motion-Omni-Avatar. Motion-Omni ist ein End-to-End-Framework, das Sprache und Ganzkörperbewegungen für gesprochene Dialoge gemeinsam erzeugt. Trainiert wurde es auf 422.856 nach Qualität eingestuften Paaren.
Das war alles für heute - etwa 5 Minuten Lesezeit.