Agenten- & Modellveröffentlichungen
Qwen 3.8 27B punktet. Qwen 3.8 27B erreicht 52 im Artificial Analysis Intelligence Index, liegt damit gleichauf mit GPT-5.6 Luna Max und einen Punkt hinter den erheblich größeren GLM-5.2 und DeepSeek V4 Pro. Es wird standardmäßig mit xhigh Reasoning ausgeliefert, vermutlich um die Benchmark-Sichtbarkeit zu maximieren.
Qwen agentisches Programmieren. Bei 16 GB VRAM bewältigt quantisiertes Qwen 3.8 27B mit MTP-spekulativer Dekodierung 73k Kontext bei 30-50 tps. Lokale Benchmarks zeigen, dass der mittlere Reasoning-Modus mit weniger Tokens fast DeepSeek V4 Flash erreicht, während xhigh das agentische Programmieren nicht deutlich verbessert.
- → Optimizing Qwen3.6 / Qwen3.8-27B on 16GB VRAM: Complete Benchmark Results and Setup Guide (~30-50tps at 32k to 72k context)
- → After pushing 1M+ tokens through Qwen 3.8 27B, here is my optimal llama.cpp config for 16GB VRAM (73k Context, Agentic Coding)
- → Local agentic coding Benchmark : Qwen 3.8 27B (in many weights quants / cache quants / engine / reasoning effort) vs others.
35B-A3B weiterhin unklar. Ein Qwen-Entwickler rät, nicht auf 35B-A3B zu warten, obwohl die Nachfrage der Community nach 35B-A3B und 122B hoch bleibt, ohne offizielles Veröffentlichungssignal.
Ling 3.0 Tiny Tempo. Ling 3.0 Tiny 8B mit 1.3B aktiven Parametern erreicht 36 Tokens/Sekunde auf 4 GB VRAM und schneidet ähnlich ab wie Qwen 3.5 9B und Gemma 12.
GLM-5.3 Post-Training. Z.ai hat GLM-5.3 veröffentlicht, dessen Verbesserung ausschließlich aus mehr Post-Training stammt, was bessere Leistung beim komplexen Codieren und bei langfristigen Aufgaben liefert.
Grok Bot Agenten. SpaceXAI hat Grok Bot eingeführt, dauerhafte KI-Agenten auf dedizierten Cloud-Computern, die mehrstufige Arbeitsabläufe bewältigen, Präferenzen speichern und in Gruppen koordinieren.
Werkzeuge & Frameworks
llama.cpp v0.1.0. llama.cpp hat seine erste semantische Version v0.1.0 veröffentlicht, und ein PR fügt adaptives MTP hinzu, das die MTP-Tiefe dynamisch wählt, wodurch die Code-Erzeugung um 10-15 % verbessert und der Recall um bis zu 100 % schneller wird.
Agenten-Zahlungs-Middleware. Die AgentCore Payments Middleware für LangChain-Agenten fügt deterministische Budgets auf Sitzungsebene und Wallet-Unterstützung hinzu, wobei LangSmith aufzeichnet, was Agenten gekauft haben und warum.
Agentische Fitnessfunktionen. Ein neuer Artikel argumentiert, dass agentische Fitnessfunktionen die evolutionäre Architektur erweitern können, indem sie urteilsintensive Risiken übernehmen, während deterministische Tore für messbare Invarianten erhalten bleiben.
Beschränkungsbewusstes GPU-Scheduling. Hugging Face hat einen beschränkungsbewussten GPU-Allokator entwickelt, der die Auslastung um bis zu 33 Prozentpunkte und die priorisierte Ausgabe um bis zu 105 % auf identischer Hardware verbessert hat.
Industrie & Wirtschaft
Stripe-OpenRouter-Deal. Stripe wird Berichten zufolge das KI-Modell-Routing-Startup OpenRouter für mehr als 7 Milliarden US-Dollar übernehmen, nach dessen Series B über 1,3 Milliarden US-Dollar; OpenRouter hat 8 Millionen Nutzer und 250 Billionen Tokens pro Monat.
Anthropic Umsatzsprung. Die annualisierte Umsatzrate von Anthropic hat im Juli 65 Milliarden US-Dollar überschritten, nachdem sie im Mai noch bei 47 Milliarden und Ende 2025 bei 9 Milliarden lag; der Börsengang wird für diesen Herbst bei einer Bewertung von über 2 Billionen US-Dollar erwartet.
Relay stellt Betrieb ein. Das KI-Workflow-Automatisierungs-Startup Relay stellt seinen Betrieb ein; sein Gründer und einige Mitarbeiter wechseln zum Chrome-Team von Google, um an KI in Chrome zu arbeiten.
Wispr sammelt 280 Millionen US-Dollar ein. Wispr hat eine Series B über 280 Millionen US-Dollar bei einer Bewertung von 2 Milliarden US-Dollar eingeworben, um sich von KI-Diktat auf Notizen und Meetings auszudehnen und das Modell Canto einzuführen.
KI-Video-Markt erholt sich. KI-generierte Videos ziehen Hollywood-Studios und Milliarden an, nachdem Sora einen Fehlstart hatte; Startups wie Promise verwenden Seedance 2.5 für Echtzeit-Hintergründe.
KI-Agenten von Grab. Grab hat die mechanische Analysearbeit mit einem fünfstufigen Modell der Agentenautonomie von 44 % auf 30 % reduziert, wobei Analysten die endgültigen Entscheidungen behalten.
Infrastruktur & Compute
OpenAI Ohio-Rechenzentrum. OpenAI hat einen 20-Jahres-Mietvertrag für 8 GW IT-Kapazität am PORTS-Pike in Ohio mit SB Energy unterzeichnet; Nvidia unterstützt mit bis zu 105 Milliarden US-Dollar und ist alleiniger Chipleferant.
Groq Neocloud-Pivot. Groq hat 350 Millionen US-Dollar bei einer Bewertung von 3,5 Milliarden US-Dollar eingesammelt, während es sich nach einem Lizenzvertrag mit Nvidia von KI-Chips zum Betrieb von Nvidia-basierter Neocloud-Infrastruktur verlagert.
RTX Pro 6000 Preissprung. CDW hat den UVP der RTX Pro 6000 von 16.000 auf 19.999 US-Dollar erhöht, und auch die Preise auf dem Gebrauchtmarkt steigen, was lokale KI-Entwickler unter Druck setzt.
Trainingsdaten & Politik
Amazon Scan seltener Bücher. Ein AirTag verfolgte eine Sammelbestellung seltener Bücher zu einer Amazon-KI-Trainingseinrichtung, in der Arbeiter Bücher zerstören, um sie zu scannen; Amazon sagt, es kaufe Bücher über kommerzielle Kanäle.
Anthropic Claude-Wasserzeichen. Anthropic wird SynthID-Text-Wasserzeichen in Claude-Ausgaben einbetten, um dem EU-KI-Gesetz zu entsprechen; Kritiker sorgen sich um die Wortwahlqualität und Transparenzprobleme.
Das war alles für heute - etwa 5 Minuten Lesezeit.