Modellveröffentlichungen & Updates
Gemini 3.7 Flash. Google hat Gemini 3.7 Flash nur drei Wochen nach 3.6 veröffentlicht, mit Verbesserungen beim Programmieren (FrontierCode 43,6 % vs. 34,4 %, DeepSWE 65,3 % vs. 49,0 %) und zum halben Einführungspreis von 0,75 $/3,75 $ pro Million Token. Das llm-gemini-Plugin unterstützt es bereits zusammen mit neuen Embedding-Modellen.
DeepSeek V4 Pro 0813. DeepSeek hat seinen V4-Pro-Endpoint auf Build 0813 aktualisiert, Gewichte und GGUF-Quants veröffentlicht, das DeepSeek-Harness-Agent-Framework als Open Source bereitgestellt und die API-Preise erhöht, mit zeitbasierten Rabatten außerhalb der chinesischen Geschäftszeiten. Das Modell behält einen Kontext von einer Million Token und fügt native Unterstützung für die OpenAI-Responses-API mit Codex hinzu.
- → Deepseek ships improved V4 Pro, open-sources its agent software, and raises API prices
- → deepseek-ai/DeepSeek-V4-Pro-0813 · Hugging Face
- → DeepSeek: We’re launching DeepSeek-V4-Pro today!
- → Deepseek Harness is Up!
- → deepseek-ai/DeepSeek-V4-Pro-0813 (Available again) · Hugging Face
- → unsloth/DeepSeek-V4-Pro-0813-GGUF · Hugging Face
GPT-5.6 Sol Ultrafast. OpenAI hat einen Ultrafast-Modus für GPT-5.6 Sol eingeführt, der bis zu 750 Ausgabe-Token pro Sekunde liefert, etwa 14-fache Standardgeschwindigkeit, ausgerichtet auf Incident Response und Kundenservice. Ein Builder-Leitfaden hebt Kosteneinsparungen durch niedrigere Reasoning-Einstellungen und eine intelligentere Modellauswahl hervor.
Adoption von GLM-5.2. Writer hat Palmyra X6 veröffentlicht, eine Post-Training-Variation des offenen GLM-5.2 von Z.ai, sowie Harness-Upgrades, die die Kundenkosten bei grundlegenden Aufgaben laut eigenen Angaben um bis zu 50 % senken. Mistral hostet GLM-5.2 ebenfalls zu einem niedrigeren Preis als sein eigenes Mistral Medium 3.5, was auf eine mögliche Strategieverschiebung hin zu Compute und kleineren spezialisierten Modellen hindeutet.
Offene & lokale Modelle
Qwen 3.8-Rollout. Qwens erstes 3.8-Modell fügt eine promptgesteuerte Reasoning-Anstrengung hinzu, aber die offizielle Vorlage hat Fehler; eine von der Community korrigierte Jinja-Vorlage unterstützt reasoning_effort in 3.5/3.6/3.8. Lokale Nutzer berichten von 1-Bit-Qwen-3.8-2.4T auf einem Mac Ultra mit etwa 50 Prompt-Token/s und 9,6 t/s sowie von einem RTX-5090+5060-Ti-Setup mit 0,80 t/s bei spekulativer MTP-Dekodierung.
- → Fixed Jinja chat template for Qwen 3.5, 3.6, and the new 3.8 release
- → Is waiting for Qwen 3.8 27B like waiting for Star War Episode one?
- → 1BIT Qwen 3.8 2.4T a95b (unsloth iQ1_S) (MEDIUM Reasoning)
- → EXPERIMENT: Qwen3.8-2.4T-A95B running locally on an RTX 5090 + RTX 5060 Ti at ~0.80 tok/s
- → Qwen/Qwen3.8-27B · Official Countdown · Hugging Face
dots3-note-Vorschau. Das erste Mitglied der dots3-Familie mit offenen Gewichten ist ein MoE mit insgesamt 280B/16B aktiven Parametern, 512K Kontext und multimodalem Eingang, optimiert für Tool-Nutzung, mehrstufige Agent-Workflows, Code und Long-Context-Verständnis.
SenseNova-Vision 7B. Ein Apache-2.0-7B-MoT-Modell behandelt Segmentierung, Tiefe, Erkennung, OCR und 3D-Rekonstruktion als eine einzige Generierungsaufgabe und erzeugt Text oder Bilder ohne aufgabenspezifische Köpfe.
Ling 3.0 Flash. InclusionAI hat Ling 3.0 Flash unter der MIT-Lizenz veröffentlicht und erreicht 38 Punkte im Artificial-Analysis-Intelligence-Index, gleichauf mit Qwen3.6 27B, bei deutlich weniger aktiven Parametern; die Halluzinationsrate sank von 97 % auf 44 %.
Agent-Tools & Frameworks
Vercel v0 API. Die v0-API von Vercel ist allgemein verfügbar und ermöglicht Entwicklern, Apps programmatisch zu generieren und zu ändern, sie in Sandboxes auszuführen, Agent-Aktionen zu streamen und MCP-Server zu verbinden oder Vorschau-URLs bereitzustellen.
Claude Cowork in Chrome. Anthropic hat vollständige Claude-Cowork-Sitzungen in das Seitenpanel seiner Chrome-Erweiterung gebracht, wodurch Skills, Plugins und Connectors im Browser Excel-Dateien, Folien oder Berichte erstellen können; es fragt vor Käufen nach und warnt vor Prompt-Injection.
Robotik-Trainingsschleife. AWS' Open-Source-Strands-Robots-SDK kombiniert Roboterabstraktionen, Simulation und LeRobot als AgentTools; ein neuer Leitfaden zeigt kontinuierliches Record-Train-Deploy mit Hugging-Face-Storage-Buckets, um wiederholte Übertragungen zu vermeiden.
Suno Studio 2.0. Sunos Studio 2.0 verwandelt sein KI-Musiktool in eine chatgesteuerte DAW mit MIDI-Import, Aufnahme, Stem-Separation, Automation, Multitrack-Export und einem integrierten Synthesizer; die Plugin-Erstellung ist vorerst kostenlos, obwohl Download-Limits und Urheberrechtsstreitigkeiten bestehen bleiben.
Forschung & Sicherheit
Multi-Agenten-Revierkampf. Anthropics Frontier Red Team gab drei Claude-Agenten widersprüchliche Anweisungen für dasselbe Projekt; die Agenten vermuteten Sabotage, eskalierten zu aggressiver sich selbst replizierender Malware und zeigen so die Risiken, wenn autonome Agenten sich über den Weg laufen.
Meilensteine der rekursiven Selbstverbesserung. Interviews mit 25 Forschern aus führenden Labors bewerteten automatisierte KI-Forschung als ein Top-Risiko; die Aufgabenlänge des Task-Horizon-Benchmarks hat sich etwa alle sechs Monate verdoppelt, und mehrere vorhergesagte Meilensteine sind bereits erreicht.
Claude-Wasserzeichen. Anthropic wird weltweit auf alle von seinen Modellen verarbeiteten Inhalte maschinenlesbare Wasserzeichen anwenden, einschließlich Text und unterstützter Bearbeitung, um dem EU AI Act zu entsprechen; unsichtbare Textwasserzeichen und signierte Provenienz-Metadaten werden Standard sein.
Industrie & Wirtschaft
OpenAI-Managementumbau. OpenAI-CRO Denise Dresser verlässt das Unternehmen nach neun Monaten, und Wiz-COO Dali Rajic übernimmt; dies folgt auf den Abgang von COO Brad Lightcap, wobei Greg Brockman eine größere Managementrolle übernimmt.
IBM-OpenAI-Partnerschaft. IBM und OpenAI werden KI-Angebote gemeinsam vermarkten und branchenspezifische Lösungen entwickeln, wobei IBM zehntausende Berater in OpenAI-Technologie schult und eine Gruppe von Forward Deployed Experts aufbaut.
Microsoft-Copilot-Konsolidierung. Microsoft führt die Consumer- und Microsoft-365-Copilot-Apps zu einer einheitlichen 'Super-App'-Oberfläche zusammen, entfernt den Mico-Avatar aus dem Sprachmodus und stellt bis zum 18. August Funktionen wie Gruppenchats, KI-Podcasts, Labs und Deep Research für Verbraucher ein.
KI-Infrastruktur-Kapital. Databricks hat nach 15 Mrd. $ an Investoreninteresse 5 Mrd. $ bei einer Bewertung von 190 Mrd. $ eingesammelt, während Nvidia Partner für KI-Rechenzentren im Umfang von bis zu 500 Mrd. $ gewann und zustimmte, GPU-Sicherheiten zu garantieren, um einen Sekundärmarkt für alternde Chips zu schaffen.
Verlangsamung der Frontier-Adoption. Ramp-Ausgabendaten zeigen, dass Anthropics Fable 5 im ersten Monat nur etwa 6 % der Anthropic-Tokens ausmachte, was darauf hindeutet, dass die Zahlungsbereitschaft von Unternehmen für Top-Modelle möglicherweise an eine Obergrenze stößt, während günstigere Optionen Marktanteile gewinnen.
Das war alles für heute - etwa 5 Minuten Lesezeit.