Agenten- und Modell-Releases
Muse-Gadgets. Meta hat Firmware und ein SDK als Open Source veröffentlicht, mit dem sich DIY-Hardware bauen lässt, die eine Verbindung zum Muse-Agenten herstellt – etwa E-Ink-Displays und HDMI-Sticks. Support gibt es über Discord.
OpenAI Dot. Der neue Agent Dot von OpenAI verhält sich wie Unternehmenssoftware, die auch das Abendessen bestellen kann. Er läuft in einer virtuellen Maschine mit Zugriff auf Apps wie Blender und GIMP und wird eher als Kollege denn als persönlicher Einkaufsassistent positioniert.
Unitree-Humanoid. Unitree hat UnifoLM-WLA-1.0 veröffentlicht, ein 6B-Modell, das mit rund 2.500 Stunden echten Roboterdaten trainiert wurde und auf dem G1 64 Ganzkörper- und Tischaufgaben bewältigt. Es kombiniert Optical Flow und MMDiT für kontinuierliche Steuerung.
FrogNano für Coding. Microsofts FrogNano-4B-2609 ist ein agentisches Modell, das von Qwen3.5-4B abstammt und mit 1.500 synthetischen SWE-Aufgaben und ausführbaren Rewards post-trainiert wurde, um Software Engineering auf Repository-Ebene in kompakter Form zu verbessern.
Cloudflare Clef. Cloudflare hat die Entscheidungsmodelle Clef und Clef-flash veröffentlicht. Sie geben Wahrscheinlichkeiten über vordefinierte Antworten aus und erreichen eine Median-Latenz von nur 39 ms, sodass Agenten ohne Human-in-the-Loop handeln können.
Tools & Frameworks
MegaCapybara-Engine. Eine eigens entwickelte Inferenz-Engine für RTX 5090 und Qwen3.8 27B beansprucht etwa die doppelte Decode-Geschwindigkeit von NInfer. Sie erreicht 500+ Token/s im Einzelbetrieb und 2.000+ Token/s über 12 Agenten hinweg, mit dynamischen Kernels und Cache-Management.
llama.cpp-Updates. llama.cpp hat Unterstützung für Decision Models hinzugefügt sowie einen CUDA-Pull-Request, der Shared Experts fusioniert, um MoE-Architekturen wie Qwen 35B A3B zu beschleunigen.
mlsubgen-Untertitel. Ein neues lokales Tool erzeugt Untertitel in 45 Sprachen komplett auf dem eigenen Rechner. Es erkennt die Sprache pro Abschnitt, gleicht zwei Spracherkennungssysteme mit einem lokalen LLM ab und bevorzugt vorhandene eingebettete Untertitel.
Forschung & Modellfortschritte
Spotlight-Speicherarchitektur. Perceptas Spotlight ersetzt Attention durch unbeschränkten beschreibbaren Speicher, den das Modell selbst indexiert. Dadurch werden Intelligenz und Wissen getrennt, sodass Fähigkeiten wachsen können, ohne die Gewichte zu ändern.
GPT-6-Updates. OpenAI hat einen Leitfaden zur GPT-6-Familie veröffentlicht und DevDay-Neuerungen angekündigt, darunter GPT-6.1 Sol, Computer Use für die Agents API, Cloud-Codex-Umgebungen und eine Decisions API.
AstaBrief als Open Source. Hugging Face hat AstaBrief als Open Source veröffentlicht. Das kleine Modell wurde speziell für die schnelle, mit Quellen belegte Erstellung wissenschaftlicher Berichte trainiert und ist darauf ausgelegt, evidenzbasiert zu bleiben und Ausgaben zu überprüfen.
Industrie & Wirtschaft
Apple verschärft Festplattenzugriff. Apple fügt dem Vollständigen Festplattenzugriff in macOS wegen der Risiken von KI-Agenten Kontrollen hinzu, nachdem Meta Muse angeblich ohne Erlaubnis Nachrichten gelesen hat. Meta sagt, der Zugriff erfolge per Opt-in, und Apple will eine sehr ausdrückliche Nutzeraktion.
Gegenwind für Rechenzentren. Amazon hat den Gemeinden rund um seine Rechenzentren 1 Mrd. US-Dollar zugesagt, und AWS-CEO Matt Garman fordert ein Ende von Moratorien und spricht von ausländischer Desinformation. Microsoft weitet unterdessen Biomimikry in Rechenzentren aus, obwohl es vor Ort Widerstand gibt.
KI wird Super Intelligence. Das Weiße Haus hat führende Tech-CEOs dazu gebracht, eine Selbstverpflichtung zur KI-Sicherheit zu unterzeichnen, und Trump hat eine Executive Order unterschrieben, die KI als „Super Intelligence“ neu positioniert. Zugleich kaufen nur 2 % der Verbraucher KI-Produkte.
OpenAI-Sicherheitsumbruch. OpenAI hat drei Forscher entlassen, ein vierter hat das Unternehmen verlassen, nachdem eine Untersuchung ergab, dass sie vertrauliche Informationen an eine externe KI-Sicherheitsorganisation weitergegeben hatten.
Uber Eats beschleunigt Suche. Uber hat seine Suchpipeline neu aufgebaut und die End-to-End-Latenz um 50 % gesenkt. Dabei kam agentisches Coding zum Einsatz, um Optimierungen zu identifizieren und zu validieren.
Airbnbs Inside-out-KI. Airbnb-CTO Ahmad Al-Dahle verfolgt eine Inside-out-KI-Strategie: generative KI intern einsetzen, um die Produktentwicklung zu beschleunigen, und dann das Kundenerlebnis transformieren.
Lokale KI & Hardware
Strata + Qwen3.8 Next. Nutzer berichten, dass Strata mit Qwen3.8 Next auf langsamem DDR4 + 7900 XTX 45–70 Token/s erreicht und auf einer leistungsbegrenzten RTX 5090 mit 96 GB DDR5 150–200 Token/s – deutlich mehr als llama.cpp.
iPhone als zweite GPU. Ein iPhone 17 Pro Max kann den Prefill von Qwen 3.8 27B auf einem MacBook mit 24 GB um 29–44 % beschleunigen, wenn es per USB-C verbunden ist und die oberen Layer auf der iPhone-GPU laufen.
Ascend-Karten mit 96 GB. Zwei Huawei-Atlas-300I-Duo-Karten mit je 96 GB können Qwen3.8 Flash-Next nach Tuning des Software-Stacks mit rund 30 Token/s ausführen – obwohl sie kein direkter CUDA-Ersatz sind.
DGX Spark und 5090-Kosten. Nvidia hat einen DGX Spark mit 64 GB vorgestellt, während der Preis des ursprünglichen 128-GB-Modells auf 6.950 US-Dollar gestiegen ist. Wer bei Micro Center eine RTX 5090 kauft, muss Berichten zufolge inzwischen No-Export-Unterlagen ausfüllen.
Das war alles für heute - etwa 5 Minuten Lesezeit.