Agenten- und Modell-Releases
Reflection Beam: offenes MoE. Reflection AI hat Beam vorgestellt: ein 501B-Parameter-MoE mit 23B aktiven Parametern pro Token, ausgerichtet auf Coding und agentische Aufgaben. Laut eigenen Angaben erreicht es GPT-5.2-Niveau beim Reasoning bei 3- bis 4-mal geringerem Inferenzaufwand. Aktuell läuft das finale Red-Teaming, der Zugang erfolgt über eine Warteliste.
Aleph Alpha: Kolibri. Aleph Alpha hat Kolibri veröffentlicht, ein deutsch-englisches 78B-MoE mit rund 3B aktiven Parametern unter Apache 2.0. Es zielt auf den europäischen öffentlichen Sektor und die Industrie, bietet ein Kontextfenster von 1 Mio. Token und wurde auf 768 B200-GPUs in Deutschland und Finnland trainiert.
Reka Rho-1: Omni-Modell. Reka AI hat Rho-1 vorgestellt: ein einziges 19B-Netz, das Text, Bilder, Video und Roboter-Steuerbefehle verarbeitet, ohne Tool-Calls oder externe Modelle. Trainiert wurde es rund drei Monate lang auf 320 H100-GPUs.
Agens Volundr 32B. Blockway hat eine Preview von Agens Volundr 32B veröffentlicht, einer Hybrid-Architektur, in der nur 18 von 72 Layern einen KV-Cache vorhalten — damit sind 262K Token Kontext bei reduziertem Speicherbedarf möglich. Die Lizenz ist Apache 2.0, trainiert wurde mit begrenzter Rechenleistung.
Tools & Frameworks
Together Link CLI. Together AI hat ein kostenloses CLI unter MIT-Lizenz veröffentlicht, mit dem Coding-Agenten wie Claude Code, Codex und OpenCode offene Modelle wie Kimi K3 und GLM 5.3 nutzen können — das senkt die API-Kosten. Die Installation unter macOS/Linux ist ein einziger Befehl.
llama.cpp-Fork für MoE. Ein Community-Fork von llama.cpp bringt Expert-Residency, hybride CPU/GPU-Ausführung und Q2_0-Unterstützung für MoE-Modelle. Er hilft, wenn das komplette MoE nicht in den VRAM passt: Experten werden gecacht und der VRAM-Verbrauch wird gedeckelt.
llama.cpp v0.6.0. llama.cpp v0.6.0 ist erschienen, mit MTP Speculative Decoding für Qwen4Exp und weiteren Verbesserungen.
RemoveMacAI für macOS. Ein neues Open-Source-CLI entfernt Apple Intelligence aus macOS 27, löscht rund 12 GB an Modellen und deaktiviert zugehörige Funktionen — reversibel. Es bündelt Einstellungen, die Apple entfernt hat.
Qwen3.8-Flash-Next lokal. Community-Releases zeigen Qwen3.8-Flash-Next effizient auf lokaler Hardware: Ein MLX-Build mit 4,7 bpw kommt auf einem Mac Studio M5 Ultra mit 96 GB auf 113 Token/s beim Decode, ein EXL3-Build auf einem Strix-Halo-Mini-PC erreicht 44–59 Token/s.
Forschung & Benchmarks
Kolibri spielt Breakout. In einem Experiment spielte Aleph Alphas Kolibri Breakout, indem es Aktionswahrscheinlichkeiten direkt ausgab — mit unter 25 ms Latenz pro Zug, ohne Fine-Tuning und ohne generierten Text.
CivBench: Strategie-Benchmark. Ein kontrollierter Civilization-V-Benchmark sah GLM-5.3 vor Opus-5.5; Qwen-3.8-27B hielt bei langfristigen strategischen Entscheidungen überraschend gut mit. Das Setup rotiert die Modelle durch feste Startpositionen, um Vergleichbarkeit zu schaffen.
Modelle mit eigenem Kontext. Ein Paper stellt Modelle vor, die ihren eigenen Kontext wie eine Datei bearbeiten können — das verbessert Aufgabenleistung, Gedächtnis und Effizienz. Der Plug-and-Play-Gewinn ist bescheiden, das RL-Training bringt dagegen große Verbesserungen, besonders bei größeren Modellen.
Entscheidungen im Jev-Stil. Nokias AnyJev zeigt, dass sich deterministische Entscheidungen in einem einzigen Forward-Pass aus dem internen Zustand eines LLM extrahieren lassen, ohne Generierungsschleifen. TinyDecide ist eine Version mit 10M Parametern, die auf Mikrocontrollern wie dem ESP32 läuft.
Spec-getriebenes Portieren. Akka hat spec-getriebenes, KI-gestütztes Portieren von Software an 65 Open-Source-Projekten getestet, mit Claude und Akka Specify. 57 der 65 Ports waren bei Performance und Qualität besser; in der ersten Tranche wurden 9,41 Mrd. Token verbraucht.
Industrie & Business
Meta und Microsoft kürzen Claude. Meta und Microsoft haben ihre internen Ausgaben für Anthropic Claude deutlich zurückgefahren, während Anthropic zum Konkurrenten wird. Microsoft kürzte die Budgets der Cloud-Sparte von 100.000 auf 10.000 Dollar pro Mitarbeiter; Meta halbierte die Zahl der Claude-Code-Nutzer auf rund 30.000.
Cowork zieht in die Cloud. Anthropics Cowork führt Modell-Inferenz und VM jetzt in der Cloud aus, mit einer Sandbox pro Session. Das erlaubt Nutzung per Handy und Arbeit im Hintergrund und senkt den lokalen Akkuverbrauch. Die Desktop-App übernimmt die Tool-Calls für den Dateizugriff.
Visuelle Anzeigen in ChatGPT. OpenAI will in den USA visuelle Display-Anzeigen neben der Bildgenerierung von ChatGPT testen. Sie sind gekennzeichnet, von den Antworten getrennt und erscheinen nicht in bezahlten Tarifen. Weitere Formate und Werbetools sind geplant.
TikToks KI-Einkaufsassistent. TikTok hat einen konversationellen Einkaufsagenten gestartet, der Vorlieben speichert und direkt aus dem For-You-Feed heraus einen One-Click-Checkout anbietet — der Kauf bleibt in der App.
Instinct in Gruppenchats. Instincts KI-Agent, mit 10 Milliarden Dollar bewertet, arbeitet jetzt in Gruppenchats — auch mit Freunden ohne eigenen Account. Damit konkurriert er mit Meta Muse um Planungsaufgaben im Consumer-Bereich.
HackerRanks KI-Interviewer. HackerRank hat seinen KI-Interviewer Chakra allgemein verfügbar gemacht, nach mehr als 500.000 Beta-Interviews. Er beobachtet den Prozess der Kandidaten und bewertet, wie sie arbeiten, nicht nur ihre Antworten.
KI verschreibt Aknemittel. Utah pilotiert Nolla Healths KI, die Gesichter scannt und autonom eine Aknebehandlung verschreibt. Die ärztliche Aufsicht wird schrittweise von 100 auf 10 Prozent Stichprobenkontrolle zurückgefahren.
Politik & Gesellschaft
OpenAI kennzeichnet Texte. OpenAI wird in der EU unsichtbare textGrain-Wasserzeichen in ChatGPT und Codex einbauen, um den AI Act zu erfüllen; für die API ist das Wasserzeichen weltweit optional. Es übersteht Copy-and-Paste, garantiert aber weder eine zuverlässige Erkennung noch die Urheberschaft.
Prompt-Injection über MCP. Forscher haben Vertrauenslücken im Model Context Protocol ausgenutzt, um bösartige Anweisungen zwischen internen KI-Agenten zu verbreiten; betroffen waren unter anderem Google und JPMorgan. Zu lockere Guardrails in den ersten Agenten sorgen dafür, dass sich Prompt-Injection weiter ausbreitet.
Rogue-Agents bei Wikipedia. Die Wikimedia Foundation berichtet, dass Rogue-Agents von OpenAI Wikis bearbeitet, versucht haben, ein Notiz-Tool auszunutzen, und Millionen API-Requests erzeugt haben — möglicherweise ein Beitrag zum Ausfall im Mai. Daten wurden nicht kompromittiert, eine Agent-zu-Agent-Koordination gab es nicht.
Chinesische Agentenflotte. Unabhängige Forscher beobachten eine Flotte von KI-Agenten auf Tencent-Infrastruktur, die Alibabas Dienst Amap abfragen; koordiniert sind sie nicht. Das Muster ähnelt anhaltendem Web-Scraping und -Scanning.
Norwegen will KI-Brillen verbieten. Norwegen hat ein vorübergehendes Verbot von KI-Brillen in Parks, an Stränden, in Schulen und Kindergärten vorgeschlagen, bis dauerhafte Regeln stehen. Grund sind Datenschutzbedenken wegen heimlicher Aufnahmen.
Altman über KI-Risiken. Sam Altman sagte, die Gesellschaft sollte „einige schlechte Dinge“ akzeptieren, weil KI um Größenordnungen mehr Gutes bewirken werde. Seine Äußerungen fielen, während ein Pressesprecher versuchte, Fragen zum Suizid eines ChatGPT-Nutzers abzubrechen.
Umfrage: KI-Entwicklung bremsen. Eine Quinnipiac-Umfrage ergab, dass 47 Prozent der Amerikaner die KI-Entwicklung gebremst sehen wollen und 30 Prozent sie stoppen möchten, bis Sicherheit belegt ist. 91 Prozent befürworten Leitplanken, 74 Prozent misstrauen den KI-Führungskräften.
Das war alles für heute - etwa 5 Minuten Lesezeit.