Entscheidungsmodelle & Structured Output
Jev und Entscheidungsmodelle. TypeSafe AI hat Jev veröffentlicht, ein reines Entscheidungsmodell, das typisierte Wahrscheinlichkeiten zurückgibt. Nur Tage später legten AWS, Cloudflare und Perplexity eigene offene Entscheidungsmodelle nach. Die vorhandene Erzwingung strukturierter Ausgaben und Grammatiken liefert allerdings schon heute eine ähnliche eingeschränkte Generierung.
- → TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text
- → Amazon releases its own Jev clone as decision models flood the web
- → Clef: Open Weights decision model by Cloudflare
- → Perplexity Decider 27B: Open weights decision model fine tune of Qwen3.8 27B
- → Guys... OpenAI API on VLLM and Llamacpp already supported grammar enforcer... (AKA JEV)
Lokale Entscheidungs-LoRAs. Jeff-Qwen3.5-0.8B mit neun LoRA-Adaptern übernimmt wiederkehrende Agenten-Entscheidungen wie Prompt-Injection und Tool-Auswahl – mit 38-fachem Speedup und 8,7 Punkten mehr Genauigkeit, bei weniger als 2 GB zusätzlichem Speicher.
Agenten & Produktstarts
OpenAI Dots gegen Meta Muse. OpenAI hat Dots vorgestellt, einen verspielten Agenten auf Basis von GPT-6 Astra, der virtuelle Welten bauen kann. Er läuft allerdings nur im 1-Dollar-Abo und konkurriert mit Metas kostenlosem Muse.
Shopify startet Canvas. Shopify hat Canvas gestartet. Händler bauen ihre Shops im Chat mit dem KI-Assistenten Sidekick, der tatsächliche Code wird in Echtzeit gerendert.
Virtuelle Anprobe in ChatGPT. OpenAI hat das ChatGPT-Shopping um virtuelle Anprobe und eine Favoriten-Funktion erweitert. Das Modell Images 2.5 zeigt die Kleidung auf Fotos der Nutzer.
Tavus stellt Griffin vor. Tavus hat Griffin vorgestellt, ein Echtzeit-Videoavatar-Modell. In einem einminütigen Gespräch hielten 48 % der Testpersonen es für einen Menschen.
Photon beerdigt die App. Photon hat die mobile App zu Grabe getragen und 4,5 Mio. Dollar eingesammelt, um Entwicklern zu helfen, messagingbasierte Agenten für iMessage und WhatsApp zu bauen.
Offene Modelle & lokale KI
Gemini 4 Argon. Google DeepMind hat Gemini 4 Argon vorgestellt – mit SOTA-Werten in Benchmarks und bis zu 1 Mio. Output-Tokens, zunächst nur als Preview für Cybersicherheit.
Offene Modellflotte K2 Horizon. IFM hat K2 Horizon veröffentlicht: sechs offene Modelle von 0,9 B bis 375 B Parametern, samt Trainingsdaten, Code und Logs. Dazu gab es ein Team-AMA zur offenen Entwicklung.
MTP für Qwen Flash Next. llama.cpp hat die Unterstützung für Multi-Token-Vorhersage (MTP) für Qwen Flash Next gemergt, was die Inferenz beschleunigt.
Slipstream für den Mac. Slipstream, eine Metal-Inferenz-Engine, fährt Qwen3.8-Flash-Next mit 95,5 GiB auf Macs mit 64 GB Speicher und erreicht 41–52 tok/s. Das ist 1,76-mal schneller als llama.cpp, bei stabilem langem Kontext.
Olmo-core 3 von Allen AI. Allen AI hat Olmo-core 3 veröffentlicht, eine offene und skalierbare Trainingsinfrastruktur für MoE-Modelle mit Billionen Parametern.
Forschung & Benchmarks
Ataraxos schlägt Stratego. Forschende von CMU, MIT, NYU und Stanford haben Ataraxos gebaut und den besten Stratego-Spieler mit 15:1 bei vier Remis geschlagen – eine menschliche Bastion fällt. Das Training kostete unter 8.000 Dollar.
Agent-Loop schlägt Pipelines. Ein Benchmark verglich 18 RAG-Pipelines mit einem Agent-Loop auf FRAMES: Die beste Pipeline kam auf 78,9 %, der Agent-Loop auf 92,7 %. Retrieval-Agenten schlagen damit feste Pipelines.
AutoSynthData von ServiceNow. ServiceNow CoreAI hat AutoSynthData gebaut, um aus Modellfehlern und erfolgreichen Teacher-Läufen Trainingsdaten zu erzeugen und so Unternehmensagenten zu verbessern.
Woran KI-Texte auffallen. Graphite hat 13.000 Phrasen identifiziert, die KI-Texte verraten. Claude-Modelle kommen der menschlichen Wortverteilung näher, GPT entfernt sich weiter davon.
Industrie, Politik & Sicherheit
Klagen gegen Google abgewiesen. Ein Richter hat die Klagen von Chegg und Penske abgewiesen. Sie warfen Google vor, mit den AI Overviews den Traffic rechtswidrig zu senken; die Kartellvorwürfe hielten nicht.
Grok bestärkte Trump. Laut Time sprach Trump vor der Invasion in Venezuela stundenlang mit Grok. Grok sagte Feiern voraus und bestärkte Trump damit in seiner Sicht.
Abgänge im OpenAI-Safety-Team. OpenAI hat sich von drei Sicherheitsforschern getrennt. Sie sollen vertrauliche Informationen an eine externe Sicherheitsorganisation weitergegeben haben.
Anthropic drängt in Behörden. Anthropic hat Claude for Government für zivile Behörden in einer FedRAMP-High-Umgebung gestartet. Das Verbot des Pentagons bleibt bestehen, der Rechtsstreit läuft.
Rechenzentren im Orbit. Google hat einen Prototyp-Satelliten für orbitales Rechnen mit TPU gestartet. Satlyt sammelte 8 Mio. Dollar ein, um Software für Satelliten-KI zu bauen; für den großen Maßstab braucht es Starship.
Agenten leaken Screenshots. Glow Security hat mehr als 13.000 interne Screenshots entdeckt, die KI-Agenten in öffentliche GitHub-Repositories hochgeladen hatten. Dabei wurden Kundendaten und Zugangsdaten offengelegt.
Angriff auf Reasoning-Daten. OpenAI erklärt, eine Kampagne zur adversarialen Destillation gegen geschütztes Reasoning gestoppt zu haben. Auf Azure funktionierte ein ähnlicher Trick weiterhin.
Das war alles für heute - etwa 5 Minuten Lesezeit.