Agentic AI News Heute

Die Nachrichten über KI-Agenten des Tages in einer 5-minütigen Lektüre: Veröffentlichungen, Tools, Forschung, Finanzierung und Unternehmensentwicklungen.

Täglich aktualisiert zusammengestellt aus 30 Quellen Sonntag, August 30, 2026

Agent- & Modell-Releases

Tencent Hy4 Preview. Tencent hat Hy4 Preview veröffentlicht, eine deutliche Größensteigerung gegenüber Hy3 mit standardmäßig hohem Reasoning und einem no_think-Modus. Die Community hat bereits ein offizielles Quant mit ~2,38 Bit und ein GGUF mit ~200 GB, das laut Berichten etwa 98 % der BF16-Leistung behält.

Lokale Inferenz & Hardware

FlashMLA sm_120 Port. Ein Community-Build erweitert FlashMLA auf Consumer-Blackwell-sm_120-GPUs und zeigt in mehreren Sparse-MLA-Workloads 2-3-fache Beschleunigung gegenüber PyTorch SDPA sowie 8 % geringere Latenz beim FP8-KV-Cache-Dekodieren.

Nemotron-16-GB-Fix. Die als Low-Bit beworbenen GGUFs von Nemotron-3.5-Lightning entpuppten sich wegen der Row-Width-Quantisierung als ~4,70 bpw; ein gepatchter llama.cpp-Build erzeugt eine echte 3,07-bpw-/11,77-GiB-Datei, die 262K Kontext auf 16 GB ausführt.

Qwen3.8-Flash-Next auf dem Mac. Ein 79-GB-2-Bit-Qwen3.8-Flash-Next lief unter llama.cpp auf einem 128-GB-M5-Max mit 350K-Kontextslot, darunter ein 333-Sekunden-Cold-Prefill eines 105K-Prompts und ngram-mod-spekulative Dekodierung.

DeepSeek V4 Flash auf Dual-GPU. Auf 2x-DGX-Spark/GX10-Setups erreicht DeepSeek V4 Flash 0731 dauerhaft 67–84 Token/s, mit lokalem HumanEval Pass@1 von 94,5 % gegenüber 97,0 % für GLM-5.3-Flash NVFP4. GLM schloss den Benchmark in etwa der halben Zeit ab.

1M Kontext auf zwei 5090ern. Ein NInfer-Fork fügt Tensor-Parallelismus und YaRN-×4-Skalierung hinzu, um Qwen3.8-27B NVFP4 mit 1.048.576-Token-Kontext auf zwei 5090ern auszuführen, mit 48–100 Token/s bei 1M und aufrechterhaltener MTP-Akzeptanz, während vLLM auf null fällt.

27B auf 16 GB. Hybride Quantisierung zusammen mit kvarn-Cache-Einstellungen lässt Qwen3.8-27B mit 100K Kontext bei 50 Token/s auf einer 16-GB-RTX-4070-Ti-SUPER laufen, unter Verwendung von MTP-spekulativer Dekodierung und KV-Cache mit Tail-Precision.

FreeToken-MoE-Engine. Forschende der UC Berkeley und des MIT haben FreeToken vorgestellt, eine Open-Source-Engine, die MoE-Expertentransfers dynamisch koordiniert, sodass Frontier-Sparse-Modelle auf Consumer-GPUs dekodieren können, ohne bei PCIe/RAM-Misses ins Stocken zu geraten.

Benchmarks & Evaluationen

Terminal Bench 4.0. Terminal Bench 4.0 wurde mit einem aktualisierten Leaderboard und Fokus auf schnelle Iterationen veröffentlicht, um der Sättigung entgegenzuwirken; GLM-5.3 erreicht innerhalb der Fehlertoleranz das Niveau von Fable 5.

Offenlegung des Finanz-Benchmarks. Eine Benchmark-Karte für Ling-3.0-flash-Fin zeigt, wie stark Agent-Scaffolding, Tools und Evaluations-Pipelines die gemeldeten Ergebnisse verändern; viele Läufe verwendeten ReAct mit Websuche und Python, und einige Eval-Sets sind intern oder noch nicht öffentlich.

Forschung & Agent-Infrastruktur

Google WikiSkill Memory. WikiSkill von Google Research gibt Agenten eine persistente, wiki-artige Wissensbasis über vergangene Fehler und Erfolge und bündelt wiederverwendbare Agent Skills, die das Verhalten steuern, ohne die Modellgewichte zu verändern.

Anthropic Model Hardware Standard. Anthropic entwickelt MHS, eine einheitliche Schnittstelle, mit der Agenten physische Geräte wie Mikroskope und Roboterarme steuern können; frühe Tests verkürzten die Multi-Machine-Integration von Wochen auf Stunden, aber menschliche Aufsicht bleibt notwendig.

Datenschicht für Agenten. Eine Präsentation von TOTVS argumentiert, dass transaktionale Systeme und Data Lakes nicht für token-hungriges, latenzsensitives Agenten-Reasoning optimiert sind, und beschreibt eine Weiterentwicklung des Datenzugriffs in Richtung MCP und semantischer Modelle.

LAION Big Video Dataset. LAION hat BVD veröffentlicht, ein reines Forschungsdataset mit 10 Millionen Stunden Video, 55 Millionen Clips und 300 Millionen Standbildern, das Video, Audio und Text verbindet; darauf trainierte Modelle übertrafen InternVid-Baselines bei einigen Benchmarks um bis zu 2,1 Punkte.

Branche & Business

Sony und Warner verklagen Anthropic. Sony Music Publishing, Warner Chappell und weitere Verlage haben Anthropic verklagt. Sie werfen dem Unternehmen vor, urheberrechtlich geschützte Werke per Torrent und Scraping für das Training von Claude verwendet zu haben, und fordern Schadensersatz von bis zu 150.000 US-Dollar pro Werk. Anthropic kündigte an, sich zu verteidigen.

OpenAI trennt sich von Cursor. OpenAI beendet nach der Übernahme durch SpaceX seinen Vertrag mit Cursor und verweist auf die Historie von Elon Musks Unternehmen, Verträge zu brechen. Anthropic positionierte sich als der zuverlässigere Partner und sagte Cursor weiterhin Rechenleistung für die Claude-Nutzung zu.

Nvidia über GPUs hinaus. Bei Nvidia verschiebt sich die Geschichte um die Geschäftsergebnisse vom GPU-Anteil hin zu Rechenzentrums-Orchestrierung und Systemen rund um die GPU. Dort hat das Unternehmen hochmoderne Netzwerk- und Orchestrierungshardware aufgebaut, während die KI-Rechenleistung auf Gigawatt skaliert.

Das war alles für heute - etwa 5 Minuten Lesezeit.

Lesen Sie es jeden Morgen direkt in Ihrem Browser

Die Erweiterung öffnet diese Zusammenfassung im Seitenfenster von Chrome – ein Klick, kein Konto.

Zu Chrome hinzufügen – Kostenlos