Wydania agentów i modeli
Tencent Hy4 preview. Tencent wydał Hy4 preview – to duże zwiększenie rozmiaru w stosunku do Hy3, z domyślnie wysokim poziomem rozumowania i trybem no_think. W społeczności jest już oficjalny kwant ~2,38-bitowy i GGUF o wielkości ~200 GB, który według doniesień zachowuje ok. 98% wydajności BF16.
Lokalna inferencja i sprzęt
FlashMLA na sm_120. Społecznościowy build rozszerza FlashMLA na konsumenckie GPU Blackwell sm_120, dając 2–3x przyspieszenie względem PyTorch SDPA w kilku rzadkich obciążeniach MLA i o 8% niższe opóźnienie dekodowania przy FP8 KV cache.
Nemotron: poprawka na 16 GB. Niskobitowe pliki GGUF Nemotron-3.5-Lightning miały w praktyce ~4,70 bpw z powodu kwantyzacji per wiersz; zpatchowany build llama.cpp generuje plik o rzeczywistych parametrach 3,07 bpw / 11,77 GiB, który na 16 GB obsługuje kontekst 262K.
Qwen3.8-Flash-Next na Macu. Dwubitowy Qwen3.8-Flash-Next o rozmiarze 79 GB uruchomiono na M5 Max z 128 GB pamięci i slotem kontekstu 350K przy użyciu llama.cpp. Obejmowało to zimny prefill trwający 333 s dla promptu 105K oraz spekulatywne dekodowanie ngram-mod.
DeepSeek V4 Flash na dwóch GPU. Na konfiguracjach 2x DGX Spark/GX10 DeepSeek V4 Flash 0731 osiąga stabilne 67–84 tok/s, z lokalnym wynikiem HumanEval Pass@1 na poziomie 94,5% wobec 97,0% dla GLM-5.3-Flash NVFP4. GLM ukończył benchmark mniej więcej w połowie tego czasu.
Kontekst 1M na dwóch 5090. Fork NInfer dodaje tensor parallelism i skalowanie YaRN ×4, aby uruchomić Qwen3.8-27B NVFP4 z kontekstem 1 048 576 tokenów na dwóch kartach 5090, dekodując z prędkością 48–100 tok/s przy 1M i utrzymując akceptację MTP tam, gdzie vLLM spada do zera.
27B na 16 GB. Hybrydowa kwantyzacja oraz ustawienia kvarn cache pozwalają uruchomić Qwen3.8-27B z kontekstem 100K i prędkością 50 tok/s na karcie RTX 4070 Ti SUPER z 16 GB, przy użyciu spekulacyjnego dekodowania MTP i tail-precision KV cache.
FreeToken: silnik MoE. Naukowcy z UC Berkeley i MIT wprowadzili FreeToken, otwarty silnik, który dynamicznie koordynuje transfery ekspertów MoE, dzięki czemu najnowsze modele sparse mogą dekodować na konsumenckich GPU bez blokowania się na missach PCIe/RAM.
Benchmarki i ewaluacje
Terminal Bench 4.0. Terminal Bench 4.0 doczekał się wydania z odświeżonym leaderboardem i naciskiem na szybkie iteracje, by walczyć z nasyceniem; GLM-5.3 osiąga poziom Fable 5 w granicach błędu statystycznego.
Finansowy benchmark: ujawnienie. Karta benchmarku dla Ling-3.0-flash-Fin pokazuje, jak duży wpływ na raportowane wyniki mają scaffolding agenta, narzędzia i pipeline’y ewaluacyjne; wiele przebiegów używało ReAct z wyszukiwaniem w sieci i Pythonem, a część zbiorów ewaluacyjnych jest wewnętrzna lub nie została jeszcze upubliczniona.
Badania i infrastruktura agentów
Google WikiSkill: pamięć. WikiSkill od Google Research zapewnia agentom trwałą bazę wiedzy w stylu wiki, zawierającą wcześniejsze porażki i sukcesy, oraz pakuje wielokrotnie używalne Agent Skills, które kierują zachowaniem bez zmiany wag modelu.
Anthropic Model Hardware Standard. Anthropic buduje MHS, ujednolicony interfejs umożliwiający agentom sterowanie fizycznymi urządzeniami, takimi jak mikroskopy i ramiona robotyczne; wczesne testy skróciły integrację wielu maszyn z tygodni do godzin, ale nadzór człowieka pozostaje konieczny.
Warstwa danych dla agentów. Prezentacja TOTVS argumentuje, że systemy transakcyjne i data lakes nie są zoptymalizowane pod kątem żarłocznego na tokeny i wrażliwego na opóźnienia rozumowania agentów. Opisuje też ewolucję dostępu do danych w kierunku MCP i modeli semantycznych.
LAION Big Video Dataset. LAION opublikował BVD, zbiór danych wyłącznie do celów badawczych zawierający 10 milionów godzin wideo, 55 milionów klipów i 300 milionów klatek, spinający wideo, audio i tekst; modele wytrenowane na nim przewyższały baseline’y InternVid o nawet 2,1 punktu w niektórych benchmarkach.
Branża i biznes
Sony i Warner pozywają Anthropic. Sony Music Publishing, Warner Chappell i inni wydawcy pozwali Anthropica, zarzucając mu pobieranie z torrentów i scrapowanie utworów chronionych prawem autorskim do trenowania Claude’a oraz domagając się odszkodowania w wysokości do 150 tys. dolarów za utwór. Anthropic zapowiada, że będzie się bronić.
OpenAI odcina Cursora. OpenAI kończy kontrakt z Cursorem po przejęciu Cursora przez SpaceX, powołując się na historię łamania umów przez firmy Elona Muska. Anthropic odpowiedziało, pozycjonując się jako bardziej niezawodny partner i zobowiązując się do zapewnienia dalszej mocy obliczeniowej na potrzeby korzystania z Claude’a w Cursorze.
Nvidia wykracza poza GPU. Narracja wokół wyników Nvidii przesuwa się z udziału w rynku GPU w stronę orkiestracji centrów danych i systemów wokół GPU, gdzie firma zbudowała najnowocześniejszy sprzęt sieciowy i orkiestracyjny, w miarę jak obliczenia AI skalują się do gigawatów.
To wszystko na dziś - około 5 minut czytania.