Premiery modeli
Qwen 3.8 27B. Zespół Qwen z Alibaba wypuścił Qwen3.8-27B oraz większy Qwen3.8-2.4T-A95B na licencji Apache 2.0. Gęsty model 27B dzieli architekturę z Qwen3.6-27B, ale poprawia kodowanie, zadania biurowe i planowanie agentów dzięki zmianom w treningu. Obsługuje 262 tys. tokenów natywnego kontekstu, z możliwością rozszerzenia do 1 mln tokenów.
GLM-5.3 od Zhipu. Firma Zhipu AI wydała GLM-5.3, który korzysta z tego samego modelu bazowego co GLM-5.2, ale rozszerzonego post-treningiem. Firma twierdzi, że jest to najmocniejszy model kodowania z otwartymi wagami, z zauważalnymi postępami w agentowym kodowaniu i wykrywaniu podatności cyberbezpieczeństwa. Wagi mają pojawić się na Hugging Face za dwa tygodnie.
Muse Glimmer od Meta. Meta udostępniła jako open-source Muse Glimmer, agentowy model 30B na licencji Apache 2.0, przeznaczony do lokalnych zastosowań na konsumenckich procesorach graficznych. Destyluje umiejętności rozumowania i wywoływania narzędzi z większego Muse Spark i przez krótki czas był na granicy możliwości w klasie 30B.
Fala otwartych modeli z Chin. W mniej niż miesiąc chińskie laboratoria wypuściły Kimi K3, Qwen3.8, DeepSeek-V4-Pro-0813 i GLM-5.3, podkreślając szybki postęp na granicy możliwości z otwartymi wagami.
Lokalne wdrożenia i społeczność
Przyspieszenie na Apple Silicon. Nowa wersja mlx-dspark wprowadza spekulatywne dekodowanie do Qwen3.8-27B na Apple Silicon, osiągając do około 3× szybsze generowanie na M4 Pro, przy jednoczesnym wytwarzaniu identycznych tokenów wyjściowych.
Kwantyzacja i wagi. Unsloth wydał skwantyzowane wagi Qwen3.8-27B, a Tim Dettmers zapowiedział nową metodę kwantyzacji, która mogłaby uruchomić GLM-5.3 na pojedynczym DGX Spark z prędkością 7 tokenów/s.
Wczesne testy Qwen 3.8. Testy społeczności pokazują mocne jednorzędowe dema kodowania i zachowanie agentowe w Qwen3.8-27B, ale niektórzy użytkownicy zgłaszają zauważalnie przyciętą wiedzę ogólną i bardzo długie ślady myślenia przy bardzo wysokim wysiłku rozumowania. Zalecane parametry próbkowania są dostępne na karcie modelu.
- → Qwen 3.8 - 27B is a game changer
- → A hunch: Qwen3.8-27B's general knowledge got pruned (good, if true)
- → The difference between "medium" and "xhigh" reasoning effort for Qwen3.8-27B is actually insane.
- → Qwen 3.8 27B - Aquarium Burst Sample Test
- → RetroCraft - Qwen 3.8 27B Q8, one shot with exact performance data on dual 3090s.
Niecenzurowany wariant lokalny. Społecznościowa wersja „heretycka” Qwen3.8-27B usuwa odmowy i zabezpieczenia, mając na celu zapewnienie lokalnej niecenzurowanej alternatywy na poziomie modelu granicznego, takiego jak Opus 4.6.
Przejrzystość i bezpieczeństwo AI
Wykrywanie znaków wodnych przez Anthropic. Anthropic zaoferuje API do wykrywania znaków wodnych, aby zewnętrzni programiści mogli wykrywać tekst prawdopodobnie wygenerowany przez Claude. Metoda wykorzystuje SynthID Text i jest mniej niezawodna w przypadku krótkich, nasyconych faktami lub mocno przepisanych tekstów.
Google czyni znak wodny opcjonalnym. Google pozwala użytkownikom wyłączać widoczne znaki wodne na obrazach, filmach i muzyce generowanych przez AI z Nano Banana, Omni i Lyria. Niewidoczne metadane SynthID i C2PA będą nadal osadzane w celu weryfikacji.
Wstrzyknięcie promptu w sądzie. Sędzia z Connecticut udokumentował to, co wydaje się być pierwszym w USA dokumentem sądowym z ukrytym tekstem mającym na celu manipulowanie systemami AI przeglądającymi sprawę. Ukryte instrukcje nie przyniosły skutku, ale sędzia nazwał tę taktykę niebezpieczną.
Agenci w produkcji
Claude Code na dyżurze konserwacyjnym. Anthropic twierdzi, że Claude Code codziennie przeprowadza konserwację swoich własnych aplikacji, tworząc 388 pull requestów ze wskaźnikiem scalania na poziomie 46 procent po przeglądzie ludzkim. Rutyny obejmują fuzzing awarii, czyszczenie zduplikowanych abstrakcji i sprawdzanie zależności.
Computer History od OpenAI. Computer History od OpenAI zastępuje prototyp zrzutów ekranu Chronicle, rejestrując kliknięcia, naciśnięcia klawiszy i przełączanie aplikacji na macOS, aby zbudować przeszukiwalną oś czasu. Może wykrywać powtarzające się przepływy pracy i sugerować wielokrotnego użytku umiejętności dla ChatGPT i Codex.
Przemysł i biznes
Wojna cenowa USA-Chiny. OpenAI i Anthropic obcinają ceny, podczas gdy chińskie otwarte modele zyskują na znaczeniu; Gemini 3.7 Flash od Google debiutuje z 50-procentową obniżką cenową skierowaną do kodowania i agentów. Ceny tokenów w czołowych amerykańskich laboratoriach spadły o prawie jedną czwartą od połowy lipca.
GPT-5.6 Sol Ultrafast. OpenAI uruchomiło podgląd trybu Ultrafast dla GPT-5.6 Sol opartego na Cerebras, dostarczając do 750 tokenów wyjściowych na sekundę. Usługa API jest początkowo ograniczona do wybranych klientów i ma na celu analizę w czasie rzeczywistym podczas incydentów lub wydarzeń rynkowych.
AI dla wszystkich od Meta. Meta powiązała wydanie Glimmer z długim listem Zuckerberga argumentującym, że AI powinno być otwarte dla wszystkich, ale relacje podcastów zauważają, że firma trzyma swój najpotężniejszy Muse Spark za interfejsami API. Te same dyskusje wskazują na nieudane przejęcie za 250 milionów dolarów.
Model Apple-Alibaba dla Chin. Apple podobno wytrenowało niestandardowy model AI na rynek chiński z pomocą Alibaba, przed wprowadzeniem Apple Intelligence na chińskie urządzenia. To partnerstwo jest rzadką współpracą AI między USA a Chinami.
Kog stawia na wnioskowanie. Francuski startup Kog wykorzystuje optymalizację oprogramowania, aby wyciągnąć większą szybkość z konwencjonalnych procesorów graficznych, takich jak AMD MI300X i Nvidia H200, celując w szybsze dekodowanie pojedynczych żądań dla obciążeń inżynierii oprogramowania.
Ryzyko cen gazu ziemnego. Nowa prognoza Noreva ostrzega, że ceny gazu ziemnego mogą potroić się w niektórych częściach USA, ponieważ hiper skalowalni dostawcy, tacy jak Amazon, Google, Meta i Microsoft, rezerwują energię gazową dla centrów danych AI.
Najważniejsze badania
Model ARC 150M. Model rekurencyjnego rozumowania latentnego z 150 mln parametrów osiąga 29,5% na ARC-AGI-1 przy koszcie 0,0007 USD za zadanie, poza opublikowaną granicą kosztów i dokładności. Działa na minimalnym sprzęcie, choć skalowanie do miliardów parametrów jest nadal potrzebne.
Wątpliwości co do autonomicznych badań. Badanie Princeton i brytyjskiego AISI z wykorzystaniem nieopublikowanych prac NeurIPS wykazało, że obecne modele graniczne radzą sobie z inżynierią badawczą, ale zawodzą w częściach badań, które mają znaczenie, przecząc twierdzeniom laboratoriów o autonomicznych badaniach AI.
Ewolucja uprzęży DarwinX. DarwinX ewoluuje uprzęże agentów poprzez naturalną selekcję promptów, narzędzi, umiejętności i przepływu sterowania, utrzymując zamrożone wagi modelu. Dodaje średnio około 17 punktów w czterech benchmarkach i przenosi się bez zmian do SWE-bench Verified.
Benchmark PlayWorld. PlayWorld porównuje modele świata wideo, wykorzystując multimodalnych graczy-agentów, którzy realizują 171 długoterminowych celów, mierząc spójność geometrii, wierność interakcji, ewolucję poza zasięgiem wzroku i ewolucję wglądu.
To wszystko na dziś - około 5 minut czytania.