Modele i interfejsy
Claude Haiku 5.5. Nowy szybki i tani model Anthropic ma kontekst 1 mln tokenów, a cena promptów spada do 0,10 dol. za milion do 100 tys. tokenów — podobnie jak w GPT-6 Luna. Tokenizer liczy jednak o około 25–30 % więcej tokenów, a powyżej 100 tys. cena rośnie pięciokrotnie. Benchmarki pokazują duży skok względem Haiku 4.5 i konkurencyjne wyniki w agentowym kodowaniu.
Mistral Large 4 „Le Chonk”. Mistral wypuścił w wersji preview model o otwartych wagach i 1 bln parametrów, zoptymalizowany pod kodowanie, cyberobronę i wybrane branże. Firma przekonuje, że możliwościami zbliża się do czołowych modeli amerykańskich i chińskich.
Modele decyzyjne Liquid AI. Liquid AI udostępniło na zasadach open source d1-3B i d1-omni-600M — multimodalne modele decyzyjne, które zwracają skalibrowane odpowiedzi tak/nie, wybór albo wynik, nie generując przy tym żadnych tokenów wyjściowych. d1-3B ma być najlepszy w klasie poniżej 10B parametrów w Decision Index i działa w zaledwie 16 ms na sprzęcie NVIDIA Jetson; pojawił się też port na WebGPU działający w przeglądarce.
Decisions API od OpenAI. OpenAI uruchomiło w wersji beta Decisions API do ocen typu tak/nie, kategorycznych i skalowych na tekście lub obrazach. Ma być około 10 razy szybsze niż Responses i obsługuje GPT-6 Luna w cenie 0,10 dol. za milion tokenów wejściowych, a tokeny wyjściowe są darmowe.
Inteligentny interfejs ChatGPT. Z GPT-6 ChatGPT potrafi zwracać interaktywne wykresy, przyciski, formularze i mini aplikacje zamiast zwykłego tekstu. OpenAI przekonuje, że rozumowanie rusza już w trakcie myślenia, co skraca czas oczekiwania. Użytkownicy płacący dostają GPT-6 Sol, a ci na darmowym planie — Luna.
Generowanie wideo Kandinsky 6.0. Kandinsky Lab wydało Kandinsky 6.0 Pro (29B) i Lite (3B) ze wsparciem dla ComfyUI i Diffusers, dokładając upscaler wideo.
Nemotron na IOI i IMO. Dostrojone modele Nemotron zdobyły nieoficjalny wynik na poziomie złota na IOI 2026 (535,4/600) oraz oficjalne złoto na IMO 2026 z wynikiem 30/42, wykorzystując SFT, RL i metodę generate-verify-refine.
Agenci i frameworki
Agenci Nous Research. Nous Research zebrało 90 mln dol. przy wycenie 1,5 mld dol. i uruchomiło Hermes for Businesses, celując w agentów AI dla firm. Otwartoźródłowy Hermes Agent ma już 24 mln klonów i odpowiada szacunkowo za 2,5 % globalnego zużycia tokenów AI.
Deep Agents w LangChain. LangChain wprowadziło zmiany w Skills: narzędzia są teraz powiązane z umiejętnościami, co pozwala utrzymać kontekst w ryzach. Doszły też Managed Deep Agents v0.9 z harmonogramami tworzonymi przez agenta, konfiguracją na pojedyncze uruchomienie i reakcjami w Slacku.
Copilot w Windows. Hybrid Intelligence od Microsoftu pozwoli Copilotowi sięgać do lokalnych plików i wykonywać działania w całym Windows — na przykład wyszukiwać dokumenty, zmieniać ich nazwy, pakować je do ZIP-a i wysyłać e-mailem w imieniu użytkownika.
Muse na iPadzie. Agentowy asystent Mety, Muse, doczekał się natywnego wsparcia iPada po przekroczeniu 6,6 mln instalacji. Dochodzą też konektory do narzędzi takich jak Canva, GitHub i QuickBooks.
Agent Lightning RL. Microsoft Research udostępniło na zasadach open source Agent Lightning v1.0 — liczący 3500 linii framework do RL dla agentów, który korzysta z prawdziwych środowisk wdrożeniowych i natywnego Kubernetesa. W jednym z przykładów podniósł Pass@1 modelu Qwen3.5-9B na SWE-bench Verified z 41,8 % do 56,4 %, zużywając około 6 tys. próbek treningowych.
Lokalna AI i narzędzia dla deweloperów
ROCm 10.1. ROCm 10.1 od AMD celuje w wąskie gardło przesyłu danych przy lokalnym wnioskowaniu. Wydanie komentują użytkownicy lokalnej AI na Reddicie.
Szybsze MoE w llama.cpp. llama.cpp otrzymał pamięć podręczną GPU dla ekspertów MoE trzymanych w pamięci hosta, co ma dać duże przyspieszenia modelom, które nie mieszczą się w całości w VRAM. Doszło też wsparcie MTP dla GLM5Next.
Kontrola repozytoriów w Unsloth Studio. Unsloth Studio sprawdza teraz ponownie zaufane repozytoria modeli przed uruchomieniem. To reakcja na przejęte wersje LiteLLM w PyPI, które pokazały, jak ataki łańcucha dostaw mogą trafiać do narzędzi AI.
GLM-5.3-Flash na dwóch GPU. Zestaw dwóch kart CMP 170HX z 64 GB pamięci uruchamia GLM-5.3-Flash przy kontekście 384K i około 90 tokenów/s dzięki EXL3. Model MoE o 320B parametrów trzyma aktywne wagi w HBM i jest porównywany z Qwen3.8-Flash-Next.
Lokalne benchmarki Qwen. Najnowsze testy społeczności porównują dostrojone Qwen3.8-27B i Qwen3.8-Flash-Next z modelami czołówki w zadaniach dziedzinowych i kodowaniu. Ewaluacja na 469 pytaniach pokazała, że lokalne modele potrafią zbliżyć się do wyników czołówki, zachowując prywatność i niższy koszt — choć nadmiar tokenów rozumowania nadal jest problemem.
Sprzęt i Windows
Surface z RTX Spark. Microsoft zapowiedział Surface Laptop Ultra i Surface RTX Spark Dev Box — oba oparte na chipie RTX Spark od Nvidii z architekturą Arm. Laptop startuje od 2599 dol. i ma do 128 GB pamięci zunifikowanej, a do sprzedaży trafi 16 października. Dev Box kosztuje od 5999 dol. i jest pomyślany do uruchamiania lokalnych modeli 120B+.
Branża i biznes
Luka w rozumieniu kodu. Ankieta wśród 300 starszych menedżerów inżynierii pokazała, że agenci do kodowania przesunęli wąskie gardło na debugowanie i rozumienie kodu: zespoły spędzają 9,8 godz. tygodniowo na pisaniu kodu, ale 16,9 godz. na jego debugowaniu. Raport zwraca uwagę na rosnące ryzyko w systemach krytycznych.
Wirtualna komórka. Biohub koordynuje przedsięwzięcie warte 1,8 mld dol., którego celem są modele AI przewidujące zachowanie komórek. Google DeepMind, Meta i Isomorphic Labs wykładają 300 mln dol., a amerykański DOE dokłada ponad 500 mln dol. na pomiary laboratoryjne i moc obliczeniową.
Klon Adobe w open source. Deweloper Brandon Thomas zbudował za pomocą Claude Opus 5.5 Artcraft — zestaw siedmiu otwartych aplikacji w Rust/WebAssembly, które klonują Photoshopa, Illustratora, Premiere i inne programy Adobe. Aplikacje są we wczesnej fazie i mają sporo braków, ale projekt pokazuje, że reimplementacja metodą clean room z pomocą AI jest możliwa.
SynthID dla wszystkich. Google udostępniło publicznie swój detektor SynthID — każdy może sprawdzić, czy obrazy, filmy i dźwięki noszą znak wodny Google'a lub jego partnerów. System oznaczył już ponad 180 mld materiałów i jest wbudowany także w Chrome i Gemini.
Playground od Google. Google Labs uruchomiło Playground — platformę przeglądarkową, w której pełnoletni Amerykanie mogą tworzyć gry z promptów tekstowych. Napędzają ją Gemini, Nano Banana i Lyria. Unity zapowiedziało z kolei Unity Spark do profesjonalnego tworzenia gier z pomocą AI.
To wszystko na dziś - około 5 minut czytania.