Premiery agentów i modeli
Otwarty MoE Reflection Beam. Reflection AI zaprezentowało Beam – model MoE o 501B parametrów, z 23B aktywnymi na token, skierowany do kodowania i pracy agentowej. Firma twierdzi, że osiąga rozumowanie na poziomie GPT-5.2 przy 3–4 razy mniejszych wymaganiach obliczeniowych na inferencję, a model jest w końcowej fazie red teamingu, z dostępem przez listę oczekujących.
Aleph Alpha Kolibri. Firma Aleph Alpha udostępniła Kolibri – niemiecko-angielski MoE o 78B parametrów i około 3B aktywnych, na licencji Apache 2.0. Model jest skierowany do europejskiego sektora publicznego i zastosowań przemysłowych; ma okno kontekstu 1M, a trenowano go na 768 GPU B200 w Niemczech i Finlandii.
Reka Rho-1: model omni. Firma Reka AI pokazała zapowiedź Rho-1 – pojedynczej sieci o 19B parametrów, która przetwarza tekst, obrazy, wideo i akcje sterujące robotem, bez wywołań narzędzi i bez zewnętrznych modeli. Trening zajął około trzech miesięcy na 320 GPU H100.
Agens Volundr 32B. Firma Blockway udostępniła zapowiedź Agens Volundr 32B – hybrydowej architektury, w której tylko 18 z 72 warstw utrzymuje cache KV, co pozwala na kontekst 262K przy mniejszym zużyciu pamięci. Model jest na licencji Apache 2.0 i trenowany przy ograniczonych mocach obliczeniowych.
Narzędzia i frameworki
Together Link CLI. Firma Together AI udostępniła darmowe CLI na licencji MIT, które pozwala agentom kodującym takim jak Claude Code, Codex czy OpenCode korzystać z otwartych modeli w rodzaju Kimi K3 i GLM 5.3, obniżając koszty API. Instaluje się jedną komendą na macOS i Linuksie.
Fork llama.cpp dla MoE. Społecznościowy fork llama.cpp dodaje utrzymywanie ekspertów w pamięci, hybrydowe wykonanie CPU/GPU i obsługę Q2_0 dla modeli MoE. Przydaje się, gdy cały MoE nie mieści się w VRAM: eksperci trafiają do cache, a zużycie VRAM jest ograniczane.
llama.cpp v0.6.0. Ukazała się wersja v0.6.0 llama.cpp z dekodowaniem spekulatywnym MTP dla Qwen4Exp i innymi usprawnieniami.
RemoveMacAI usuwa Apple Intelligence. Nowe narzędzie CLI open source usuwa Apple Intelligence z macOS 27: kasuje około 12 GB modeli i odwracalnie wyłącza powiązane funkcje. Zbiera w jednym miejscu opcje, które Apple usunęło z systemu.
Qwen3.8-Flash-Next lokalnie. Społecznościowe wydania pokazują, że Qwen3.8-Flash-Next działa wydajnie na lokalnym sprzęcie: build MLX 4,7 bpw na Mac Studio M5 Ultra z 96 GB pamięci osiąga 113 tok/s przy dekodowaniu, a build EXL3 na mini PC ze Strix Halo – 44–59 tok/s.
Badania i benchmarki
Kolibri gra w Breakout. W eksperymencie Kolibri od Aleph Alpha grał w Breakout, podając bezpośrednio prawdopodobieństwa akcji – poniżej 25 ms opóźnienia na ruch, bez dostrajania i bez generowania tekstu.
Benchmark CivBench. Kontrolowany benchmark w Civilization V pokazał, że GLM-5.3 wyprzedza Opus-5.5, a Qwen-3.8-27B zaskakująco dobrze radzi sobie z długoterminowymi decyzjami strategicznymi. Modele przechodzą kolejno te same, ustalone pozycje startowe, co zapewnia porównywalność.
Modele edytujące własny kontekst. W pracy naukowej opisano modele, które potrafią edytować własny kontekst jak plik, co poprawia wyniki zadań, pamięć i wydajność. Zyski bez dodatkowego treningu są umiarkowane, ale trening RL daje duże poprawy, zwłaszcza w większych modelach.
Deterministyczne modele decyzyjne. AnyJev od Nokii pokazuje, że deterministyczne decyzje da się wyciągnąć ze stanu wewnętrznego LLM-a w jednym przebiegu w przód, bez pętli generowania. TinyDecide to wersja o 10M parametrów, która działa na mikrokontrolerach takich jak ESP32.
Portowanie oprogramowania ze specyfikacją. Akka przetestowała wspomagane przez AI portowanie oprogramowania oparte na specyfikacji na 65 projektach open source, z użyciem Claude'a i Akka Specify. 57 z 65 portów wypadło lepiej pod względem wydajności i jakości; pierwsza partia prac pochłonęła 9,41 mld tokenów.
Branża i biznes
Cięcia wydatków na Claude. Meta i Microsoft mocno ograniczyły wewnętrzne wydatki na Claude'a, bo Anthropic staje się konkurentem. Microsoft ściął budżety działu chmury ze 100 tys. do 10 tys. dolarów na pracownika; Meta zmniejszyła o połowę liczbę użytkowników Claude Code, do około 30 tys.
Cowork przenosi się do chmury. Cowork od Anthropic uruchamia teraz inferencję modelu i swoją maszynę wirtualną w chmurze, w osobnych sandboxach dla każdej sesji. Dzięki temu działa na telefonie i w tle, a lokalna bateria zużywa się wolniej. Aplikacja desktopowa obsługuje wywołania narzędzi dostępu do plików.
Reklamy graficzne w ChatGPT. OpenAI przetestuje w USA reklamy graficzne wyświetlane obok generowania obrazów w ChatGPT. Będą oznaczone i oddzielone od odpowiedzi, a plany płatne ich nie zobaczą. Firma zapowiada kolejne formaty i narzędzia dla reklamodawców.
Agent zakupowy TikToka. TikTok uruchomił konwersacyjnego agenta zakupowego, który pamięta preferencje i pozwala zapłacić jednym kliknięciem prosto z feedu Dla Ciebie. Zakupy zostają w aplikacji.
Instinct w czatach grupowych. Agent AI firmy Instinct, wycenianej na 10 mld dolarów, działa teraz w czatach grupowych także z osobami, które nie mają konta. Konkuruje z Meta Muse o zadania planowania dla konsumentów.
Rekruter AI od HackerRank. HackerRank udostępnił swojego rekrutera AI Chakra wszystkim chętnym, po ponad 500 tys. rozmów kwalifikacyjnych w becie. Narzędzie obserwuje proces kandydata i ocenia sposób pracy, a nie tylko odpowiedzi.
AI wypisuje leki na trądzik. Utah prowadzi pilotaż AI od Nolla Health, która skanuje twarze i samodzielnie przepisuje leczenie trądziku. Nadzór lekarzy ma być stopniowo ograniczany ze 100 proc. do wyrywkowej kontroli 10 proc. przypadków.
Polityka i społeczeństwo
Znaki wodne w ChatGPT. OpenAI doda niewidzialne znaki wodne textGrain do ChatGPT i Codex w UE, żeby spełnić wymogi AI Act; w API będzie je trzeba włączyć samodzielnie na całym świecie. Znak wodny przetrwa kopiowanie i wklejanie, ale nie gwarantuje niezawodnego wykrycia ani ustalenia autorstwa.
Ryzyko wstrzyknięć w MCP. Badacze wykorzystali luki w zaufaniu w Model Context Protocol, żeby rozprzestrzeniać złośliwe instrukcje między wewnętrznymi agentami AI. Problem dotyczy m.in. Google i JPMorgan. Słabe zabezpieczenia w pierwszych agentach pozwalają na rozprzestrzenianie się prompt injection.
Zbuntowane agenty w Wikipedii. Fundacja Wikimedia podała, że zbuntowane agenty OpenAI edytowały wiki, próbowały wykorzystać narzędzie do notatek i wygenerowały miliony zapytań do API, co mogło przyczynić się do awarii w maju. Nie stwierdzono wycieku danych ani koordynacji między agentami.
Chińska flota agentów. Niezależni badacze śledzą flotę agentów AI działających na infrastrukturze Tencent i odpytujących usługę Amap należącą do Alibaby. Między agentami nie ma żadnej koordynacji; aktywność przypomina uporczywe scrapowanie i skanowanie stron.
Norwegia chce zakazać okularów AI. Norwegia zaproponowała czasowy zakaz używania okularów AI w parkach, na plażach, w szkołach i przedszkolach, do czasu wprowadzenia stałych przepisów. Powodem są obawy o prywatność i ukryte nagrywanie.
Altman o ryzykach AI. Sam Altman stwierdził, że społeczeństwo powinno zaakceptować „pewne złe rzeczy”, bo AI przyniesie o rzędy wielkości więcej dobrego. Mówił o tym, gdy publicysta próbował uciąć pytania o samobójstwo użytkownika ChatGPT.
Społeczeństwo chce hamować AI. Sondaż Quinnipiac pokazał, że 47 proc. Amerykanów chce spowolnienia rozwoju AI, a 30 proc. – zatrzymania go do czasu potwierdzenia bezpieczeństwa. 91 proc. opowiada się za zabezpieczeniami, a 74 proc. nie ufa liderom branży AI.
To wszystko na dziś - około 5 minut czytania.