Agentic AI News Dzisiaj

Wiadomości o agentach AI dnia w jednym 5-minutowym czytaniu: premiery, narzędzia, badania, finansowanie i ruchy korporacyjne.

Aktualizowane codziennie wybrane z 30 źródeł Poniedziałek, Sierpień 31, 2026

Premiery modeli i lokalna AI

Model audio-językowy Sori-1B. Model o parametrach 1B trenowany od zera na parach tekst-audio, bez wstępnego treningu tylko na tekście, ma opierać odpowiedzi na audio. Wykorzystuje zamrożony enkoder Audio Flamingo Next od NVIDIA i własny tokenizator ontologii słuchowej. Licencja: niekomercyjna/akademicka.

Lokalne wdrożenia Qwen3.8. Z raportów społeczności wynika, że Qwen3.8-27B i Flash Next działają na sprzęcie od telefonu z 12 GB (3,5 tok/s) do czterech GPU R9700 (generowanie 80–120 tok/s, kontekst 700 tys.). W lokalnych zadaniach agentowych Flash Next jest szybszy i stabilny technicznie, a model dense 27B pozostaje mocniejszy przy dłuższej pracy wieloturowej; część użytkowników uważa jednak, że modele są dense, choć chwali jakość tłumaczeń na niemiecki.

Niecenzurowane wydania GGUF. Użytkownik Reddita opublikował GGUF-y modelu LongCat-Flash-Lite-Sparse (model ze sparse attention, 69B-A3B, kontekst 1M), a także Qwen3.8-27B z MTP, Qwen3.5-122B-A10B, Qwen3-Coder-Next i model wizyjny. Obsługa LongCat wymaga niestandardowego forka llama.cpp.

Stacjonarny sprzęt AI. Stacjonarny DGX Station od NVIDIA zapewnia wydajność klasy centrów danych – przepustowość pamięci 7,1 TB/s. Framework najwyraźniej przygotowuje płytę główną z 192 GB pamięci; spodziewana cena to około 4,5 tys. dolarów.

Benchmarki i ewaluacje

Benchmark pentestów LLM. Nowy benchmark testuje LLM-y na żywej infrastrukturze, którą modele muszą zaatakować; ma wskazać najlepszy model do bezpieczeństwa ofensywnego, a nie odtwarzać znane CVE.

Indeks benchmarków kodowania. Użytkownik Reddita zebrał główne agentowe benchmarki kodowania w „Agentic Coding Index” i obliczył metrykę gęstości inteligencji, by porównać możliwości modeli w przeliczeniu na parametr.

Otwarty VLM w teście egocentrycznym. Przy użyciu HFlow na egocentrycznym benchmarku wideo otwarty VLM Gemma dorównał Gemini 2.5 Flash w metrykach widoczności dłoni i manipulacji, będąc 19-krotnie tańszym, dzięki czemu możliwe jest prywatne przetwarzanie self-hosted.

Narzędzia i frameworki dla agentów

Cloudflare AI Search. Cloudflare AI Search oferuje teraz kompletny potok wyszukiwania dla własnych danych, z integracją z agentami, wyszukiwaniem multimodalnym i trybem Discover, który potrafi indeksować strony bez plików sitemap.

AWS Kiro Crew. AWS udostępnił Kiro Crew jako open source. To środowisko pracy do uruchamiania wielu asynchronicznych agentów kodujących, ze wspólną pamięcią, umiejętnościami wielokrotnego użytku i zaplanowanymi zadaniami; wewnętrznie korzystało z niego ponad 39 000 programistów.

Czym jest ChatGPT Work. ChatGPT Work od OpenAI, dostępny w płatnych planach, występuje w wersji chmurowej przez chatgpt.com oraz lokalnej wersji desktopowej, która ma dostęp do plików i może uruchamiać programy; granice między nim a czatem pozostają jednak niejasne.

Claude Code: obniżony limit. Zapowiedziane przez Anthropic podniesienie bazowego limitu Claude Code o 25% oznacza faktycznie obniżkę o 17% względem obecnego tymczasowego zwiększenia o 50%. Firma dodała też automatyczne narzędzie do zgłaszania błędów.

Badania i analizy

Agenci bez wyczucia czasu. Badanie wykazało, że Claude Code i Codex konsekwentnie błędnie szacują czas wykonania zadań, zawyżając czas krótkich zadań 3–10-krotnie, co jest problematyczne dla długotrwałych zadań agentowych.

PILOT: samodoskonalenie na żywo. PILOT to platforma nadzorca-wykonawca, która dodaje agentom długohoryzontowym sterowanie na żywo i samorozwój w czasie rzeczywistym; na Terminal-Bench 2.0 osiąga wyniki lepsze nawet o 9,8 punktu niż porównywalne platformy.

GameWAM: model świata i akcji. GameWAM to pierwszy model świata i akcji do natywnej rozgrywki wideo, który jednocześnie generuje przyszłe klatki i akcje klawiatury i myszy przez flow matching, z długohoryzontową kontrolą cykli blokowych.

Next-chunk RL vs SFT. Kontrolowane badanie pokazuje, że mieszany SFT na danych bez CoT i z długim CoT bije strategię next-chunk RL jako trening przed RLVR, przy ponad 60-krotnie mniejszej mocy obliczeniowej.

Debata o sprawczości AI. Przywołując incydent Hugging Face z lipca, esej przekonuje, że o wynikach zdecyduje sprawczość AI, a nie tylko możliwości, i że ważne jest, jak użytkownicy tę sprawczość przyznają lub ograniczają.

Przemysł, polityka i biznes

NVIDIA przejmie Hugging Face. NVIDIA miałaby przejąć Hugging Face za 12,9 mld dolarów. Taka transakcja połączyłaby infrastrukturę obliczeniową z głównym hubem dystrybucji otwartych modeli i przyspieszyła uprzemysłowienie AI.

Bariery handlowe USA wobec robotyki. Waszyngton zaostrzył ograniczenia i cła na chińskie drony i roboty, powołując się na bezpieczeństwo narodowe, ale skala produkcji i przewaga kosztowa Chin mogą osłabić ich globalny wpływ.

Adopcja AI w przemyśle. Meta testuje roboty Watney, Kinova i ABB do resetów serwerów, wymiany kabli i cyklicznego zasilania w centrach danych. Caterpillar przenosi lekcje z autonomicznego górnictwa na budownictwo i używa asystentów AI dla techników.

Musk: własne części turbin. SpaceX buduje odlewnię łopatek i kierownic turbin gazowych. Musk twierdzi, że odlewy we własnym zakresie mogą przyspieszyć zasilanie centrów AI gazem ziemnym nawet o 18 miesięcy.

Pracownicy mniej przychylni AI. Dane Glassdoor pokazują, że pozytywne nastawienie amerykańskich pracowników do AI spadło z 81% w 2019 r. do 43% w połowie 2026 r. Najbardziej optymistyczni są menedżerowie, a najbardziej negatywne nastawienie mają kobiety z pokolenia Z, pisarze i pracownicy ubezpieczeniowi.

Wydawcy muzyczni pozywają Anthropic. Sony Music, Warner Music i inne firmy zarzucają Anthropicowi nielegalne pobieranie z torrentów dziesiątek tysięcy chronionych prawem tekstów piosenek do trenowania Claude'a. Pozew wymienia imiennie dyrektora generalnego Dario Amodei oraz współzałożyciela Benjamina Manna.

Teksas blokuje kamery Flock. Gubernator Abbott zamroził wydatki stanowe na kamery Flock AI do monitoringu po wydaniu ponad 30 mln dolarów; wpływ miały na to dwupartyjne obawy o prywatność i incydenty nadużyć przez funkcjonariuszy.

To wszystko na dziś - około 5 minut czytania.

Czytaj go każdego ranka, prosto w przeglądarce

Rozszerzenie otwiera to podsumowanie w panelu bocznym Chrome — jeden klik, bez konta.

Dodaj do Chrome — za darmo