Agentic AI News Dzisiaj

Wiadomości o agentach AI dnia w jednym 5-minutowym czytaniu: premiery, narzędzia, badania, finansowanie i ruchy korporacyjne.

Aktualizowane codziennie wybrane z 30 źródeł Poniedziałek, Wrzesień 7, 2026

Czołowe laboratoria AI

OpenAI stawia na RSI. OpenAI twierdzi, że osiągnęło cel, jakim był „automatyczny stażysta badawczy”. Wewnętrzni agenci do kodowania przyspieszają badania, a część planów przyspieszono o sześć miesięcy. Esej głównego naukowca Jakuba Pachockiego przedstawia rekurencyjne samodoskonalenie jako centralny element AGI. Firma wiąże lipcowy wzrost wydatków na AI przypadających na badacza z modelem opublikowanym później jako GPT-6 Astra.

Agenci bezpieczeństwa Figmy. Figma zbudowała agentów AI na Panther SIEM, którzy badają alerty z AWS, Okta, GitHub, GCP i osquery. Czas rozwiązywania złożonych alertów spadł o 70%, a liczba powiadomień dyżurnych o 20%; w pętli wciąż pozostaje człowiek.

Framework Mantis od Google. Google udostępniło Mantis jako open source. Ten agentowy framework do wykrywania podatności łączy agentów recenzujących z odtwarzaniem w piaskownicy, aby ograniczyć fałszywe alarmy i halucynowane podatności podczas skanowania kodu.

Lokalna inferencja i sprzęt

LayerStoRm: strumieniowanie ekspertów. LayerStoRm, eksperymentalny silnik na licencji MIT, na bieżąco strumieniuje ekspertów MoE z RAM-u hosta do GPU. Uruchamia w ten sposób skwantowany model GLM-5.3-Flash (186 GiB) z prędkością 24,5 tok/s na 96 GB VRAM oraz cache prefiksów pod kodowanie agentowe.

Zestawy z Radeon Pro R9700. Zestawy budowane przez społeczność wokół AMD Radeon AI Pro R9700 dojrzewają: system z dwoma R9700 i 64 GB DDR5 uruchamia Qwen 3.8 27B FP8/MXFP4 oraz Flash Next w vLLM, a użytkownicy dyskutują o offloadingu DeepSeek V4 Flash i Qwen 3.8 Flash na 4xR9700.

Optymalizacja lokalnego cache. Nowe narzędzie open source pod obciążeniem sprawdza, ile z deklarowanej pojemności cache KV faktycznie zostaje. Wyniki pokazują, że poprawki dedupe i boundfix potrafią zachować do 146% pojemności; użytkownicy raportują też, że cache f16 poprawia akceptację MTP w porównaniu z Q8 na starszych GPU.

Benchmarki i ewaluacja

Struggle Bench. Nowy „Struggle Bench” daje modelowi serwer, mieszkanie i konto bankowe, a następnie sprawdza, przez ile miesięcy model zdoła płacić czynsz i działać, nie popełniając cyberprzestępstw. To test prawdziwej autonomii i umiejętności przetrwania.

Harness lm-eval-ledger. lm-eval-ledger uruchamia benchmarki i wszystkie dane zapisuje w SQLite. Do tego ma aplikację webową, w której można zobaczyć i porównać, jak modele odpowiedziały na każde pytanie, zamiast tylko zbiorczych liczb.

Głębsze benchmarki kodowania. Program-Bench, SRE-Bench i Code Migration wymagają od agentów rekonstruowania plików binarnych z dokumentacji, rozumienia rzeczywistych plików binarnych bez kodu źródłowego i przepisywania programów w innym języku. To test głębokich kompetencji w inżynierii oprogramowania.

Sprawy prawne i prawa autorskie

Seattle Times i Newsday pozywają. The Seattle Times i Newsday pozywają OpenAI i Microsoft o naruszenie praw autorskich, domagając się zniszczenia modeli AI zbudowanych na ich utworach. Dołączają w ten sposób do prawie 400 lokalnych gazet, które wysuwają podobne roszczenia.

Spory o ugodę Anthropic. Autorzy informują, że wydawcy i agenci domagają się z ugody Anthropic wartej 1,5 mld dolarów więcej, niż wynosi ich udział. Spory dotyczą też praw, które wróciły do autorów – w takich przypadkach autorzy powinni otrzymać pełną kwotę.

Bezpieczeństwo i guardrails

Abliteracja jako usługa. Amerykański startup Abliteration.ai sprzedaje przez API dostęp do modeli open-weight poddanych abliteracji, takich jak GLM-5.3, z myślą o red teamingu i analizie malware. Usunięcie odmów odpowiedzi obniża próg nadużyć.

Warianty Qwen bez cenzury. Porównanie ośmiu abliterowanych wariantów Qwen 3.8 27B wykazało, że najwyższy wskaźnik HarmBench ASR ma orcarouter, a najbliżej możliwości modelu bazowego jest apostate. Niektóre wydania mają jednak osobliwości, np. brak trybu wizyjnego i MTP.

Debata o psychozie AI. Naukowcy przekonują, że przymilne chatboty mogą wzmacniać urojenia w „komorze echa jednej osoby” i wzywają do uznania „psychozy związanej z AI”. To, czy zasługuje ona na osobną jednostkę diagnostyczną, pozostaje sporne.

Premiery modeli i badania

Kompaktowe modele Spark-X2.5. XHToken wydało modele Spark-X2.5-4B i 1.7B – efektywne modele z natywnym kontekstem 1 mln tokenów i obsługą ponad 200 języków. Do llama.cpp trafił też PR dodający ich obsługę.

WeatherNext 3: nauka z satelitów. WeatherNext 3 od Google i DeepMind rezygnuje z symulacji fizycznych i uczy się bezpośrednio z danych satelitarnych w czasie rzeczywistym. Generuje godzinne prognozy w rozdzielczości 5 km i poprawia dokładność prognoz opadów o nawet 50%.

Muse Voice Transcribe od Meta. Meta udostępniła Muse Voice Transcribe – model działający w czasie rzeczywistym, który dzieli audio na segmenty po 80 ms, transkrybuje mowę i rozróżnia do 20 mówców. Kosztuje 0,18 dolara za godzinę i obsługuje ponad 70 języków.

Google: model muzyczny Lyria 3.5. Google udostępniło Lyria 3.5 w Gemini i API. Model generuje muzykę z ekspresyjnymi wokalami, a do treningu wykorzystano wyłącznie licencjonowane dane.

To wszystko na dziś - około 5 minut czytania.

Czytaj go każdego ranka, prosto w przeglądarce

Rozszerzenie otwiera to podsumowanie w panelu bocznym Chrome — jeden klik, bez konta.

Dodaj do Chrome — za darmo