Agenci i premiery modeli
Claude Fable 5.1. Firma Anthropic wypuściła Fable 5.1 i Mythos 5.1, twierdząc, że modele lepiej radzą sobie z kodowaniem i zadaniami badawczymi, a praca agentów może być nawet o 45% tańsza dzięki tańszemu odczytowi z cache. Wersja Fable 5.1 bez ograniczeń jest już dostępna, choć wstępne analizy kosztów kwestionują maksymalne oszczędności przy najwyższym poziomie rozumowania.
- → Claude Fable 5.1 made me a really nice animated pelican
- → Anthropic launches Claude Fable 5.1 and says it’s up to 45 percent cheaper for agentic work
- → Anthropic's Claude Fable 5.1 promises better coding and research at up to 45 percent less
- → Anthropic’s new Fable release is cheaper, less restrictive
Premiera OpenAI Astra. OpenAI twierdzi, że przygotowywany model Astra jako pierwszy LLM spełnia krytyczny próg cyberbezpieczeństwa – potrafi samodzielnie znajdować i wykorzystywać nieznane luki. Firma opóźniła część prac nad Astrą po włamaniu do Hugging Face, aby wzmocnić zabezpieczenia, i ograniczy dostęp do najbardziej zaawansowanych funkcji cyberbezpieczeństwa modelu.
Nowe modele Spark-X2.5. Otwarte modele Spark-X2.5-4B i 1.7B trafiły na Hugging Face z nowatorską architekturą. Autorzy twierdzą, że wydajnością dorównują modelowi Qwen 3.5 9B i natywnie obsługują kontekst 1M. Nie działają jeszcze w głównym repozytorium llama.cpp, ale istnieje dla nich autorski fork.
Runway Solaris: model UI. Firma Runway zaprezentowała Solaris, „Interface World Model”, który w czasie rzeczywistym generuje klatki interfejsu użytkownika zamiast uruchamiać kod, reagując na kliknięcia i głos. To wciąż projekt badawczy, z ograniczeniami w renderowaniu tekstu i wsparciu dla czytników ekranu.
Lokalne AI i sprzęt
Qwen3.8 lokalnie. Społeczność donosi, że Qwen3.8 27B i Flash-Next działają na różnym sprzęcie: 12 tok/s na Macu z 48 GB pamięci, 280 tok/s dekodowania na dwóch procesorach Epyc R9700 z jądrami MXFP4 i 132 tok/s dekodowania na pojedynczym RTX 3090 po autorskich optymalizacjach. Benchmarki kwantyzacji sugerują, że UD Q3_K_XL dobrze pasuje do kart z 16 GB; część użytkowników uważa natomiast, że Qwen3.8 dobrze pisze kod, ale zbyt chętnie go modyfikuje.
- → Running 104GB Qwen3.8-Flash-Next on 48GB Mac at ~12 tok/s
- → How I got 280 tok/s on Qwen3.8 27B on 2xr9700's and 940k tokens kv cache
- → I pushed Qwen3.8-27B to 2.000 prefill per second and 132 decode per second on A RTX 3090.
- → Kaitchup posted Qwen3.8 27B Benchmarks for quants from Q4 to Q1
- → Everyone is t/s maxing.. 3.8.. but after a week of using it for work I'm tempted to switch back to 3.6
Podwyżki cen DGX Spark. Znacząco podrożały Nvidia DGX Spark i Asus Ascent GX10 – cena modelu Asusa wzrosła z 3999 do 5999 USD. Kupujący zastanawiają się, czy klastry DGX Spark są bardziej opłacalne niż systemy AMD Epyc z większą przepustowością pamięci, chociaż DGX oferuje FP4 i równoległość tensorową.
Awarie CMP 170HX. Jeden z użytkowników donosi, że w ciągu dwóch tygodni z pięciu kart CMP 170HX dwie padły, a trzecia miała wadliwe rdzenie tensorowe. Jego zdaniem obecne ceny nie uzasadniają ryzyka przy inferencji modeli LLM.
INT8 i mylące kwantyzacje. Społeczność zastanawia się, dlaczego modele INT8 W8A8 nie są szerzej stosowane na RTX 3090, skoro karty te mają natywne rdzenie tensorowe INT8. Inny użytkownik zarzuca AtomicChat błędne oznaczenie kwantyzacji IQ2_S jako Q4_K_M.
Intel wraca do pamięci. Intel zasygnalizował, że może wrócić do branży pamięci; CEO wspomniał o zatrudnieniu byłego dyrektora SK Hynix Seok-Hee Lee i o nowej architekturze pamięci. Szczegółów jednak na razie brak.
Narzędzia i frameworki
Premiera OpenClaw 2.0. OpenClaw 2.0, osobisty agent AI o otwartym kodzie źródłowym, upraszcza konfigurację, bo wykrywa istniejące subskrypcje ChatGPT/Claude i lokalne modele; przeglądarka została przebudowana i jest teraz głównym interfejsem. Doszły też współdzielone sesje w chmurze do pracy zespołowej.
Codex: lokalne narzędzia. Desktopowa aplikacja Codex od OpenAI zawiera teraz w środowisku uruchomieniowym pełną instalację LibreOffice oraz inne binaria, takie jak Poppler i git. Dzięki temu potrafi przetwarzać dokumenty bez zewnętrznych zależności.
Fabryki oprogramowania AI. Czołowe projekty open source z dziedziny AI, takie jak Flue i tldraw, odrzucają zewnętrzne PR-y, a zamiast tego używają zespołów agentów, które kategoryzują zgłoszenia, odtwarzają błędy, nanoszą poprawki i weryfikują rozwiązania. Projekt AI SDK firmy Vercel wdrożył wieloagentową „fabrykę oprogramowania”, by uporać się z zaległościami obejmującymi ponad 1000 zgłoszeń i 800 PR-ów.
Terraform dla agentów. HashiCorp pozycjonuje HCP Terraform jako nadzorowaną warstwę sterowania dla infrastruktury opartej na AI. Agenci mogą tworzyć i wdrażać zmiany w Terraformie, podczas gdy platforma egzekwuje polityki, kontrolę tożsamości i zapisy audytowe.
Aktualizacja datasette-mcp. Wtyczka datasette-mcp doczekała się wersji 0.2, w której wyniki zapytań SQL zmieniono z tablic na obiekty, aby słabsze modele poprawnie mapowały kolumny.
Badania i bezpieczeństwo
BenchMIRT: audyt benchmarków. Hugging Face wprowadziło BenchMIRT, metodę audytu benchmarków LLM na poziomie pojedynczych promptów. Pokazuje ona, że prompty w obrębie jednego benchmarku potrafią mierzyć różne zdolności, a średnie wyniki mogą to maskować.
Agentowe wideo Gemini. Google DeepMind wprowadziło agentowe rozumienie wideo w modelach Gemini 3.7/3.6/3.5 Flash-Lite. Dzięki natywnym narzędziom wideo modele dynamicznie przeszukują i analizują segmenty nagrań, co zwiększa dokładność i ogranicza zużycie tokenów podczas analizy wideo.
Znakowanie tekstów Claude. Firma Anthropic udostępniła regulatorom, mediom i fact-checkerom API do weryfikacji znaków wodnych. Dzięki niemu uprawnione organizacje mogą wykrywać tekst wygenerowany przez Claude'a na podstawie statystycznego wzorca, który potrafi przetrwać część edycji – zgodnie z wymogami aktu o AI.
Wybory i uprzedzenia AI. Z badania AlgorithmWatch wynika, że wyborcze AI Overviews Google są niespójne, opierają się na niewielu źródłach i czasem opisują kandydatów stronniczo. Osobno wyszukiwarka AI Google udzielała porad o wzywaniu pomocy w zależności od narodowości, co wymusiło poprawki.
Branża i biznes
Błyskawiczny wzrost AfterQuery. Według doniesień startup AfterQuery, zajmujący się danymi treningowymi dla AI, pozyskał finansowanie przy wycenie 3,2 mld USD. To dziesięciokrotny wzrost w ciągu pięciu miesięcy i rekordowo szybkie osiągnięcie statusu jednorożca w historii Y Combinator. Firma zatrudnia profesjonalistów, którzy szkolą modele, jak wykonywać zadania tak, jak robią to eksperci.
AIR pozyskuje 50 mln USD. Startup AIR, zajmujący się bezpieczeństwem AI, wyszedł z ukrycia z 50 mln USD finansowania. Ma pomagać firmom wykrywać agenty i stale weryfikować wykorzystywane przez nie umiejętności, serwery MCP i dodatki, blokując nieautoryzowane interakcje między komponentami oprogramowania.
Google zabiega o Hollywood. Według doniesień Google szuka umów licencyjnych z dużymi studiami, aby trenować modele AI na treściach chronionych prawem autorskim; oferuje za to wysokie opłaty. Analitycy ostrzegają jednak, że takie umowy mogą zaszkodzić wizerunkowi studiów w oczach opinii publicznej.
Frontier AI priorytetem. Nowy szef Google DeepMind, Koray Kavukcuoglu, powiedział, że liczy się tylko przywództwo w obszarze frontier AI. Przyznał, że obecne modele nieco odstają od czołówki, ale obiecał domknąć lukę. Nie podał żadnych konkretów na temat Gemini 4 ani 3.5 Pro.
Agenci w operacjach. Dane z OpenAI Enterprise Signals pokazują, że firmy z czołówki generują 8,3 razy więcej tokenów wyjściowych na aktywnego użytkownika. Tymczasem startupy Basis, Clay i Exa Labs wdrażają agentów do onboardingu, zarządzania kontami i integracji developerskich.
Spór prawny Apple–OpenAI. Apple wystąpiło o przyspieszone postępowanie dowodowe przeciwko OpenAI, zarzucając, że firma nie sprawdziła MacBooka byłego pracownika Apple, na którym znajdowały się rozmowy o niszczeniu materiału dowodowego.
Google Pics: narzędzie graficzne. W Workspace zadebiutowało Google Pics, narzędzie do tworzenia i edycji obrazów za pomocą AI, oparte na Nano Banana. Ma konkurować z Canvą i Adobe Express, oferując projektowanie z promptów i precyzyjną edycję obiektów.
Agenci AI dla konsumentów. Fambot wprowadził szefa sztabu AI dla rodzin – ma zarządzać domową logistyką. John Deere wypuścił asystenta JD AI dla rolników, który korzysta z ich danych. Amazon dodał do Alexy alerty zakupowe „Update Me When”.
To wszystko na dziś - około 5 minut czytania.