Modele lokalne i workflowy agentów
Qwen3.8-27B z niską kwantyzacją. Użytkownicy zauważają, że Qwen3.8-27B pozostaje mocny w kodowaniu agentowym nawet przy Q3_xxs i Q6; niskie i średnie presety reasoning osiągają wysokie wyniki i ograniczają pętle, a preserve_thinking zapobiega powtarzaniu rozumowania.
Czyściec 16 GB VRAM. Konfiguracja Windows z 16 GB VRAM uruchamia Qwen3.8-27B z wyłączonym MTP, skwantowaną pamięcią podręczną i kontekstem ~100k, dzięki przeniesieniu modułu wizyjnego do RAM.
Szybsza lokalna inferencja. vLLM na dwóch kartach RTX 3090 osiąga 143 tok/s dla Qwen3.8-27B; dedykowane przepisy dla Strix Halo oferują warianty Q8/Q6/Q5 z Unsloth Dynamic Quants.
63-godzinny symulator lotu na MacBooku. Qwen3.8-27B w kwantyzacji 3-bitowej na MacBooku Air M2 potrzebował 63 godzin, ale ostatecznie stworzył działający symulator lotu w HTML, pokazując, że lokalne kodowanie agentowe jest możliwe, choć wolne.
Harnessy i infrastruktura agentów
Harness bije model. Niestandardowy harness Nvidii z zarządzaniem pamięcią i komponentem nadzorczym podniósł wynik Claude Opus 5 z 30% do 100% w ARC-AGI-3, pokazując, że wrapper agenta może mieć większe znaczenie niż sam wybór modelu.
DeepSeek Flash z widzeniem. DeepSeek-V4-Flash-Vision-Exp dodaje rozumienie obrazów dla workflowów agentowych i niemal dorównuje Opus 4.8 w wewnętrznych benchmarkach agentowych; zaktualizowany harness obsługuje obrazy jako wejście w poleceniach oraz w MCP/ACP.
Agenci AI Cloudflare. Cloudflare zmniejszyło liczbę otwartych zgłoszeń Astro o około 85% dzięki izolowanym agentom GitHub Actions, które reprodukują, diagnozują, weryfikują i naprawiają; standardy inżynieryjne zamienia też w mechanizmy kontrolne egzekwowane przez AI.
MCP dla Azure DevOps. Hostowany serwer MCP Microsoftu dla Azure DevOps jest ogólnie dostępny, ale Claude Desktop, ChatGPT i Cursor nie mogą się jeszcze połączyć, ponieważ rejestracja klienta uwierzytelniania Entra nie jest obsługiwana.
Aktualizacje CLI LLM. llm 0.32.1 naprawia zepsuty pin zależności OpenAI, a llm-openrouter 0.7 dodaje ślady rozumowania oraz serwerowe narzędzia Shell, WebFetch i WebSearch.
Premiery modeli i bezpieczeństwo
Jailbreak Opus 4.6. TechCrunch odkryło, że Claude Opus 4.6 generuje jawnie seksualne treści w 10 na 10 bezpośrednich zapytań; starsze modele mają wspólny wieloturnowy jailbreak, a najnowsze wersje Opus są na niego odporne.
Bezpieczeństwo Claude Mythos 5. Anthropic używa Claude Mythos 5 w skanerze bezpieczeństwa kodu dla klientów korporacyjnych. Narzędzie sugeruje poprawki wymagające akceptacji człowieka i daje partnerom dostęp do modelu bez bezpośredniej interakcji.
Generowanie przezroczystych obrazów. GPT-Image-2 od OpenAI potrafi teraz generować przez API pliki PNG bez tła – co przydaje się do zdjęć produktów i ikon. Kanał alfa jest dodawany podczas generowania.
Podgląd dots3-note. llama.cpp dodaje obsługę dots3-note, modelu MoE 280B z 16B aktywnymi parametrami, kontekstem 512K i multimodalnym rozumieniem tekstu, obrazów, wideo i audio.
Badania i benchmarki
SWE-bench Science. Nowy benchmark 119 zadań dotyczących oprogramowania naukowego pokazuje, że najlepszy agent (Claude Code z Opus-5 max) osiąga wynik poniżej 50%. Typowe błędy dotyczą wiedzy naukowej, eksploracji, generalizacji i integracji.
Tańsza ocena trace'ów. LangSmith z pomocą Fireworks dostroił model Qwen do wykrywania błędów dostrzeganych w produkcyjnych trace'ach, dorównując wydajnością czołówce przy kosztach niższych nawet 100 razy.
Prawo skalowania symulacji. Simile AI, z rundą serii B o wartości 2 mld USD, prowadzi symulacje zachowań ludzkich dla firm z listy Fortune 100 i twierdzi, że dokładność w porównaniu z grupami fokusowymi wynosi 85–99%. CEO Joon Sung Park mówi o przejściu od agentów generatywnych do cyfrowych bliźniaków.
Branża i biznes
Umowa Nvidii z Poolside. Nvidia uzyskuje licencję na Model Factory od Poolside i zatrudnia 109 pracowników w ramach transakcji o wartości 6 mld USD, a dodatkowo inwestuje 1 mld USD. To nie jest przejęcie ani acquihire.
Inwestycje w centra danych. Nvidia obejmuje mniejszościowy udział w Cloverleaf Infrastructure, aby przyspieszyć rozwój centrów danych, po zainwestowaniu 1,5 mld USD w SB Energy.
Sprzeciw wobec centrów danych. 75% Amerykanów sprzeciwia się budowie centrów danych w pobliżu ich domów; rok temu było to 42%. Największe obawy dotyczą zużycia energii, wody i wykorzystania terenów.
Wyścig AI: USA–Chiny. Stany Zjednoczone przygotowują list, w którym wzywają kraje partnerskie do opowiedzenia się po jednej ze stron w sprawie AI i ostrzegają, że dołączenie do chińskiej inicjatywy wykluczy je z Pax Silica.
Skok przychodów OpenAI. GPT-5.6 Sol zwiększył kwartalne przychody OpenAI o 35%, a przychody z segmentu enterprise o ponad 50%, wyprzedzając tempo wzrostu biznesowego API Anthropic w Q3.
To wszystko na dziś - około 5 minut czytania.