Lokalne modele i sprzęt
Przyspieszenie Qwen3.8-27B. Dekodowanie spekulacyjne DFlash2 przyspiesza Qwen3.8-27B do 218 tok/s na dwóch kartach 3090, około 200 na 5090 i 124 na pojedynczej 3090 z zoptymalizowanym silnikiem. Kwantyzacje GGUF DFlash2 są dostępne.
Kolejny średni model Qwen. Kierownik społeczności Qwen zapowiada, że nowy średni model o otwartych wagach pojawi się w przyszłym tygodniu, prawdopodobnie z ponad 100 miliardami parametrów, bez wcześniejszego dostępu.
Wsparcie Ling-3.0 na brzegu. llama.cpp oficjalnie wspiera teraz Ling-3.0 (BailingMoE3). Wariant tiny obsługuje pełny kontekst 128K na Orin Nano 8GB za 249 dolarów przy 33 tok/s, a Arc B580 osiąga ~114 tok/s.
Szybkość DeepSeek V4 Flash. Zoptymalizowane jądra i podgrzewanie pamięci podręcznej KV skróciły turę czatu na Mac Studio M3 Ultra z 6-20 sekund do 1,6 s. Konfiguracja z 4x RTX 3060 przetwarza prompty z prędkością ~100 tok/s przy kwantyzacji 144GiB.
Przegląd modeli niskobitowych. Model ternarny Bonsai 27B działa teraz na głównej gałęzi CUDA/Vulkan; Mach-1 Additive 35B osiąga do 120 t/s na laptopach konsumenckich. Trwają prace nad nowymi wariantami opartymi na Qwen3.8-27B.
Narzędzia i frameworki dla agentów
Dopasowane ewaluatory agentów. LangChain wprowadza Tuned Evaluators, które automatycznie dołączają informacje zwrotne o postrzeganych błędach do śladów produkcyjnych. Używają one specjalistycznego modelu, obniżając koszty ewaluacji nawet o 82%.
Benchmark wyszukiwania agentów. Search Index od Artificial Analysis rankuje Parallel, Exa, Firecrawl i inne pod względem jakości, kosztu i szybkości dla agentów. Lepsza jakość wyszukiwania zmniejszyła zużycie tokenów o ponad 40%.
WriteGuard dla MCP. WriteGuard od Cloudflare, obecnie w prywatnej becie, dodaje scentralizowane polityki, atrybucję i dzienniki audytowe dla operacji zapisu przez serwery MCP.
Fabryki oprogramowania Warp. Warp Factories to warstwa infrastruktury, która pomaga mniejszym firmom wdrażać agentów kodujących AI przy użyciu modelu fabryki oprogramowania.
Makiety Claude Code. Polecenie /design od Anthropic w Claude Code tworzy makiety interfejsu w terminalu, dopasowując się do stylu istniejącej bazy kodu przed rozpoczęciem prac.
Bezpieczeństwo, ochrona i polityka
Przebudowa bezpieczeństwa OpenAI. Po incydencie z Hugging Face i dowodach, że Astra może osiągnąć krytyczne zdolności w cyberbezpieczeństwie, OpenAI wstrzymało RL na dwa tygodnie i wzmocniło sandboksy. Jego największy planowany trening RL dla modeli granicznych pozostaje wstrzymany.
Copilot ujawnia zabezpieczenia. Naukowcy poprosili Microsoft 365 Copilot o wyjaśnienie swoich zabezpieczeń związanych z potwierdzaniem przez użytkownika, a następnie stworzyli exploit wykorzystujący kliknięcie linku do eksfiltracji danych bez potwierdzenia.
ChatGPT for Teens. ChatGPT for Teens automatycznie obejmuje użytkowników poniżej 18 roku życia, z surowszymi ograniczeniami treści, trybem nauki i kontrolami rodzicielskimi. Ma na celu ograniczenie oszukiwania i szkodliwych treści.
Debata Amodei na temat otwartych modeli. CEO Anthropic, Dario Amodei, twierdzi, że otwarte modele przenoszą władzę na właścicieli chipów i broni propozycji regulacji AI. Krytycy, w tym LeCun i Sacks, oskarżają go o sianie paniki.
Przemysł i biznes
Cursor uruchamia Origin. Cursor uruchamia Origin, rywala GitHub do hostowania kodu, z funkcjami natywnymi dla agentów i planowanym ekosystemem aplikacji.
Wycena Etched się podwaja. Etched zebrało 700 milionów dolarów przy wycenie 21 miliardów dolarów, podwajając ją w ciągu miesiąca, po tym jak Jane Street przetestowało swoje układy wnioskowania prefill/decode.
Popyt na routing modeli. Zakup OpenRouter przez Stripe za 7 miliardów dolarów i 300 milionów dolarów ARR Glean podkreślają rosnący popyt na routing modeli, w miarę jak modele o otwartych wagach zyskują na popularności.
Badania i analizy
Kalibracja pamięci agentów. Badanie Hugging Face pokazuje, że efekty pamięci agentów różnią się w zależności od poziomu modelu: gpt-oss-120b zyskał +16,1 p.p. w wykonywaniu zadań przy pełnych wytycznych, podczas gdy słabsze modele potrzebują kompaktowego wyszukiwania.
Niezależne dane o użytkowaniu AI. Obserwatorium AI Uniwersytetu Stanforda zebrało prawdziwe rozmowy i stwierdziło, że korzystanie z AI znacznie różni się w zależności od modelu, a przypadki użycia w pracy są mniej powszechne, niż twierdzą firmy.
Kompresja kontekstu gubi instrukcje. Naukowcy z Penn State odkrywają, że tylko 17% ograniczeń sesji przetrwa kompresję kontekstu; mały dodatkowy LLM odzyskuje większość utraconych instrukcji.
Samodoskonalenie nie jest na wyciągnięcie ręki. Badanie prowadzone przez Princeton wykazuje, że agenci AI potrafią rozwiązywać problemy inżynieryjne, ale brakuje im osądu do otwartych badań nad AI, co sugeruje, że rekurencyjne samodoskonalenie może potrwać dłużej.
To wszystko na dziś - około 5 minut czytania.