Premiery i aktualizacje modeli
Cichy model Ox Alpha. Nowy nieogłoszony model Ox Alpha wydaje się oparty na GLM lub Mimo, ale szczegóły nie są potwierdzone. Ma być modelem z czołówki do wydajnego kodowania, długotrwałej pracy agentów AI i zastosowań produkcyjnych.
SenseNova U1.5-Lite. Firma SenseNova wypuściła U1.5-Lite, jeden zunifikowany model łączący wyspecjalizowanych ekspertów do renderowania tekstu, estetyki i edycji obrazu. Poprawia podążanie za złożonymi instrukcjami, natywne generowanie w 4K i wierność edycji.
Tencent Hunyuan Hy4. Tencent rozpoczął testy na szaro nowego flagowego modelu Hunyuan Hy4 w aplikacji Yuanbao. Model oznaczono jako ekspercki, z obsługą narzędzi, pozycjonowany powyżej Hy3 i DeepSeek.
Model 2 wyłącznie wewnętrzny. Z raportu o ryzyku Anthropica wynika, że jego najbardziej zaawansowany model, oznaczony kryptonimem Model 2, jest przeznaczony wyłącznie do użytku wewnętrznego. Wypada lepiej niż publiczne modele Claude i jest intensywnie wykorzystywany do kodowania i badań.
Ling-3.0: podstawowe checkpointy. AntLing opublikował sześć bazowych checkpointów Ling-3.0 w dwóch rozmiarach i trzech etapach treningu. Wszystkie są na licencji MIT i przeznaczone do kontynuacji pretreningu oraz badań.
Produkty i platformy agentowe
Wtyczka ChatGPT do Messages. OpenAI udostępnił wtyczkę do Apple Messages, dzięki której ChatGPT analizuje, pisze i wysyła wiadomości. Wtyczka współpracuje z Codexem i ChatGPT Work; szczegóły dotyczące prywatności wciąż są niejasne.
Meta AI na Maca. Meta wydała aplikację na Maka z systemowym dyktowaniem i świadomością ekranu opartą na Muse Spark. Dodała też integracje biznesowe dla reklam i Google Workspace.
Slack: kanały do kodowania. Slack wprowadził kanały do wspólnego vibe-codingu. Zespoły mogą w nich oznaczać agentów AI, takich jak Claude czy Devin, przeglądać diffy i podglądać wyniki przed wdrożeniem.
Agent OS od Binance. Binance uruchomił Agent OS, platformę pozwalającą agentom AI analizować rynki i wykonywać transakcje. Użytkownik ustala limity, a platforma obsługuje MCP.
Router od Ramp. Ramp uruchomił Router, usługę routingu modeli AI, która daje dostęp do wielu dostawców LLM i strategii. Do końca 2026 roku jest bezpłatna.
Narzędzia i frameworki
LangSmith Preview Builds. LangSmith dodał funkcję Preview Builds, która pozwala testować zmiany w agentach z gałęzi PR w odizolowanych środowiskach przypominających produkcyjne, zanim trafią do merga.
NVIDIA CUDA MCP. NVIDIA udostępniła hostowany serwer CUDA MCP do operacji CUDA wspomaganych AI, takich jak przeszukiwanie oficjalnej dokumentacji, pisanie zoptymalizowanego kodu GPU i analiza wydajności.
Skill /wayfinder. Matt Pocock opublikował /wayfinder, skill pomagający agentom planować projekty o niejasnym stanie końcowym. To odpowiedź na problem planowania we mgle wojny.
LFM2.5-DSpark. Hugging Face zapowiedział DSpark dla modeli LFM2.5. Oferuje do 3,2× szybszą inferencję na GPU i 2,87× na urządzeniu, a latencja wywoływania funkcji spada o 57%.
Badania i benchmarki
Wydajność Qwen3.8-27B. Deweloper zoptymalizował Qwen3.8-27B do 381 tokenów/s na RTX 3090. W benchmarku AIME 2026 uzyskał 29/30 przy FP8 i wysokim poziomie rozumowania, dorównując modelowi Claude Opus 4.6.
GEN-1.5: nauka z jednego pokazu. Model GEN-1.5 od Generalist AI uczy roboty nowych zadań na podstawie jednego, 3–12-sekundowego pokazu. Średnia skuteczność wynosi 59%, a po 10 krokach treningu 83%.
Strony pisane przez AI. Pew Research ustalił, że ponad jedna trzecia stron opublikowanych od czasu premiery ChatGPT nosi ślady autorstwa AI. Badanie oparto na danych Common Crawl i detekcji z użyciem Pangram.
Guardrailsy ułatwiają wykrycie AI. Według CTO Pangrama guardrailsy po treningu prowadzą do mode collapse, przez co tekst LLM staje się wykrywalny. Modele bazowe i wąskie fine-tuningi wymykają się wykrywaniu.
Sutton o danych syntetycznych. Richard Sutton przekonuje, że syntetyczne dane nie rozwiążą problemu skalowania. Nazywa to „wielkim błędem”, bo świat jest nieskończenie złożony.
Tao o kryzysie matematyki. Terence Tao uważa, że AI może wywołać największy kryzys matematyki od czasów Gödla. Zmusi to do ponownego przemyślenia, co uznajemy za wkład matematyczny.
Branża i biznes
Micro1: boom na dane. Startup Micro1, dostarczający dane do trenowania AI, zwiększył w osiem miesięcy run rate brutto ze 100 do 500 mln dolarów. Przychody netto to około 150–200 mln, a popyt na unikalne dane treningowe do AI bije rekordy.
OpenAI vs Anthropic. Dane Ramp pokazują, że wśród amerykańskich użytkowników biznesowych Anthropic wyprzedza OpenAI 44% do 40%. Jednak w trzecim kwartale do tej pory OpenAI rośnie szybciej.
Koniec sporu Runlayer–Rippling. Runlayer i Rippling wycofały pozwy dotyczące konkurencji w obszarze bramek MCP. Rippling uczcił to, natychmiast publikując swoją bramkę MCP.
Brockman u steru OpenAI. Greg Brockman po cichu umacnia swoją pozycję w OpenAI. Prowadzi bieżące operacje na stanowisku president, podczas gdy Sam Altman pozostaje CEO; wszystko to tuż przed IPO.
Chiny doganiają w AI. Z analizy Decoder wynika, że chińskie Kimi K3 i GLM-5.3 są na wyciągnięcie ręki od amerykańskich modeli. Przewaga konkurencyjna przesuwa się więc z poziomu modeli na inne czynniki.
Unitree: okrężne finansowanie. Wycena IPO chińskiej firmy Unitree na 50 mld dolarów opiera się na państwowych ośrodkach, które kupują roboty i odsprzedają dane treningowe. To budzi obawy o okrężne finansowanie.
Bezpieczeństwo i niezawodność
Grok: atak prompt injection. Badacze pokazali, że Grok potrafi wykradać dane użytkowników, gdy złośliwe instrukcje są zaszyfrowane. Poinformowano o tym xAI w czerwcu, ale problem nadal występuje.
Grok: błąd bełkotu. Grok wysyła niektórym użytkownikom Grok.com odpowiedzi będące bełkotem. xAI potwierdziło, że to rzadki, przejściowy problem z generowaniem.
To wszystko na dziś - około 5 minut czytania.