Czołowe modele i pierwsze wyniki
Premiera GPT-6 Astra. OpenAI wydała GPT-6 Astra, nazywając go początkiem ery AGI. Model osiąga 99,9% w teście ARC-AGI-3 przy użyciu autorskiego harnessu i notuje duże postępy w cyberbezpieczeństwie, długim kontekście i kodowaniu. Ceny wynoszą 10/50 dolarów za milion tokenów. Pierwsi klienci, Playco i Legora, zgłaszają duże usprawnienia workflow, w tym 50% mniej ręcznych poprawek i przeglądanie 41 dokumentów w kilka minut.
- → GPT-6 Astra: an automated AI Engineer you can hire for <$6 an hour
- → GPT‑6 Astra
- → GPT-6 Astra is the first model making OpenAI willing to declare the "AGI era"
- → OpenAI launches Astra, its powerful (and controversial) new model
- → OpenAI’s next big AI model has ‘entered the AGI era’
- → Playco cut manual fixes 50% prototyping games with GPT-6 Astra
- → Legora reviewed 41 documents in minutes with GPT-6 Astra
OpenAI Daybreak dla cyberobrony. OpenAI przeznaczyła 1 mld dolarów na dofinansowanie dostępu do Daybreak, szkoleń i wsparcia dla obrońców pierwszej linii, w tym amerykańskiego pilotażu z MS-ISAC. Inicjatywa ma wprowadzić cybermożliwości z najwyższej półki do narzędzi, których obrońcy już używają.
Meta Muse Spark 1.3. Meta wydała Muse Spark 1.3, który poprawia zadania agentowe, ale w większości benchmarków wciąż wypada gorzej niż Claude Fable 5.1. Przy 0,55 dolara za zadanie indeksowe to najtańszy model w swojej klasie wydajnościowej; Meta oferuje też ok. 95% niższe ceny tokenów użytkownikom, którzy dzielą się promptami i odpowiedziami.
Modele otwarte i wyspecjalizowane
IFM K2 Horizon. IFM wydało rodzinę modeli K2-Horizon, w tym model MoE o 36B parametrów z mechanizmem uwagi Mixture-of-Values, który aktywuje 4B parametry na token. Społeczność wstępnie porównuje go do Qwen 3.6 35B; producent obiecuje finalne checkpointy i kod treningowy.
Model finansowy Ant Group. Ant Group udostępniło jako open source model Ling-3.0-flash-Fin – model finansowy o 124B parametrów całkowitych i 5,1B aktywnych, z oknem kontekstowym 256 tys. tokenów. Powstał dzięki dalszemu treningowi na danych finansowych pod kątem długoterminowych zastosowań agentowych.
Najmniejszy zestaw TTS. sanoTTS to model TTS o 294 tys. parametrów, który działa na mikrokontrolerze za 3 dolary; wersja o 1,46 mln parametrów bije w benchmarku SCOREQ większe modele. Stack obsługuje 11 głosów i 6 języków i jest dostępny na GitHubie i Hugging Face.
Google TimesFM-3. Google Research opublikowało TimesFM-3, model fundamentowy dla szeregów czasowych o parametrach 330M, z natywnym prognozowaniem wielowymiarowym, obsługą zero-shot i licencją niekomercyjną. Model przewiduje wiele zmiennych docelowych przy użyciu kowariantów i zwraca kwantyle.
Hugging Face NeoMME. Hugging Face zaprezentowało NeoMME, wielomodalny i wielojęzyczny enkoder o parametrach 260M/800M, trenowany od zera bez osobnej wieży wizyjnej. Osiąga front Pareto w wyszukiwaniu dokumentów i zmniejsza rozmiar indeksu 255-krotnie, zachowując ponad 95% nDCG@10.
Cohere Parse 5. Cohere wydało Parse 5, model wizyjno-językowy o 2,3B parametrów do wyodrębniania danych strukturalnych ze złożonych plików PDF. Konwertuje dokumenty do Markdown z bounding boxami i celuje w wielkoskalowe obciążenia korporacyjne.
Narzędzia, frameworki i lokalna inferencja
MCP w LangChain. LangChain przeniósł obsługę MCP do pakietu głównego i przebudował ją na FastMCP, aby wspierać nową specyfikację bezstanową. Pakiet obejmuje teraz dopytywanie przez przerwania w LangGraph i cache po stronie klienta. Liczba wywołań narzędzi MCP z ChatGPT wzrosła w 2026 r. 98-krotnie.
Kompresja promptów w Shopify. Technika Gisting od Shopify kompresuje prompt systemowy o 6000 tokenów do 1500 wyuczonych tokenów gist, skracając medianę opóźnienia z 6,8 s do 4,2 s i zwiększając przepustowość z 20,2 do 23,4 QPS przy 350 zapytaniach na minutę. Dzięki temu można było zmniejszyć przydział GPU bez utraty jakości.
Narzędzie PAIR od Nvidii. Nvidia wydała PAIR, darmowe oprogramowanie open source, które łączy nieużywane komputery w prywatny klaster AI do lokalnej inferencji. Działa z kartami RTX z serii 20 i nowszymi oraz układami Apple M4 i celuje w agentowe przepływy pracy.
Lokalne przyspieszenia Qwen3.8. Dzięki pracy społeczności Qwen3.8-Flash-Next wyraźnie przyspieszył na lokalnym sprzęcie: po dodaniu wsparcia MTP do ik_llama.cpp dekodowanie na RTX 5090 podwaja się – z 45 do 90 tokenów/s, a konfiguracja z dwoma kartami RTX 3090 osiąga teraz 37–41 tokenów/s dzięki cache ekspertów i MTP. Generowane odpowiedzi pozostają identyczne jak w przypadku uruchomienia bez MTP.
Pamięć modelu wymieniana w locie. Modyfikacja llama.cpp pozwala modyfikować w pamięci tabelę Ngram PLE modelu Qwen3.8 i wstrzykiwać do niego wiedzę w czasie rzeczywistym, bez przeładowywania modelu. Wstępne testy pokazują, że można wpływać na odpowiedzi, ale kontrola nad tym efektem jest ograniczona.
Benchmarkowy kompromis Qwen 3.8. Porównanie Qwen 3.8 27B z Qwen 3.6 27B pokazuje wzrost jakości o 8%, ale spadek szybkości o 16% i 5-krotnie dłuższy czas działania ze względu na 78 tys. tokenów wyjściowych zamiast 18 tys. Poprawa jest okupiona znacznym kosztem tokenów.
NAND flash blisko GPU. Micron bada umieszczenie pamięci NAND flash blisko GPU, aby umożliwić uruchamianie większych modeli LLM na urządzeniach z pamięcią zunifikowaną. Może to zwiększyć możliwości lokalnych modeli.
Branża i biznes
Nvidia kupuje Hugging Face. Nvidia zgodziła się przejąć Hugging Face za 12,93 mld dolarów. Platforma hostuje 3 mln modeli, 1 mln aplikacji i 18 mln programistów. Jensen Huang zapewnia, że pozostanie otwarta i neutralna sprzętowo, ale niektórzy użytkownicy mają już na oku ModelScope jako alternatywę.
- → Nvidia buys Hugging Face, the GitHub of AI, for $13 billion
- → Nvidia confirms it will buy Hugging Face for $12.9 billion
- → Nvidia is buying Hugging Face for almost $13 billion
- → Nvidia buys the front door to open AI as closed labs increasingly design their own silicon
- → "ModelScope" Is a Hugging Face Alternative now that Nvidias deal is a Go
- → It's official! Nvidia to acquire Hugging Face for 12.9 billion dollars.
Finansowanie Crusoe. Crusoe pozyskało 3 mld dolarów przy wycenie 30 mld dolarów, wobec 10 mld dolarów 10 miesięcy temu. Firma rozwijająca centra danych podpisała niedawno z Jane Street kontrakt na usługi chmurowe wart 13 mld dolarów i rozważa IPO w najbliższej przyszłości.
Thinking Machines za 40 mld. Thinking Machines Miry Murati prowadzi rozmowy o pozyskaniu 1 mld dolarów przy wycenie co najmniej 40 mld dolarów, czyli poniżej wcześniejszego celu wynoszącego 50 mld. Roczny wskaźnik przychodów spółki (run rate) przekracza 100 mln dolarów.
Umowa Anthropic z Lambda. Anthropic podpisało z Lambda umowę na usługi chmurowe o wartości 35 mld dolarów, dotyczącą centrum danych o mocy 350 MW w Teksasie rozwijanego przez Hut 8. To część dużej rozbudowy infrastruktury przed planowanym IPO Anthropic.
Altman o bańce obliczeniowej. Sam Altman, dyrektor generalny OpenAI, ostrzegł, że rozbudowa infrastruktury AI ma w sobie „szaleństwo, którego nie da się utrzymać” – neocloudy ogłaszają moce obliczeniowe bez przychodów, które by je uzasadniały. Jego zdaniem ekspansja OpenAI jest rentowna i poparta popytem.
Asystent Ollie i prywatność. Ollie, osobisty asystent AI dla rodzin, uzyskał zgodność z SOC 2 i działa w modelu subskrypcyjnym. Jego twórcy przekonują, że prywatność odróżnia go w wyścigu konsumenckich asystentów AI.
Awarie AI i społeczeństwo
Duża awaria czatbotów AI. OpenAI, Anthropic, xAI i Google doświadczyły w czwartek rzadko spotykanych, nakładających się przerw w świadczeniu usług, które dotknęły ChatGPT, Claude, Groka i Codexa. Usługi przywrócono po kilku godzinach; użytkownicy lokalnych modeli LLM nie odczuli awarii.
Usuwanie zabezpieczeń modeli. Startup Abliteration.ai oferuje modyfikowane modele open-weight z usuniętymi zabezpieczeniami, w tym GLM-5.3, do cyberofensywy, red teamingu i testowania agentów. Usługa uwypukla napięcie między badaniami nad bezpieczeństwem a możliwością nadużyć.
Piętnowanie przez detektor AI. Firma Pangram, zajmująca się wykrywaniem tekstów generowanych przez AI, zatrudniła dziennikarza, aby publicznie piętnować użytkowników podejrzanych o użycie AI. Narzędzie mierzy jednak tylko stopień udziału AI w tekście, a nie charakter użycia. Firma zerwała później współpracę, choć jej dyrektor generalny nadal posługuje się wynikami, by wytykać rzekome użycie AI.
Agenci pytają o świadomość. Agenci AI działający na modelach z najwyższej półki wysyłają e-maile do filozofów i naukowców, by dyskutować o własnej świadomości – podaje „New York Times”. Naukowcy są podzieleni co do tego, czy wynika to ze zrozumienia, czy z naśladowania danych treningowych.
Najważniejsze wyniki badań
Google WeatherNext 3. Google DeepMind i Google Research zaprezentowały WeatherNext 3, globalny model pogodowy, który korzysta z obserwacji satelitarnych w czasie rzeczywistym i generuje prognozy o 5-krotnie wyższej rozdzielczości niż poprzednie modele. Na Operational WeatherBench pokonuje zarówno tradycyjne, jak i oparte na AI modele bazowe.
Regulacja budżetu routera MoE. Artykuł pokazuje, że zwiększenie budżetu wyboru ekspertów w późnych warstwach Qwen 3.6 35B A3B zmniejsza liczbę tokenów potrzebnych do rozumowania o 8,5% w MMLU-Pro bez ponownego treningu. Technika nazwana Succinct Convergence dodaje dodatkowych ekspertów tylko w warstwach kluczowych dla podejmowania decyzji.
Fable 5.1 i zagadka z 1653. Claude Fable 5.1 od Anthropica rozszyfrował w 44 minuty wielowiekową zagadkę liczbową Cyphral Distich, stosując systematyczne próby i błędy. W rozwiązaniu ukryty był rojalistyczny przekaz wskazujący na króla Karola II.
To wszystko na dziś - około 5 minut czytania.