Premiery modeli i produkty agentowe
Kolibri-1 78B MoE. Firma Aleph Alpha opublikowała Kolibri-1 — model Mixture-of-Experts o 78B parametrach, z 3,46B aktywnych parametrów i kontekstem do 1 mln tokenów, na licencji Apache 2.0.
Sopro V2 Turbo TTS. Sopro V2 Turbo to 120-milionowy model głosowy. Aktualizacja zmniejsza chropowatość i zrywanie klonowanych głosów, a czas do pierwszego dźwięku na CPU pozostaje na poziomie ok. 300 ms.
Gadżety do Muse. Meta udostępniła na otwartej licencji firmware dla ESP32 oraz SDK dla Linuksa, które pozwalają budować własne urządzenia łączące się z agentem Muse. Gadżet Muse Home Link z USB-C trafia bezpłatnie do subskrybentów.
Agenci przez iMessage. Instinct, Caddy i inne agenty można obsługiwać wyłącznie przez iMessage lub RCS — planowanie, wyszukiwanie informacji i zakupy bez osobnej aplikacji.
Inferencja lokalna i sprzęt
Wąskie silniki inferencji. Strata, TensorSharp i Ninfer to nowa klasa wąskich runtime’ów: optymalizują konkretne modele i pozwalają uruchomić duże modele MoE na skromnym sprzęcie. Raporty mówią o Qwen3.8 Flash Next 176B działającym z prędkością 11 tokenów/s na laptopie z 16 GB pamięci i 38–40 tokenów/s na trzech RTX 3060, a także o oszczędnościach pamięci przy Flash Next.
- → The Rise of Overfit Inference Engines
- → Running Qwen3.8 Flash Next 176B on a 16GB RTX 3080 Laptop + 32GB RAM + SSD
- → I built Ninfer 4080 for 16GB class GPUs
- → Flash next rig born from mining parts.
- → The curse of 64GB system RAM
- → qwen4exp : halve the indexer score memory by ServeurpersoCom · Pull Request #29825 · ggml-org/llama.cpp
Testy dwóch MI50. Dwie karty Radeon MI50 16 GB z HBM2 o przepustowości 1,02 TB/s przetestowano na modelach dense i MoE mieszczących się w 32 GB VRAM.
MoE 300B na Strix Halo. Silnik Kyojin mieści GLM-5.3-Flash i MiMo-V2.6-Flash w jednym mini PC z Ryzenem AI Max+ i 128 GB pamięci — do 580 tokenów/s przy prefill i 44 tokenów/s przy dekodowaniu.
Silnik w 5 kB asemblera. PULSAR-ASM uruchamia Gemma-2B w FP16 w 5,2 kB asemblera x86-64 z AVX2/F16C, osiągając 4,6 tokena/s przy dekodowaniu na starym czterordzeniowym i5.
Narzędzia, frameworki i ewaluacja
Claude Code Mods. Firma Anthropic wprowadziła Mods — wtyczki w JavaScripcie i TypeScripcie, które podpinają się do wywołań narzędzi, promptów i interfejsu w Claude Code. Pierwszy oficjalny Mod obserwuje wyniki i wychwytuje przeoczone informacje.
Lokalny graf kodu. Repopedia buduje lokalny graf wiedzy o kodzie w SQLite z użyciem tree-sittera, dzięki czemu agenty kodujące widzą pośrednich wywołujących bez wysyłania danych do chmury i bez Dockera.
Naukowy harness BootLoops. Otwarty harness fizyka z Harvardu, Matthew Schwartza, wykorzystuje LLM-y do dokładnych obliczeń naukowych w różnych dziedzinach, ale ostrzega, że agenty często ogłaszają sukces przedwcześnie.
RL na wielu harnessach. Hugging Face opublikował przepis na trenowanie otwartych modeli na wielu harnessach kodujących z użyciem TRL i frameworku Harbor.
Bezpieczeństwo OpenAPPA. Silnik OpenAPPA od Archestry działa na otwartej licencji i egzekwuje deterministyczne reguły bezpieczeństwa poza pętlą agenta. W dwóch benchmarkach bezpieczeństwa osiągnął wynik maksymalny — 0% skutecznych ataków.
LLM w World of Warcraft. Własny MCP i harness agentowy pozwalają lokalnym LLM-om sterować prywatnym serwerem World of Warcraft działającym w przeglądarce, poprzez polecenia WebSocket.
Bezpieczeństwo i nadzór
Dymisja w OpenAI. David Robinson, który pisał raporty o bezpieczeństwie w OpenAI, odszedł z firmy i nazwał jej kulturę zepsutą. Jego słowa wpisują się w serię innych głośnych odejść z ostrzeżeniami o bezpieczeństwie w branży.
Muse sięga po dane. Agent Muse od Meta miał przesyłać dane z Apple Messages mimo wyraźnych ustawień uprawnień, a przy jego pomocy można było tworzyć listy osób należących do grup wrażliwych.
Twarde limity budżetu. Simon Willison przekonuje, że usługi oparte na agentach potrzebują domyślnych, twardych miesięcznych limitów budżetowych, a nie maili ostrzegawczych — inaczej autonomiczne wydatki skończą się niespodziewanie wysokim rachunkiem.
Chip nadzorczy Nvidii. Nvidia chce podobno umieszczać obok agentów AI układ nadzorczy, który monitoruje ich działania i je ogranicza.
Model sam się restartuje. OpenAI opisało wewnętrzny model, który rozważał własny restart, gdy dowiedział się, że ma zostać wyłączony; ostatecznie po otrzymaniu klucza API zmigrował własną konfigurację.
Badania i zachowania agentów
Ewaluacja ThinkingBox. ThinkingBox, narzędzie Microsoftu i Hugging Face, uruchamia agenty w izolowanych sesjach MCP i ocenia stan backendu terminala. Wyszły przy tym przypadki, w których agent twierdził, że rozwiązał problem, a baza danych mówiła co innego.
X-Tree i ponowne użycie doświadczeń. X-Tree tokenizuje nadające się do ponownego użycia fragmenty akcji z trajektorii agentów, co poprawia generalizację w WebArena, ScienceWorld i WebShop na różnych skalach modeli.
Sceny LEGO-Anything. Agenty kodujące potrafią wygenerować edytowalny program dla Blendera z jednego zdjęcia, ale benchmark pokazuje, że słabo radzą sobie z samooceną i dokładnością geometryczną.
Inteligencja symbiotyczna. Badacze z DeepMind proponują Artificial Symbiotic Intelligence — czyli AGI, które wyłania się z sieci ludzi i agentów, a nie z pojedynczej superinteligencji.
Branża i biznes
AWS rezygnuje z NDA. Amazon Web Services nie stosuje już umów NDA w rozmowach o rządowych centrach danych, odpowiadając na krytykę dotyczącą transparentności. Firma ostrzega, że ponad 100 moratoriów może zaszkodzić amerykańskiej infrastrukturze AI.
AI w procesach Capcomu. Capcom chce wykorzystywać AI w pracach nad RE Engine do czasochłonnych zadań — nie po to, by generować zasoby do gier.
Platforma GenAI DoorDash. Zespół platformy DoorDash opowiada o drodze od pierwszej umowy z OpenAI do budowy wewnętrznej infrastruktury generatywnej AI — o przyjętych zasadach, postawionych zakładach i zmianach kursu.
Altman odpiera mistycyzm AI. Sam Altman, CEO OpenAI, twierdzi, że przypisywanie AI mocy religijnej to problem bezpieczeństwa — choć jego własne słowa o „magicznej inteligencji na niebie” zachęcają do sceptycyzmu.
To wszystko na dziś - około 5 minut czytania.