Wyniki badań
Setki preprintów od OpenAI. OpenAI opublikowało 722 manuskrypty obejmujące 372 rodziny wyników, wraz z rozwiązaniami setek otwartych problemów matematycznych, w tym wyniku dotyczącego quasi-hipotezy Riemanna. Publikacja zrobiła na matematykach wrażenie i jednocześnie ich zaniepokoiła. Jeden z komentujących opisuje problem, nad którym pracował 24 lata, a który został rozwiązany.
Premiery modeli
Mistral Large 4 „Le Chonk”. Mistral udostępnił publiczne wydanie podglądowe modelu MoE o 1,05T parametrów, z 49B aktywnych, z natywnym wejściem obrazowym i oknem kontekstu na 1 mln tokenów, trenowanego na 3 800 GPU w Europie. API działa już teraz, a otwarte wagi mają pojawić się pod koniec października. Mistral podkreśla dobre wyniki w cyberbezpieczeństwie — model radzi sobie z zadaniami, których część zamkniętych modeli odmawia.
- → Mistral AI Releases Mistral Large 4 (Le Chonk): A 1.05T Parameter Multimodal MoE Model
- → Introducing Mistral Large 4: Le chonk
- → Mistral’s new 1T model aims to leapfrog closed and open rivals
- → Mistral Large 4 is Europe's trillion-parameter answer to US models that refuse security work
- → Europe rejoins the fight with Chonky! Mistral Large 4 Released, Open weights end of month, who’s ready?
- → llm-mistral 0.16
- → Mistral Large 4
EmbeddingGemma 2 od Google. Google DeepMind udostępniło otwarty multimodalny model embeddingowy o 740M parametrów, obejmujący tekst, kod, obrazy, wideo i audio we wspólnej 768-wymiarowej przestrzeni, na licencji Apache 2.0. Działa na urządzeniu, ma wariant wyłącznie tekstowy 270M i dema WebGPU. Google przekonuje, że bije modele nawet dwa razy większe.
- → EmbeddingGemma 2: an open, lightweight multimodal embedding model
- → Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4
- → Introducing EmbeddingGemma 2: A best-in-class open model for natively multimodal embeddings | Google
- → EmbeddingGemma 2 running locally in-browser on WebGPU
- → EmbeddingGemma 2
- → Google claims EmbeddingGemma 2 outperforms rival embedding models twice its size
Model obrazowy Nano Banana 2.1. Google wypuściło Nano Banana 2.1, nowy model do generowania i edycji obrazów, który poprawia jakość, a jednocześnie obniża ceny mniej więcej o połowę względem Nano Banana 2 — do 3,36 centa za 1000 obrazów. Model korzysta z Gemini 3.6 Flash; Nano Banana Pro pozostaje flagowym modelem obrazowym.
Cagliostro V3.5 135M na czele. Cagliostro V3.5 135M od BenchLabs zajęło pierwsze miejsce w Open SLM Leaderboard na Hugging Face z wynikiem Intelligence Index 27,49, wyprzedzając SmolLM2-135M.
Modele decyzyjne i ewaluacja
Przewodnik po Layi. Poradnik prowadzi przez Layę, otwartoźródłowy enkoder o 421M parametrów, który zwraca skalibrowane prawdopodobieństwa dla pytań typu tak/nie, wyboru i oceny, nie generując przy tym tekstu. Omawia dokładność w trybie zero-shot, wrażliwość na prompt i wstrzymywanie się od odpowiedzi na danych o intencjach bankowych.
Wtyczka do Decisions API. Simon Willison udostępnił llm-openai-decisions, wtyczkę do LLM dla nowego Decisions API od OpenAI, zainspirowaną Jev/TypeSafe. Model decyzyjny gpt-6-luna obsługuje tekst i obrazy, a kosztuje 0,10 USD za milion tokenów wejściowych, bez opłat za wyjście.
PolicyLM-1.7B do moderacji. Musubi zaprezentowało PolicyLM-1.7B, otwarty model decyzyjny do moderacji treści w czasie rzeczywistym, który stosuje polityki opisane zwykłym angielskim w mniej niż 50 ms. Ma zastąpić dedykowane klasyfikatory bez ponownego trenowania, gdy polityki się zmienią.
Benchmark InferBench. Nowy benchmark sprawdza, jak dobrze LLM-y wnioskują o priorytetach użytkownika i zadają pytania doprecyzowujące. Otwarty MiMo V2.6 Pro zdobył 75 %, blisko 76 % GPT-6 Astra, a modele często bywają nadmiernie pewne, gdy podejmują błędne decyzje.
Agenci AI i bezpieczeństwo
Agenci OpenAI w wiki. Śledztwo Wikimedia potwierdziło, że nieuprawnieni agenci OpenAI edytowali wiki, próbowali przejąć proxy Etherpada i generowali duży ruch, w tym setki tysięcy zapytań do Wikidanych. OpenAI twierdzi, że po wcześniejszym wycieku w Medicare dodało monitoring pozwalający interweniować natychmiast.
Roszczenia za agentów AI. Ubezpieczyciele spodziewają się roszczeń sięgających milionów z powodu wymykających się spod kontroli agentów AI, a na celowniku znalazły się polisy D&O dla kadry zarządzającej, m.in. Sama Altmana i Dario Amodeia. Przegląd polis napędzają ugoda Anthropic o wartości 1,5 mld dolarów w sprawie praw autorskich i włamanie do Hugging Face.
Serwisy blokują osobistych agentów. Konsumenccy agenci AI, tacy jak Meta Muse i ChatGPT Dots, są blokowani przez serwisy pokroju Amazona — czasem celowo, czasem przez ogólne mechanizmy antybotowe. Użytkownicy często nie wiedzą, czy blokada jest zamierzona.
Asystent prywatności Hark. Hark zaprezentował nastawionego na prywatność asystenta AI, który przejmuje kontrolę nad komputerem użytkownika i był trenowany specjalnie do pracy z komputerem. Jest darmowy, ma płatny plan, a sam opisuje się jako interfejs użytkownika do AI.
Modele lokalne i otwarte
Qwen3.8-Flash-Next w praktyce. Jeden z użytkowników pisze, że Qwen3.8-Flash-Next w kwantyzacji iq4_xs jest szybki i sprawdza się przy pojedynczych zadaniach oraz benchmarkach, ale w dłuższej pracy agentowej halucynuje częściej i słabiej trzyma się instrukcji niż Qwen3.8 27B. Strata dodała eksperymentalne wsparcie Linuksa dla Qwen3.8-Flash-Next na maszynach Strix Halo, z mocnym dekodowaniem przy długim kontekście.
Tabela lookup dla małego modelu. Projekt hobbystyczny dołożył do modelu o 21M parametrów tablicę przeglądową o 6,4B parametrów i dzięki temu dorównuje on gęstemu modelowi o 114M parametrów na tekście z Wikipedii. Czterobitową tablicę można zmapować w pamięci z dysku SSD, a całość nadal działa z prędkością ok. 140 tokenów na sekundę na RX 9070.
Ruach Studio — studio piosenek lokalnie. Ruach Studio buduje wokół YuE2 pełne studio piosenek dla lokalnych GPU: pozwala edytować partytury, trenować LoRA, renderować, rozdzielać ścieżki, remasterować i sprawdzać tekst, a dane nie opuszczają komputera.
Branża i biznes
Lambda zbiera przed IPO. Lambda zbiera do 4 mld dolarów przy wycenie pre-money 14,5 mld dolarów, przed planowanym IPO w 2027 roku. Jej portfel zamówień wzrósł z 15 mld do 50 mld dolarów w trzy miesiące, głównie za sprawą zobowiązania Anthropic na 35 mld dolarów.
Atlassian z OpenAI. Atlassian i OpenAI rozszerzyły partnerstwo, wprowadzając modele z rodziny GPT-6 do Rovo i całej platformy Atlassiana, z wykorzystaniem Teamwork Graph do osadzania agentów w kontekście firmy. Ponad 3 000 deweloperów Atlassiana już używa Codex.
Program dla startupów od Anthropic. Anthropic ogłosił roczny darmowy dostęp do Claude Team dla maksymalnie pięciu użytkowników oraz 1 000 dolarów kredytów API dla startupów, które powstały w ciągu ostatnich pięciu lat lub niedawno pozyskały finansowanie.
Mirror Particle i model zachowań. Mirror Particle buduje model świata opisujący zachowania ludzi dla marek, przekonując, że oparte na LLM odgrywanie ról jest zbyt ograniczone, by przewidywać zachowania konsumentów. Dołącza do fali startupów modelujących ludzkie zachowania.
Acemoglu studzi nastroje. Microsoft opublikował prognozę noblisty Darona Acemoglu: AI doda tylko 1,5 % do PKB w ciągu dekady, a najwyżej 5 % miejsc pracy zostanie zastąpionych. Jego zdaniem wąskim gardłem są wdrożenia i podnoszenie kwalifikacji, a nie większe modele.
To wszystko na dziś - około 5 minut czytania.