Modele decyzyjne i structured output
Jev i modele decyzyjne. TypeSafe AI udostępniło Jev — model wyłącznie decyzyjny, który zwraca typowane prawdopodobieństwa. W ciągu kilku dni AWS, Cloudflare i Perplexity wypuściły własne otwarte modele decyzyjne. Stosowane już structured output i wymuszanie gramatyk dają podobny efekt: generację z ograniczeniami.
- → TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text
- → Amazon releases its own Jev clone as decision models flood the web
- → Clef: Open Weights decision model by Cloudflare
- → Perplexity Decider 27B: Open weights decision model fine tune of Qwen3.8 27B
- → Guys... OpenAI API on VLLM and Llamacpp already supported grammar enforcer... (AKA JEV)
Lokalne LoRA decyzyjne. Jeff-Qwen3.5-0.8B z dziewięcioma adapterami LoRA obsługuje powtarzalne decyzje agenta, takie jak prompt injection i wybór narzędzi, z 38-krotnym przyspieszeniem i dokładnością wyższą o 8,7 pkt, zużywając przy tym poniżej 2 GB dodatkowej pamięci.
Agenci i premiery produktów
Dots od OpenAI kontra Muse. OpenAI ogłosiło Dots — przesłodzonego agenta opartego na GPT-6 Astra, który potrafi budować wirtualne światy. Na razie jest jednak dostępny tylko w planie za 1 dol. miesięcznie i konkuruje z darmowym Muse od Meta.
Canvas od Shopify. Shopify uruchomił Canvas, który pozwala sprzedawcom budować sklepy w rozmowie z AI Sidekick, z renderowaniem prawdziwego kodu na żywo.
Wirtualna przymierzalnia w ChatGPT. OpenAI dodało do zakupów w ChatGPT wirtualne przymierzanie i dodawanie do ulubionych, wykorzystując model Images 2.5 do wizualizacji ubrań na zdjęciach użytkownika.
Awatar Griffin od Tavus. Tavus zaprezentował Griffin, model awatara wideo działający w czasie rzeczywistym; 48% badanych uznało go za człowieka podczas minutowej rozmowy.
Pogrzeb aplikacji od Photon. Photon urządziło pogrzeb aplikacjom mobilnym i pozyskało 4,5 mln dol. na narzędzia dla deweloperów budujących agentów opartych na komunikatorach — iMessage i WhatsApp.
Otwarte modele i AI lokalnie
Gemini 4 Argon. Google DeepMind przedstawiło Gemini 4 Argon z wynikami SOTA i do 1 mln tokenów wyjściowych, na start tylko w podglądzie dla cyberbezpieczeństwa.
Otwarta rodzina K2 Horizon. IFM wypuściło K2 Horizon — sześć otwartych modeli od 0,9B do 375B parametrów, wraz z danymi treningowymi, kodem i logami; zespół prowadzi AMA o otwartym rozwoju.
Qwen Flash Next z MTP. llama.cpp scalił obsługę multi-token prediction dla Qwen Flash Next, co przyspiesza wnioskowanie.
Slipstream na Maca. Slipstream, silnik wnioskowania oparty na Metal, uruchamia Qwen3.8-Flash-Next o rozmiarze 95,5 GiB na Macach z 64 GB pamięci, osiągając 41–52 tok./s — 1,76 razy szybciej niż llama.cpp i przy stabilnym długim kontekście.
Olmo-core 3. Allen AI udostępniło Olmo-core 3 — otwartą, skalowalną infrastrukturę treningową dla modeli MoE o bilionie parametrów.
Badania i benchmarki
Ataraxos ogrywa Stratego. Badacze z CMU, MIT, NYU i Stanforda zbudowali Ataraxos, który pokonał najlepszego gracza w Stratego 15:1 przy czterech remisach, kończąc ludzką dominację w tej grze; trening kosztował poniżej 8 tys. dol.
Agentowy RAG górą. Benchmark 18 pipeline'ów RAG kontra pętla agentowa na FRAMES: najlepszy pipeline 78,9%, pętla agentowa 92,7% — agenci wyszukiwania wypadają lepiej niż sztywne pipeline'y.
AutoSynthData. ServiceNow CoreAI zbudowało AutoSynthData, które generuje dane treningowe z błędów modeli i sukcesów nauczyciela, poprawiając agentów korporacyjnych.
Jak poznać tekst AI. Graphite znalazł 13 tys. fraz zdradzających teksty pisane przez AI; modele Claude zbliżają się do ludzkiego rozkładu słów, a GPT się od niego oddala.
Branża, polityka i bezpieczeństwo
Pozwy przeciw Google oddalone. Sędzia oddalił pozwy Chegg i Penske, które twierdziły, że AI Overviews od Google nielegalnie odbiera im ruch; zarzuty antymonopolowe się nie obroniły.
Grok przed inwazją na Wenezuelę. Według Time Trump spędził godziny na rozmowach z Grokiem przed inwazją na Wenezuelę; Grok przewidywał, że mieszkańcy będą świętować, co tylko utwierdziło Trumpa w jego przekonaniu.
OpenAI żegna badaczy bezpieczeństwa. OpenAI rozstało się z trzema badaczami bezpieczeństwa; powodem miało być przekazanie poufnych informacji zewnętrznej organizacji zajmującej się bezpieczeństwem AI.
Anthropic wchodzi do rządu. Anthropic uruchomiło Claude for Government dla agencji cywilnych w środowisku FedRAMP High; zakaz z Pentagonu wciąż obowiązuje w trakcie sporu prawnego.
Centra danych w kosmosie. Google wystrzeliło prototypowego satelitę obliczeniowego z TPU; Satlyt pozyskał 8 mln dol. na oprogramowanie dla AI na satelitach, a do skalowania potrzebny będzie Starship.
Wyciek zrzutów od agentów. Glow Security wykryło ponad 13 tys. wewnętrznych zrzutów ekranu, które agenci AI wgrali do publicznych repozytoriów na GitHubie, ujawniając dane klientów i poświadczenia.
Kradzież rozumowania przez destylację. OpenAI twierdzi, że zatrzymało wrogą kampanię destylacji wymierzoną w chronione rozumowanie; ten sam trik wciąż działał w Azure.
To wszystko na dziś - około 5 minut czytania.