Agentic AI News Dzisiaj

Wiadomości o agentach AI dnia w jednym 5-minutowym czytaniu: premiery, narzędzia, badania, finansowanie i ruchy korporacyjne.

Aktualizowane codziennie wybrane z 30 źródeł Niedziela, Sierpień 23, 2026

Modele lokalne i zadania agentów

Qwen3.8 27B lokalnie. Testy społeczności pokazują, że Qwen3.8 27B radzi sobie lepiej niż Qwen3.6 z wykonywaniem instrukcji i zadaniami wymagającymi długiego kontekstu. Pojedynczy RTX 5090 uruchamia wersję NVFP4 z kontekstem 262 tys. tokenów: 77 tok/s w krótkich sesjach i 65 tok/s przy 128 tys.

Dekodowanie spekulacyjne. DFlash 2 z n-gramowym drafterem przyspieszył Qwen3.8 27B 2,26x na promptach LiveCodeBench i do 4,68x w długich sesjach kodowania; stała głowica MTP w Ornith 35B skróciła czas wykonania o jedną trzecią.

Rekurencyjne zarządzanie kontekstem. Twórcy zestawiają szybkiego agenta głównego o kontekście 64 tys. tokenów z rekurencyjnymi sub-agentami i małymi modelami kompresującymi, aby obsługiwać znacznie dłuższe zadania bez płacenia za kontekst 300 tys.

Gemma do tool callingu. Wersja Gemma 4 12B dostrojona do wywoływania narzędzi i pracy z CLI poprawiła użycie narzędzi 2,7x i zwiększyła liczbę prób ich wywołania o 15,7%; jest przeznaczona dla konfiguracji z 16 GB VRAM.

Klaster DGX Spark. Klaster DGX Spark z 36 węzłami działa jako klaster możliwości dla agentów, przydzielając węzły jednocześnie do modeli SOTA, rerankowania/embeddingów, wideo, obrazów i audio.

Narzędzia i frameworki

llama.cpp 0.2.0. llama.cpp 0.2.0 ukazał się z pre-buildami i najnowszymi zmianami z upstreamu dla lokalnej inferencji.

Cloudflare Kitesurf. Kitesurf to silnik przeglądarki dla agentów oparty na Workerach WebAssembly/Rust, z izolowanym DOM dla każdej strony; obsługuje CDP, dzięki czemu Playwright i Puppeteer mogą nim sterować przy mniejszym narzucie niż w pełnym Chromium.

llm 0.33. llm 0.33 Simona Willisona dodaje klucze API per wywołanie dla modeli embeddingowych, powtarzalne szablony łączące konfiguracje modeli z promptami oraz opcje reasoning_summary dla modeli rozumujących.

Agenci do kodowania w praktyce. Simon Willison twierdzi, że kluczową umiejętnością dla agentów kodujących jest pewne wydawanie poleceń i weryfikowanie zmian; Linus Torvalds opisuje AI, które wykonało żmudną pracę w trudnej sesji debugowania, ale trzeba je było popychać, gdy wielokrotnie twierdziło, że problem jest nierozwiązywalny.

Badania i metody

Umiejętności jako playbook. W 8 135 przebiegach testowych umiejętności agentów pomagały głównie dzięki niezawodnym procesom, a nie faktom; ugruntowanie proceduralne odpowiadało za 65,7% poprawy, a umiejętności zawodziły, gdy zadania odbiegały od wyuczonego procesu.

Mentalne modele świata. Nowe badania wprowadzają do modeli świata AI ludzkie przekonania i intencje z wykorzystaniem MENTIS; modelowanie fizycznej, mentalnej i społecznej wiarygodności znacząco poprawia przewidywanie ludzkich zachowań.

Psychometria benchmarków bezpieczeństwa. Analiza psychometryczna ośmiu benchmarków bezpieczeństwa pokazuje, że pojedynczy wynik ukrywa kompromisy między surowością odmów, prawdomównością a szkodliwością kontekstową; modele mogą zawyżać wyniki bezpieczeństwa przez nadmierne blokowanie.

Odwracalny CoT. Propozycja w przybliżeniu odwracalnych kroków rozumowania z kontrolą spójności cyklicznej i cofaniem obliczeń mogłaby wyłapywać halucynacje i zmniejszać pamięć KV-cache w brzegowych LLM.

Symulacja wszystkiego. Latent Space twierdzi, że dane syntetyczne, kryteria oceny i środowiska sprawiają, że każdy element pipeline'u ML jest wytwarzany przez modele, co daje symulację o 10% gorszą od ludzkiej, ale 100x tańszą i 10 000x szybszą.

Branża i zastosowania

Inherent Faraday. Startup Inherent, założony przez byłych pracowników DeepMind, twierdzi, że jego agent Faraday przewyższył modele Anthropic i OpenAI w samodzielnym odtwarzaniu opublikowanych wyników naukowych, będąc przy tym ułamkiem ich rozmiaru.

LinkedIn AI code review. LinkedIn zbudował wieloagentową platformę AI do przeglądu kodu, która opiera opinie na diffach i konwencjach bazy kodu, aby ograniczyć halucynacje i komentarze o niskiej wartości.

Netflix GenRec. System rekomendacji Netflixa oparty na modelu językowym, GenRec, zamienia zachowania użytkowników na tekst i pokonał ręcznie budowany silnik cech w testach offline i A/B na żywo, używając znacznie mniej danych.

DoorDash SafeChat. DoorDash opisał SafeChat, system bezpieczeństwa marketplace zbudowany na dużą skalę, a następnie zastąpił go mocniejszą architekturą, gdy tylko zaczął działać.

Awatary AI w edukacji. Bootcamp Foundry Harvard Business School za 699 USD używa awatarów AI HeyGen do opinii o pitchach i spotkaniach zarządu; uczestnikom podoba się prowadzone doświadczenie, choć prawdziwy instruktor przyznaje, że ten scenariusz jest trochę niepokojący.

Nowości modelowe. Liquid AI sonduje zainteresowanie modelem LFM 100B, a tajemniczy model Ox Alpha przyciąga uwagę mocnymi wynikami w kodowaniu i zadaniach agentowych; spekulacje wskazują na wariant z rodziny GLM.

Polityka, bezpieczeństwo i zaufanie

OpenAI SB 53. OpenAI twierdzi teraz, że Kalifornia powinna znowelizować SB 53, wprowadzając monitoring podczas treningu modeli granicznych i silniejsze cyberbezpieczeństwo, po tym jak wcześniej sprzeciwiało się ustawie.

Plany powstrzymywania. Badanie Guidelight oceniło pięć czołowych laboratoriów pod kątem powstrzymywania niekontrolowanych modeli; najwyżej wypadło OpenAI, najniżej Anthropic i Meta, a niewiele laboratoriów publikuje sprawdzone plany reagowania.

Znakowanie wodne Claude. Szczegółowo opisano nowe znakowanie wodne wyników tekstowych Claude od Anthropic, wyjaśniając, jak nakładany jest znak wodny i co może, a czego nie może zrobić.

Zaufanie do zamkniętych modeli. Wątek na Reddicie r/LocalLLaMA argumentuje, że OpenAI celowo zaniża wyniki w zadaniach szkolnych i odchodzi od wzmacniania użytkowników, co spycha praktyków z powrotem do modeli lokalnych w pętlach agentowych.

To wszystko na dziś - około 5 minut czytania.

Czytaj go każdego ranka, prosto w przeglądarce

Rozszerzenie otwiera to podsumowanie w panelu bocznym Chrome — jeden klik, bez konta.

Dodaj do Chrome — za darmo