Yerel Modeller ve Ajan İş Yükleri
Yerel Qwen3.8 27B. Topluluk testleri, Qwen3.8 27B'nin talimat takibi ve uzun bağlam çalışmalarında Qwen3.6'dan daha güçlü olduğunu gösteriyor; tek bir RTX 5090, NVFP4 sürümünü 262K bağlamla, kısa bağlamda 77 tok/s ve 128K'da 65 tok/s hızında çalıştırıyor.
Spekülatif decoding. DFlash 2, n-gram taslak modeliyle Qwen3.8 27B için LiveCodeBench prompt'larında 2,26x, uzun kodlama oturumlarında ise 4,68x'e varan hızlanma sağladı; Ornith 35B üzerindeki sabit MTP başlığı duvar saati süresini üçte bir oranında kısalttı.
Özyinelemeli bağlam yönetimi. Geliştiriciler, 300K bağlamın maliyetine katlanmadan çok daha uzun görevleri işlemek için hızlı bir 64K ana ajanı, özyinelemeli alt ajanlarla ve küçük sıkıştırıcı modellerle birleştiriyor.
Gemma araç çağırma ince ayarı. Araç çağırma ve CLI kullanımı için hazırlanan Gemma 4 12B ince ayarı, araç kullanımını 2,7 kata çıkarırken araç çağırma denemelerini %15,7 artırdı; 16GB VRAM'li sistemler hedefleniyor.
DGX Spark kümesi. 36 düğümlü bir DGX Spark kümesi, düğümleri SOTA modeller, rerank/embedding, video, görüntü ve ses işleri arasında bölerek bir ajan yetenek kümesi olarak çalıştırılıyor.
Araçlar ve Framework'ler
llama.cpp 0.2.0. llama.cpp 0.2.0 sürümü, yerel çıkarım için hazır derlemeler ve en son üst akış değişiklikleriyle yayınlandı.
Cloudflare Kitesurf. Kitesurf, WebAssembly/Rust Workers üzerine inşa edilmiş ve her sayfa için yalıtılmış DOM sunan, ajanlara yönelik bir tarayıcı motoru; CDP desteklediğinden Playwright ve Puppeteer, tam Chromium'a kıyasla daha az ek yük ile onu kontrol edebiliyor.
llm 0.33. Simon Willison'ın llm 0.33 sürümü, embedding modelleri için çağrı başına API anahtarları, model yapılandırmaları ile prompt'ları birleştiren tekrarlanabilir şablonlar ve akıl yürütme modelleri için reasoning_summary seçenekleri ekliyor.
Kodlama ajanı pratiği. Simon Willison, kodlama ajanları için asıl becerinin, değişiklikleri net biçimde istemek ve doğrulamak olduğunu savunuyor. Linus Torvalds ise zorlu bir hata ayıklama oturumunda angarya işleri yapan bir yapay zekayı anlatıyor; model sorunun çözülemez olduğunu defalarca iddia edince iteklenmesi gerekti.
Araştırma ve Yöntemler
Playbook olarak beceriler. 8.135 test çalıştırmasında, ajan becerileri asıl olarak gerçeklerden çok güvenilir süreçler sunarak işe yaradı; prosedürel temellendirme kazanımların %65,7'sini oluşturdu ve görevler öğrenilen süreçten saptığında beceriler başarısız oldu.
Zihinsel dünya modelleri. Yeni araştırma, MENTIS ile yapay zeka dünya modellerine insan inançlarını ve niyetlerini ekliyor; fiziksel, zihinsel ve sosyal akla yatkınlığı modellemek, insan davranışını tahmin etmeyi önemli ölçüde iyileştiriyor.
Güvenlik kıyaslaması psikometrisi. Sekiz güvenlik kıyaslamasının psikometrik analizi, tek bir puanın reddetme katılığı, doğruluk ve bağlamsal zarar arasındaki ödünleşimleri gizlediğini gösteriyor; modeller aşırı engelleyerek güvenlik puanlarını şişirebiliyor.
Tersinir CoT. Döngü tutarlılığı denetimleri ve hesaplamayı geri alma ile yaklaşık olarak tersinir akıl yürütme adımları önerisi, halüsinasyonları yakalayabilir ve uç LLM'lerde KV-önbellek belleğini azaltabilir.
Her şeyi simüle etme. Latent Space, sentetik veri, rubrikler ve ortamların ML hattının her bileşenini model kaynaklı hale getirdiğini ve bunun insan simülasyonuna %10 daha kötü ama 100 kat daha ucuz ve 10.000 kat daha hızlı yaklaştığını savunuyor.
Endüstri ve Uygulamalar
Inherent Faraday. DeepMind mezunlarının kurduğu Inherent girişimi, Faraday ajanının, yayımlanmış bilimsel bulguları bağımsız olarak yeniden üretmede, boyutu çok daha küçük olmasına rağmen Anthropic ve OpenAI modellerinden daha iyi performans gösterdiğini söylüyor.
LinkedIn AI incelemeleri. LinkedIn, geri bildirimi diff'lere ve kod tabanı kurallarına dayandırarak halüsinasyonları ve düşük sinyalli yorumları azaltan çok ajanlı bir AI kod inceleme platformu geliştirdi.
Netflix GenRec. Netflix'in dil modeli tabanlı öneri sistemi GenRec, kullanıcı davranışını metne dönüştürüyor ve çok daha az veriyle, çevrimdışı ve canlı A/B testlerinde elle oluşturulmuş özellik motorunu geride bıraktı.
DoorDash SafeChat. DoorDash, ölçekli olarak kurulan bir pazar yeri güvenlik sistemi olan SafeChat'i ayrıntılarıyla anlattı ve işe yaramaya başlayınca daha güçlü bir mimariyle değiştirdi.
Eğitimde AI avatarları. Harvard Business School'un 699 dolarlık Foundry bootcamp'i, sunum ve yönetim kurulu toplantısı geri bildirimi için HeyGen AI avatarlarını kullanıyor; katılımcılar yönlendirmeli deneyimi sevse de gerçek eğitmen metnin biraz ürkütücü olduğunu söylüyor.
Model haberleri. Liquid AI, 100B LFM modeline ilgiyi yokluyor; bu sırada Ox Alpha adlı gizemli bir model, güçlü kodlama ve ajan performansıyla dikkat çekiyor ve spekülasyonlar GLM ailesinden bir türev olduğuna işaret ediyor.
Politika, Güvenlik ve Güven
OpenAI SB 53. OpenAI, daha önce karşı çıktığı SB 53 yasa tasarısına ilişkin şimdi Kaliforniya'nın, sınır model eğitimi sırasında izleme ve daha güçlü siber güvenlik eklemek için tasarıyı değiştirmesi gerektiğini söylüyor.
Sınırlama planları. Guidelight araştırması, beş sınır laboratuvarını kontrolden çıkmış model sınırlaması açısından derecelendirdi; OpenAI en yüksek, Anthropic ve Meta en düşük puanı aldı ve çok az laboratuvar, uygulandığı gösterilmiş müdahale planları yayımlıyor.
Claude filigranlama. Anthropic'in Claude metin çıktıları için yeni filigranlama sistemi, filigranın nasıl uygulandığı ve neler yapıp yapamadığı detaylı şekilde açıklanıyor.
Kapalı model güveni. Reddit'teki r/LocalLLaMA başlığı, OpenAI'in okul ödevlerinde sandbagging yaptığını ve kullanıcı güçlendirmesinden uzaklaşarak geliştiricileri ajan döngüleri için yerel modellere geri ittiğini öne sürüyor.
Bugünlük bu kadar - yaklaşık 5 dakikalık okuma.