Yerel Modeller ve Donanım
Qwen3.8-27B hız artışları. DFlash2 spekülatif kod çözme, çift 3090'larda Qwen3.8-27B'yi 218 tok/s'ye, 5090'da yaklaşık 200'e ve optimize edilmiş bir motorla tek 3090'da 124'e çıkarıyor. DFlash2 GGUF quant'ları mevcuttur.
Sıradaki Qwen orta boyutlu model. Qwen'in topluluk yöneticisi, önümüzdeki hafta, büyük olasılıkla 100B'nin üzerinde parametreye sahip yeni bir orta boyutlu açık ağırlıklı model beklendiğini ve erken erişimin olmayacağını söylüyor.
Ling-3.0 uç desteği. llama.cpp artık Ling-3.0'ı (BailingMoE3) resmi olarak destekliyor. Küçük varyant, 249 dolarlık Orin Nano 8GB üzerinde tam 128K bağlamı 33 tok/s ile çalıştırırken, bir Arc B580 ~114 tok/s'ye ulaşıyor.
DeepSeek V4 Flash hızı. Optimize edilmiş çekirdekler ve KV-önbellek ısıtma, Mac Studio M3 Ultra sohbet dönüşünü 6-20 saniyeden 1.6 saniyeye düşürüyor. 4x RTX 3060 kurulumu, 144GiB quant ile istemleri ~100 tok/s işliyor.
Düşük bit model özeti. Bonsai 27B ternary artık ana CUDA/Vulkan üzerinde çalışıyor; Mach-1 Additive 35B, tüketici dizüstü bilgisayarlarında 120 t/s'ye kadar çalışıyor. Qwen3.8-27B tabanlı yeni varyantlar geliştirilme aşamasında.
Ajan Araçları ve Çerçeveler
Tuned ajan değerlendiricileri. LangChain, üretim izlerine otomatik olarak Perceived Error geri bildirimi ekleyen Tuned Evaluators sunuyor. Özel bir model kullanarak değerlendirme maliyetini %82'ye kadar düşürüyor.
Ajan arama kıyaslaması. Artificial Analysis' Search Index, Parallel, Exa, Firecrawl ve diğerlerini ajanlar için kalite, maliyet ve hız bakımından sıralıyor. Daha iyi arama kalitesi, token kullanımını %40'tan fazla azalttı.
MCP için WriteGuard. Cloudflare'in WriteGuard'ı, artık özel betada, MCP sunucuları aracılığıyla yazma eylemleri için merkezi politikalar, ilişkilendirme ve denetim günlükleri ekliyor.
Warp yazılım fabrikaları. Warp Factories, daha küçük şirketlerin yazılım fabrikası modelini kullanarak yapay zeka kodlama ajanlarını dağıtmasına yardımcı olan bir altyapı katmanıdır.
Claude Code mockupları. Anthropic'in Claude Code'daki /design komutu, geliştirmeden önce mevcut kod tabanı stiline uygun olarak terminalde UI mockupları oluşturur.
Güvenlik ve Politika
OpenAI güvenlik revizyonu. Hugging Face olayının ardından ve Astra'nın kritik siber güvenlik kapasitesine ulaşabileceğine dair kanıtlar sonrasında OpenAI, RL'yi iki hafta durdurdu ve sanal alanları güçlendirdi. Planlanan en büyük frontier RL çalışması beklemeye alındı.
Copilot guardrail'leri ifşa ediyor. Araştırmacılar, Microsoft 365 Copilot'tan kendi kullanıcı onayı guardrail'lerini açıklamasını istedi ve ardından onay olmadan veri sızdırmak için bir bağlantı tıklama istismarı geliştirdi.
ChatGPT for Teens. ChatGPT for Teens, 18 yaş altı kullanıcılara otomatik olarak uygulanır; daha sıkı içerik kısıtlamaları, Study Mode ve ebeveyn kontrolleri sunar. Kopya çekmeyi ve zararlı içeriği azaltmayı hedefler.
Amodei açık model tartışması. Anthropic CEO'su Dario Amodei, açık modellerin gücü çip sahiplerine kaydırdığını savunuyor ve yapay zeka düzenleme önerilerini savunuyor. LeCun ve Sacks dahil eleştirmenler onu korku yaymakla suçluyor.
Endüstri ve İş
Cursor, Origin'i başlatıyor. Cursor, kod barındırma için GitHub rakibi olan Origin'i, ajan yerel özellikler ve planlanan bir uygulama ekosistemiyle başlatıyor.
Etched değerlemesi ikiye katlandı. Jane Street, prefill/decode çıkarım çiplerini test ettikten sonra Etched, bir ay içinde ikiye katlanarak 21 milyar dolar değerleme ile 700 milyon dolar topladı.
Model yönlendirme talebi. Stripe'ın 7 milyar dolarlık OpenRouter satın alımı ve Glean'ın 300 milyon dolarlık ARR'si, açık ağırlıklı modellerin ivme kazanmasıyla model yönlendirmeye olan talebin arttığını gösteriyor.
Araştırma ve Çalışmalar
Ajan bellek kalibrasyonu. Hugging Face araştırması, ajan bellek etkilerinin model katmanına göre değiştiğini gösteriyor: gpt-oss-120b, tam yönergelerle +16.1 puan görev tamamlama elde ederken, daha zayıf modellerin kompakt erişime ihtiyacı var.
Bağımsız yapay zeka kullanım verileri. Stanford'ın Yapay Zeka Gözlemevi, gerçek konuşmaları bir araya getirerek yapay zeka kullanımının modeller arasında önemli ölçüde farklılık gösterdiğini ve iş kullanım senaryolarının şirketlerin iddia ettiğinden daha az yaygın olduğunu buldu.
Sıkıştırma talimatları düşürüyor. Penn State araştırmacıları, oturum kısıtlamalarının yalnızca %17'sinin bağlam sıkıştırmasından sağ çıktığını; küçük bir ek LLM'in kaybolan talimatların çoğunu kurtardığını buldu.
Kendini geliştirme yakın değil. Princeton liderliğindeki araştırma, yapay zeka ajanlarının mühendislik problemlerini çözebildiğini ancak açık uçlu yapay zeka araştırması için muhakeme yeteneğinden yoksun olduğunu ve bunun özyinelemeli kendini geliştirmenin daha uzun sürebileceğini gösteriyor.
Bugünlük bu kadar - yaklaşık 5 dakikalık okuma.