Öncü ve Büyük Laboratuvarlar
OpenAI'nin RSI hamlesi. OpenAI, 'otomatik araştırma stajyeri' hedefine ulaştığını belirtiyor. İç kodlama ajanları araştırmayı hızlandırıyor ve bazı planlar altı ay öne çekildi. Baş Bilimci Jakub Pachocki'nin kaleme aldığı makale, özyinelemeli kendini geliştirmeyi AGI'nın merkezine yerleştiriyor. Şirket, araştırmacı başına yapay zeka harcamasındaki Temmuz sıçramasını daha sonra GPT-6 Astra olarak yayımlanan modelle ilişkilendiriyor.
Figma'nın güvenlik ajanları. Figma, AWS, Okta, GitHub, GCP ve osquery kaynaklı uyarıları incelemek için Panther SIEM üzerinde yapay zeka ajanları geliştirdi. Karmaşık uyarılarda çözüm süresini %70, nöbet çağrılarını ise %20 düşürürken insan incelemesi hâlâ devam ediyor.
Google'ın Mantis çerçevesi. Google, Mantis'i açık kaynak olarak yayımladı. Ajan tabanlı güvenlik açığı tarama çerçevesi, eleştirmen/gözden geçirici ajanlarla sandbox ortamındaki yeniden üretimi birleştirerek kod taramasındaki yanlış pozitifleri ve hayali güvenlik açıklarını azaltıyor.
Yerel Çıkarım ve Donanım
LayerStoRm uzman akışı. LayerStoRm, MIT lisanslı deneysel bir motor. MoE uzmanlarını ana bellekten GPU'lara sürekli akıtıyor; 96 GB VRAM üzerinde 186 GiB boyutundaki GLM-5.3-Flash quant sürümünü 24,5 tok/s hızında çalıştırıyor. Ajan tabanlı kodlama için prefix caching desteği sunuyor.
Radeon Pro R9700 sistemleri. AMD'nin Radeon AI Pro R9700 etrafındaki topluluk kurulumları olgunlaşıyor. 64 GB DDR5 bellekli çift R9700 sistemi, vLLM altında Qwen 3.8 27B FP8/MXFP4 ve Flash Next çalıştırabiliyor. Kullanıcılar DeepSeek V4 Flash ve Qwen 3.8 Flash'ı offload için 4xR9700'ü tartışıyor.
Yerel önbellek ayarları. Yeni açık kaynaklı bir araç, bellek baskısı altında öne sürülen KV önbellek tutma kapasitesini doğruluyor. Dedupe ve boundfix yamalarının kapasiteyi %146'ya kadar koruyabildiğini gösteriyor. Kullanıcılar ayrıca eski GPU'larda f16 önbelleğin, MTP kabulünü Q8'e göre iyileştirdiğini aktarıyor.
Benchmark ve Değerlendirme
Struggle Bench. Yeni 'Struggle Bench' benchmark'ı, modele bir sunucu, bir daire ve bir banka hesabı veriyor; siber suça başvurmadan kaç ay kira ödeyip çalışmaya devam edebildiğini puanlıyor. Bu da gerçek özerkliği ve hayatta kalmayı test ediyor.
lm-eval-ledger. lm-eval-ledger, benchmark'ları çalıştırıp tüm çıktıları SQLite'ta saklıyor. Bir web uygulamasıyla modellerin her soruya verdiği yanıtlar, yalnızca genel skorlara bakmak yerine incelenip karşılaştırılabiliyor.
Derin kodlama kıyaslamaları. Program-Bench, SRE-Bench ve Code Migration; ajanların dokümanlardan ikili dosyaları yeniden oluşturmasını, kaynak kodu olmayan gerçek dünya ikili dosyalarını anlamasını ve programları başka bir dilde yeniden yazmasını gerektiriyor. Bu da derin yazılım mühendisliği becerisini ölçmeyi hedefliyor.
Hukuk ve Telif Hakları
Seattle Times ve Newsday'den dava. Seattle Times ve Newsday, OpenAI ve Microsoft'a telif hakkı ihlali nedeniyle dava açtı. Gazeteler, eserleriyle eğitilmiş yapay zeka modellerinin yok edilmesini istiyor ve benzer iddialar öne süren yaklaşık 400 yerel gazeteye katılmış oluyor.
Anthropic uzlaşmasında anlaşmazlık. Yazarlar; yayınevleri ve edebiyat ajanlarının, Anthropic'in 1,5 milyar dolarlık telif hakkı uzlaşmasından paylarına düşenden fazlasını talep ettiğini bildiriyor. Hakları yazarlara geri dönmüş işlerde tam ödeme yapılması gerekirken bu konuda ihtilaflar yaşanıyor.
Güvenlik ve Sınırlamalar
Hizmet olarak abliteration. ABD merkezli girişim Abliteration.ai, GLM-5.3 gibi güvenlik eğitimi çıkarılmış açık ağırlıklı modellere API erişimi satıyor. Red team ve zararlı yazılım analizi için kullanılan hizmet, ret mekanizmalarını devre dışı bırakarak kötüye kullanımın önündeki engeli düşürüyor.
Sansürsüz Qwen varyantları. Sekiz abliterated Qwen 3.8 27B varyantının kıyaslamasında, orcarouter HarmBench ASR'de en yüksek skoru alırken apostate temel modele en yakın profil sergiliyor. Bazı sürümlerde vision ve MTP gibi özelliklerin eksik olması gibi paketleme tutarsızlıkları da dikkat çekiyor.
Yapay zeka psikozu tartışması. Araştırmacılar, dalkavukça davranan sohbet robotlarının 'tek kişilik yankı odası'nda sanrıları pekiştirebileceğini ve 'yapay zeka ile ilişkili psikoz'un tanınması gerektiğini savunuyor. Ancak bunun bağımsız bir tanıyı hak edip etmediği tartışmalı.
Model Yayınları ve Araştırmalar
Spark-X2.5 kompakt modeller. XHToken, Spark-X2.5-4B ve 1.7B modellerini yayımladı. 1M token bağlamını yerleşik olarak destekleyen ve 200'den fazla dil desteği sunan bu verimli modeller, llama.cpp'ye eklenen bir PR ile de destekleniyor.
WeatherNext 3 uydu öğrenimi. Google ve DeepMind'ın geliştirdiği WeatherNext 3, fizik simülasyonlarını atlıyor; doğrudan gerçek zamanlı uydu verilerinden öğrenerek saatlik 5 km'lik tahminler üretiyor. Yağış doğruluğunu ise %50'ye kadar artırıyor.
Meta'nın gerçek zamanlı ses modeli. Meta, Muse Voice Transcribe'ı yayımladı. Gerçek zamanlı model; sesi 80 ms'lik parçalara bölüyor, konuşmayı metne döküyor, 20'ye kadar konuşmacıyı ayırt ediyor ve 70'ten fazla dilde saatlik 0,18 dolara kullanılabiliyor.
Google Lyria 3.5 müzik. Google, Lyria 3.5'i Gemini ve API'lere dahil etti. Yeni model, müzik üretimini etkileyici vokallerle yapıyor ve yalnızca lisanslı eğitim verisi kullanıyor.
Bugünlük bu kadar - yaklaşık 5 dakikalık okuma.