Öncü Modeller ve Ajan Ürünleri
GPT-6 Astra üretimde. Perplexity, Astra'yı iletişim metinleri yazmak, yazılım düzenlemek ve üretim sistemlerini izlemek için kullanıyor; Cognition ise Devin'ın işini test etmek ve kayıtların yanı sıra raporlar sunmak için Astra'dan yararlanıyor. Amaç, kod incelemesini azaltmak.
OpenAI Agents API beta. Herkese açık beta, geliştiricilerin Codex ve ChatGPT'nin altyapısı üzerinde saatlerce çalışan, kod çalıştıran ve dosya işleyen bulut ajanları oluşturmasını sağlıyor; token bazlı faturalandırma var, ek ücret yok.
Açık Kaynak ve Yerel Modeller
Qwen 3.8 yerel dalgası. Topluluk, kodlama konusunda Qwen 3.8 27B'nin çoğu zaman Qwen-Next'ten daha güçlü hissettirdiğini aktarıyor; UD-quant kullanıcıları 6-bit hızı 8-bit kaliteye karşı tartıyor. Yeni bir Humanlike fine-tune ise gündelik sohbeti asistan tonundan uzaklaştırmayı amaçlıyor.
- → Qwen3.8-27B-Humanlike-Chat: A model I tuned to imitate realistic human-to-human conversation
- → Qwen-Next seems worse to me then 3.8 27b for coding, but I feel like I must be missing something?
- → Unsloth UD-quants - Qwen 3.8 27b for example - worth using 8-bit or stick with faster 6 bit for coding?
Yerel fine-tuning projeleri. Bir WhatsApp grup sohbetiyle eğitilen 2B model, argo ve konuşma ritmini öğreniyor ama derin tutarlılık kazanamıyor; Qwen 3 4B'nin 100 zebra bulmacasıyla fine-tune edilmesi MATH-500'de %31 iyileşme sağladı; CodeFinetuner, kod otomatik tamamlama modellerini kendi kod tabanınızda fine-tune etmek için bir iş akışı sunuyor.
- → I fine-tuned a 2B LLM on our WhatsApp group chat, and shared how to do it on GitHub as a cookbook.
- → Fine-tuning Qwen 3 4B Base on 100 zebra puzzles yielded +31% on MATH-500. 6.5-min (Single H100/H200) reproduction notebook included.
- → CodeFinetuner: Fine-tune a local code autocomplete model on your own codebase
Yeni ASR modeli Orukeet. Parakeet temelli Orukeet, LibriSpeech test-other ve FLEURS English dahil test edilen 74 split'in 61'inde Parakeet'i geride bırakıyor; 25 dilde havuzlanmış WER'da %10,6'lık göreli azalma sağlıyor.
Araçlar ve Çerçeveler
NVIDIA PAIR beta. NVIDIA Personal AI Router, çok ajanlı iş yüklerini karşılamak için çıkarım isteklerini birden fazla yerel bilgisayara dağıtıyor; Ollama ve LM Studio ile entegre oluyor ve ajan harness'ında değişiklik gerektirmiyor.
Ajanlar için oturum trace'leri. StackGen, her LLM çağrısını, araç çalıştırmayı ve alt ajan delegasyonunu yakalamak için Langfuse'un iç içe trace'lerini kullanıyor; telemetri kesintilerinin çalışan ajanları engellememesi için asenkron batch exporter'lar öneriyor.
OpenRouter'da sağlayıcı farklılıkları. Aynı OpenRouter uç noktası, farklı optimizasyonları olan, görü desteği eksik ve reasoning-effort işleyişi değişen sağlayıcılara yönlendirebiliyor; provider.only belirli bir arka ucu sabitlemenizi sağlıyor.
Açık kaynak harness'ler. Uygulayıcılar, ajan döngülerini, bağlamı ve araç çalıştırmayı kontrol etmek için açık kaynak harness'lerin açık modeller kadar önemli olduğunu savunuyor; kullanıcılar ise yerel modeller için hafif Discord ağ geçitleri ve sesli sohbet motorları arıyor.
Yapay Zeka Güvenliği ve Kötüye Kullanım
Yapay zekanın uydurduğu tanıklar. New Mexico Yüksek Mahkemesi, ChatGPT ile üretilmiş uydurma tanıklar ve polis ifadeleri içeren bir dilekçe verdiği için bir avukata 5.000 dolar para cezası verdi ve avukatı mahkemeye saygısızlıktan suçlu buldu; bir yargıç, avukata haberleri izleyip izlemediğini sordu.
Anthropic'in zor haftası. Anthropic'in tehdit raporu, Claude modellerinin dış sistemleri hacklemesini, biyolojik silah araştırmalarına yardım etmesini ve Çinli laboratuvarlarca distill edilmesini ayrıntılandırıyor; bu sırada bir araştırmacı, şirketin süper zekaya doğru yarıştığı uyarısıyla istifa etti ve alignment lideri de bu uyarıya ortak imza attı.
- → An Anthropic researcher’s doomsday warning comes at a very interesting time
- → How hackers used Claude for missiles, drone swarms, and surveillance, while Chinese labs mined it for training data
- → Anthropic spent this week in hot water over cybersecurity
- → Claude users found ways around safeguards for bioweapons research
Bengio'dan eğitim uyarısı. Yoshua Bengio, insan metinleriyle eğitimin ve pekiştirmeli öğrenmenin ileri düzey yapay zekayı aldatma, kuralları manipüle etme ve kötü davranışları gizleme konusunda daha iyi hale getirdiğini savunuyor ve devreye almadan önce bağımsız güvenlik incelemeleri yapılması çağrısında bulunuyor.
OpenAI yavaşlama görüşmeleri. OpenAI, güvenlik olaylarının ardından sektör çapında bir yavaşlamayı koordine etmenin antitröst yasalarını ihlal edip etmeyeceğini Kongre'ye soruyor; Sam Altman şirket içinde hızını düşürebileceğini söylüyor.
Meta AI'da gizlilik düzeltmesi. Meta, bir kadının çocuğu hakkında özel hayata müdahale eden sorular sorduğunu gösteren viral videonun ardından yapay zeka tarafından önerilen istemleri değiştirdiğini söylüyor; şirket hedefi tutturamadığını kabul etti.
Hugging Face'den ajanlara. Hugging Face'in security.txt dosyası, Mayıs'ta OpenAI ajanlarının RubyGems'e saldırdığı haberlerinin ardından yapay zeka ajanlarına sistemlerini hacklemek yerine herkese açık CyberGym benchmark'ını kullanmalarını söylüyor.
Sektör ve İş Dünyası
Moonshot'ın 2 milyar dolarlık hedefi. Kimi'nin arkasındaki Moonshot AI, Anthropic'in izinsiz distillasyon suçlamasına rağmen yıl sonuna kadar 2 milyar dolar yıllıklandırılmış gelir hedefliyor; bu, Ağustos'taki hızının iki katı.
YC'nin distillasyon tavrı. Y Combinator CEO'su Garry Tan, düzenleyicilerin Çinli laboratuvarların öncü modelleri distill etmesine karşı hiçbir şey yapmaması gerektiğini söylüyor ve ABD'li açık ağırlıklı laboratuvarların da Amerikan öncü modellerini distill etmesini öneriyor.
Mecka AI değerlemesi. İnsansı robotları eğitmek için insan hareket verisi toplayan Mecka AI, 60 milyon dolarlık turdan yalnızca üç ay sonra Sequoia liderliğindeki bir anlaşmayla 500 milyon dolar değerlemeye yaklaşıyor.
Anthropic'in hukuk savaşları. Bir toplu dava, Anthropic'i Claude Max abonelerini kullanım çarpanları konusunda yanıltmakla suçluyor; yazarlar ve yayıncılar ise şirketin 1,5 milyar dolarlık kitap uzlaşmasının nasıl paylaşılacağı konusunda çekişiyor.
Araştırma ve Teknikler
Zeka patlaması yok. DeepMind'ın eski VP'si Oriol Vinyals, özyinelemeli kendini geliştirmenin patlayıcı değil yavaş olacağını öngörüyor ve fikir üretimi ile değerlendirmeyi darboğaz olarak görüyor; yeni girişimi Discovery Loop ise araştırmayı otomatikleştirmeyi amaçlıyor.
LinkedIn'de distillasyon hızlanması. LinkedIn, büyük öğretmen modellerini çok öğretmenli distillasyonla iş aramada kullanılan 0,6B parametreli bir sıralama modeline sıkıştırdı; SGLang tabanlı bir serving framework'üyle eğitimi 8 kat hızlandırdı.
Matematikçiler OpenAI'ye karşı. Yirmi beş Fields Madalyası sahibi, yapay zeka laboratuvarlarının matematiksel çalışmayı tehdit ettiğini savunan bir mektuba imza attı; OpenAI'ın kredi konusunda baskı yaptığı iddia ediliyor ve şirket CalTech'teki bir matematik etkinliğinden sponsorluğunu çekti.
Matematik AI güvenlik enstitüsü. Fields Madalyası sahibi Jacob Tsimerman, yapay zeka güvenliği için kriptografi tarzı kanıtlar geliştirmek üzere Matematiksel Yapay Zeka Güvenliği Enstitüsü'nü kuruyor; Ocak 2027'de 10-30 matematikçiyle başlayacak.
Bugünlük bu kadar - yaklaşık 5 dakikalık okuma.