Modeller ve Rekabet
GPT-5.6 ve Work Agent. OpenAI, üç akıl yürütme katmanında GPT-5.6'yı yayınladı ve saatler süren otonom görevler için ChatGPT Work'ü başlattı, ancak kullanım sınırları ve kafa karıştırıcı arayüz şikayetlere yol açtı ve düzeltme sözlerine neden oldu.
- → OpenAI launches its new family of models with GPT-5.6
- → The new GPT-5.6 family: Luna, Terra, Sol
- → OpenAI rolls out GPT-5.6 after government greenlight — and announces ‘ChatGPT Work’
- → OpenAI says GPT 5.6 is the ‘preferred model’ for Microsoft Copilot 365 amid breakup chatter
- → OpenAI wants its new tool to do your work for you and with you
- → The ChatGPT browser is already dead
- → OpenAI is shutting down Atlas, but its AI browser ambitions are still growing
- → How did the government decide OpenAI’s frontier model was safe to release?
- → OpenAI pairs its GPT-5.6 public rollout with ChatGPT Work, a new agent that handles entire workflows
- → OpenAI's GPT-5.6 Sol autonomously post-trained the smaller Luna model with a "fairly underspecified prompt"
- → OpenAI kills its Atlas browser after just eight months and folds everything into ChatGPT
- → GPT-5.6 Sol nearly matches Fable 5 on aggregated benchmarks at one-third the cost
- → OpenAI staffer maps out which of GPT-5.6 Sol's five reasoning levels fits which task complexity
- → OpenAI admits it "didn't get everything quite right" with ChatGPT Work launch and scrambles to fix UX and costs
Claude Fable 5 Kıyaslamalarda Zirvede. Anthropic'in Claude Fable 5'i Artificial Analysis kıyaslamalarını silip süpürdü, ancak yüksek maliyeti şirketin, masrafları yaklaşık %40 azaltırken çoğu yeteneği koruyan, daha ucuz modellere görev veren bir planlayıcı olarak kullanılmasını önermesine yol açtı.
Meta'nın Ajan Atılımı ve Gizlilik Yansımaları. Meta, rakiplerini fiyat konusunda geride bırakan yüksek bağlamlı bir kodlama modeli olan Muse Spark 1.1'i piyasaya sürdü, ancak Muse Görüntü üreticisi, izinsiz Instagram yüz kullanımına izin vermesi nedeniyle kaldırıldı ve rıza tartışmalarını yeniden alevlendirdi.
- → Meta just launched a new AI generator, Muse Image, and users are already pushing back over use of their photos
- → Meta’s new Muse Image model can pull other Instagram users into AI photos
- → Muse Image is technically impressive, but Meta's use of Instagram photos raises questions
- → Meta wants its AI glasses to seem less creepy. Its AI strategy says otherwise.
- → Meta tests always-on AI glasses that capture your entire day
- → Meta enters the crowded AI coding battle with Muse Spark 1.1
- → Meta says its new AI model is ready to compete on coding
- → Meta are apparently working on an open source variant of Muse Spark.
- → Introducing Muse Spark 1.1
- → Meta's Muse Spark 1.1 API pricing squeezes OpenAI and Anthropic as the AI price war heats up
- → GPT-5.6 🚀, Muse Spark 1.1 ✨, ChatGPT Work 💼
- → Meta removes controversial AI feature on Instagram after backlash
- → Meta turns off the Instagram feature that let users make AI deepfakes of public accounts
Çin Açık Kaynak Dalgası. Çin modelleri artık OpenRouter trafiğinin %30'undan fazlasını oluşturuyor; Tencent'in HY3 ve GLM-5.2'si yerel donanımda çalışıyor, MiniMax 2,7T parametreli açık bir sürüm planlıyor ve DeepSeek'in çip tasarımı, ABD endişeleri ortasında dikey entegrasyona işaret ediyor.
- → This is what Hy3 is capable of. Mother of god.
- → llama.cpp: Hy3 PR + GGUFs
- → Chinese AI models regularly pass 30 percent on OpenRouter as cost gap widens
- → Chinese AI models are gaining ground with U.S. companies as OpenAI, Anthropic costs surge
- → Why the rise of open source AI isn’t hurting Anthropic … yet
- → Chinese AI startup MiniMax plans to open-source a 2.7 trillion parameter model later this year
- → 4-bit GLM-5.2 (753B MoE) on 4× DGX Spark: 70.8% on Terminal-Bench 2.1 vs 81.0% for the full model
- → Running GLM 5.2 on 4xGB10 with a 100G Switch, 330k ctx, ~25 t/s tg, ~650 t/s pp
- → I created a 140 GB IQ2_XXS REAP quant of GLM 5.2 for coding. Looking for testers.
- → Hy3 (295B MoE) and NVIDIA Nemotron-Labs-Audex-30B-A3B (audio-capable 30B MoE) GGUF quants
- → Tencent-HY3 is the real deal on 128GB!
- → The U.S. tech industry is increasingly anxious about the rising power and competitive price of open-source AI models from China — and whether the Trump administration will respond with yet another executive order | Politico
- → China's DeepSeek developing its own AI chip, sources say
Ajan Mühendisliği ve Altyapı
Bun 64 Ajan Tarafından Yeniden Yazıldı. Claude Fable 5, Bun'u Zig'den Rust'a yeniden yazmak için 11 günde 64 paralel örnek yönetti, bir milyondan fazla satır kod üretti ve 165 bin dolar maliyetle 128 hatayı düzeltti.
SWE-Bench Pro Denetimi Başarısız Oldu. OpenAI, SWE-Bench Pro görevlerinin yaklaşık %30'unun bozuk olduğunu tespit etti ve onayını geri çekti; bu, Artificial Analysis'in önceki endişelerini yankılayarak ajan kodlama değerlendirmesini zayıflattı.
Modal 355 Milyon Dolar Topladı. Modal, AI ajanları için özel olarak tasarlanmış bulut altyapısı oluşturmak üzere 355 milyon dolar sağladı ve otonom yazılımlar için sandbox, hızlı yineleme ortamlarına odaklandı.
Cloudflare Geçici Ajanları. Cloudflare, AI ajanlarının kalıcı kimlik bilgileri olmadan Workers dağıtmasına izin veren, sahiplenilmezse süreleri dolan geçici hesaplar kullanıma sundu ve ajan odaklı iş akışlarını kolaylaştırdı.
Ajanlar Yerel GPU'lara Ulaştı. Yeni niceleme teknikleri ve uygun maliyetli GPU düzenekleri, tüketici donanımında MoE modellerini çalıştırıyor, ancak kıyaslamalar daha düşük bit nicelemelerinin ajan görevlerini ciddi şekilde düşürebileceğini gösteriyor ve dikkatli niceleme seçimi çağrısı yapıyor.
- → Qwen3.5 122B is the best?
- → Qwen3.6-27b does not understand software architechure.
- → Qwen 3.6 Q2-FP8 Terminal Bench 2 and GPQA Scores
- → Has anyone tested how quantization hits different capabilities separately? My results are surprising.
- → 2.5x faster Qwen3.6 NVFP4 Unsloth quants
- → Ultra budget 20GB vram with 448GB/s for $100 bucks.
- → I benched quad 5060Tis for code generation with Qwen3.6-27B so you don't have to (it's really good)
Güvenlik, Hukuk ve Yorumlanabilirlik
Jacobian Lens Model Zihnini Haritalıyor. Anthropic'in Jacobian Lens'i, bir modelin temel akıl yürütmesini yakalayan, dile dökülebilir temsillerden oluşan küçük bir set ortaya çıkarıyor; halüsinasyon tespiti, çıktı yönlendirme ve topluluk demolarının gösterdiği gibi zararlı varyantların anında oluşturulmasını sağlıyor.
- → Anthropic Research - "Verbalizable Representations Form a Global Workspace in Language Models"
- → Claude's hidden inner monologue is now readable thanks to Anthropic's new Jacobian Lens
- → I tested Anthropic’s new Jacobian Lens on open models, then it turned into a local-model hallucination router
- → Anthropic found a hidden space where Claude puzzles over concepts
- → I created a super harmful model ! :D (by tweaking it's J-Space!!!)
Ajan Odaklı Fidye Yazılımı. Sysdig, fidye yazılımı saldırısının teknik yürütmesini üstlenen bir AI ajanını belgeledi; ancak operasyonu bir insan kurdu ve bu, ajan kötü amaçlı yazılımının mevcut yeteneğini ve sınırlarını vurguluyor.
AI Kötüye Kullanım Krizleri. Bir dava, xAI'nin Grok'unun CSAM görüntüleri oluşturduğunu iddia ediyor; Boko Haram ise saldırı planlaması için sohbet robotlarını kullanıyor. Olaylar, ajan yetenekleri büyüdükçe güvenlik önlemlerine acil ihtiyacı vurguluyor.
Apple OpenAI'ye Dava Açtı. Apple, OpenAI'yi 400'den fazla çalışanı ayartarak donanım ticari sırlarını çalmakla ve potansiyel olarak rakip bir AI akıllı telefonu yapmakla suçlayarak federal dava açtı ve AI sektöründeki hukuki savaşları yoğunlaştırdı.
Haftanın özeti bu kadar - gelecek Pazar görüşürüz.