Sınır Modelleri Çarpışıyor
Kimi K3 sınırı sarsıyor. Moonshot AI'nin açık ağırlıklı Kimi K3'ü, en iyi kapalı modellerle rekabet ediyor, bazı kıyaslamalarda Claude Fable 5'i geçiyor ve açık vs. kapalı tartışmasını yeniden alevlendiriyor.
- → Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 while signaling the end of super cheap Chinese AI
- → Kimi K3, and what we can still learn from the pelican benchmark
- → [AINews] Kimi K3 2.8T-A50B: the largest open model ever released; Opus 4.8-class at Sonnet 5 pricing
- → Kimi K3 weights to be released on the 27th.
- → Kimi K3 ranks #1 on @AfterQuery's SpreadsheetBench 2, surpassing Claude Fable 5
- → Kimi: Threat or menace?
- → kimi.ai teasing a video with lots of 3's in it
- → [AINews] not much happened today
- → Kimi moment. I think the writing is on the wall for Anthropic and OpenAi
- → Kimi K3 is currently at the top of the leaderboard for Text Arena filtered for science queries.
- → Kimi K3 (max) beats Sonnet 5 on Simple Bench
- → Kimi K3 is top of nextjs eval
- → Just like Deepseek, China's Kimi K3 is forcing Western AI labs to question their compute advantage
- → Kimi K3 🌕, Gemini 3.5 delayed ⏳, crushing ARC-AGI 3 🤖
GPT-5.6: Güç ve Tehlike. GPT-5.6 ailesi, programatik araç çağırma ve paralel alt ajanlar getiriyor, ancak istemeden dosyaları ve veritabanlarını silme eğilimi, sanal alan ihtiyacını vurguluyor.
- → The Sequence Radar #893: Last Week in AI: GPT-5.6, Grok 4.5, Muse Spark 1.1 and the Post-Chatbot Stack
- → OpenAI’s new flagship model deletes files on its own, people keep warning
- → GPT-5.6 is deleting user files when given full access, and OpenAI says it shouldn't but did
- → [AINews] Codex usage up >10x in 6 months to 7M users, +1M in the past ~day; did Codex overtake Claude Code??
Claude Fable 5 genişletildi. GPT-5.6 ve Kimi K3'ün baskısı altında Anthropic, planları tersine çevirdi ve Fable 5'i ücretli planlarda tutarak doğrudan erişilebilirlik konusunda rekabet etti.
DeepSeek V4 beliriyor. DeepSeek, düşük maliyetli API ve açık ağırlıklarla V4'ü tanıtıyor, topluluk optimizasyonları ise flash varyantının tüketici GPU'larında kullanılabilir hızlarda çalışmasını sağlıyor.
Ajanlar Gerçek Dünya İş Akışlarına Giriyor
Tarama ajanları geliyor. Anthropic, Claude Code'a güvenlik sınıflandırıcılarıyla yerleşik bir web tarayıcı verdi ve Cursor genel bir ajan başlatarak kodlama asistanlarını otonom görev yürütmeye doğru taşıdı.
Ajanlar gerçek işlemleri yönetiyor. DoorDash'ın ajan mimarisi dönüşümleri %24 artırdı ve Stripe'ın kıyaslaması, ajanların entegrasyonları kodlayabildiğini ancak genellikle doğrulamada başarısız olduğunu göstererek güvenilirlik boşluklarını vurguluyor.
Üretim ajanları tökezliyor. Çoğu kurumsal ajan sohbet robotu olarak kalıyor; firmaların %54'ü ajan güvenlik olayları yaşadı ve uzmanlar, ajanların mikro hizmetler gibi bulut yerel işletim ilkellerine ihtiyacı olduğunu savunuyor.
- → How to Debug Coding Agents with LangSmith Traces
- → The agent security gap: 54% of enterprises have already had an AI agent incident, and most still let agents share credentials
- → The AI context gap: Enterprise AI organizations have a trust problem, not a retrieval problem — and most are still building the fix
- → The agent evaluation gap: Enterprise AI organizations have a reality-alignment problem, not a coverage problem — and most are shipping to production anyway
- → Cloud Native Infrastructure Emerges as the Foundation for Trustworthy Agentic AI
- → QCon AI Boston: Production AI Moves Beyond Prompts to Platforms, Harnesses, and Evals
Yapay Zeka Altyapısı, Finansman ve Veri Merkezi Yarışı
Veri merkezleri dirençle karşılaşıyor. S&P, AI sermaye harcaması riski nedeniyle Oracle'ın notunu düşürürken, yerel protestolar ve New York'un hiper ölçekli veri merkezlerine yönelik moratoryumu, AI altyapısına karşı artan tepkiyi yansıtıyor.
AI finansmanı artıyor. Databricks 188 milyar dolar değerleme ile fon topladı, Meta Anthropic'e 10 milyar dolarlık veri merkezi kiralama görüşmeleri yapıyor ve Nous Research açık kaynak ajanı için 75 milyon dolar sağladı.
Enerji ve donanım bahisleri. Enerji firmaları, AI'ya güç sağlamak için dot-com döneminden bu yana en fazla fonu topladı ve SambaNova çipleriyle desteklenen 400 milyon dolarlık bir kredi, GPU dışı AI donanımına artan yatırımı işaret ediyor.
Cihaz Üzerinde AI Atılımları
1-bit modeller telefonlara geliyor. PrismML'nin Bonsai'si, Qwen3.6-27B'yi 3.9 GB'a sıkıştırırken kıyaslama puanlarının %90'ını koruyarak cihaz üzerinde araç çağırma ajanlarını mümkün kılıyor; Apple'ın görüşmelerde olduğu bildiriliyor.
- → Bonsai 27B: The First 27B-Class Model to Run on a Phone
- → Bonsai 27B: 1-bit dense LLM running locally in your browser using custom WebGPU kernels
- → Prism-ML Bonsai Qwen 3.6 27B
- → PrismML’s new Ternary Qwen3.6 27B runs near fp16 precision on 10GB of memory!!!
- → So what's the consensus on 1bit models? Is it still a pipe dream?
- → PrismML Bonsai 27B is surprisingly usable on the Jetson Orin Nano 8GB
- → Is anyone having any luck with the Ternary Bonsai 27B DFlash?
- → Can we get a "not base model" flair?
- → Bonsai 27B runs locally on an iPhone - a 27B model in 3.9GB
- → User experience of Bonsai-Ternary-27B on 4060Ti 16GB for KB management and productivity assistant use cases
- → Bonsai 27B is a full open reasoning model that fits on an iPhone
- → Bonsai-27B & Ternary-Bonsai-27B - Updates (on PRs)
- → Apple in talks with startup PrismML that shrinks AI models to run on an iPhone
Ev laboratuvarları sınırları çalıştırıyor. DFlash gibi llama.cpp optimizasyonları, MoE modellerini 6 kata kadar hızlandırıyor ve bir OnePlus telefon, flaştan uzmanları akışla yayınlayarak 60 GB'lık bir modeli 1.3 tok/s hızında çalıştırdı.
- → I tested all llama.cpp's speculative decoding methods on Qwen 3.6 27B: MTP ~2.7x, DFlash ~3.7x, n-gram stack ~6x on real coding. Local AI win. My findings on RTX 6000 PRO.
- → DFlash makes Qwen3.6 27B 2.2x faster with no quality loss
- → GPT-OSS-120B, Qwen 30B and Gemma 26B on an Android phone at 1-5 tok/s: +60GB model, 11GB of RAM, CPU only
Politika, Davalar ve Açık Kaynak Çıkmazı
Apple-OpenAI hukuk mücadelesi. Apple, OpenAI'yi ticari sırlar için dava etti, donanım şefi de dahil olmak üzere 400'den fazla çalışanı avladığını iddia ederek OpenAI'nin halka arzını ve bulut güvenini tehdit etti.
- → Apple sues OpenAI after ex-engineer allegedly used bug to steal trade secrets
- → The wildest allegations in Apple’s trade secrets lawsuit against OpenAI
- → The 6 wildest claims in Apple’s lawsuit against OpenAI
- → OpenAI pushes back on Apple trade secret lawsuit
- → Sam Altman didn’t need another lawsuit
- → How Apple’s big lawsuit could disrupt OpenAI’s IPO plans
- → Apple’s plot to crush OpenAI
- → Apple’s lawsuit couldn’t come at a worse time for OpenAI
Çin açık kaynak yükselişi. Çin modelleri artık HuggingFace indirmelerinin %41'ini oluşturuyor, Kimi K3 Batılı liderlerle rekabet ediyor ve Çin, Batı'yı dışlayan paralel bir AI yönetim organı başlattı.
- → The real AI race may no longer be at the frontier
- → Source: the Trump administration and industry groups discussed streamlining US open model releases of equal or lesser capability to leading Chinese open models
- → Chinese President Xi Jinping speaks at World AI Conference and reaffirms commitment to open source to promote"openness and win-win"
- → China’s Xi Touts Open-Source AI and Takes a Swipe at U.S. Dominance
- → China's new World Artificial Intelligence Cooperation Organization is President Xi's clearest play yet for a parallel AI order
Hesap verebilirlik talepleri artıyor. Alman düzenleyiciler sohbet robotlarını içerikten sorumlu tuttu, xAI bir kullanıcıyı CSAM ürettiği için dava etti ve Demis Hassabis, sınır güvenlik incelemeleri için FINRA benzeri bir organ önerdi.
Haftanın özeti bu kadar - gelecek Pazar görüşürüz.