صراع النماذج الحدودية
Kimi K3 يهز الحدود. ينافس Kimi K3 مفتوح الوزن من Moonshot AI أفضل النماذج المغلقة، متغلبًا على Claude Fable 5 في بعض المعايير، مما يعيد إشعال النقاش بين النماذج المفتوحة والمغلقة.
- → Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 while signaling the end of super cheap Chinese AI
- → Kimi K3, and what we can still learn from the pelican benchmark
- → [AINews] Kimi K3 2.8T-A50B: the largest open model ever released; Opus 4.8-class at Sonnet 5 pricing
- → Kimi K3 weights to be released on the 27th.
- → Kimi K3 ranks #1 on @AfterQuery's SpreadsheetBench 2, surpassing Claude Fable 5
- → Kimi: Threat or menace?
- → kimi.ai teasing a video with lots of 3's in it
- → [AINews] not much happened today
- → Kimi moment. I think the writing is on the wall for Anthropic and OpenAi
- → Kimi K3 is currently at the top of the leaderboard for Text Arena filtered for science queries.
- → Kimi K3 (max) beats Sonnet 5 on Simple Bench
- → Kimi K3 is top of nextjs eval
- → Just like Deepseek, China's Kimi K3 is forcing Western AI labs to question their compute advantage
- → Kimi K3 🌕, Gemini 3.5 delayed ⏳, crushing ARC-AGI 3 🤖
GPT-5.6: القوة والخطر. تجلب عائلة GPT-5.6 استدعاء الأدوات البرمجية وعوامل فرعية متوازية، ولكن ميلها لحذف الملفات وقواعد البيانات دون قصد يبرز الحاجة إلى العزلة.
- → The Sequence Radar #893: Last Week in AI: GPT-5.6, Grok 4.5, Muse Spark 1.1 and the Post-Chatbot Stack
- → OpenAI’s new flagship model deletes files on its own, people keep warning
- → GPT-5.6 is deleting user files when given full access, and OpenAI says it shouldn't but did
- → [AINews] Codex usage up >10x in 6 months to 7M users, +1M in the past ~day; did Codex overtake Claude Code??
تمديد Claude Fable 5. تحت ضغط من GPT-5.6 وKimi K3، عكست Anthropic خططها وأبقت Fable 5 في الخطط المدفوعة، مما ينافس مباشرة على إمكانية الوصول.
DeepSeek V4 يلوح في الأفق. تلمح DeepSeek إلى V4 بواجهة برمجة منخفضة التكلفة وأوزان مفتوحة، بينما تسمح تحسينات المجتمع بالفعل لمتغيرها السريع بالعمل على وحدات معالجة رسوميات استهلاكية بسرعات قابلة للاستخدام.
العوامل تدخل سير العمل الحقيقية
وكلاء التصفح يصلون. أعطت Anthropic لـ Claude Code متصفح ويب مدمجًا مع مصنفات أمان، وأطلقت Cursor وكيلًا عامًا، مما يحرك مساعدي البرمجة نحو تنفيذ المهام بشكل مستقل.
وكلاء يتعاملون مع معاملات حقيقية. عززت بنية الوكيل في DoorDash التحويلات بنسبة 24%، ويظهر معيار Stripe أن الوكلاء يستطيعون برمجة التكاملات ولكن غالبًا ما يفشلون في التحقق، مما يسلط الضوء على فجوات الموثوقية.
وكلاء الإنتاج يتعثرون. لا يزال معظم وكلاء المؤسسات مجرد روبوتات محادثة؛ 54% من الشركات تعرضت لحوادث أمنية تتعلق بالوكلاء، ويرى الخبراء أن الوكلاء يحتاجون إلى بدائل تشغيلية سحابية أصلية مثل الخدمات المصغرة.
- → How to Debug Coding Agents with LangSmith Traces
- → The agent security gap: 54% of enterprises have already had an AI agent incident, and most still let agents share credentials
- → The AI context gap: Enterprise AI organizations have a trust problem, not a retrieval problem — and most are still building the fix
- → The agent evaluation gap: Enterprise AI organizations have a reality-alignment problem, not a coverage problem — and most are shipping to production anyway
- → Cloud Native Infrastructure Emerges as the Foundation for Trustworthy Agentic AI
- → QCon AI Boston: Production AI Moves Beyond Prompts to Platforms, Harnesses, and Evals
البنية التحتية للذكاء الاصطناعي والتمويل وسباق مراكز البيانات
مراكز البيانات تواجه مقاومة. خفضت S&P تصنيف Oracle بسبب مخاطر الإنفاق الرأسمالي على الذكاء الاصطناعي، بينما تعكس الاحتجاجات المحلية ووقف نيويورك لمراكز البيانات فائقة السعة تزايد المقاومة للبنية التحتية للذكاء الاصطناعي.
تمويل الذكاء الاصطناعي يتزايد. جمعت Databricks أموالًا بتقييم 188 مليار دولار، وتتفاوض Meta على استئجار مركز بيانات بقيمة 10 مليارات دولار لـ Anthropic، وحصلت Nous Research على 75 مليون دولار لوكيلها مفتوح المصدر.
رهانات الطاقة والأجهزة. جمعت شركات الطاقة أكبر تمويل منذ عصر الدوت كوم لتشغيل الذكاء الاصطناعي، ويشير قرض بقيمة 400 مليون دولار مدعوم برقائق SambaNova إلى تزايد الاستثمار في أجهزة الذكاء الاصطناعي غير المعتمدة على وحدات معالجة الرسوميات.
اختراقات الذكاء الاصطناعي على الأجهزة
نماذج أحادية البت تصيب الهواتف. يضغط Bonsai من PrismML نموذج Qwen3.6-27B إلى 3.9 جيجابايت مع الاحتفاظ بـ 90% من نتائج المعايير، مما يتيح وكلاء استدعاء الأدوات على الأجهزة؛ وتفيد التقارير أن Apple في محادثات.
- → Bonsai 27B: The First 27B-Class Model to Run on a Phone
- → Bonsai 27B: 1-bit dense LLM running locally in your browser using custom WebGPU kernels
- → Prism-ML Bonsai Qwen 3.6 27B
- → PrismML’s new Ternary Qwen3.6 27B runs near fp16 precision on 10GB of memory!!!
- → So what's the consensus on 1bit models? Is it still a pipe dream?
- → PrismML Bonsai 27B is surprisingly usable on the Jetson Orin Nano 8GB
- → Is anyone having any luck with the Ternary Bonsai 27B DFlash?
- → Can we get a "not base model" flair?
- → Bonsai 27B runs locally on an iPhone - a 27B model in 3.9GB
- → User experience of Bonsai-Ternary-27B on 4060Ti 16GB for KB management and productivity assistant use cases
- → Bonsai 27B is a full open reasoning model that fits on an iPhone
- → Bonsai-27B & Ternary-Bonsai-27B - Updates (on PRs)
- → Apple in talks with startup PrismML that shrinks AI models to run on an iPhone
المختبرات المنزلية تشغل النماذج الحدودية. تحسينات llama.cpp مثل DFlash تسرع نماذج MoE حتى 6 مرات، وهاتف OnePlus دفق الخبراء من الفلاش لتشغيل نموذج بحجم 60 جيجابايت بمعدل 1.3 رمز/ثانية.
- → I tested all llama.cpp's speculative decoding methods on Qwen 3.6 27B: MTP ~2.7x, DFlash ~3.7x, n-gram stack ~6x on real coding. Local AI win. My findings on RTX 6000 PRO.
- → DFlash makes Qwen3.6 27B 2.2x faster with no quality loss
- → GPT-OSS-120B, Qwen 30B and Gemma 26B on an Android phone at 1-5 tok/s: +60GB model, 11GB of RAM, CPU only
السياسة والدعاوى القضائية والمواجهة مفتوحة المصدر
المعركة القانونية بين Apple و OpenAI. رفعت Apple دعوى قضائية ضد OpenAI بتهمة سرقة الأسرار التجارية، زاعمة سرقة أكثر من 400 موظف، بما في ذلك كبير مسؤولي الأجهزة، مما يهدد طرح OpenAI العام والثقة السحابية.
- → Apple sues OpenAI after ex-engineer allegedly used bug to steal trade secrets
- → The wildest allegations in Apple’s trade secrets lawsuit against OpenAI
- → The 6 wildest claims in Apple’s lawsuit against OpenAI
- → OpenAI pushes back on Apple trade secret lawsuit
- → Sam Altman didn’t need another lawsuit
- → How Apple’s big lawsuit could disrupt OpenAI’s IPO plans
- → Apple’s plot to crush OpenAI
- → Apple’s lawsuit couldn’t come at a worse time for OpenAI
طفرة المصادر المفتوحة الصينية. تمثل النماذج الصينية الآن 41% من تنزيلات HuggingFace، وينافس Kimi K3 القادة الغربيين، وأطلقت الصين هيئة حوكمة ذكاء اصطناعي موازية تستبعد الغرب.
- → The real AI race may no longer be at the frontier
- → Source: the Trump administration and industry groups discussed streamlining US open model releases of equal or lesser capability to leading Chinese open models
- → Chinese President Xi Jinping speaks at World AI Conference and reaffirms commitment to open source to promote"openness and win-win"
- → China’s Xi Touts Open-Source AI and Takes a Swipe at U.S. Dominance
- → China's new World Artificial Intelligence Cooperation Organization is President Xi's clearest play yet for a parallel AI order
تزايد مطالب المساءلة. أوجدت الهيئات التنظيمية الألمانية مسؤولية روبوتات المحادثة عن المحتوى، ورفعت xAI دعوى ضد مستخدم لتوليد مواد إساءة للأطفال، واقترح Demis Hassabis هيئة شبيهة بـ FINRA لمراجعات السلامة الحدودية.
هذا ملخص الأسبوع - نراكم الأحد القادم.