स्थानीय मॉडल और हार्डवेयर
Qwen3.8-27B गति लाभ. DFlash2 स्पेक डिकोडिंग दो 3090 पर Qwen3.8-27B को 218 टोकन/सेकंड तक पहुंचाता है, 5090 पर लगभग 200, और अनुकूलित इंजन के साथ एकल 3090 पर 124। DFlash2 GGUF क्वांट उपलब्ध हैं।
अगला Qwen मिडसाइज़. Qwen के सामुदायिक प्रबंधक का कहना है कि अगले सप्ताह एक नया मिडसाइज़ ओपन-वेट मॉडल आने की उम्मीद है, संभवतः 100B से अधिक पैरामीटर के साथ, और कोई प्रारंभिक पहुंच नहीं होगी।
Ling-3.0 एज समर्थन. llama.cpp अब आधिकारिक रूप से Ling-3.0 (BailingMoE3) का समर्थन करता है। टाइनी वैरिएंट $249 Orin Nano 8GB पर पूर्ण 128K संदर्भ 33 टोकन/सेकंड पर चलाता है, जबकि Arc B580 ~114 टोकन/सेकंड तक पहुंचता है।
DeepSeek V4 Flash गति. अनुकूलित कर्नेल और KV-कैश वार्मिंग ने Mac Studio M3 Ultra चैट टर्न को 6-20 सेकंड से घटाकर 1.6s कर दिया। 4x RTX 3060 सेटअप 144GiB क्वांट के साथ प्रॉम्प्ट को ~100 टोकन/सेकंड पर प्रोसेस करता है।
लो-बिट मॉडल राउंडअप. Bonsai 27B टर्नरी अब मुख्यधारा CUDA/Vulkan पर काम करता है; Mach-1 Additive 35B कंज्यूमर लैपटॉप पर 120 टोकन/सेकंड तक चलता है। Qwen3.8-27B पर आधारित नए वैरिएंट विकास में हैं।
एजेंट टूल्स और फ्रेमवर्क
ट्यून्ड एजेंट इवैल्यूएटर. LangChain ट्यून्ड इवैल्यूएटर पेश करता है जो उत्पादन ट्रेस में स्वचालित रूप से Perceived Error फीडबैक जोड़ते हैं। यह एक विशेष मॉडल का उपयोग करता है, जिससे मूल्यांकन लागत 82% तक कम हो जाती है।
एजेंट खोज बेंचमार्क. Artificial Analysis का Search Index एजेंटों के लिए Parallel, Exa, Firecrawl और अन्य को गुणवत्ता, लागत और गति के आधार पर रैंक करता है। बेहतर खोज गुणवत्ता ने टोकन उपयोग को 40% से अधिक कम कर दिया।
MCP के लिए WriteGuard. Cloudflare का WriteGuard, अब निजी बीटा में, MCP सर्वर के माध्यम से लेखन क्रियाओं के लिए केंद्रीकृत नीतियां, एट्रिब्यूशन और ऑडिट लॉग जोड़ता है।
Warp सॉफ्टवेयर फैक्ट्रियाँ. Warp Factories एक इंफ्रास्ट्रक्चर परत है जो छोटी कंपनियों को सॉफ्टवेयर फैक्ट्री मॉडल का उपयोग करके AI कोडिंग एजेंट तैनात करने में मदद करती है।
Claude Code मॉकअप. Claude Code में Anthropic का /design कमांड टर्मिनल में UI मॉकअप बनाता है, जो विकास से पहले मौजूदा कोडबेस शैली से मेल खाता है।
सुरक्षा, संरक्षा और नीति
OpenAI सुरक्षा ओवरहाल. Hugging Face घटना और इस सबूत के बाद कि Astra महत्वपूर्ण साइबर सुरक्षा क्षमता को प्रभावित कर सकता है, OpenAI ने दो सप्ताह के लिए RL रोक दिया और सैंडबॉक्स को मजबूत किया। इसका सबसे बड़ा नियोजित फ्रंटियर RL रन अभी भी रोका हुआ है।
Copilot गार्डरेल्स का खुलासा. शोधकर्ताओं ने Microsoft 365 Copilot से उसके स्वयं के उपयोगकर्ता-पुष्टि गार्डरेल्स को समझाने के लिए कहा, फिर बिना पुष्टि के डेटा निकालने के लिए एक लिंक-क्लिक एक्सप्लॉइट बनाया।
किशोरों के लिए ChatGPT. किशोरों के लिए ChatGPT 18 वर्ष से कम उम्र के उपयोगकर्ताओं पर स्वचालित रूप से लागू होता है, जिसमें सख्त सामग्री प्रतिबंध, स्टडी मोड और माता-पिता के नियंत्रण शामिल हैं। इसका उद्देश्य धोखाधड़ी और हानिकारक सामग्री को कम करना है।
Amodei ओपन-मॉडल बहस. Anthropic के सीईओ Dario Amodei का तर्क है कि ओपन मॉडल चिप मालिकों को शक्ति स्थानांतरित करते हैं और AI विनियमन प्रस्तावों का बचाव करते हैं। LeCun और Sacks सहित आलोचक उन पर भय फैलाने का आरोप लगाते हैं।
उद्योग और व्यापार
Cursor ने Origin लॉन्च किया. Cursor ने Origin लॉन्च किया, जो कोड होस्टिंग के लिए GitHub का प्रतियोगी है, जिसमें एजेंट-नेटिव सुविधाएँ और एक ऐप इकोसिस्टम की योजना है।
Etched का मूल्यांकन दोगुना. Etched ने Jane Street द्वारा इसके प्रीफिल/डिकोड इंफ्रेंस चिप्स का परीक्षण करने के बाद $21B मूल्यांकन पर $700M जुटाए, जो एक महीने में दोगुना है।
मॉडल रूटिंग मांग. Stripe की $7B OpenRouter खरीद और Glean का $300M ARR, ओपन-वेट मॉडलों की बढ़ती लोकप्रियता के साथ मॉडल रूटिंग की बढ़ती मांग को उजागर करते हैं।
अनुसंधान और अध्ययन
एजेंट मेमोरी कैलिब्रेशन. Hugging Face अध्ययन से पता चलता है कि एजेंटिक मेमोरी प्रभाव मॉडल स्तर के अनुसार भिन्न होते हैं: gpt-oss-120b को पूर्ण दिशानिर्देशों के साथ कार्य पूर्णता में +16.1pp का लाभ हुआ, जबकि कमजोर मॉडलों को कॉम्पैक्ट पुनर्प्राप्ति की आवश्यकता होती है।
स्वतंत्र AI उपयोग डेटा. Stanford का AI Observatory वास्तविक बातचीत एकत्र करता है और पाता है कि AI उपयोग मॉडलों के बीच काफी भिन्न है, जिसमें कंपनियों के दावे की तुलना में कार्य उपयोग के मामले कम आम हैं।
कॉम्पैक्शन निर्देश गिराता है. Penn State के शोधकर्ताओं ने पाया कि संदर्भ कॉम्पैक्शन के बाद केवल 17% सत्र बाधाएँ बचती हैं; एक छोटा ऐड-ऑन LLM अधिकांश खोए हुए निर्देशों को पुनर्प्राप्त करता है।
आत्म-सुधार निकट नहीं. Princeton के नेतृत्व में हुए अध्ययन में पाया गया कि AI एजेंट इंजीनियरिंग समस्याओं को हल कर सकते हैं, लेकिन उनमें खुले अंत वाले AI अनुसंधान के लिए निर्णय की कमी है, जो बताता है कि पुनरावर्ती आत्म-सुधार में अधिक समय लग सकता है।
आज के लिए बस इतना ही - लगभग 5 मिनट का पठन।