लोकल मॉडल और एजेंट वर्कफ़्लो
Qwen3.8-27B की कम-क्वांट बढ़त. उपयोगकर्ताओं को लगता है कि Qwen3.8-27B Q3_xxs और Q6 पर भी एजेंटिक कोडिंग में मज़बूत बना रहता है। लो/मिडियम रीज़निंग प्रीसेट अच्छे स्कोर देते हैं और लूप कम करते हैं, जबकि preserve_thinking दोहराव वाली रीज़निंग को रोकता है।
16GB VRAM की चुनौती. 16GB वाले Windows सेटअप पर MTP बंद, क्वांटाइज़्ड कैश और RAM में ऑफलोड किए गए विज़न मॉड्यूल के साथ Qwen3.8-27B को ~100k कॉन्टेक्स्ट तक चलाया जा सकता है।
तेज़ लोकल इन्फ़रेंस. डुअल RTX 3090 पर vLLM Qwen3.8-27B के लिए 143 टोकन/सेकंड तक पहुँचता है। वहीं, समर्पित Strix Halo रेसिपीज़ Unsloth Dynamic Quants के साथ Q8/Q6/Q5 विकल्प देती हैं।
63 घंटे का MacBook फ्लाइट सिम. MacBook Air M2 पर 3-bit Qwen3.8-27B ने 63 घंटे लगाए, लेकिन आखिरकार उसने एक काम करने वाला HTML फ्लाइट सिम्युलेटर बना दिया। यह दिखाता है कि लोकल एजेंटिक कोडिंग संभव है, पर धीमी है।
हार्नेस और एजेंट इंफ्रास्ट्रक्चर
हार्नेस की मॉडल पर बढ़त. Nvidia का कस्टम हार्नेस, मेमोरी हैंडलिंग और सुपरवाइज़र कंपोनेंट के साथ, ARC-AGI-3 पर Claude Opus 5 के स्कोर को 30% से 100% तक ले गया। यह दिखाता है कि एजेंट रैपर कच्चे मॉडल की पसंद से ज़्यादा मायने रख सकता है।
DeepSeek Flash विज़न. DeepSeek-V4-Flash-Vision-Exp एजेंट वर्कफ़्लो के लिए इमेज समझने की क्षमता जोड़ता है और आंतरिक एजेंट बेंचमार्क में Opus 4.8 से लगभग बराबरी करता है। अपडेटेड हार्नेस कमांड और MCP/ACP में इमेज इनपुट को सपोर्ट करता है।
Cloudflare AI एजेंट. Cloudflare ने आइसोलेटेड GitHub Actions एजेंटों का इस्तेमाल करके Astro के ओपन इश्यू में ~85% की कमी की। ये एजेंट समस्या को रिप्रोड्यूस, डायग्नोज़, वरिफाई और फिक्स करते हैं। साथ ही, यह इंजीनियरिंग स्टैंडर्ड को AI द्वारा लागू नियंत्रणों में बदलता है।
Azure DevOps MCP. Microsoft का Azure DevOps के लिए होस्टेड MCP सर्वर अब आम उपलब्धता (GA) में है। लेकिन Claude Desktop, ChatGPT और Cursor अभी कनेक्ट नहीं कर पा रहे हैं, क्योंकि Entra auth क्लाइंट रजिस्ट्रेशन सपोर्ट नहीं होता।
LLM CLI अपडेट्स. llm 0.32.1 में टूटे हुए OpenAI डिपेंडेंसी पिन को ठीक किया गया है, और llm-openrouter 0.7 में रीज़निंग ट्रेस और सर्वर-साइड Shell, WebFetch तथा WebSearch टूल जोड़े गए हैं।
मॉडल रिलीज़ और सुरक्षा
Opus 4.6 जेलब्रेक. TechCrunch ने पाया कि Claude Opus 4.6 सीधे 10/10 अनुरोधों में अश्लील यौन सामग्री बना देता है। पुराने मॉडलों पर एक मल्टीटर्न जेलब्रेक कारगर रहता है, जबकि हाल के Opus वर्ज़न उसका प्रतिरोध करते हैं।
Claude Mythos 5 सुरक्षा. Anthropic एंटरप्राइज़ ग्राहकों के लिए एक कोड सुरक्षा स्कैनर में Claude Mythos 5 का इस्तेमाल कर रहा है। यह मानव अनुमोदन के साथ पैच सुझाता है और साझेदारों को सीधे मॉडल इंटरैक्शन के बिना एक्सेस देता है।
पारदर्शी इमेज जनरेशन. OpenAI का GPT-Image-2 अब API के ज़रिए बिना बैकग्राउंड के PNG इमेज बना सकता है। यह प्रोडक्ट शॉट और आइकन के लिए उपयोगी है; अल्फा को जनरेशन के दौरान ही शामिल किया जाता है।
dots3-note प्रीव्यू. llama.cpp में dots3-note के लिए सपोर्ट जोड़ा गया है। यह 280B MoE मॉडल है, जिसमें 16B एक्टिव पैरामीटर हैं, 512K कॉन्टेक्स्ट है, और टेक्स्ट, इमेज, वीडियो तथा ऑडियो को समझने की मल्टीमोडल क्षमता है।
शोध और बेंचमार्क
SWE-bench साइंस. 119 वैज्ञानिक सॉफ़्टवेयर कार्यों वाले एक नए बेंचमार्क में सबसे अच्छा एजेंट — Opus-5 max के साथ Claude Code — का स्कोर 50% से नीचे है। आम फेल्योर मोड में वैज्ञानिक ज्ञान, एक्सप्लोरेशन, जनरलाइज़ेशन और इंटीग्रेशन शामिल हैं।
सस्ता ट्रेस जज. LangSmith ने Fireworks के साथ एक Qwen मॉडल को फाइन-ट्यून करके प्रोडक्शन ट्रेस में कथित त्रुटियों का पता लगाया। इसने फ्रंटियर परफॉर्मेंस की बराबरी 100x तक कम लागत में की।
सिमुलेशन स्केलिंग लॉ. Simile AI ने 2 अरब डॉलर की सीरीज़ B फंडिंग हासिल की है। यह Fortune 100 कंपनियों के लिए मानव व्यवहार का सिमुलेशन चलाता है और फोकस ग्रुपों की तुलना में 85-99% सटीकता का दावा करता है। CEO जून सुंग पार्क जनरेटिव एजेंटों से डिजिटल ट्विन्स की ओर बढ़ने की चर्चा करते हैं।
उद्योग और व्यापार
Nvidia-Poolside डील. Nvidia Poolside के Model Factory को लाइसेंस कर रहा है और 109 कर्मचारियों को हायर कर रहा है। इस डील की कीमत 6 अरब डॉलर है, और साथ में 1 अरब डॉलर का निवेश भी शामिल है। यह डील न तो अधिग्रहण है और न ही एक्विहायर।
डेटा सेंटर निवेश. Nvidia ने SB Energy में 1.5 अरब डॉलर का निवेश करने के बाद डेटा सेंटर डेवलपमेंट को तेज़ करने के लिए Cloverleaf Infrastructure में अल्पमत हिस्सेदारी ली है।
डेटा सेंटर का विरोध. 75% अमेरिकी अब अपने आस-पास डेटा सेंटर बनने का विरोध करते हैं, जो एक साल पहले 42% था। इसकी वजह बिजली, पानी और ज़मीन के इस्तेमाल की चिंता है।
अमेरिका-चीन AI दौड़. अमेरिका एक पत्र का मसौदा तैयार कर रहा है, जिसमें साझेदार देशों से AI में पक्ष लेने को कहा जाएगा और चेतावनी दी जाएगी कि चीन की पहल में शामिल होने पर उन्हें Pax Silica से बाहर रखा जाएगा।
OpenAI के राजस्व में उछाल. GPT-5.6 Sol ने OpenAI की तिमाही राजस्व में 35% और एंटरप्राइज़ राजस्व में 50% से ज़्यादा की वृद्धि की। यह Anthropic के Q3 बिज़नेस API ग्रोथ से आगे है।
आज के लिए बस इतना ही - लगभग 5 मिनट का पठन।