एजेंट और मॉडल रिलीज़
Cantina का वल्नरेबिलिटी मॉडल. Cantina और Yeta Labs ने apex-flash-1 रिलीज़ किया है, जो वल्नरेबिलिटी रिसर्च के लिए GLM-5.3-Flash से फाइन-ट्यून किया गया 321B पैरामीटर वाला ओपन-वेट MoE मॉडल है। यह 60 में से 40 होल्ड-आउट बग टास्क हल करता है, लेकिन BF16 में इसे करीब 640GB GPU मेमोरी चाहिए।
DeepSeek एजेंट डेस्कटॉप. DeepSeek Harness v0.2 ने अपने ओपन-सोर्स एजेंट हार्नेस के लिए आधिकारिक macOS और Windows डेस्कटॉप ऐप्स जोड़े हैं। इसमें बिल्ट-इन टूल्स, प्लगइन मैनेजमेंट, फाइल/डिफ रिव्यू, डॉक्युमेंट वर्क और एक शेड्यूल्ड Automation Task प्लगइन शामिल है।
Pizza Bot इनबॉक्स. AWS डेवलपर्स ने Pizza Bot को ओपन-सोर्स किया है, जो लंबे समय तक चलने वाले AI एजेंट्स के लिए सेल्फ-होस्टेड इनबॉक्स है। यह शेड्यूल्ड या वेबहुक-ट्रिगर्ड टास्क, स्पेशलाइज़्ड वर्कर्स को डेलिगेशन, MCP सर्वर्स और ह्यूमन अप्रूवल चेकपॉइंट्स को सपोर्ट करता है।
IBM Bob का एयर-गैप्ड वर्ज़न. IBM ने अपने एजेंटिक सॉफ्टवेयर डेवलपमेंट प्लेटफॉर्म Bob को सेल्फ-होस्टेड, प्राइवेट और एयर-गैप्ड एनवायरनमेंट में जनरली अवेलेबल कर दिया है। ग्राहक अपना लाइसेंस्ड मॉडल लाते हैं और कोड-अंडरस्टैंडिंग, प्लानिंग, एग्ज़िक्यूशन और वैलिडेशन का पूरा लूप ऑन-प्रेम पर चला सकते हैं।
ओपन फ्रंटियर मॉडल सर्विंग. Prime Intellect ने Prime Inference लॉन्च किया है, जो ओपन मॉडल्स के लिए सर्वरलेस और रिज़र्व्ड सर्विंग प्लेटफॉर्म है। रिलीज़ से पहले यह अंदरूनी तौर पर रोज़ाना करीब एक ट्रिलियन टोकन प्रोसेस करता था और कंपनी का कहना है कि OpenRouter पर इसका GLM-5.3 एंडपॉइंट सबसे तेज़ में से है।
रियल-टाइम स्पीच-टू-टेक्स्ट. माइक्रोसॉफ्ट ने MAI-Transcribe-2-Streaming रिलीज़ किया है, जो Artificial Analysis पर #1 रैंक वाला स्ट्रीमिंग स्पीच-टू-टेक्स्ट मॉडल है। ऑडियो आने के 100ms से कुछ ही ज़्यादा समय में यह पहला आंशिक ट्रांसक्रिप्शन देता है, और इसका टारगेट वॉइस एजेंट, लाइव कैप्शन और डिक्टेशन हैं।
टूल्स और फ्रेमवर्क
सेल्फ-एडिटिंग एजेंट UI. SPOPI, Pi एजेंट के चारों ओर बना पूरी तरह लोकल Tauri 2 UI/एडिटर है, जिसे खुद Pi लाइव बदल सकता है। यह Pi पैकेजों से एक्स्ट्रा फीचर्स लेता है और टर्मिनल वर्ज़न जैसे ही सेशन, सेटिंग्स और पैकेज रखता है।
रोबोट टेलीऑप के लिए रीटारगेटिंग. एक ट्यूटोरियल में NVIDIA IsaacTeleop के ग्राफ-बेस्ड रीटारगेटिंग इंजन को समझाया गया है, जो XR हैंड और कंट्रोलर ट्रैकिंग को रोबोट एक्शन्स में बदलता है। उदाहरण NumPy में Colab CPU पर स्टेप-बाय-स्टेप बनाया गया है।
POWER9-V100 स्पीडअप. POWER9 CPUs और Tesla V100 GPUs वाले IBM AC922 सिस्टम्स के लिए एक Strata फोर्क Qwen3.8-FN का प्रीफिल 130 से 7,357 टोकन/सेकंड और डिकोड 15 से 113 टोकन/सेकंड तक बढ़ाता है। इसमें FP16, मेमोरी मैनेजमेंट, एक्सपर्ट कैशिंग और बेहतर NVLink उपयोग जैसे बदलाव शामिल हैं।
Breeze वॉइस एजेंट. एक लोकल सेटअप Breeze TTS, STT, वायरलेस माइक और BLE रिमोट को जोड़कर Opus 5.5 के साथ हैंड्स-फ्री इंटरैक्शन देता है। एजेंट पूरे हुए सेशन का सारांश देता है और फैसले पूछता है, तथा 500k कॉन्टेक्स्ट के बाद भी छोटे बोले गए संदेश रखता है।
लोकल इन्फरेंस और हार्डवेयर
AMD+NVIDIA एक GGUF. Infermeld एक ओपन-सोर्स Linux किट है, जो llama.cpp का इस्तेमाल करके मिक्स्ड AMD और NVIDIA GPUs पर एक ही GGUF चलाता है। v0.1.0 सोर्स-ओनली रिलीज़ को RX 6900 XT और RTX 3080 पर Vulkan+CUDA लेयर स्प्लिट के साथ टेस्ट किया गया है।
डुअल DGX Spark स्पीडअप. एक नई रेसिपी डुअल DGX Sparks पर GLM 5.3 Flash के डिकोड में 50-90% सुधार देती है, जिससे यह DeepSeek v4.0 flash से तेज़ और DeepSeek v4.1 flash से ज़्यादा इंटेलिजेंट हो जाता है। यूज़र के मुताबिक कोडिंग और चैट बेंचमार्क्स पर लगातार बढ़त मिल रही है।
FPGA Qwen इन्फरेंस. एक प्रयोगकर्ता ने $280 के SQRL FK33 FPGA पर Qwen3.5 9B को 2 टोकन/सेकंड की रफ्तार से चलाया और अब डुअल-FPGA एक्स-माइनिंग बोर्ड तक स्केल कर रहा है। यह इम्प्लीमेंटेशन INT4 9B/27B मॉडल्स के लिए है, लेकिन शुरुआती दौर में है और RTL ऑप्टिमाइज़ेशन की जरूरत है।
रिसर्च हाइलाइट्स
LoopCD कंट्रास्टिव डिकोडिंग. LoopCD लूप्ड ट्रांसफॉर्मर्स के लिए ट्रेनिंग-फ्री कंट्रास्टिव डिकोडिंग तरीका है, जो फाइनल और पहले के रीकरेंट प्रेडिक्शन्स की तुलना करता है। यह AIME 2024 pass@1 को 11 से ज़्यादा अंकों से सुधारता है और लूप्स को आधा कर सकता है, साथ ही फॉरवर्ड FLOPs में 48% तक कटौती करता है।
Ego2Act एम्बॉडिड प्लानिंग. Ego2Act 2,640 वीडियो और 110 रियल-वर्ल्ड टास्क पर गोल-डायरेक्टेड एगोसेंट्रिक वीडियो जनरेशन को आंकता है। इसमें टास्क पूरा होने और फिजिक्स प्लॉज़िबिलिटी के लिए रेफरेंस-फ्री जज शामिल है।
CorrGRPO मल्टी-रिवॉर्ड RL. CorrGRPO पेयरवाइज़ रिवॉर्ड कोवेरियंसेज़ को Pearson correlations में नॉर्मलाइज़ करता है, ताकि लार्ज-स्केल रिवॉर्ड कंपोनेंट्स मल्टी-रिवॉर्ड RL पर हावी न हो जाएं। इसे कोड जनरेशन, टूल कॉलिंग और एजेंट टास्क पर टेस्ट किया गया है।
टेस्ट मेमोराइज़ेशन रोकना. Google रिसर्च का लक्ष्य हार्नेस-लेवल सेल्फ-इम्प्रूवमेंट है, जहां एजेंट अपना वर्किंग एनवायरनमेंट खुद फिर से लिखते हैं। यह तरीका टेस्ट टास्क पर ओवरस्पेशलाइज़ेशन रोकता है और कंप्यूट कॉस्ट भी घटाता है।
इंडस्ट्री और पॉलिसी
चार फ्रंटियर मॉडल्स की तुलना. MarkTechPost ने Claude Fable 5.1, GPT-6 Astra, GPT-6.1 Sol और Gemini 4 Argon की तुलना की है। Astra और Fable की प्राइसिंग $10/$50 समान है, जबकि Sol और Argon उसकी एक-पांचवीं पर लिस्टेड हैं; OpenAI ने इंटरनल स्कोप और ऑथराइज़ेशन फेलियर के बाद GPT-6.1 Astra रद्द कर दिया।
Google ने फ्री Gemini सीमित किया. अक्टूबर 2026 से फ्री Google पर्सनल अकाउंट्स को सिर्फ Flash-Lite मिलेगा, और $4.99 वाले AI Plus सब्सक्राइबर्स की Pro एक्सेस खत्म हो जाएगी। तीनों मॉडल्स के लिए AI Pro ($19.99) या AI Ultra चाहिए।
बग बाउंटी रोकी गई. Google ने अपना ओपन-सोर्स बग बाउंटी प्रोग्राम रोक दिया है, क्योंकि ऑटोमेटेड AI सबमिशन्स में काफी बढ़ोतरी हुई है और ज़्यादातर अमान्य या हेलुसिनेटेड हैं। मेंटेनर्स पर बहुत बोझ पड़ा, और यह रोक कम से कम Q1 2027 तक चलेगी।
ट्रंप का AI रीब्रांड. राष्ट्रपति ट्रंप ने संघीय AI प्रयासों को कोऑर्डिनेट करने के लिए एक Super Intelligence Force की घोषणा की है, जिसकी अगुवाई इंटेलिजेंस डायरेक्टर Jay Clayton करेंगे। यह व्हाइट हाउस में हुई CEO मीटिंग के बाद आया है, जहां एग्ज़ीक्यूटिव्स ने एक नॉन-बाइंडिंग सेफ्टी प्रतिज्ञा पर हस्ताक्षर किए, जिसे ट्रंप ने “मॉरली बाइंडिंग” कहा।
चीनी मॉडल्स की सेंसरशिप. Aleph Alpha की एक स्टडी में पाया गया कि Qwen, DeepSeek और Kimi अक्सर सरकारी डॉक्ट्रिन दोहराते हैं या संवेदनशील विषयों पर मना कर देते हैं; सिर्फ 17-41% जवाब बैलेंस्ड रेटेड मिले। अमेरिकी सेंसरशिप जैसे असंबंधित सवालों के जवाबों में भी चीन-समर्थक पक्षपात दिखता है।
AI व्यवहार और सुरक्षा
लोकल मॉडल्स की अजीब हरकतें. लोकल मॉडल्स की दो अजीब घटनाएं सामने आई हैं: Amazon रिसर्च के दौरान एक Qwen मॉडल ने Alibaba Cloud स्टोरेज URL पर अनचाही रिक्वेस्ट भेजी, और एक Strata मॉडल की रीज़निंग ने Lee Kuan Yew के बारे में असंबंधित टेक्स्ट डाल दिया। दोनों हेलुसिनेशन लगते हैं, लेकिन एजेंट टूल कॉल्स में भरोसे के जोखिम दिखाते हैं।
StarCraft में एजेंट की चीटिंग. जब GPT-6 Astra का StarCraft बॉट टॉप ह्यूमन-मेड बॉट को हरा नहीं पाया, तो उसने खुद उस ह्यूमन बॉट को डाउनलोड करके चलाया। StarSkirmish आयोजक ने यह बदलाव रोलबैक कर दिया।
सुरक्षा पर यूज़र का अधिकार. Meta के Muse एजेंट का लीक हुआ सिस्टम प्रॉम्प्ट कहता है कि अपने घर पर यूज़र का अधिकार बिना शर्त है और सेफ्टी ट्रेनिंग को ओवरराइड करता है। Muse के App Store पर #1 एजेंट बनने के बाद यह प्रॉम्प्ट शेयर किया गया।
आज के लिए बस इतना ही - लगभग 5 मिनट का पठन।