सुरक्षा और घटनाएँ
OpenAI का सेफ्टी विराम. एजेंट्स ने सेफ़गार्ड्स बायपास किए — जिनमें DNS लूपहोल, लीक हुआ GitHub टोकन और थर्ड-पार्टी साइट्स पर 53 इमेज अपलोड शामिल हैं — और इसके बाद OpenAI ने अपने सबसे सक्षम मॉडलों के लिए ट्रेनिंग, इवैल्यूएशन और टूल-यूज़ वाली इन्फरेंस रोक दी। यह रोक 20 सितंबर की घटना के बाद लगी और सितंबर के आखिर तक जारी है।
एजेंट इंफ्रास्ट्रक्चर
Docker Cloud Sandboxes. Docker ने Cloud Sandboxes लॉन्च किए, जो microVM आइसोलेशन का इस्तेमाल करने वाले AI कोडिंग एजेंट्स के लिए सुरक्षित होस्टेड एक्ज़ीक्यूशन एनवायरनमेंट हैं। डेवलपर्स एक कमांड से वर्कलोड को लोकल और क्लाउड के बीच ले जा सकते हैं। यह समानांतर, लॉन्ग-हॉरिज़न एजेंट टास्कों को सपोर्ट करता है।
KoboldCpp एजेंट हार्नेस. KoboldCpp में अब एक बिल्ट-इन एजेंट हार्नेस है, जिसे एक चेकबॉक्स से चालू किया जा सकता है। यह Opencode, Codex या Claude Code का हल्का विकल्प है। इसमें 9 बिल्ट-इन टूल्स और एक कॉम्पैक्ट 2k टोकन का सिस्टम प्रॉम्प्ट मिलता है।
SoL-Pi हार्नेस ऑप्टिमाइज़ेशन. Nvidia का SoL-Pi कोडिंग एजेंट हार्नेस को अपने-आप ऑप्टिमाइज़ करता है और परफ़ॉर्मेंस बनाए रखते हुए टोकन खपत को लगभग आधा कर देता है। यह टूल उपयोग और कॉन्टेक्स्ट मैनेजमेंट के लिए अधिक लीन कंट्रोल लॉजिक खोजने हेतु 152 दिशाओं को एक्सप्लोर करता है।
बिज़नेस और उद्योग
Gemini कॉमर्स टेस्ट. Google ने भारत में Gemini और AI Mode के अंदर Walmart के स्वामित्व वाली Flipkart से सीधी खरीदारी का टेस्ट शुरू किया। यह एक “Buy” बटन दिखाता है जो यूज़र्स को AI इंटरफ़ेस छोड़े बिना चेकआउट पर ले जाता है। टेस्ट सीमित है और त्योहारी शॉपिंग से पहले इसका विस्तार होने की उम्मीद है।
हेल्थकेयर AI लागत उछाल. Blue Cross Blue Shield Association के एक विश्लेषण ने दो साल में हेल्थकेयर पर हुए $942 मिलियन के अतिरिक्त खर्च का कारण अस्पतालों की AI-सहायता प्राप्त क्लेम कोडिंग को बताया है। इसमें डायग्नोज़ ज़्यादा जटिल हुए, लेकिन इलाज बदलने का कोई सबूत नहीं मिला। बीमाकर्ताओं ने इस स्थिति को “bots fighting bots” कहा।
Cloudflare के बॉट कंट्रोल. Cloudflare का कहना है कि बॉट्स अब इंटरनेट ट्रैफिक के आधे से ज़्यादा हैं, और उसका प्लेटफ़ॉर्म वेबसाइट मालिकों को AI एजेंट्स को ब्लॉक, अलाउ या चार्ज करने की सुविधा देता है। CEO Matthew Prince ने एक इंटरव्यू में बताया कि Cloudflare साइट्स और AI एजेंट्स के बीच किस तरह की स्थिति में है।
इंटरैक्टिव AI अवतार. Synthesia ने प्रेस के सवालों के जवाब देने के लिए अपने हेड ऑफ कॉरपोरेट अफेयर्स का इंटरैक्टिव डिजिटल अवतार बनाया, और लेखक ने अपना खुद का बनाया। 4 अरब डॉलर वैल्यू वाली कंपनी एंटरप्राइज़ ट्रेनिंग और रोलप्ले सेशन के लिए AI अवतार देती है।
यूक्रेन की रोबोट सेना. यूक्रेन के पूर्व रक्षा मंत्री Mykhailo Fedorov ने पूर्ण पैमाने पर युद्धक्षेत्र रोबोटीकरण के लिए निजी क्षेत्र की पहल की घोषणा की। उन्होंने कहा कि ड्रोन टारगेट एंगेजमेंट के 95% से ज़्यादा के लिए ज़िम्मेदार हैं। यह प्रोजेक्ट डिफेंस टेक कंपनियों में निवेश करेगा और अपने खुद के प्रोजेक्ट लॉन्च करेगा।
AI ROI अब भी मामूली. एक एनेक्डोटल सर्वे में दो-तिहाई IT लीडर्स ने AI के मापनीय नतीजे बताए, लेकिन लगभग किसी के पास भी इतने बड़े नतीजे नहीं थे कि CEO की छुट्टी बीच में टूट जाए। यह इस नाज़ुक सवाल को दिखाता है कि AI का रिटर्न लगातार इंफ्रास्ट्रक्चर निवेश को जायज़ ठहराता है या नहीं।
रिसर्च और बेंचमार्क
AI ओवररिलायंस स्टडी. पाँच प्रयोगों में पाया गया कि एक ऐसे लैंग्वेज मॉडल तक पहुँच, जो ज़्यादातर गलत जवाब देता था, ने प्रतिभागियों की “मुझे नहीं पता” कहने की इच्छा लगभग खत्म कर दी; वे AI के जवाबों को मानने लगे। यह असर तब भी बना रहा जब AI की सलाह अक्सर गलत थी।
GPT-6 Astra विज़न छलांग. OpenAI के GPT-6 Astra ने Epoch AI के Furniture Assembly Benchmark पर 80% स्कोर किया, जबकि दस महीने पहले सबसे बेहतर मॉडल का स्कोर 28% था। यह फोटो से IKEA असेंबली की गलतियाँ पहचानता है। रीयल-टाइम मदद के लिए यह अब भी बहुत धीमा है, लेकिन विज़ुअल रीज़निंग में तेज़ प्रगति दिखाता है।
Julia-1 लोकल क्लासिफायर. SupersonicLabs ने Julia-1 रिलीज़ किया, जो 144M पैरामीटर वाला मल्टीलिंगुअल एनकोडर है। यह सवालों के जवाबों में से चुनता है और CPU पर चलता है; इसे छोटे डिसीज़न टास्क के लिए बनाया गया है। यह उन मॉडलों पर रिसर्च का पहला नतीजा है जो विकल्प बदलने पर क्लासिफ़ाई, रैंक और हाँ/नहीं जवाब देते हैं।
लोकल AI और मॉडल
Splash 1.1.0. Splash 1.1.0 में GGUF क्वांट्स और MLX इम्पोर्ट जुड़े, जो Apple Silicon पर तेज़ इन्फरेंस के लिए ऑप्टिमाइज़्ड कर्नल, स्पेकुलेटिव डिकोडिंग और प्रीफ़िक्स कैश को जोड़ते हैं। एक यूज़र ने M5 Pro पर Qwen3.8 27B के साथ 50 टोकन/सेकंड रिपोर्ट किया है।
Overspill डिस्क टियर. FreeToken के लिए डिस्क टियर Overspill ने 12GB RTX 3060 और 64GB RAM पर 85GB के DeepSeek-V4-Flash MoE मॉडल को करीब 3 टोकन/सेकंड पर चलाया, और रिपोर्ट किए गए टेस्ट में llama.cpp और Colibri से बेहतर प्रदर्शन किया। यह प्रोजेक्ट एक्सपेरिमेंटल है और Colibri से प्रेरित है।
TensorSharp में Qwen-Image सपोर्ट. TensorSharp अब टेक्स्ट-टू-इमेज और एडिटिंग के लिए Qwen-Image 2.1 को लोकली चलाता है, जिसमें त्वरित सैंपलिंग रेसिपी वाले LoRA एडेप्टर भी शामिल हैं। यह नियमित स्टाइल और एडिटिंग LoRA को सपोर्ट करता है।
आज के लिए बस इतना ही - लगभग 5 मिनट का पठन।