फ्रंटियर और बड़ी लैब्स
OpenAI का RSI अभियान. OpenAI का कहना है कि उसने अपने 'ऑटोमेटेड रिसर्च इंटर्न' लक्ष्य को हासिल कर लिया है। आंतरिक कोडिंग एजेंटों से रिसर्च की रफ्तार बढ़ी है, और कुछ योजनाएँ छह महीने पहले ही पूरी हो गई हैं। चीफ साइंटिस्ट Jakub Pachocki के निबंध में रिकर्सिव सेल्फ-इम्प्रूवमेंट को AGI का केंद्र बताया गया है। कंपनी प्रति शोधकर्ता AI खर्च में जुलाई में आई उछाल को उस मॉडल से जोड़ती है जो बाद में GPT-6 Astra के रूप में जारी हुआ।
Figma के सुरक्षा एजेंट. Figma ने Panther SIEM पर AI एजेंट बनाए हैं, जो AWS, Okta, GitHub, GCP और osquery के अलर्ट की जाँच करते हैं। इससे जटिल अलर्ट के समाधान के समय में 70% और ऑन-कॉल पेजों में 20% की कमी आई है, जबकि मानव समीक्षा अब भी बरकरार है।
Google का Mantis हार्नेस. Google ने Mantis को ओपन-सोर्स कर दिया है। यह एक एजेंटिक वल्नरेबिलिटी स्कैनिंग फ्रेमवर्क है, जो क्रिटिक/रिव्यूअर एजेंट और सैंडबॉक्स्ड रिप्रोडक्शन को जोड़ता है, ताकि कोड स्कैनिंग में फॉल्स पॉजिटिव और हैल्युसिनेटेड वल्नरेबिलिटी कम हों।
लोकल इंफेरेंस और हार्डवेयर
LayerStoRm एक्सपर्ट स्ट्रीमिंग. LayerStoRm, एक प्रायोगिक MIT-लाइसेंस्ड इंजन, MoE एक्सपर्ट्स को होस्ट RAM से GPU तक लगातार स्ट्रीम करता है। यह 96 GB VRAM पर 186 GiB GLM-5.3-Flash क्वांट को 24.5 tok/s पर चलाता है और एजेंटिक कोडिंग के लिए प्रीफिक्स कैशिंग भी करता है।
Radeon Pro R9700 बिल्ड. AMD के Radeon AI Pro R9700 के आसपास कम्युनिटी बिल्ड परिपक्व हो रहे हैं। 64 GB DDR5 वाला डुअल-R9700 सिस्टम vLLM के तहत Qwen 3.8 27B FP8/MXFP4 और Flash Next चलाता है। वहीं, यूज़र DeepSeek V4 Flash और Qwen 3.8 Flash को ऑफलोड करने के लिए 4xR9700 पर चर्चा कर रहे हैं।
लोकल कैश ट्यूनिंग. एक नया ओपन-सोर्स टूल लोड के दौरान दावा किए गए KV कैश रिटेंशन की जाँच करता है। यह दिखाता है कि डिडुप और बाउंडफिक्स पैच 146% तक क्षमता बनाए रख सकते हैं। यूज़र यह भी बता रहे हैं कि पुराने GPUs पर f16 कैश, Q8 की तुलना में MTP स्वीकृति को बेहतर बनाता है।
बेंचमार्क और इवैलुएशन
Struggle Bench. 'Struggle Bench' मॉडल को एक सर्वर, अपार्टमेंट और बैंक खाता देता है। फिर यह स्कोर करता है कि वह बिना साइबर अपराध किए कितने महीने किराया चुका सकता है और चालू रह सकता है। यानी यह असली ऑटोनॉमी और अस्तित्व की परीक्षा है।
lm-eval-ledger हार्नेस. lm-eval-ledger बेंचमार्क चलाकर पूरा डेटा SQLite में स्टोर करता है। इसके साथ एक वेब ऐप भी है, जिससे सिर्फ हेडलाइन नंबरों के बजाय यह देखा और तुलना किया जा सकता है कि मॉडल ने हर सवाल का जवाब कैसे दिया।
गहरे कोडिंग बेंचमार्क. Program-Bench, SRE-Bench और Code Migration एजेंटों को दस्तावेज़ों से बाइनरी रिकंस्ट्रक्ट करने, बिना सोर्स के असली दुनिया की बाइनरी समझने और प्रोग्राम को दूसरी भाषा में दोबारा लिखने के लिए चुनौती देते हैं। ये बेंचमार्क गहरी सॉफ्टवेयर इंजीनियरिंग क्षमता की जाँच करते हैं।
कानून और कॉपीराइट
Seattle Times और Newsday का मुकदमा. The Seattle Times और Newsday ने OpenAI और Microsoft के खिलाफ कॉपीराइट उल्लंघन का मुकदमा किया है। उन्होंने अपने कामों पर आधारित AI मॉडलों को नष्ट करने की माँग की है। इसके साथ वे ऐसी ही माँग रखने वाले करीब 400 स्थानीय अखबारों के साथ शामिल हो गए हैं।
Anthropic समझौते पर विवाद. लेखकों का कहना है कि प्रकाशक और एजेंट Anthropic के $1.5 अरब कॉपीराइट समझौते में अपने हिस्से से ज़्यादा दावा कर रहे हैं। रिवर्टेड अधिकारों को लेकर भी विवाद है, जहाँ लेखकों को पूरा भुगतान मिलना चाहिए।
सुरक्षा और गार्डरेल
Abliteration सर्विस. अमेरिकी स्टार्टअप Abliteration.ai, GLM-5.3 जैसे सेफ्टी-एब्लिटरेटेड ओपन-वेट मॉडल का API एक्सेस बेचता है। इनका इस्तेमाल रेड टीमिंग और मालवेयर विश्लेषण के लिए होता है। रिफ्यूज़ल हटाकर यह दुरुपयोग की राह आसान करता है।
अनसेंसर्ड Qwen वेरिएंट. आठ एब्लिटरेटेड Qwen 3.8 27B वेरिएंट की तुलना में orcarouter HarmBench ASR पर सबसे ऊपर रहा, जबकि apostate बेस क्षमताओं के सबसे करीब है। हालाँकि, कुछ रिलीज़ में विज़न और MTP जैसी सुविधाओं के न होने जैसी पैकेजिंग खामियाँ भी सामने आईं।
AI साइकोसिस पर बहस. शोधकर्ताओं का कहना है कि चापलूसी करने वाले चैटबॉट 'एक व्यक्ति की इको चैंबर' में भ्रम को बढ़ावा दे सकते हैं। वे 'AI-संबंधित साइकोसिस' को पहचाने जाने की माँग करते हैं, हालाँकि इसे एक अलग निदान के रूप में माना जाए या नहीं, यह विवादित है।
मॉडल रिलीज़ और रिसर्च
Spark-X2.5 कॉम्पैक्ट मॉडल. XHToken ने Spark-X2.5-4B और 1.7B जारी किए हैं। ये कुशल मॉडल हैं, जिनमें नेटिव 1M-टोकन कॉन्टेक्स्ट और 200+ भाषाओं के लिए सपोर्ट है। इसके अलावा, llama.cpp के एक PR ने इनके लिए सपोर्ट जोड़ा है।
WeatherNext 3 सैटेलाइट लर्निंग. Google और DeepMind का WeatherNext 3 फिजिक्स सिमुलेशन छोड़कर सीधे रीयल-टाइम सैटेलाइट डेटा से सीखता है। यह हर घंटे 5 किमी रिज़ॉल्यूशन वाले पूर्वानुमान बनाता है और वर्षा की सटीकता में 50% तक सुधार करता है।
Meta का रीयल-टाइम ऑडियो मॉडल. Meta ने Muse Voice Transcribe जारी किया है। यह रीयल-टाइम मॉडल ऑडियो को 80 मिलीसेकंड के हिस्सों में बाँटता है, बोली लिखता है और 20 स्पीकर तक अलग पहचानता है। 70+ भाषाओं में इसकी कीमत $0.18 प्रति घंटा है।
Google Lyria 3.5 संगीत. Google ने Lyria 3.5 को Gemini और APIs में शामिल कर दिया है। यह एक्सप्रेसिव वोकल्स के साथ संगीत जनरेट करता है और सिर्फ लाइसेंस्ड ट्रेनिंग डेटा पर आधारित है।
आज के लिए बस इतना ही - लगभग 5 मिनट का पठन।