लोकल मॉडल और एजेंट वर्कलोड
Qwen3.8 27B लोकल. सामुदायिक परीक्षणों से पता चलता है कि Qwen3.8 27B, निर्देश-पालन और लंबे-संदर्भ कार्यों में Qwen3.6 से अधिक मजबूत है; एक अकेला RTX 5090, NVFP4 संस्करण को 262K संदर्भ के साथ छोटे संदर्भ में 77 टोकन/सेकंड और 128K पर 65 टोकन/सेकंड की गति से चलाता है।
स्पेक्युलेटिव डिकोडिंग. n-gram ड्राफ्टर के साथ DFlash 2 ने Qwen3.8 27B के लिए LiveCodeBench प्रॉम्प्ट्स पर 2.26x और लंबे कोडिंग सत्रों में 4.68x तक की गति दिखाई; Ornith 35B पर एक फिक्स्ड MTP हेड ने वॉल-क्लॉक समय को एक तिहाई कम कर दिया।
रिकर्सिव संदर्भ प्रबंधन. डेवलपर्स एक तेज़ 64K मुख्य एजेंट को रिकर्सिव सब-एजेंट्स और छोटे कंप्रेसर मॉडल के साथ जोड़ रहे हैं ताकि 300K संदर्भ के लिए भुगतान किए बिना बहुत लंबे कार्यों को संभाला जा सके।
Gemma टूल-कॉलिंग ट्यून. टूल कॉलिंग और CLI उपयोग के लिए एक Gemma 4 12B फाइन-ट्यून ने टूल उपयोग में 2.7x सुधार किया और टूल-कॉल प्रयासों में 15.7% की वृद्धि की; यह 16GB VRAM सेटअप को लक्षित करता है।
DGX Spark क्लस्टर. 36-नोड DGX Spark क्लस्टर को एजेंट क्षमता क्लस्टर के रूप में चलाया जा रहा है, जो नोड्स को SOTA मॉडल, रीरैंक/एम्बेडिंग, वीडियो, इमेज और ऑडियो कार्यों में एक साथ विभाजित करता है।
टूल्स और फ्रेमवर्क
llama.cpp 0.2.0. llama.cpp संस्करण 0.2.0 लोकल इन्फ्रेंस के लिए प्री-बिल्ड्स और नवीनतम अपस्ट्रीम परिवर्तनों के साथ जारी किया गया।
Cloudflare Kitesurf. Kitesurf एजेंटों के लिए एक ब्राउज़र इंजन है, जो WebAssembly/Rust Workers पर बनाया गया है और प्रति पृष्ठ पृथक DOM रखता है; यह CDP का समर्थन करता है, जिससे Playwright और Puppeteer इसे पूर्ण Chromium की तुलना में कम ओवरहेड के साथ चला सकते हैं।
llm 0.33. साइमन विलिसन के llm 0.33 में एम्बेडिंग मॉडल के लिए प्रति-कॉल API कुंजियाँ, मॉडल कॉन्फ़िग और प्रॉम्प्ट्स को संयोजित करने के लिए दोहराने योग्य टेम्पलेट्स, और रीज़निंग मॉडल के लिए reasoning_summary विकल्प जोड़े गए हैं।
कोडिंग एजेंट अभ्यास. साइमन विलिसन का तर्क है कि कोडिंग एजेंटों के लिए मुख्य कौशल बदलावों को आत्मविश्वास से निर्देशित करना और सत्यापित करना है; लिनुस टॉर्वाल्ड्स ने एक ऐसे AI का वर्णन किया जिसने एक कठिन डीबग सत्र में छोटे-मोटे काम किए, लेकिन बार-बार समस्या को अनसुलझा बताने के बाद उसे आगे बढ़ने के लिए प्रेरित करना पड़ा।
रिसर्च और तरीके
कौशल प्लेबुक के रूप में. 8,135 परीक्षण रनों में, एजेंट कौशल ने मुख्य रूप से विश्वसनीय प्रक्रियाएँ देकर मदद की, न कि तथ्यों से; प्रक्रियात्मक आधार ने 65.7% लाभ में योगदान दिया, और जब कार्य सीखी गई प्रक्रिया से भटक गए तो कौशल विफल रहे।
मानसिक विश्व मॉडल. नए शोध में MENTIS के साथ AI विश्व मॉडल में मानवीय विश्वासों और इरादों को जोड़ा गया है; भौतिक, मानसिक और सामाजिक संभाव्यता का मॉडलिंग मानव व्यवहार की भविष्यवाणी में काफी सुधार करता है।
सुरक्षा बेंचमार्क साइकोमेट्रिक्स. आठ सुरक्षा बेंचमार्क के साइकोमेट्रिक विश्लेषण से पता चलता है कि एक एकल स्कोर इनकार की सख्ती, सत्यता और प्रासंगिक हानि के बीच के ट्रेड-ऑफ को छिपाता है; मॉडल अति-अवरोधन करके सुरक्षा स्कोर बढ़ा सकते हैं।
रिवर्सिबल CoT. चक्र-संगति जांच और अनकम्प्यूटेशन के साथ लगभग प्रतिवर्ती तर्क चरणों का एक प्रस्ताव भ्रम को पकड़ सकता है और एज LLM में KV-cache मेमोरी कम कर सकता है।
सब कुछ सिमुलेशन. Latent Space का तर्क है कि सिंथेटिक डेटा, रूब्रिक्स और एनवायरनमेंट प्रत्येक ML पाइपलाइन घटक को मॉडल-निर्मित बना रहे हैं, जो मानव सिमुलेशन से सिर्फ 10% बदतर, 100x सस्ता और 10,000x तेज़ है।
इंडस्ट्री और एप्लिकेशन
Inherent Faraday. DeepMind के पूर्व कर्मचारियों की स्टार्टअप Inherent का कहना है कि उसका Faraday एजेंट स्वतंत्र रूप से प्रकाशित वैज्ञानिक निष्कर्षों को दोहराने में Anthropic और OpenAI मॉडलों से बेहतर प्रदर्शन करता है, वह भी काफी छोटे आकार के साथ।
LinkedIn AI समीक्षाएँ. LinkedIn ने एक बहु-एजेंट AI कोड समीक्षा प्लेटफ़ॉर्म बनाया है जो फीडबैक को डिफ्स और कोडबेस कन्वेंशनों पर आधारित करता है, ताकि भ्रम और कम-सिग्नल टिप्पणियों को कम किया जा सके।
Netflix GenRec. Netflix का भाषा-मॉडल अनुशंसा प्रणाली, GenRec, उपयोगकर्ता व्यवहार को टेक्स्ट में बदलता है और काफी कम डेटा के साथ ऑफ़लाइन और लाइव A/B परीक्षणों में अपने हाथ से बने फीचर इंजन को हरा देता है।
DoorDash SafeChat. DoorDash ने SafeChat का विवरण दिया, जो बड़े पैमाने पर बनाई गई एक मार्केटप्लेस सुरक्षा प्रणाली है; फिर जब यह काम करने लगी, तो इसे एक अधिक शक्तिशाली आर्किटेक्चर से बदल दिया।
शिक्षा में AI अवतार. हार्वर्ड बिजनेस स्कूल का $699 वाला Foundry बूटकैंप, पिच और बोर्ड-मीटिंग फीडबैक के लिए HeyGen AI अवतारों का उपयोग करता है; प्रतिभागियों को यह निर्देशित अनुभव पसंद आता है, हालाँकि असली प्रशिक्षक का कहना है कि यह प्रतिकृति थोड़ी डरावनी है।
मॉडल समाचार. Liquid AI 100B LFM मॉडल में रुचि का सर्वेक्षण कर रहा है, जबकि Ox Alpha नामक एक रहस्यमय मॉडल मजबूत कोडिंग और एजेंटिक प्रदर्शन के कारण ध्यान आकर्षित कर रहा है, और अटकलें GLM-परिवार के व्युत्पन्न की ओर इशारा कर रही हैं।
नीति, सुरक्षा और विश्वास
OpenAI SB 53. OpenAI अब कहता है कि कैलिफ़ोर्निया को SB 53 में संशोधन करके फ्रंटियर ट्रेनिंग के दौरान निगरानी और मजबूत साइबर सुरक्षा जोड़नी चाहिए, पहले उसने इस विधेयक का विरोध किया था।
नियंत्रण योजनाएँ. Guidelight के एक अध्ययन ने पांच फ्रंटियर लैब्स को रॉग-मॉडल नियंत्रण पर ग्रेड दिया; OpenAI ने सबसे अधिक अंक प्राप्त किए, Anthropic और Meta सबसे कम, और बहुत कम लैब्स ने प्रदर्शित प्रतिक्रिया योजनाएँ प्रकाशित कीं।
Claude वॉटरमार्किंग. Anthropic के क्लॉड टेक्स्ट आउटपुट के लिए नई वॉटरमार्किंग तकनीक का विस्तार से वर्णन किया गया है, जिसमें बताया गया है कि वॉटरमार्क कैसे लगाया जाता है और यह क्या कर सकता है और क्या नहीं।
क्लोज्ड मॉडल विश्वास. Reddit r/LocalLLaMA पर एक थ्रेड में तर्क दिया गया है कि OpenAI जानबूझकर स्कूली काम में कम प्रदर्शन कर रहा है और उपयोगकर्ता सशक्तिकरण से दूर जा रहा है, जिससे प्रैक्टिशनर एजेंटिक लूप्स के लिए फिर से लोकल मॉडल की ओर लौट रहे हैं।
आज के लिए बस इतना ही - लगभग 5 मिनट का पठन।