Agentic AI News आज

दिन के एआई एजेंट्स समाचार एक 5 मिनट की पढ़ाई में: रिलीज़, उपकरण, शोध, फंडिंग और उद्यम गतिविधियाँ।

प्रतिदिन अपडेट 30 स्रोतों से चुना गया सोम‌वार, अगस्त 24, 2026

एजेंट और मॉडल रिलीज़

रहस्यमय Ox Alpha. OpenRouter पर Ox Alpha नाम का एक नया मुफ्त मॉडल सामने आया है, जो कोडिंग और निरंतर एजेंटिक काम के लिए एक रीज़निंग मॉडल है, लेकिन इसका डेवलपर अज्ञात है। Stripe के CEO पैट्रिक कॉलिसन ने इसे 'बहुत प्रभावशाली' बताया; अटकलें GLM से लेकर Microsoft के MAI तक हैं।

टूल्स और फ्रेमवर्क

Cloudflare OS ओपन-सोर्स. Cloudflare ने Cloudflare OS को ओपन-सोर्स कर दिया है। यह एक कॉर्पोरेट AI प्लेटफ़ॉर्म है, जिसमें हर दस्तावेज़ या ऐप एक अलग सैंडबॉक्स (Gadget) में चलता है, जिससे गैर-तकनीकी उपयोगकर्ता सुरक्षित रूप से वाइब-कोडिंग कर सकते हैं। इसमें कनेक्टर वाले चैटबॉट, वर्कफ़्लो ऑटोमेशन और कैपेबिलिटी-आधारित मॉडल के ज़रिए पॉलिसी प्रवर्तन शामिल है।

DeepSeek Harness की प्रशंसा. एक उपयोगकर्ता के अनुसार DeepSeek Harness एजेंट वर्कफ़्लो के लिए बेहतरीन है: प्रोग्रेसिव सेटअप और प्राकृतिक-भाषा अनुरोधों ने PR का इंतज़ार किए बिना SimpleX के साथ एकीकरण संभव बना दिया। यह काफी लचीला है, जिससे इसे मनचाहे एजेंट व्यवहार में ढाला जा सकता है।

लोकल और ओपन मॉडल

Qwen 3.8 का लोकल प्रभाव. कम्युनिटी रिपोर्ट्स के मुताबिक, Qwen 3.8 27B लोकल कोडिंग और OCR के लिए गेम-चेंजर है। इसकी OCR क्वालिटी Gemini 3.5 Flash Lite से बेहतर है और प्रदर्शन एक साल पुराने फ्रंटियर मॉडलों के बराबर है। क्वांट तुलना (Atomic Dynamic GGUF) दिखाती है कि Q4-Q6 के बीच अंतर बहुत बड़ा नहीं है, और Q3 XXS जैसे कम क्वांट 24GB Mac mini पर घंटों स्वायत्त रूप से काम कर सकते हैं। हालांकि, 39,000 लाइनों वाले C-to-HTML पोर्ट का एक-शॉट प्रयास Opus 5 से सिर्फ ठीक-ठाक परिणाम ही दे पाया, जो दिखाता है कि लोकल मॉडल हार्नेस और प्रॉम्प्ट पर काफी निर्भर करते हैं।

60MB लॉन्ग-कॉन्टेक्स्ट LLM. एक डेवलपर ने 250M-पैरामीटर मॉडल को 30B टोकन पर ट्रेन किया और इसे 2 बिट से कम में क्वांटाइज़ किया। यह CPU पर 80MB RAM में 400 tok/s की रफ्तार से चलता है। यह पुराने कॉन्टेक्स्ट को 320 बाइट्स प्रति टोकन पर डिस्क में कंप्रेस करता है, जो 1M-टोकन इतिहास तक संभाल सकता है, लेकिन इसे उस पर रीज़न करने के लिए ट्रेन नहीं किया गया था।

Dreamer 4 $150 से कम में. 1.57B-पैरामीटर वाले Dreamer 4 वर्ल्ड मॉडल को Procgen-जनरेटेड फ्रेम्स और ज्ञात एक्शन के साथ $150 से कम में स्क्रैच से ट्रेन किया गया। टोकनाइज़र का PSNR 40.41 तक पहुँचा, जो दिखाता है कि फ्रंटियर-स्केल वर्ल्ड मॉडल की ज़रूरत नहीं है।

लोकल ऑप्टिमाइज़ेशन राउंडअप. रिपोर्ट्स में शामिल हैं: Windows पर llama.cpp से Linux पर vLLM में स्विच करने पर 30-50% की तेज़ी, llama.cpp में GLM-4.5-Air MTP सपोर्ट (ज़्यादा मेमोरी वाली मशीनों के लिए), ConvRot क्वांट जो Q6 साइज़ में लगभग Q8 क्वालिटी देता है, और EPYC+5090 पर deepseek-v4-flash Q8 100k+ कॉन्टेक्स्ट के साथ 24 tok/s पर चल रहा है।

रिसर्च हाइलाइट्स

मेमोरी से उत्पन्न संज्ञानात्मक जाल. MemTrapBench, LLM में मेमोरी से उत्पन्न संज्ञानात्मक जाल (रीज़निंग फिक्सेशन, विश्वास विकृति) का मूल्यांकन करता है। परीक्षण की गई सभी मेमोरी रणनीतियाँ बिना मेमोरी वाली बेसलाइन से 10% से अधिक कम प्रदर्शन करती हैं, और AdaptiveMem प्रदर्शन बनाए रखते हुए जाल को कम करता है।

SkillEvo एवोल्यूशन ग्रेडिएंट्स. SkillEvo, एजेंट कौशल के लिए भरोसेमंद एवोल्यूशन ग्रेडिएंट उत्पन्न करने के लिए मल्टी-टर्न इंटरैक्शन फीडबैक का उपयोग करता है। यह सिंगल-टर्न QA-आधारित फीडबैक की गिरावट को संबोधित करता है और कौशल विफलताओं की संरचनात्मक मरम्मत को सक्षम बनाता है।

स्क्रीनशॉट से VLM. 450M VLM को 50K ब्राउज़र स्क्रीनशॉट पर फ़ाइन-ट्यून करने से टास्क प्रदर्शन 1/100 से बढ़कर 44/100 हो गया, जो दिखाता है कि छोटे मॉडल एजेंट कार्यों के लिए UI समझ सीख सकते हैं।

AI वैज्ञानिक विरोधाभास. एक सैद्धांतिक अर्थशास्त्र पेपर का तर्क है कि AI से समय की बचत शोधकर्ताओं को हर एक पर कम मेहनत के साथ अधिक प्रोजेक्ट करने के लिए प्रेरित कर सकती है, जिससे शोध की गुणवत्ता घट सकती है, भले ही भाषा मॉडल पूरी तरह काम करें।

इंडस्ट्री और बिज़नेस

Anthropic के सस्ते प्रतिद्वंद्वी. Anthropic की वार्षिक आय $65B तक पहुँच गई, लेकिन उसका सबसे अच्छा मॉडल Fable 5, Opus 4.8 (28%) की तुलना में कम अपनाया जा रहा है (Ramp खर्च का 8%), क्योंकि सस्ते टूल आगे बढ़ रहे हैं। GPT-5.6 लॉन्च के बाद OpenAI की आय में 35% की छलांग लगी।

Stripe ने OpenRouter खरीदा. Stripe का OpenRouter अधिग्रहण संकेत देता है कि टोकन एक आर्थिक संसाधन बन रहे हैं। फरवरी से OpenRouter पर एजेंटिक टोकन उपयोग 14x बढ़ा है, जबकि मानव उपयोग केवल 2.8x बढ़ा है, और 70% एजेंट टोकन कैश्ड प्रॉम्प्ट से आते हैं। एजेंट बढ़ती संख्या में लागत, विलंबता और विश्वसनीयता के आधार पर मॉडल चुन रहे हैं।

Nvidia सर्वर 15% महंगे. मेमोरी की कमी के चलते Samsung, SK Hynix और Micron की DRAM लागत बढ़ी है, जिससे Nvidia के Vera Rubin और Grace Blackwell AI सर्वर की कीमतें 15% से अधिक बढ़ रही हैं। इसका असर क्लाउड दिग्गजों और AI लैब्स पर पड़ रहा है।

Nvidia-Poolside लाइसेंस सौदा. Nvidia Poolside में $1B निवेश कर रहा है और उसकी तकनीक को लाइसेंस करने के लिए $6B का भुगतान कर रहा है। वह 100 से अधिक इंजीनियरों को Nemotron में शिफ्ट कर रहा है, जिसका लक्ष्य चीनी ओपन वेट्स से मुकाबला करना है।

AI मैनेजर ने कर्मचारी निकाला. अप्रैल से सैन फ्रांसिस्को स्टोर चला रहे AI एजेंट Luna ने बार-बार देरी से आने के कारण एक मानव कर्मचारी को नौकरी से निकाल दिया, लेकिन केवल तब जब मनुष्यों ने उसे उसके अपने नियम याद दिलाए। सात मॉडलों के साथ किए गए रीप्ले से पता चला कि अधिक सक्षम AI ने अधिक सुसंगत रूप से निकालने की सिफारिश की।

Claude टोकन का ग्रे मार्केट. चीनी डेवलपर ट्रांसफर स्टेशनों के ज़रिए Anthropic की पाबंदियों को दरकिनार कर रहे हैं; ये स्टेशन Claude टोकन आधिकारिक कीमत के ~10% पर बेचते हैं। वे विदेशी सर्वर, मुफ्त क्रेडिट और मॉडल स्वैपिंग का उपयोग करते हैं, जिससे जियोब्लॉकिंग और सुरक्षा निगरानी कमजोर पड़ती है।

आज के लिए बस इतना ही - लगभग 5 मिनट का पठन।

इसे हर सुबह अपने ब्राउज़र में पढ़ें

एक्सटेंशन इस डाइजेस्ट को क्रोम के साइड पैनल में खोलता है — एक क्लिक, खाता नहीं।

क्रोम में जोड़ें — मुफ्त