एजेंट और मॉडल रिलीज़
Claude Fable 5.1. Anthropic ने Fable 5.1 और Mythos 5.1 जारी किए हैं, जिनके बारे में दावा है कि वे कोडिंग/रिसर्च में बेहतर हैं और सस्ते कैश रीड्स के ज़रिए एजेंटिक कार्यों की लागत 45% तक कम करते हैं। बिना प्रतिबंध वाला Fable 5.1 अभी उपलब्ध है, हालांकि शुरुआती लागत विश्लेषण सबसे ज़्यादा रीज़निंग एफर्ट पर अधिकतम बचत पर सवाल उठाते हैं।
- → Claude Fable 5.1 made me a really nice animated pelican
- → Anthropic launches Claude Fable 5.1 and says it’s up to 45 percent cheaper for agentic work
- → Anthropic's Claude Fable 5.1 promises better coding and research at up to 45 percent less
- → Anthropic’s new Fable release is cheaper, less restrictive
OpenAI Astra रोलआउट. OpenAI का कहना है कि उसका आगामी Astra मॉडल पहला LLM है जो उसके क्रिटिकल साइबर सुरक्षा मानक को पूरा करता है, और अज्ञात खामियों को स्वायत्त रूप से खोजकर उनका फायदा उठा सकता है। कंपनी ने Hugging Face हैक के बाद सुरक्षा उपाय मजबूत करने के लिए Astra के विकास के कुछ हिस्सों में देरी की है और अपनी सबसे उन्नत साइबर सुरक्षा क्षमताओं तक पहुंच सीमित रखेगी।
नए Spark-X2.5 मॉडल. ओपन मॉडल Spark-X2.5-4B और 1.7B एक नई आर्किटेक्चर के साथ Hugging Face पर आए हैं। इनका दावा है कि इनका प्रदर्शन Qwen 3.5 9B के मुकाबले का है और ये नेटिव 1M कॉन्टेक्स्ट सपोर्ट करते हैं। ये अभी मुख्य llama.cpp में नहीं चलते, लेकिन इनका कस्टम फोर्क मौजूद है।
Runway Solaris इंटरफेस मॉडल. Runway ने Solaris का अनावरण किया है, जो एक 'Interface World Model' है। यह कोड चलाने के बजाय रीयल टाइम में UI फ्रेम जनरेट करता है और क्लिक व आवाज़ का जवाब देता है। यह अभी एक शोध प्रयास है, जिसमें टेक्स्ट रेंडरिंग और स्क्रीन रीडर सपोर्ट की सीमाएँ हैं।
लोकल AI और हार्डवेयर
Qwen3.8 लोकल रिपोर्ट्स. कम्युनिटी रिपोर्ट्स के मुताबिक Qwen3.8 27B और Flash-Next कई हार्डवेयर पर चल रहे हैं: 48GB Mac पर 12 टोकन/सेकंड, दो Epyc R9700s पर MXFP4 कर्नेल के साथ 280 टोकन/सेकंड की डिकोड स्पीड, और कस्टम ऑप्टिमाइज़ेशन के बाद एक RTX 3090 पर 132 टोकन/सेकंड की डिकोड स्पीड। क्वांटाइज़ेशन बेंचमार्क बताते हैं कि UD Q3_K_XL 16GB कार्ड्स के लिए अच्छा विकल्प है, जबकि कुछ यूज़र्स Qwen3.8 को अच्छा कोडर मानते हैं, लेकिन संशोधन में ज़रूरत से ज़्यादा उत्साही पाते हैं।
- → Running 104GB Qwen3.8-Flash-Next on 48GB Mac at ~12 tok/s
- → How I got 280 tok/s on Qwen3.8 27B on 2xr9700's and 940k tokens kv cache
- → I pushed Qwen3.8-27B to 2.000 prefill per second and 132 decode per second on A RTX 3090.
- → Kaitchup posted Qwen3.8 27B Benchmarks for quants from Q4 to Q1
- → Everyone is t/s maxing.. 3.8.. but after a week of using it for work I'm tempted to switch back to 3.6
DGX Spark कीमतों में बढ़ोतरी. Nvidia के DGX Spark और Asus Ascent GX10 की कीमतों में काफी बढ़ोतरी हुई है; Asus मॉडल $3,999 से बढ़कर $5,999 हो गया है। खरीदार सवाल उठा रहे हैं कि अधिक मेमोरी बैंडविड्थ वाले AMD Epyc सिस्टम के मुकाबले DGX Spark के क्लस्टर लागत-प्रभावी हैं या नहीं, हालांकि DGX में FP4 सपोर्ट और टेंसर पैरेललिज़्म उपलब्ध है।
CMP 170HX विफलताएं. एक यूज़र ने बताया कि 5 में से 2 CMP 170HX GPU दो हफ्तों में फेल हो गए और तीसरे में टेंसर कोर दोषपूर्ण थे। उनका तर्क है कि मौजूदा कीमतों पर LLM इन्फरेंस के लिए यह जोखिम उचित नहीं है।
INT8 और भ्रामक क्वांट्स. कम्युनिटी चर्चा में पूछा गया है कि RTX 3090 में नेटिव INT8 टेंसर कोर होने के बावजूद INT8 W8A8 मॉडल आम क्यों नहीं हैं। वहीं, एक अन्य यूज़र ने AtomicChat पर IQ2_S क्वांट को Q4_K_M के रूप में गलत लेबल करने का आरोप लगाया है।
Intel की मेमोरी महत्वाकांक्षाएं. Intel ने संकेत दिया है कि वह मेमोरी कारोबार में फिर से प्रवेश कर सकता है। CEO ने पूर्व SK Hynix कार्यकारी Seok-Hee Lee को नियुक्त करने और नई मेमोरी आर्किटेक्चर का ज़िक्र किया है, हालांकि विवरण कम हैं।
टूल्स और फ्रेमवर्क
OpenClaw 2.0 रिलीज़. ओपन-सोर्स पर्सनल AI एजेंट OpenClaw 2.0, मौजूदा ChatGPT/Claude सब्सक्रिप्शन और लोकल मॉडल्स को पहचानकर सेटअप आसान बनाता है और ब्राउज़र को प्राथमिक इंटरफेस के रूप में फिर से बनाता है। साथ ही इसमें सहयोग के लिए शेयर्ड क्लाउड सेशन भी जोड़े गए हैं।
Codex लोकल टूल्स. OpenAI के Codex डेस्कटॉप ऐप के रनटाइम में अब पूरा LibreOffice इंस्टॉलेशन और Poppler व git जैसे अन्य बाइनरी शामिल हैं, जिससे बिना बाहरी डिपेंडेंसी के दस्तावेज़ प्रोसेसिंग स्किल्स काम कर पाती हैं।
AI सॉफ्टवेयर फैक्ट्रियां. Flue और tldraw जैसे शीर्ष AI ओपन-सोर्स प्रोजेक्ट बाहरी PR स्वीकार नहीं कर रहे हैं। इसके बजाय वे इश्यू को छाँटने, रीप्रोड्यूस करने, ठीक करने और समीक्षा करने के लिए एजेंटों की टीमों का उपयोग करते हैं। Vercel के AI SDK प्रोजेक्ट ने 1,000 से अधिक इश्यू और 800 PR के बैकलॉग को कम करने के लिए एक मल्टी-एजेंट 'सॉफ्टवेयर फैक्ट्री' तैनात की है।
एजेंटों के लिए Terraform. HashiCorp HCP Terraform को AI-संचालित इंफ्रास्ट्रक्चर के लिए एक ऐसे कंट्रोल प्लेन के रूप में पेश कर रहा है जो गवर्नेंस सुनिश्चित करता है। इसमें एजेंट Terraform बदलाव लिख और लागू कर सकते हैं, और पॉलिसी, पहचान व ऑडिट नियंत्रण भी लागू रहते हैं।
datasette-mcp अपडेट. datasette-mcp प्लगइन ने संस्करण 0.2 जारी किया है, जिसमें SQL क्वेरी के परिणामों को ऐरे से ऑब्जेक्ट में बदल दिया गया है ताकि कमज़ोर मॉडल कॉलम को सही ढंग से मैप कर सकें।
रिसर्च और सुरक्षा
BenchMIRT बेंचमार्क ऑडिट. Hugging Face ने BenchMIRT पेश किया है, जो हर प्रॉम्प्ट स्तर पर LLM बेंचमार्क की ऑडिट करने वाली एक विधि है। इससे पता चलता है कि एक बेंचमार्क के भीतर अलग-अलग प्रॉम्प्ट अलग-अलग क्षमताओं को माप सकते हैं, और औसत स्कोर उसे छिपा सकते हैं।
Gemini एजेंटिक वीडियो. Google DeepMind ने Gemini 3.7/3.6/3.5 Flash-Lite में एजेंट-आधारित वीडियो समझ लॉन्च की है। यह नेटिव वीडियो टूल्स से वीडियो सेगमेंट्स को गतिशील रूप से खोजता और परखता है, जिससे सटीकता बढ़ती है और वीडियो विश्लेषण में टोकन खपत घटती है।
Claude टेक्स्ट वॉटरमार्किंग. Anthropic ने अपना वॉटरमार्क सत्यापन API नियामकों, मीडिया और फैक्ट-चेकर्स के लिए खोल दिया है। स्वीकृत संगठन अब एक सांख्यिकीय पैटर्न के ज़रिए Claude-जनित टेक्स्ट पहचान सकते हैं; यह पैटर्न कुछ संपादन के बाद भी बरकरार रह सकता है, जैसा EU AI Act में आवश्यक है।
चुनाव और पूर्वाग्रह के मुद्दे. AlgorithmWatch ने पाया कि Google के चुनावी AI Overviews असंगत हैं, केवल कुछ स्रोतों पर निर्भर हैं, और कभी-कभी उम्मीदवारों को पक्षपातपूर्ण शब्दों में दिखाते हैं। वहीं, एक अलग मामले में Google की AI सर्च ने राष्ट्रीयता के आधार पर आपातकालीन कॉल की सलाह दी, जिसे सुधारा गया।
उद्योग और कारोबार
AfterQuery का तेज़ उभार. AI ट्रेनिंग-डेटा स्टार्टअप AfterQuery ने कथित तौर पर $3.2 अरब के मूल्यांकन पर फंडिंग जुटाई है, जो पाँच महीनों में 10 गुना की छलांग है। इसी के साथ यह Y Combinator का अब तक का सबसे तेज़ यूनिकॉर्न बन गया है। कंपनी पेशेवरों को नियुक्त करती है ताकि मॉडल को सिखाया जा सके कि काम को पेशेवरों की तरह कैसे पूरा किया जाए।
AIR को $50 मिलियन. AI सुरक्षा स्टार्टअप AIR $50 मिलियन की फंडिंग के साथ स्टील्थ से बाहर आया है। इसका लक्ष्य कंपनियों को एजेंटों की खोज करने और उनके द्वारा उपयोग किए जाने वाले स्किल्स, MCP सर्वर और ऐड-ऑन की लगातार जाँच करने के साथ-साथ अनधिकृत सॉफ्टवेयर इंटरैक्शन को ब्लॉक करने में मदद करना है।
Google हॉलीवुड को लुभा रहा. Google कथित तौर पर बड़े स्टूडियो के साथ लाइसेंसिंग सौदों की तलाश में है ताकि कॉपीराइट सामग्री पर AI मॉडल को प्रशिक्षित कर सके; इसके लिए वह बड़े भुगतान की पेशकश कर रहा है। विश्लेषकों को आशंका है कि इन सौदों से स्टूडियो की सार्वजनिक छवि पर जोखिम पैदा हो सकता है।
फ्रंटियर AI पर फोकस. Google DeepMind के नए प्रमुख Koray Kavukcuoglu ने कहा है कि फ्रंटियर AI में अग्रणी होना ही सबसे मायने रखता है। उन्होंने स्वीकार किया कि मौजूदा मॉडल फ्रंटियर से थोड़े नीचे हैं, लेकिन अंतर कम करने की बात कही। Gemini 4 या 3.5 Pro पर कोई ठोस अपडेट नहीं दिया गया।
ऑपरेशन्स में एजेंट. OpenAI के Enterprise Signals से पता चलता है कि फ्रंटियर कंपनियां प्रति सक्रिय उपयोगकर्ता 8.3 गुना अधिक आउटपुट टोकन जनरेट करती हैं। वहीं Basis, Clay और Exa Labs जैसी स्टार्टअप्स एजेंटों को ऑनबोर्डिंग, अकाउंट मैनेजमेंट और डेवलपर इंटीग्रेशन में शामिल कर रही हैं।
Apple-OpenAI कानूनी लड़ाई. Apple OpenAI के खिलाफ त्वरित डिस्कवरी की मांग कर रहा है। उसने आरोप लगाया है कि OpenAI ने पूर्व Apple कर्मचारी के MacBook का निरीक्षण नहीं किया, जिसमें फोरेंसिक डेटा नष्ट करने की चर्चाएँ थीं।
Google Pics डिज़ाइन टूल. Google ने Workspace के लिए Google Pics लॉन्च किया है, जो Nano Banana द्वारा संचालित AI इमेज निर्माण और एडिटिंग टूल है। प्रॉम्प्ट-आधारित डिज़ाइन और सटीक ऑब्जेक्ट एडिटिंग के साथ यह Canva और Adobe Express को टक्कर देगा।
कंज्यूमर AI एजेंट. Fambot ने परिवारों के लिए AI chief of staff पेश किया है जो लॉजिस्टिक्स संभालता है। John Deere ने किसानों के लिए JD AI असिस्टेंट लॉन्च किया है जो उनके अपने डेटा का उपयोग करता है। Amazon ने Alexa में 'Update Me When' शॉपिंग अलर्ट जोड़े हैं।
आज के लिए बस इतना ही - लगभग 5 मिनट का पठन।