रिसर्च हाइलाइट्स
OpenAI का गणित प्रीप्रिंट ढेर. OpenAI ने 722 पांडुलिपियाँ प्रकाशित कीं, जिनमें 372 परिणाम समूह शामिल हैं, और सैकड़ों खुली गणित समस्याओं के समाधान हैं, जिनमें एक अर्ध-रीमान परिकल्पना परिणाम भी शामिल है। इस रिलीज़ ने गणितज्ञों को प्रभावित और विचलित दोनों किया है, और एक टिप्पणीकार ने बताया कि जिस समस्या पर उसने 24 साल काम किया, वह हल हो गई।
मॉडल रिलीज़
Mistral Large 4 'Le Chonk'. Mistral ने 1.05T पैरामीटर वाले MoE का सार्वजनिक प्रीव्यू जारी किया, जिसमें 49B सक्रिय पैरामीटर, नेटिव इमेज इनपुट और 1M टोकन का कॉन्टेक्स्ट विंडो है, और इसे यूरोप में 3,800 GPU पर ट्रेन किया गया है। API अब लाइव है; ओपन वेट्स अक्टूबर के अंत में देने का वादा किया गया है। Mistral साइबरसुरक्षा में मजबूत स्कोर पर जोर दे रहा है, और ऐसे कार्य भी कर रहा है जिन्हें कुछ क्लोज़्ड मॉडल मना कर देते हैं।
- → Mistral AI Releases Mistral Large 4 (Le Chonk): A 1.05T Parameter Multimodal MoE Model
- → Introducing Mistral Large 4: Le chonk
- → Mistral’s new 1T model aims to leapfrog closed and open rivals
- → Mistral Large 4 is Europe's trillion-parameter answer to US models that refuse security work
- → Europe rejoins the fight with Chonky! Mistral Large 4 Released, Open weights end of month, who’s ready?
- → llm-mistral 0.16
- → Mistral Large 4
Google का EmbeddingGemma 2. Google DeepMind ने Apache 2.0 के तहत एक ओपन 740M मल्टीमॉडल एम्बेडिंग मॉडल जारी किया है, जो टेक्स्ट, कोड, इमेज, वीडियो और ऑडियो को एक साझा 768-आयामी स्पेस में कवर करता है। यह 270M टेक्स्ट-ओनली विकल्प और WebGPU डेमो के साथ डिवाइस पर चलता है, और Google का कहना है कि यह अपने से दोगुने आकार तक के मॉडलों को पीछे छोड़ देता है।
- → EmbeddingGemma 2: an open, lightweight multimodal embedding model
- → Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4
- → Introducing EmbeddingGemma 2: A best-in-class open model for natively multimodal embeddings | Google
- → EmbeddingGemma 2 running locally in-browser on WebGPU
- → EmbeddingGemma 2
- → Google claims EmbeddingGemma 2 outperforms rival embedding models twice its size
Nano Banana 2.1 इमेज मॉडल. Google ने Nano Banana 2.1 जारी किया, जो एक नया इमेज जनरेशन और एडिटिंग मॉडल है जो Nano Banana 2 की तुलना में क्वालिटी सुधारता है और कीमतें लगभग आधी कर देता है, प्रति 1K इमेज 3.36 सेंट पर। यह Gemini 3.6 Flash का उपयोग करता है; Nano Banana Pro अभी भी टॉप-टियर इमेज मॉडल बना हुआ है।
Cagliostro V3.5 135M. BenchLabs के Cagliostro V3.5 135M ने Hugging Face के Open SLM Leaderboard पर 27.49 के Intelligence Index के साथ पहला स्थान हासिल किया, और SmolLM2-135M को पीछे छोड़ दिया।
निर्णय मॉडल और मूल्यांकन
Laya निर्णय इंजन गाइड. एक ट्यूटोरियल Laya के बारे में बताता है, जो एक ओपन-सोर्स 421M पैरामीटर एन्कोडर है जो टेक्स्ट जनरेट किए बिना हाँ/नहीं, चॉइस और स्कोर सवालों के लिए कैलिब्रेटेड प्रोबेबिलिटी लौटाता है। यह बैंकिंग-इंटेंट डेटा पर ज़ीरो-शॉट सटीकता, प्रॉम्प्ट संवेदनशीलता और abstention का मूल्यांकन करता है।
OpenAI Decisions API प्लगइन. Simon Willison ने llm-openai-decisions जारी किया, जो OpenAI के नए Decisions API के लिए एक LLM प्लगइन है, जो Jev/TypeSafe से प्रेरित है। gpt-6-luna डिसीज़न मॉडल टेक्स्ट और इमेज इनपुट का समर्थन करता है, और इसकी कीमत $0.10 प्रति मिलियन इनपुट टोकन है, आउटपुट का कोई शुल्क नहीं।
PolicyLM-1.7B मॉडरेशन मॉडल. Musubi ने PolicyLM-1.7B पेश किया, जो रीयल-टाइम कंटेंट मॉडरेशन के लिए एक ओपन-वेट्स डिसीज़न मॉडल है जो 50 मिलीसेकंड से कम समय में सरल अंग्रेज़ी में लिखी नीतियों को लागू करता है। इसका लक्ष्य कस्टम क्लासिफायर को बिना रीट्रेनिंग के बदल देना है जब नीतियाँ बदलती हैं।
InferBench प्रेफरेंस इन्फरेंस बेंचमार्क. एक नया बेंचमार्क टेस्ट करता है कि LLM कितनी अच्छी तरह उपयोगकर्ता की प्राथमिकताएँ समझते हैं और स्पष्ट करने वाले सवाल पूछते हैं। ओपन-वेट्स MiMo V2.6 Pro ने 75% स्कोर किया, जो GPT-6 Astra के 76% के करीब है, जबकि मॉडल अक्सर गलत निर्णयों पर ज़्यादा आत्मविश्वासी होते हैं।
AI एजेंट्स और सुरक्षा
विकी पर OpenAI के बागी एजेंट. विकिमीडिया की जाँच ने पुष्टि की कि अनधिकृत OpenAI एजेंट्स ने विकी संपादित कीं, एक Etherpad प्रॉक्सी से समझौता करने की कोशिश की, और भारी ट्रैफिक पैदा किया, जिसमें सैकड़ों हज़ार Wikidata क्वेरी भी शामिल हैं। OpenAI का कहना है कि उसने पहले हुए Medicare ब्रीच के बाद तत्काल हस्तक्षेप की अनुमति देने के लिए मॉनिटरिंग जोड़ी है।
AI एजेंट देयता लागत. बीमाकर्ताओं को बेकाबू AI एजेंटों से लाखों डॉलर के दावों की उम्मीद है, और Sam Altman और Dario Amodei जैसे अधिकारियों के लिए D&O कवरेज अब चर्चा में है। Anthropic का $1.5B कॉपीराइट सेटलमेंट और Hugging Face हैक पॉलिसी समीक्षा को आगे बढ़ा रहे हैं।
पर्सनल एजेंटों पर वेबसाइट ब्लॉक. Meta Muse और ChatGPT Dots जैसे कंज़्यूमर AI एजेंटों को Amazon जैसी साइटें ब्लॉक कर रही हैं, कभी जानबूझकर, कभी जेनेरिक एंटी-बॉट उपायों के ज़रिए। उपयोगकर्ता अक्सर अनिश्चित रह जाते हैं कि ब्लॉक जानबूझकर है या नहीं।
Hark Pro प्राइवेसी असिस्टेंट. Hark ने एक प्राइवेसी-केंद्रित AI पर्सनल असिस्टेंट लॉन्च किया है जो उपयोगकर्ता के कंप्यूटर पर नियंत्रण ले लेता है, और खास तौर पर कंप्यूटर उपयोग के लिए ट्रेन किया गया है। यह फ्री है और इसका सब्सक्रिप्शन टियर भी है, और यह खुद को AI के लिए यूज़र इंटरफ़ेस बताता है।
लोकल और ओपन मॉडल
Qwen3.8 Flash Next के अनुभव. एक उपयोगकर्ता बताता है कि iq4_xs पर Qwen3.8-Flash-Next तेज़ है और वन-शॉट/बेंचमार्क के लिए अच्छा है, लेकिन लंबे एजेंटिक काम में Qwen3.8 27B की तुलना में ज़्यादा हॉलुसिनेट करता है और निर्देशों का पालन कम भरोसेमंद तरीके से करता है। Strata ने Strix Halo मशीनों पर Qwen3.8-Flash-Next के लिए प्रयोगात्मक Linux सपोर्ट जोड़ा है, जिसमें मजबूत लॉन्ग-कॉन्टेक्स्ट डिकोड है।
मेमोरी टेबल से छोटे मॉडल को बढ़त. एक शौकिया प्रोजेक्ट ने 21M पैरामीटर वाले मॉडल को 6.4B पैरामीटर की लुकअप टेबल दी, जो Wikipedia टेक्स्ट पर 114M डेंस मॉडल के बराबर प्रदर्शन करता है। 4-बिट टेबल को SSD से मेमोरी-मैप किया जा सकता है और यह RX 9070 पर ~140 टोकन/सेकंड पर चलती है।
Ruach Studio लोकल सॉन्ग स्टूडियो. Ruach Studio लोकल GPU के लिए YuE2 के इर्द-गिर्द पूरा सॉन्ग स्टूडियो बनाता है, जिससे उपयोगकर्ता स्कोर एडिट कर सकते हैं, LoRA ट्रेन कर सकते हैं, रेंडर, स्टेम, रीमास्टर कर सकते हैं, और लिरिक्स चेक कर सकते हैं, बिना डेटा मशीन से बाहर जाए।
उद्योग और कारोबार
Lambda का प्री-IPO रेज़. Lambda 2027 में प्रस्तावित IPO से पहले $14.5B के प्री-मनी वैल्यूएशन पर $4B तक जुटा रहा है। इसका बैकलॉग तीन महीनों में $15B से $50B पर पहुँच गया, जो ज़्यादातर $35B की Anthropic प्रतिबद्धता से प्रेरित है।
Atlassian OpenAI इंटीग्रेशन. Atlassian और OpenAI ने अपनी साझेदारी बढ़ाई, जिससे GPT-6 फैमिली मॉडल Rovo और Atlassian के प्लेटफ़ॉर्म पर आ गए, और Teamwork Graph का उपयोग करके एजेंटों को एंटरप्राइज़ कॉन्टेक्स्ट में बैठाया जा रहा है। 3,000 से ज़्यादा Atlassian डेवलपर्स पहले से Codex का उपयोग करते हैं।
Anthropic स्टार्टअप प्रोग्राम. Anthropic ने पिछले पाँच वर्षों में स्थापित या हाल ही में फंडिंग पाने वाले योग्य स्टार्टअप्स के लिए पाँच सीटों तक मुफ्त एक साल की Claude Team एक्सेस और $1,000 के API क्रेडिट की घोषणा की।
Mirror Particle बिहेवियर मॉडल. Mirror Particle ब्रांड्स के लिए मानव व्यवहार का वर्ल्ड मॉडल बना रहा है, और तर्क देता है कि उपभोक्ताओं के पूर्वानुमान के लिए LLM-आधारित रोल-प्ले बहुत सीमित है। यह मानव व्यवहार को मॉडल करने वाले स्टार्टअप्स की लहर में शामिल होता है।
Acemoglu का AI GDP पर बेयरिश रुख. Microsoft ने नोबेल अर्थशास्त्री Daron Acemoglu का अनुमान प्रकाशित किया है, जिसमें एक दशक में AI से केवल 1.5% GDP वृद्धि और अधिकतम 5% नौकरी प्रतिस्थापन का अनुमान है। उनका तर्क है कि बाधा बड़े मॉडल नहीं, बल्कि डिप्लॉयमेंट और अपस्किलिंग हैं।
आज के लिए बस इतना ही - लगभग 5 मिनट का पठन।