एजेंट और मॉडल रिलीज़
Muse गैजेट्स. Meta ने अपने Muse एजेंट से जुड़ने वाले DIY हार्डवेयर—जैसे E Ink डिस्प्ले और HDMI स्टिक—बनाने के लिए फर्मवेयर और SDK ओपन-सोर्स किए हैं, साथ में सपोर्ट के लिए Discord भी है।
OpenAI Dot. OpenAI का नया Dot एजेंट एंटरप्राइज़ सॉफ़्टवेयर जैसा है, जो डिनर भी ऑर्डर कर सकता है। यह वर्चुअल मशीन में चलता है और Blender, GIMP जैसे ऐप्स तक इसकी पहुँच है; इसे पर्सनल शॉपर नहीं, बल्कि सहकर्मी के तौर पर पेश किया गया है।
Unitree ह्यूमनॉइड मॉडल. Unitree ने UnifoLM-WLA-1.0 जारी किया है। यह 6B मॉडल असली रोबोट डेटा के करीब 2,500 घंटों पर प्रशिक्षित है और G1 पर 64 व्होल-बॉडी और टेबलटॉप टास्क संभालता है। इसमें कंटीन्यूअस कंट्रोल के लिए optical flow और MMDiT को जोड़ा गया है।
FrogNano कोडिंग के लिए. Microsoft का FrogNano-4B-2609, Qwen3.5-4B से बना एक एजेंटिक मॉडल है। इसे executable rewards के साथ 1,500 सिंथेटिक SWE टास्क पर पोस्ट-ट्रेन किया गया है, ताकि कॉम्पैक्ट रूप में रिपॉज़िटरी-स्तरीय सॉफ़्टवेयर इंजीनियरिंग बेहतर हो।
Cloudflare Clef. Cloudflare ने Clef और Clef-flash डिसीज़न मॉडल जारी किए हैं, जो पहले से तय जवाबों पर संभावनाएँ आउटपुट करते हैं। इनकी मीडियन लेटेंसी 39 मिलीसेकंड तक कम है, जिससे एजेंट बिना ह्यूमन-इन-द-लूप काम कर सकते हैं।
टूल्स और फ्रेमवर्क
MegaCapybara इंजन. RTX 5090 और Qwen3.8 27B के लिए खास तौर पर बना एक इन्फ़रेंस इंजन NInfer की डिकोड गति से लगभग दोगुनी रफ़्तार का दावा करता है—एकल पर 500+ टोकन/सेकंड और 12 एजेंट्स पर 2000+ टोकन/सेकंड—साथ में डायनामिक कर्नेल और कैश मैनेजमेंट।
llama.cpp अपडेट. llama.cpp में डिसीज़न मॉडल्स के लिए सपोर्ट जोड़ा गया है और एक CUDA pull request भी, जो shared experts को फ्यूज़ करके Qwen 35B A3B जैसी MoE आर्किटेक्चर को तेज़ करता है।
mlsubgen सबटाइटल्स. एक नया लोकल टूल 45 भाषाओं में सबटाइटल्स पूरी तरह आपकी अपनी मशीन पर बनाता है। यह हर हिस्से की भाषा पहचानता है, दो स्पीच रिकग्नाइज़र्स को लोकल LLM से मिलाता है और मौजूदा embedded सबटाइटल्स को प्राथमिकता देता है।
रिसर्च और मॉडल प्रगति
Spotlight मेमोरी आर्किटेक्चर. Percepta का Spotlight, attention की जगह असीमित राइटेबल मेमोरी लाता है, जिसे मॉडल खुद इंडेक्स करता है। यह बुद्धि को ज्ञान से अलग करता है, ताकि वेट्स बदले बिना क्षमताएँ बढ़ सकें।
GPT-6 अपडेट. OpenAI ने GPT-6 फैमिली गाइड प्रकाशित की और DevDay अपडेट घोषित किए, जिनमें GPT-6.1 Sol, Agents API के लिए computer use, क्लाउड Codex एनवायरनमेंट्स और Decisions API शामिल हैं।
AstaBrief ओपन-सोर्स. Hugging Face ने AstaBrief ओपन-सोर्स किया है। यह एक छोटा मॉडल है, जिसे तेज़ और साइटेशन वाली वैज्ञानिक रिपोर्ट जनरेशन के लिए खास तौर पर प्रशिक्षित किया गया है। इसे सबूतों पर टिके रहने और आउटपुट सत्यापित करने के लिए डिज़ाइन किया गया है।
उद्योग और बिज़नेस
Apple सख्त करेगा डिस्क एक्सेस. Apple, AI एजेंट के जोखिमों के चलते macOS Full Disk Access में नियंत्रण जोड़ रहा है। यह कदम Meta Muse के कथित तौर पर बिना अनुमति मैसेज पढ़ने की घटना के बाद आया है। Meta का कहना है कि एक्सेस ऑप्ट-इन है, जबकि Apple चाहता है कि यूज़र बहुत स्पष्ट कार्रवाई करे।
डेटा सेंटर विरोध. Amazon ने डेटा सेंटर कम्युनिटीज़ के लिए 1 अरब डॉलर देने का वादा किया, और AWS CEO Matt Garman ने मोरटोरियम खत्म करने की अपील करते हुए दावा किया कि यह विदेशी डिसइन्फॉर्मेशन है। Microsoft स्थानीय विरोध के बीच डेटा सेंटर्स में बायोमिमिक्री का विस्तार कर रहा है।
AI बना सुपर इंटेलिजेंस. व्हाइट हाउस ने बड़ी टेक कंपनियों के CEO से AI सेफ्टी प्रतिज्ञा पर हस्ताक्षर कराए, और Trump ने AI को 'सुपर इंटेलिजेंस' का नया नाम देने वाला कार्यकारी आदेश साइन किया। वहीं, सिर्फ़ 2% उपभोक्ता ही AI प्रोडक्ट्स खरीद रहे हैं।
OpenAI सेफ्टी में उथल-पुथल. OpenAI ने तीन शोधकर्ताओं को निकाल दिया और चौथे ने संस्थान छोड़ दिया, क्योंकि जाँच में पाया गया कि उन्होंने बाहरी AI सेफ्टी संगठन को गोपनीय जानकारी लीक की थी।
Uber Eats की सर्च तेज़. Uber ने अपनी सर्च पाइपलाइन दोबारा बनाई, जिससे end-to-end लेटेंसी 50% घट गई। ऑप्टिमाइज़ेशन की पहचान और मान्यता के लिए एजेंटिक कोडिंग का इस्तेमाल किया गया।
Airbnb की inside-out AI. Airbnb के CTO Ahmad Al-Dahle एक inside-out AI रणनीति अपना रहे हैं: पहले प्रोडक्ट डेवलपमेंट तेज़ करने के लिए कंपनी के अंदर जनरेटिव AI का इस्तेमाल, फिर कस्टमर एक्सपीरियंस को बदलना।
लोकल AI और हार्डवेयर
Strata + Qwen3.8 Next. यूज़र्स के मुताबिक, Qwen3.8 Next के साथ Strata धीमे DDR4+7900XTX पर 45-70 टोकन/सेकंड और 96GB DDR5 वाले पावर-लिमिटेड RTX 5090 पर 150-200 टोकन/सेकंड चलता है, जो llama.cpp को काफ़ी पीछे छोड़ता है।
iPhone बना दूसरा GPU. USB-C से जुड़े होने और ऊपरी लेयर्स को फ़ोन GPU पर चलाने पर एक iPhone 17 Pro Max, 24GB MacBook पर Qwen 3.8 27B का प्रीफ़िल 29-44% तक तेज़ कर सकता है।
Ascend 96GB कार्ड्स. 96GB वाले दो Huawei Atlas 300I Duo कार्ड, सॉफ़्टवेयर स्टैक ट्यूनिंग के बाद Qwen3.8 Flash-Next को करीब 30 टोकन/सेकंड पर चला सकते हैं, हालाँकि ये CUDA के ड्रॉप-इन रिप्लेसमेंट नहीं हैं।
DGX Spark और 5090 कीमतें. Nvidia ने 64GB DGX Spark पेश किया, जबकि मूल 128GB मॉडल की कीमत बढ़कर $6,950 हो गई। वहीं, Micro Center पर RTX 5090 खरीदने के लिए अब कथित तौर पर no-export कागज़ी कार्रवाई करनी पड़ती है।
आज के लिए बस इतना ही - लगभग 5 मिनट का पठन।