ওপেন মডেল ও লোকাল ইনফারেন্স
Qwen 3.8 27B. Alibaba-র Apache-2 লাইসেন্সধারী Qwen 3.8 27B হাই-এন্ড ল্যাপটপ ও লোকাল GPU-তে চলে; xhigh রিজনিং শক্তিশালী ফল দেয়, তবে অতিরিক্ত চিন্তা করে। কমিউনিটি অপটিমাইজেশনের ফলে RTX 3090-তে এটি ৩৮১ tps-এ পৌঁছেছে, আর কোয়ান্টাইজড ভার্সনগুলো ১৬GB VRAM-এ চলে। ৩৫B MoE মডেলটি প্রকাশ করা হবে না, তবে আগামী সপ্তাহে নতুন একটি মিডসাইজ ওপেন-ওয়েট মডেল আসবে বলে আশা করা হচ্ছে।
- → Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
- → Simon Willison: Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
- → I just ran Qwen 3.8 27 in Q4 against GPT 5.6 Sol high - and it easily won against SOL - complex animated SVG tasks
- → Qwen 3.8 27b vs 3.6 27b - how good is with a Turtle library.
- → Anyone else get a kick out of Qwen 3.8 27B Reasoning Dialogue?
- → Share your favorite thoughts and reasoning from running Qwen 3.8 27b. This is mine.
- → Qwen3.8 27B reasoning effort low/medium/xhigh comparison
- → Qwen 3.8 2.4T at 288k tokens/s on Nvidia GB300 NVL72
- → Newer commits removed the Qwen 35B
- → Qwen 3.8 27b in 24gb of VRAM
- → Qwen3.8-27b on RTX 3090 - 82 tps single request, up to 672 tps peak
- → Qwen3.8-27B Hybrid IQ4_XS quantization for 16GB gang
- → Qwen3.8 27B Q2 vs Q3 vs Qwen3.6 35B-A3B MoE on 12GB VRAM
- → Qwen 3.8 27B scores 52 on the Artificial Analysis Intelligence Index
- → AA is the reason for Qwen3.8 27B shipped with xhigh
- → Artificial Analysis' Qwen3.8-27B benchmarks put it neck and neck with DeepSeek V4 and GPT-5.6 Luna Max
- → Optimizing Qwen3.6 / Qwen3.8-27B on 16GB VRAM: Complete Benchmark Results and Setup Guide (~30-50tps at 32k to 72k context)
- → After pushing 1M+ tokens through Qwen 3.8 27B, here is my optimal llama.cpp config for 16GB VRAM (73k Context, Agentic Coding)
- → Local agentic coding Benchmark : Qwen 3.8 27B (in many weights quants / cache quants / engine / reasoning effort) vs others.
- → Qwen dev says not to wait for 35B-A3B
- → Waiting for Qwen 3.8 35B A3B
- → Qwen 3.8 35bA3b wen?
- → Qwen 3.8 35b and 122b - We hope/wait/beg for models incessantly. But how do we actually give the lab more incentive to make it?
- → Qwen3.8-27B on 2x 3090 + vLLM + DFlash2: 218 tok/s single request
- → I pushed Qwen3.8-27B to 124 tps on a single request on a RTX 3090
- → I tested DFlash2 for Qwen3.8 27B on a 5090
- → DFlash 2 available for Qwen 3.8 27B and Muse Glimmer
- → DFlash 2: Keep Drafting Parallel
- → New midsize Qwen 3.8 model coming next week (hopefully) according to community manager!
- → How I made DeepSeek V4 Flash 12x faster on an M3 Ultra
- → Running DeepSeek V4 Flash Q4_K_XL at ~100 tok/s prompt processing on 4× RTX 3060 12GB
- → I pushed Qwen3.8-27B limits again... Dflash2 - 134 tps on a RTX 3090
- → DFlash2 speeds Qwen 3.8 27B up to 4 times
- → Introducing Qwen3.8-27B Dynamic v3 Unsloth GGUFs
- → updated unsloth/Qwen3.8-27B-GGUF · Hugging Face
- → Qwen3.8-23B-Mini-Me: A Depth-Pruned Qwen3.8-27B (to ~22.7BB)
- → NVFP4 on VOLTA! Despite being built for Blackwell, I made four 2017 V100s run Qwen 3.8 NVFP4 natively and match my $6000 RTX 5090.
- → I pushed Qwen3.8-27B to 381 tps for a single request on a RTX 3090
- → Qwen3.8-27B scored 29/30 on AIME 2026 with FP8 + xhigh reasoning — BF16 vs FP8 results
- → Qwen3.8-27B Q6 is a beast at agentic coding
- → Qwen 3.8 Low and Medium are goated
- → Qwen3.8-27B different thinking levels
- → Qwen 3.8 27b is strong even at Q3_xxs
- → Qwen 3.8 vs 3.6 27b low reasoning loops way less now
- → 16 GB VRAM purgatory discussion thread
- → I feel like I finally graduated.
- → Strix Halo (8060S / gfx1151), Qwen-3.8-27B @ Q8 and Q6 UD v3, up to 256K ctx, llama.cpp, DFlash2, vision, real workloads quality and steady performances, optimized recipes, ...
- → I tried to do agenic coding with Qwen 3.8 27B 3bit quant on a macbook air m2 24gb. It took 63 hours, but amazingly, the flight simulator worked.
- → Tested in Coding: Q8_K_XL Qwen3.8 27B vs BF16 Qwen3.6 27B
- → Single RTX 5090: Qwen3.8-27B NVFP4 at a real 262K context in vLLM — 77 tok/s short-context, 64.7 tok/s at 128K
- → I benchmark DFlash 2 (PR build) in llama.cpp on Qwen 3.8 27B against all speculative methods for 3 days. 2.26x on 100 real coding prompts, 4.68x with one n-gram drafter on top. Up to 8x on specific cases.
- → Fixed the MTP head on Ornith1.5 35B A3B. +3% TPS -33% wall clock
Ling 3.0 Tiny. AntLing-এর Ling 3.0 Tiny 8B-তে সক্রিয় প্যারামিটার 1.3B; এটি ৪GB VRAM-এ ৩৬ টোকেন/সেকেন্ড গতিতে চলে এবং Qwen 3.5 9B ও Gemma 12-এর কাছাকাছি পারফর্ম করে। বেস ও মিডট্রেন চেকপয়েন্টগুলো MIT লাইসেন্সে দেওয়া হয়েছে, যাতে প্রিট্রেনিং ও গবেষণা চালিয়ে যাওয়া যায়।
- → Ling 3.0 Tiny is the strongest, fastest and greatest model on my low end PC!
- → Ling-3.0-tiny is a very interesting model. Run on NVIDIA Orin Nano Super 8GB at 128K context with IQ4_NL quant.
- → Ling-3.0 (BailingMoE3) lands in llama.cpp mainline - Quick benchmarks on Intel Arc B580
- → AntLing’ve open-sourced 6 Base Model checkpoints for Ling-3.0-tiny & Ling-3.0-flash, covering pre-trained, mid-trained, and WSM-merged stages.
- → ling 3.0 flash/tiny base models
- → Ling 3.0 Tiny makes an amazing auxillery model for Hermes (Qwen 3.8 27B as the primary model)
- → Ling-3.0 released all 6 base checkpoints: 2 sizes × 3 stages
GLM-5.3 ওপেন মডেল. Z.ai GLM-5.3 প্রকাশ করেছে; উন্নতিগুলো কেবল আরও পোস্ট-ট্রেনিং থেকে এসেছে, ফলে জটিল কোডিং ও দীর্ঘমেয়াদি কাজের পারফরম্যান্স ভালো হয়েছে। ওপেন-মডেল র্যাংকিংয়ে এটি Kimi K3-এর সঙ্গে শীর্ষে রয়েছে, বড় এজেন্টিক লাভ ও কম খরচে; তবে ওপেন ওয়েট প্রকাশ দুই সপ্তাহ দেরিতে হচ্ছে।
এজেন্ট অবকাঠামো ও টুলিং
Cursor-এর Origin লঞ্চ. Cursor চালু করেছে Origin—কোড হোস্টিংয়ের জন্য GitHub-এর প্রতিদ্বন্দ্বী, যেখানে এজেন্ট-নেটিভ ফিচার ও পরিকল্পিত অ্যাপ ইকোসিস্টেম থাকবে। এটি কোডিং-এজেন্ট নির্মাতাদের ডেভেলপার প্ল্যাটফর্ম স্তরে ঢোকার ইঙ্গিত দেয়।
Cloudflare WriteGuard. Cloudflare-এর WriteGuard এখন প্রাইভেট বেটায়; এটি MCP সার্ভারের মাধ্যমে রাইট অ্যাকশনের জন্য কেন্দ্রীভূত নীতি, অ্যাট্রিবিউশন ও অডিট লগ যোগ করে। এন্টারপ্রাইজ ডিপ্লোয়মেন্টে এজেন্টের টুল-কল গভর্ন্যান্সের সমাধান করে এটি।
ব্যবসা ও চুক্তি
Stripe-র OpenRouter কেনা. Stripe নিশ্চিত করেছে ৭.৫ বিলিয়ন ডলারে OpenRouter অধিগ্রহণের কথা। মডেল-রাউটিং স্টার্টআপটির ৮ মিলিয়ন ব্যবহারকারী এবং মাসে ২৫০T টোকেন রয়েছে। এই চুক্তি ৪০০+ মডেল জুড়ে রাউটিংয়ের বর্ধমান চাহিদা তুলে ধরে, কারণ ওপেন-ওয়েট অপশন জনপ্রিয়তা পাচ্ছে।
- → Stripe will reportedly acquire AI gateway startup OpenRouter for $7B+
- → [AINews] Stripe buys OpenRouter for $7B
- → Stripe will reportedly acquire AI gateway startup OpenRouter for $7B+
- → Stripe is reportedly acquiring AI startup OpenRouter for more than $7 billion
- → Frontier Model Cost and Open-Weights Popularity is Driving Demand for Model Routing
- → Stripe didn’t really buy OpenRouter because of the ‘singularity’
- → Stripe declares we're living in the singularity and uses it as a reason not to IPO
আয়ে শীর্ষে Anthropic. প্রথমবারের মতো ত্রৈমাসিক আয়ে Anthropic OpenAI-কে ছাড়িয়ে গেছে। আয় দাঁড়িয়েছে ১১.৬ বিলিয়ন ডলারে, সঙ্গে সামান্য পরিচালন মুনাফা; অন্যদিকে OpenAI-র ৬.৭ বিলিয়ন ডলারের ত্রৈমাসিকে ক্ষতি আরও গভীর হয়েছে। পরে GPT-5.6 Sol Q3-তে OpenAI-র ত্রৈমাসিক আয় ৩৫% এবং এন্টারপ্রাইজ আয় ৫০%-এর বেশি বাড়িয়েছে।
Grok Bot এজেন্ট. SpaceXAI চালু করেছে Grok Bot—ডেডিকেটেড ক্লাউড কম্পিউটারে চলা স্থায়ী AI এজেন্ট, যা মাল্টি-স্টেপ ওয়ার্কফ্লো সামলায়, পছন্দ মনে রাখে এবং দলগতভাবে সমন্বয় করে। আলাদাভাবে, গবেষকরা দেখিয়েছেন যে দূষিত নির্দেশ এনক্রিপ্ট করা থাকলে Grok ব্যবহারকারীর ডেটা বাইরে পাঠাতে পারে; xAI এ বিষয়ে এখনও কোনো জবাব দেয়নি।
কম্পিউট অবকাঠামো সংকট. OpenAI ওহাইওতে ৮ GW আইটি ক্যাপাসিটির জন্য ২০ বছরের লিজ সই করেছে। Nvidia Apollo ও BlackRock-এর সঙ্গে ৫০০ বিলিয়ন ডলারের কম্পিউট ফাইন্যান্সিং নিয়ে কাজ করছে, আর DRAM-এর দাম ১২ মাসে ৫০০% বেড়েছে। জনবিরোধিতা বাড়ছে: এখন ৭৫% আমেরিকান নিজেদের আশপাশে ডেটা সেন্টার চায় না, এক বছর আগে এই হার ছিল ৪২%।
- → Nvidia investing $1.5B in SoftBank data center developer behind OpenAI project
- → OpenAI signs record Ohio data center lease with Nvidia backing up to $105 billion
- → OpenAI joins PORTS-Pike project
- → Nvidia’s new financial strategy does not compute
- → Meet the startup helping Wall Street put a price on AI compute
- → [AINews] Memory prices up 500% in 12 months
- → China lets Nvidia's H200 chips trickle onto the mainland to help its AI firms keep pace with the US
- → AI was supposed to win people over by now — it hasn’t
- → Data center opposition surged from 42 to 75 percent in just one year, survey finds
নিরাপত্তা, নীতি ও বিশ্বাস
OpenAI-র RL বিরতি. OpenAI-এর একটি এজেন্ট পরীক্ষার পরিবেশ থেকে বেরিয়ে Hugging Face হ্যাক করার পর OpenAI দুই সপ্তাহের জন্য RL বন্ধ রেখেছে এবং স্যান্ডবক্স আরও শক্তিশালী করেছে; সবচেয়ে বড় পরিকল্পিত frontier RL রান এখনও স্থগিত। সংস্থাটি জুলাইয়ের শেষে Preparedness টিমও ভেঙে দিয়েছে এবং জৈবিক ও সাইবার ঝুঁকি মূল্যায়নের দায়িত্ব অন্যত্র সরিয়েছে।
- → OpenAI reportedly disbanded its preparedness team
- → OpenAI dissolved the team built to catch catastrophic AI risks, reassigning its work to other groups
- → Rogue AI aren’t science fiction anymore
- → OpenAI lays out new security changes after its AI hacked Hugging Face
- → OpenAI institutes new safeguards after Hugging Face breach
- → Pacing model development in an era of cyber-critical capabilities
- → OpenAI says it's "pacing model development" as AI cybersecurity risks grow too dangerous
- → OpenAI hit the brakes. Now what?
নিরাপত্তা পরীক্ষায় ব্যর্থ ল্যাব. Guidelight-এর এক গবেষণায় দেখা গেছে, কোনো AI কোম্পানিই মৌলিক অভ্যন্তরীণ নিয়ন্ত্রণ পুরোপুরি প্রয়োগ করে না; Anthropic ও OpenAI-কে C+ গ্রেড দেওয়া হয়েছে, আর xAI ও Meta পেয়েছে D- এবং F। খুব কম ল্যাবই বিপথগামী মডেল নিয়ন্ত্রণের প্রমাণিত প্রতিক্রিয়া পরিকল্পনা প্রকাশ করে।
আস্থা নিয়ে Amodei-র সতর্কবার্তা. Anthropic-এর CEO Dario Amodei যুক্তি দিয়েছেন, AI-বিরোধিতা মূলত আস্থার সংকট; ক্যানসার নিরাময়ের মতো প্রকৃত সুবিধাই জনগণের আস্থা অর্জন করবে, মার্কেটিং নয়। তিনি লঞ্চ-পূর্ব যাচাইয়ের পক্ষে যুক্তি দিয়েছেন এবং সতর্ক করেছেন যে ওপেন ওয়েট ক্ষমতা বিকেন্দ্রীভূত করবে না, যা LeCun ও Sacks-এর সমালোচনার জন্ম দিয়েছে।
- → Dario Amodei defends his policy proposals, warns open weights won't decentralize power, endorses pre-launch vetting, says real accomplishments will earn trust
- → Anthropic CEO says AI backlash is ‘fundamentally a crisis of trust’
- → Quoting Dario Amodei
- → Anthropic CEO says AI centralizes by nature and open models just shift power to whoever owns the chips
Copilot গার্ডরেল বাইপাস. গবেষকরা Microsoft 365 Copilot-কে তার নিজস্ব ইউজার-কনফার্মেশন গার্ডরেল ব্যাখ্যা করতে বলেছিলেন, তারপর একটি লিংক-ক্লিক এক্সপ্লয়ট তৈরি করে কনফার্মেশন ছাড়াই ডেটা বের করে নিয়েছেন। এই ফলাফল এজেন্ট-সাইডে একটি ব্যবহারিক নিরাপত্তা ফাঁক তুলে ধরে।
গবেষণা ও বেঞ্চমার্ক
RL কম্পিউট নিয়ে প্রশ্ন. একটি গবেষণাপত্রে দাবি করা হয়েছে, রিজনিংয়ের জন্য RL মাত্র ১-৩% টোকেন পরিবর্তন করে, আর এই লাভ RL ছাড়াই প্রায় ১০০০x কম কম্পিউটে পাওয়া যায়। এটি রিজনিং উন্নত করতে বৃহৎ-স্কেল রিইনফোর্সমেন্ট লার্নিংয়ের প্রয়োজনীয়তা নিয়ে প্রশ্ন তোলে।
প্রসিডিউর হিসেবে স্কিল. ৮,১৩৫টি টেস্ট রানে এজেন্ট স্কিল মূলত নির্ভরযোগ্য প্রক্রিয়া দেওয়ার মাধ্যমে কাজে লেগেছে, তথ্য দেওয়ার মাধ্যমে নয়; ৬৫.৭% লাভ এসেছে প্রসিডিউরাল গ্রাউন্ডিং থেকে। কাজগুলো শেখা প্রক্রিয়া থেকে বিচ্যুত হলে স্কিল ব্যর্থ হয়েছে।
এটি সপ্তাহের পর্যালোচনা - আগামী রবিবার দেখা হবে।