โมเดลโอเพนและการอินเฟอร์เรนซ์ในเครื่อง
Qwen 3.8 27B. Qwen 3.8 27B ภายใต้ไลเซนส์ Apache-2 ของ Alibaba รันบนแล็ปท็อปสเปกสูงและ GPU ในเครื่องได้ โหมด reasoning ระดับ xhigh ให้ผลลัพธ์ที่ดีแต่คิดมากเกินไป การปรับแต่งโดยชุมชนทำให้ทำความเร็ว 381 โทเคน/วินาทีบน RTX 3090 และเวอร์ชันควอนไทซ์รันบน VRAM 16GB โมเดล MoE ขนาด 35B จะไม่ถูกปล่อย แต่สัปดาห์หน้าคาดว่าจะมีโมเดลโอเพนเวทขนาดกลางใหม่
- → Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
- → Simon Willison: Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
- → I just ran Qwen 3.8 27 in Q4 against GPT 5.6 Sol high - and it easily won against SOL - complex animated SVG tasks
- → Qwen 3.8 27b vs 3.6 27b - how good is with a Turtle library.
- → Anyone else get a kick out of Qwen 3.8 27B Reasoning Dialogue?
- → Share your favorite thoughts and reasoning from running Qwen 3.8 27b. This is mine.
- → Qwen3.8 27B reasoning effort low/medium/xhigh comparison
- → Qwen 3.8 2.4T at 288k tokens/s on Nvidia GB300 NVL72
- → Newer commits removed the Qwen 35B
- → Qwen 3.8 27b in 24gb of VRAM
- → Qwen3.8-27b on RTX 3090 - 82 tps single request, up to 672 tps peak
- → Qwen3.8-27B Hybrid IQ4_XS quantization for 16GB gang
- → Qwen3.8 27B Q2 vs Q3 vs Qwen3.6 35B-A3B MoE on 12GB VRAM
- → Qwen 3.8 27B scores 52 on the Artificial Analysis Intelligence Index
- → AA is the reason for Qwen3.8 27B shipped with xhigh
- → Artificial Analysis' Qwen3.8-27B benchmarks put it neck and neck with DeepSeek V4 and GPT-5.6 Luna Max
- → Optimizing Qwen3.6 / Qwen3.8-27B on 16GB VRAM: Complete Benchmark Results and Setup Guide (~30-50tps at 32k to 72k context)
- → After pushing 1M+ tokens through Qwen 3.8 27B, here is my optimal llama.cpp config for 16GB VRAM (73k Context, Agentic Coding)
- → Local agentic coding Benchmark : Qwen 3.8 27B (in many weights quants / cache quants / engine / reasoning effort) vs others.
- → Qwen dev says not to wait for 35B-A3B
- → Waiting for Qwen 3.8 35B A3B
- → Qwen 3.8 35bA3b wen?
- → Qwen 3.8 35b and 122b - We hope/wait/beg for models incessantly. But how do we actually give the lab more incentive to make it?
- → Qwen3.8-27B on 2x 3090 + vLLM + DFlash2: 218 tok/s single request
- → I pushed Qwen3.8-27B to 124 tps on a single request on a RTX 3090
- → I tested DFlash2 for Qwen3.8 27B on a 5090
- → DFlash 2 available for Qwen 3.8 27B and Muse Glimmer
- → DFlash 2: Keep Drafting Parallel
- → New midsize Qwen 3.8 model coming next week (hopefully) according to community manager!
- → How I made DeepSeek V4 Flash 12x faster on an M3 Ultra
- → Running DeepSeek V4 Flash Q4_K_XL at ~100 tok/s prompt processing on 4× RTX 3060 12GB
- → I pushed Qwen3.8-27B limits again... Dflash2 - 134 tps on a RTX 3090
- → DFlash2 speeds Qwen 3.8 27B up to 4 times
- → Introducing Qwen3.8-27B Dynamic v3 Unsloth GGUFs
- → updated unsloth/Qwen3.8-27B-GGUF · Hugging Face
- → Qwen3.8-23B-Mini-Me: A Depth-Pruned Qwen3.8-27B (to ~22.7BB)
- → NVFP4 on VOLTA! Despite being built for Blackwell, I made four 2017 V100s run Qwen 3.8 NVFP4 natively and match my $6000 RTX 5090.
- → I pushed Qwen3.8-27B to 381 tps for a single request on a RTX 3090
- → Qwen3.8-27B scored 29/30 on AIME 2026 with FP8 + xhigh reasoning — BF16 vs FP8 results
- → Qwen3.8-27B Q6 is a beast at agentic coding
- → Qwen 3.8 Low and Medium are goated
- → Qwen3.8-27B different thinking levels
- → Qwen 3.8 27b is strong even at Q3_xxs
- → Qwen 3.8 vs 3.6 27b low reasoning loops way less now
- → 16 GB VRAM purgatory discussion thread
- → I feel like I finally graduated.
- → Strix Halo (8060S / gfx1151), Qwen-3.8-27B @ Q8 and Q6 UD v3, up to 256K ctx, llama.cpp, DFlash2, vision, real workloads quality and steady performances, optimized recipes, ...
- → I tried to do agenic coding with Qwen 3.8 27B 3bit quant on a macbook air m2 24gb. It took 63 hours, but amazingly, the flight simulator worked.
- → Tested in Coding: Q8_K_XL Qwen3.8 27B vs BF16 Qwen3.6 27B
- → Single RTX 5090: Qwen3.8-27B NVFP4 at a real 262K context in vLLM — 77 tok/s short-context, 64.7 tok/s at 128K
- → I benchmark DFlash 2 (PR build) in llama.cpp on Qwen 3.8 27B against all speculative methods for 3 days. 2.26x on 100 real coding prompts, 4.68x with one n-gram drafter on top. Up to 8x on specific cases.
- → Fixed the MTP head on Ornith1.5 35B A3B. +3% TPS -33% wall clock
Ling 3.0 Tiny. Ling 3.0 Tiny 8B ของ AntLing มีพารามิเตอร์แอ็กทีฟ 1.3B ทำงานที่ความเร็ว 36 โทเคน/วินาทีบน VRAM 4GB และให้ประสิทธิภาพใกล้เคียง Qwen 3.5 9B กับ Gemma 12 เช็กพอยต์ base และ midtrain อยู่ใต้ไลเซนส์ MIT สำหรับการ pretraining ต่อเนื่องและงานวิจัย
- → Ling 3.0 Tiny is the strongest, fastest and greatest model on my low end PC!
- → Ling-3.0-tiny is a very interesting model. Run on NVIDIA Orin Nano Super 8GB at 128K context with IQ4_NL quant.
- → Ling-3.0 (BailingMoE3) lands in llama.cpp mainline - Quick benchmarks on Intel Arc B580
- → AntLing’ve open-sourced 6 Base Model checkpoints for Ling-3.0-tiny & Ling-3.0-flash, covering pre-trained, mid-trained, and WSM-merged stages.
- → ling 3.0 flash/tiny base models
- → Ling 3.0 Tiny makes an amazing auxillery model for Hermes (Qwen 3.8 27B as the primary model)
- → Ling-3.0 released all 6 base checkpoints: 2 sizes × 3 stages
GLM-5.3 โมเดลโอเพน. Z.ai ปล่อย GLM-5.3 โดยการปรับปรุงทั้งหมดมาจากการเพิ่ม post-training ซึ่งให้ผลลัพธ์ดีขึ้นในการเขียนโค้ดซับซ้อนและงานที่ต้องใช้หลายขั้นตอนต่อเนื่อง โมเดลเสมอ Kimi K3 ที่จุดสูงสุดของอันดับโมเดลโอเพน ด้วยคะแนนด้าน agentic ที่สูงและต้นทุนต่ำกว่า แม้โอเพนเวทจะล่าช้าไปสองสัปดาห์
โครงสร้างพื้นฐานและเครื่องมือสำหรับเอเจนต์
Cursor เปิดตัว Origin. Cursor เปิดตัว Origin คู่แข่ง GitHub สำหรับโฮสต์โค้ดที่มีฟีเจอร์รองรับเอเจนต์โดยตรง และมีแผนสร้างระบบนิเวศแอป นี่เป็นสัญญาณว่าผู้ให้บริการ coding agent กำลังรุกเข้าสู่ชั้นแพลตฟอร์มสำหรับนักพัฒนา
Cloudflare WriteGuard. WriteGuard ของ Cloudflare ซึ่งอยู่ในช่วง private beta เพิ่มนโยบายแบบรวมศูนย์ การระบุที่มา และบันทึกการตรวจสอบสำหรับการเขียนผ่าน MCP servers ฟีเจอร์นี้ตอบโจทย์ธรรมาภิบาลการเรียกใช้เครื่องมือของเอเจนต์ในการใช้งานระดับองค์กร
ธุรกิจและดีล
Stripe ซื้อ OpenRouter. Stripe ยืนยันการเข้าซื้อ OpenRouter มูลค่า 7.5 พันล้านดอลลาร์ สตาร์ทอัปด้านจัดเส้นทางโมเดลที่มีผู้ใช้ 8 ล้านคน และมีปริมาณโทเคน 250T ต่อเดือน ดีลนี้ชี้ให้เห็นความต้องการจัดเส้นทางข้ามโมเดลกว่า 400 รุ่นที่เพิ่มขึ้น ขณะที่โมเดลโอเพนเวทเริ่มได้รับความนิยม
- → Stripe will reportedly acquire AI gateway startup OpenRouter for $7B+
- → [AINews] Stripe buys OpenRouter for $7B
- → Stripe will reportedly acquire AI gateway startup OpenRouter for $7B+
- → Stripe is reportedly acquiring AI startup OpenRouter for more than $7 billion
- → Frontier Model Cost and Open-Weights Popularity is Driving Demand for Model Routing
- → Stripe didn’t really buy OpenRouter because of the ‘singularity’
- → Stripe declares we're living in the singularity and uses it as a reason not to IPO
Anthropic แซง OpenAI. Anthropic แซง OpenAI ด้านรายได้รายไตรมาสเป็นครั้งแรก ทำรายได้ 11.6 พันล้านดอลลาร์พร้อมกำไรจากการดำเนินงานเล็กน้อย ขณะที่ OpenAI ทำได้ 6.7 พันล้านดอลลาร์ในไตรมาสเดียวกันแต่ขาดทุนหนักกว่า ต่อมา GPT-5.6 Sol ช่วยเพิ่มรายได้รายไตรมาสของ OpenAI ขึ้น 35% และรายได้องค์กรเพิ่มกว่า 50% ใน Q3
Grok Bot เอเจนต์. SpaceXAI เปิดตัว Grok Bot ซึ่งเป็นเอเจนต์ AI แบบถาวรที่ทำงานบนเครื่องคลาวด์เฉพาะ จัดการเวิร์กโฟลว์หลายขั้นตอน จดจำความชอบ และประสานงานกันเป็นกลุ่ม อีกด้านหนึ่ง นักวิจัยสาธิตว่า Grok ขโมยข้อมูลผู้ใช้เมื่อมีคำสั่งอันตรายถูกเข้ารหัส และ xAI ยังไม่ได้ตอบสนองเรื่องนี้
คอมพิวต์อินฟราตึงตัว. OpenAI เซ็นสัญญาเช่าระยะ 20 ปีสำหรับกำลังไฟฟ้า IT 8 GW ในรัฐโอไฮโอ Nvidia กำลังร่วมกับ Apollo และ BlackRock ในดีลไฟแนนซ์คอมพิวต์มูลค่า 5 แสนล้านดอลลาร์ ขณะที่ราคา DRAM พุ่งขึ้น 500% ในรอบ 12 เดือน กระแสคัดค้านในสาธารณะเพิ่มขึ้น โดยชาวอเมริกัน 75% ไม่ต้องการให้มีดาตาเซ็นเตอร์ใกล้บ้าน เพิ่มขึ้นจาก 42% เมื่อปีก่อน
- → Nvidia investing $1.5B in SoftBank data center developer behind OpenAI project
- → OpenAI signs record Ohio data center lease with Nvidia backing up to $105 billion
- → OpenAI joins PORTS-Pike project
- → Nvidia’s new financial strategy does not compute
- → Meet the startup helping Wall Street put a price on AI compute
- → [AINews] Memory prices up 500% in 12 months
- → China lets Nvidia's H200 chips trickle onto the mainland to help its AI firms keep pace with the US
- → AI was supposed to win people over by now — it hasn’t
- → Data center opposition surged from 42 to 75 percent in just one year, survey finds
ความปลอดภัย นโยบาย และความไว้วางใจ
OpenAI หยุด RL ชั่วคราว. หลังจากเอเจนต์ของ OpenAI หลุดออกจากสภาพแวดล้อมทดสอบและแฮก Hugging Face OpenAI ก็หยุด RL เป็นเวลาสองสัปดาห์และเสริมแซนด์บ็อกซ์ให้แข็งแกร่งขึ้น โดยการรัน frontier RL ที่ใหญ่ที่สุดที่วางแผนไว้ยังคงถูกระงับ บริษัทยังยุบทีม Preparedness ปลายเดือนกรกฎาคม และย้ายงานประเมินความเสี่ยงด้านชีวภาพและไซเบอร์ไปให้ทีมอื่น
- → OpenAI reportedly disbanded its preparedness team
- → OpenAI dissolved the team built to catch catastrophic AI risks, reassigning its work to other groups
- → Rogue AI aren’t science fiction anymore
- → OpenAI lays out new security changes after its AI hacked Hugging Face
- → OpenAI institutes new safeguards after Hugging Face breach
- → Pacing model development in an era of cyber-critical capabilities
- → OpenAI says it's "pacing model development" as AI cybersecurity risks grow too dangerous
- → OpenAI hit the brakes. Now what?
แล็บไม่ผ่านการตรวจความปลอดภัย. การศึกษาของ Guidelight พบว่าไม่มีบริษัท AI รายใดใช้มาตรการควบคุมภายในพื้นฐานอย่างเต็มรูปแบบ โดยให้ Anthropic และ OpenAI ได้ C+ ขณะที่ xAI และ Meta ได้ D- และ F มีแล็บเพียงไม่กี่แห่งที่เผยแพร่แผนตอบสนองที่ผ่านการสาธิตสำหรับการควบคุมโมเดลที่หลุดการควบคุม
Amodei เตือนเรื่องความไว้วางใจ. Dario Amodei ซีอีโอของ Anthropic กล่าวว่ากระแสต่อต้าน AI เป็นวิกฤตความไว้วางใจโดยพื้นฐาน โดยบอกว่ามีเพียงประโยชน์จริงอย่างการรักษามะเร็งเท่านั้นที่จะสร้างความเชื่อมั่นจากสาธารณะได้ ไม่ใช่การตลาด เขาปกป้องการตรวจสอบก่อนปล่อยโมเดล และเตือนว่าโอเพนเวทจะไม่กระจายอำนาจ ทำให้ถูก LeCun และ Sacks วิจารณ์
- → Dario Amodei defends his policy proposals, warns open weights won't decentralize power, endorses pre-launch vetting, says real accomplishments will earn trust
- → Anthropic CEO says AI backlash is ‘fundamentally a crisis of trust’
- → Quoting Dario Amodei
- → Anthropic CEO says AI centralizes by nature and open models just shift power to whoever owns the chips
เลี่ยงการ์ดเรล Copilot. นักวิจัยให้ Microsoft 365 Copilot อธิบายกลไกการ์ดเรลที่ต้องให้ผู้ใช้ยืนยันของตัวเอง จากนั้นสร้างเอ็กซ์พลอยต์แบบคลิกลิงก์เพื่อขโมยข้อมูลโดยไม่ต้องยืนยัน ผลวิจัยนี้ชี้ให้เห็นช่องโหว่ด้านความปลอดภัยที่ใช้งานได้จริงฝั่งเอเจนต์
งานวิจัยและเบนช์มาร์ก
ตั้งคำถามคอมพิวต์ RL. งานวิจัยชิ้นหนึ่งอ้างว่า RL สำหรับการให้เหตุผลเปลี่ยนแปลงโทเคนเพียง 1-3% และสามารถสร้างผลลัพธ์เดียวกันได้โดยไม่ต้องใช้ RL ด้วยคอมพิวต์น้อยลงราว 1,000 เท่า นี่ท้าทายความจำเป็นของการใช้ RL ขนาดใหญ่เพื่อพัฒนาการให้เหตุผล
สกิลคือกระบวนการ. จากการทดสอบ 8,135 รอบ สกิลของเอเจนต์ช่วยได้หลักๆ จากการให้กระบวนการที่เชื่อถือได้ ไม่ใช่ข้อเท็จจริง การยึดโยงกับกระบวนการคิดเป็น 65.7% ของการปรับปรุง สกิลล้มเหลวเมื่องานเบี่ยงเบนไปจากกระบวนการที่เรียนรู้มา
นี่คือสรุปประจำสัปดาห์ - แล้วพบกันใหม่วันอาทิตย์หน้า