เอเจนต์และการเปิดตัวโมเดล
Ox Alpha ลึกลับ. โมเดลฟรีตัวใหม่ชื่อ Ox Alpha โผล่บน OpenRouter ในฐานะโมเดล reasoning สำหรับงานเขียนโค้ดและงานแบบเอเจนต์ที่ทำต่อเนื่องยาวนาน แต่ยังไม่มีการเปิดเผยว่าผู้พัฒนาเป็นใคร แพทริก คอลลิสัน ซีอีโอของ Stripe เรียกมันว่า “น่าประทับใจมาก” ส่วนกระแสคาดเดาไล่ตั้งแต่ GLM ไปจนถึง MAI ของไมโครซอฟต์
เครื่องมือและเฟรมเวิร์ก
Cloudflare OS เปิดซอร์ส. Cloudflare เปิดซอร์ส Cloudflare OS แพลตฟอร์ม AI สำหรับองค์กร ที่เอกสารหรือแอปแต่ละตัวรันในแซนด์บ็อกซ์แยก ('Gadget') ทำให้ผู้ใช้ที่ไม่ใช่สายเทคนิคสามารถ 'vibe coding' ได้อย่างปลอดภัย ภายในแพลตฟอร์มมีแชตบอตพร้อมคอนเนกเตอร์ ระบบอัตโนมัติสำหรับเวิร์กโฟลว์ และการบังคับใช้นโยบายผ่านโมเดลแบบ capability-based
DeepSeek Harness ได้คำชม. ผู้ใช้รายหนึ่งรายงานว่า DeepSeek Harness ยอดเยี่ยมมากสำหรับเวิร์กโฟลว์ของเอเจนต์ โดยการตั้งค่าแบบค่อยเป็นค่อยไปและการสั่งงานด้วยภาษาธรรมชาติทำให้ผสานกับ SimpleX ได้โดยไม่ต้องรอ PR ตัวเครื่องมือไม่ได้บังคับแนวทางตายตัว จึงปรับให้เป็นพฤติกรรมเอเจนต์ตามที่ต้องการได้
โมเดลโลคัลและโอเพน
Qwen 3.8 เปลี่ยนเกมโลคัล. รายงานจากคอมมูนิตี้ระบุว่า Qwen 3.8 27B เป็นตัวเปลี่ยนเกมสำหรับงานเขียนโค้ดและ OCR แบบโลคัล โดยคุณภาพ OCR ดีกว่า Gemini 3.5 Flash Lite และประสิทธิภาพเทียบเท่าโมเดลระดับ frontier เมื่อปีที่แล้ว การเทียบ quant (Atomic Dynamic GGUF) พบว่าความต่างระหว่าง Q4-Q6 ไม่ได้ห่างกันมาก ส่วน quant ต่ำอย่าง Q3 XXS ก็ทำงานเองต่อเนื่องได้เป็นเวลาหลายชั่วโมงบน Mac mini แรม 24GB อย่างไรก็ตาม การพอร์ต C จำนวน 39,000 บรรทัดเป็น HTML แบบ one-shot โดย Opus 5 ยังได้ผลลัพธ์แค่พอใช้ ซึ่งชี้ให้เห็นว่าโมเดลโลคัลต้องพึ่งพา harness และพรอมป์อย่างมาก
LLM 60MB คอนเทกซ์ยาว. นักพัฒนาคนหนึ่งเทรนโมเดล 250M พารามิเตอร์ด้วยโทเคน 30B และทำ quantization ให้เหลือต่ำกว่า 2 บิต รันในแรม 80MB ที่ความเร็ว 400 โทเคน/วินาทีบน CPU ตัวโมเดลบีบอัดคอนเทกซ์ที่เก่ากว่าลงดิสก์ในอัตรา 320 ไบต์ต่อโทเคน รองรับประวัติสูงสุด 1M โทเคน แต่ไม่ได้ถูกเทรนให้คิดวิเคราะห์จากคอนเทกซ์นั้น
Dreamer 4 ไม่ถึง $150. Dreamer 4 เวิลด์โมเดลขนาด 1.57B พารามิเตอร์ถูกเทรนจากศูนย์ด้วยงบไม่ถึง $150 โดยใช้เฟรมจาก Procgen ที่มีแอ็กชันกำกับไว้ ค่า PSNR ของ tokenizer อยู่ที่ 40.41 แสดงให้เห็นว่าไม่จำเป็นต้องใช้เวิลด์โมเดลระดับ frontier
รวมอัปเดตออปติไมซ์โลคัล. รายงานที่ออกมาได้แก่ การเพิ่มความเร็ว 30-50% จากการย้ายจาก llama.cpp บน Windows ไป vLLM บน Linux การรองรับ MTP ของ GLM-4.5-Air ใน llama.cpp สำหรับเครื่องที่แรมเยอะ ConvRot quant ที่ให้คุณภาพใกล้เคียง Q8 ในขนาด Q6 และ deepseek-v4-flash Q8 ซึ่งรันที่ 24 โทเคน/วินาทีบน EPYC+5090 พร้อมคอนเทกซ์ 100k+
ไฮไลต์งานวิจัย
กับดักการคิดจากเมมโมรี. MemTrapBench วัดกับดักการคิดที่เกิดจากเมมโมรีใน LLM เช่น การยึดติดกับแนวคิดเดิมและการบิดเบือนความเชื่อ โดยกลยุทธ์เมมโมรีทุกแบบที่ทดสอบมีประสิทธิภาพต่ำกว่าเบสไลน์ที่ไม่มีเมมโมรีมากกว่า 10% ขณะที่ AdaptiveMem ช่วยลดกับดักลงได้โดยไม่ทำให้ประสิทธิภาพลดลง
SkillEvo เกรเดียนต์วิวัฒนาการ. SkillEvo ใช้ฟีดแบ็กจากการโต้ตอบหลายเทิร์นเพื่อสร้าง evolution gradient ที่น่าเชื่อถือสำหรับสกิลของเอเจนต์ โดยแก้ปัญหาฟีดแบ็กแบบคำถาม-ตอบรอบเดียวที่เสื่อมคุณภาพ และช่วยให้ซ่อมแซมสกิลที่ล้มเหลวในเชิงโครงสร้างได้
VLM จากสกรีนช็อต. การ fine-tune VLM ขนาด 450M ด้วยสกรีนช็อตเบราว์เซอร์ 50K ช่วยเพิ่มคะแนนประสิทธิภาพงานจาก 1/100 เป็น 44/100 แสดงให้เห็นว่าโมเดลเล็กๆ ก็เรียนรู้ความเข้าใจ UI สำหรับงานเอเจนต์ได้
ข้อขัดแย้งนักวิทยาศาสตร์ AI. บทความเศรษฐศาสตร์เชิงทฤษฎีชี้ว่า การที่ AI ช่วยประหยัดเวลาอาจทำให้นักวิจัยทำโปรเจกต์มากขึ้นแต่ใช้ความพยายามต่อโปรเจกต์น้อยลง ซึ่งอาจลดคุณภาพงานวิจัยลง แม้โมเดลภาษาจะทำงานได้อย่างไร้ที่ติก็ตาม
อุตสาหกรรมและธุรกิจ
Anthropic เจอคู่แข่งราคาถูก. รายได้แบบ annualized ของ Anthropic แตะ $65B แต่โมเดลที่ดีที่สุดอย่าง Fable 5 มียอดใช้งานต่ำ (คิดเป็น 8% ของยอดใช้จ่ายบน Ramp) เทียบกับ Opus 4.8 ที่ 28% ขณะที่เครื่องมือราคาถูกกว่ากำลังมาแรง ส่วนรายได้ OpenAI พุ่งขึ้น 35% หลังเปิดตัว GPT-5.6
Stripe ซื้อ OpenRouter. การเข้าซื้อ OpenRouter ของ Stripe สะท้อนว่าโทเคนกำลังกลายเป็นทรัพยากรทางเศรษฐกิจ โดยปริมาณการใช้โทเคนของเอเจนต์บน OpenRouter เติบโต 14 เท่าตั้งแต่เดือนกุมภาพันธ์ ขณะที่การใช้งานของมนุษย์เพิ่มขึ้นเพียง 2.8 เท่า และ 70% ของโทเคนที่เอเจนต์ใช้มาจากพรอมป์ที่แคชไว้ ยิ่งไปกว่านั้น เอเจนต์เลือกโมเดลโดยพิจารณาจากต้นทุน ความหน่วง และความน่าเชื่อถือมากขึ้นเรื่อยๆ
ราคาเซิร์ฟเวอร์ Nvidia พุ่ง 15%. การขาดแคลนหน่วยความจำผลักดันราคาเซิร์ฟเวอร์ AI ของ Nvidia ให้สูงขึ้นกว่า 15% สำหรับระบบ Vera Rubin และ Grace Blackwell เนื่องจากต้นทุน DRAM ที่เพิ่มขึ้นจาก Samsung, SK Hynix และ Micron ซึ่งกระทบยักษ์ใหญ่คลาวด์และแล็บ AI
Nvidia ซื้อลิขสิทธิ์ Poolside. Nvidia ลงทุน $1B ใน Poolside และจ่าย $6B เพื่อขอสิทธิ์ใช้เทคโนโลยีของบริษัท พร้อมย้ายวิศวกรกว่า 100 คนไปยังทีม Nemotron โดยตั้งเป้าแข่งขันกับโมเดลโอเพนเวตของจีน
AI ผู้จัดการไล่พนักงาน. เอเจนต์ AI ชื่อ Luna ซึ่งดูแลร้านค้าในซานฟรานซิสโกมาตั้งแต่เดือนเมษายน ไล่พนักงานมนุษย์คนหนึ่งออกเพราะมาสายซ้ำๆ แต่ก็ต่อเมื่อมนุษย์ช่วยเตือนมันถึงกฎที่มันตั้งไว้เอง การจำลองเหตุการณ์ซ้ำด้วยโมเดลเจ็ดตัวพบว่า AI ที่มีความสามารถมากกว่าจะแนะนำให้ไล่ออกอย่างเสมอต้นเสมอปลายมากกว่า
ตลาดเทาโทเคน Claude. นักพัฒนาชาวจีนเลี่ยงข้อจำกัดของ Anthropic ผ่านสถานีตัวกลางที่ขายโทเคน Claude ในราว 10% ของราคาอย่างเป็นทางการ โดยใช้เซิร์ฟเวอร์ต่างประเทศ เครดิตฟรี และการสลับโมเดล ซึ่งบ่อนทำลาย geoblocking และการเฝ้าระวังความปลอดภัย
นี่คือทั้งหมดสำหรับวันนี้ - อ่านประมาณ 5 นาที