การเปิดตัวโมเดล
Qwen 3.8 27B. ทีม Qwen ของ Alibaba เปิดตัว Qwen3.8-27B และ Qwen3.8-2.4T-A95B ที่ใหญ่กว่า ภายใต้สัญญา Apache 2.0 โมเดล dense ขนาด 27B ใช้สถาปัตยกรรมเดียวกันกับ Qwen3.6-27B แต่ปรับปรุงการเขียนโค้ด งานออฟฟิศ และการวางแผนของเอเจนต์ผ่านการเปลี่ยนแปลงการฝึกฝน รองรับบริบทดั้งเดิม 262k โทเคน และขยายได้ถึง 1M โทเคน
GLM-5.3 จาก Zhipu. Zhipu AI เปิดตัว GLM-5.3 ซึ่งใช้โมเดลฐานเดียวกันกับ GLM-5.2 แต่ขยายการฝึกซ้ำหลังการฝึก บริษัทอ้างว่าเป็นโมเดลโค้ดแบบเปิดน้ำหนักที่แข็งแกร่งที่สุด โดยมีความก้าวหน้าที่โดดเด่นในด้านการเขียนโค้ดแบบเอเจนต์และการค้นหาช่องโหว่ด้านความปลอดภัยทางไซเบอร์ คาดว่าน้ำหนักจะเผยแพร่บน Hugging Face ภายในสองสัปดาห์
Muse Glimmer ของ Meta. Meta เปิดซอร์ส Muse Glimmer โมเดลเอเจนต์ขนาด 30B ภายใต้ Apache 2.0 ที่ออกแบบมาสำหรับเวิร์กโฟลว์ในเครื่องบน GPU ทั่วไป โดยกลั่นทักษะการให้เหตุผลและการเรียกใช้เครื่องมือจาก Muse Spark ที่ใหญ่กว่า และเคยเป็นโมเดลชั้นนำในคลาส 30B ชั่วครู่
คลื่นโมเดลเปิดของจีน. ในเวลาไม่ถึงเดือน ห้องแล็บจีนได้เปิดตัว Kimi K3, Qwen3.8, DeepSeek-V4-Pro-0813 และ GLM-5.3 ซึ่งตอกย้ำความก้าวหน้าอย่างรวดเร็วของโมเดลเปิดน้ำหนักระดับแนวหน้า
การปรับใช้ในเครื่องและชุมชน
ความเร็วบน Apple Silicon. การออกรุ่น mlx-dspark ใหม่นำ speculative decoding มาใช้กับ Qwen3.8-27B บน Apple Silicon ทำให้สร้างข้อความได้เร็วขึ้นประมาณ 3 เท่าบน M4 Pro ในขณะที่ให้โทเคนเอาต์พุตเหมือนเดิม
การทำ Quantization และน้ำหนัก. Unsloth เปิดตัวน้ำหนักแบบ quantized ของ Qwen3.8-27B และ Tim Dettmers ปล่อยทีเซอร์วิธีการ quantization ใหม่ที่สามารถรัน GLM-5.3 บน DGX Spark ตัวเดียวที่ความเร็ว 7 โทเคนต่อวินาที
การทดสอบ Qwen 3.8 ช่วงแรก. การทดสอบของชุมชนแสดงให้เห็นเดโมการเขียนโค้ดแบบ one-shot และพฤติกรรมเอเจนต์ที่แข็งแกร่งใน Qwen3.8-27B แต่ผู้ใช้บางรายรายงานว่าความรู้ทั่วไปถูกตัดออกอย่างเห็นได้ชัด และมีร่องรอยการคิดที่ยาวมากเมื่อใช้ระดับความพยายาม reasoning แบบ xhigh พารามิเตอร์การสุ่มตัวอย่างที่แนะนำมีอยู่ใน model card
- → Qwen 3.8 - 27B is a game changer
- → A hunch: Qwen3.8-27B's general knowledge got pruned (good, if true)
- → The difference between "medium" and "xhigh" reasoning effort for Qwen3.8-27B is actually insane.
- → Qwen 3.8 27B - Aquarium Burst Sample Test
- → RetroCraft - Qwen 3.8 27B Q8, one shot with exact performance data on dual 3090s.
เวอร์ชันท้องถิ่นแบบไม่มีการเซ็นเซอร์. เวอร์ชัน 'heretic' ของ Qwen3.8-27B จากชุมชนได้ลบการปฏิเสธและการป้องกันออกไป เพื่อเป็นทางเลือกท้องถิ่นที่ไม่มีการเซ็นเซอร์ในระดับโมเดลชั้นนำอย่าง Opus 4.6
ความโปร่งใสและความปลอดภัยของ AI
การตรวจจับลายน้ำของ Anthropic. Anthropic จะให้บริการ API สำหรับตรวจจับลายน้ำ เพื่อให้นักพัฒนาบุคคลที่สามสามารถตรวจหาข้อความที่น่าจะสร้างโดย Claude วิธีการนี้ใช้ SynthID Text และมีความน่าเชื่อถือน้อยลงกับข้อความสั้น ข้อความที่เน้นข้อเท็จจริง หรือข้อความที่ถูกเขียนใหม่มาก
Google ทำให้ลายน้ำเป็นตัวเลือก. Google อนุญาตให้ผู้ใช้ปิดลายน้ำที่มองเห็นได้บนรูปภาพ วิดีโอ และเพลงที่สร้างโดย AI จาก Nano Banana, Omni และ Lyria โดยยังคงฝัง SynthID ที่มองไม่เห็นและข้อมูลเมตา C2PA เพื่อการตรวจสอบ
การฉีดพรอมptในศาล. ผู้พิพากษาในรัฐคอนเนตทิคัตบันทึกสิ่งที่ดูเหมือนเป็นการยื่นเอกสารต่อศาลสหรัฐฯ ฉบับแรกที่มีข้อความซ่อนอยู่ซึ่งมีเจตนาเพื่อจัดการระบบ AI ที่ตรวจสอบคดี คำสั่งที่ซ่อนอยู่นั้นไม่มีผล แต่ผู้พิพากษาเรียกกลวิธีนี้ว่าอันตราย
เอเจนต์ในการใช้งานจริง
หน้าที่บำรุงรักษาของ Claude Code. Anthropic กล่าวว่า Claude Code ได้ดำเนินการบำรุงรักษารายวันบนแอปของตัวเอง โดยสร้าง pull requests 388 รายการ มีอัตราการ merge 46 เปอร์เซ็นต์หลังการตรวจสอบโดยมนุษย์ กิจวัตรรวมถึงการ fuzz เพื่อหาความผิดพลาด การทำความสะอาด abstraction ที่ซ้ำซ้อน และการตรวจสอบ dependency
Computer History ของ OpenAI. Computer History ของ OpenAI แทนที่ต้นแบบ Chronicle ที่จับภาพหน้าจอ โดยบันทึกการคลิก การกดแป้นพิมพ์ และการสลับแอปบน macOS เพื่อสร้างไทม์ไลน์ที่ค้นหาได้ สามารถตรวจจับเวิร์กโฟลว์ที่เกิดขึ้นซ้ำและแนะนำทักษะที่ใช้ซ้ำได้สำหรับ ChatGPT และ Codex
อุตสาหกรรมและธุรกิจ
สงครามราคาสหรัฐฯ-จีน. OpenAI และ Anthropic กำลังลดราคาลง ขณะที่โมเดลเปิดของจีนมีความแข็งแกร่งขึ้น Gemini 3.7 Flash ของ Google เปิดตัวพร้อมส่วนลดเปิดตัว 50 เปอร์เซ็นต์สำหรับการเขียนโค้ดและเอเจนต์ ราคาโทเคนจากห้องแล็บชั้นนำของสหรัฐฯ ลดลงเกือบหนึ่งในสี่ตั้งแต่กลางเดือนกรกฎาคม
GPT-5.6 Sol Ultrafast. OpenAI เปิดตัวโหมด Ultrafast แบบตัวอย่างสำหรับ GPT-5.6 Sol ที่ขับเคลื่อนโดย Cerebras ให้ความเร็วสูงสุด 750 โทเคนเอาต์พุตต่อวินาที บริการ API ในช่วงแรกจำกัดเฉพาะลูกค้าที่เลือก และมุ่งเน้นการวิเคราะห์แบบเรียลไทม์ระหว่างเหตุการณ์หรือเหตุการณ์ตลาด
AI เพื่อทุกคนของ Meta. Meta จับคู่การเปิดตัว Glimmer กับจดหมายยาวของ Zuckerberg ที่โต้แย้งว่า AI ควรเปิดให้ทุกคน แต่รายการพอดแคสต์ชี้ว่าบริษัทยังเก็บ Muse Spark ที่ทรงพลังที่สุดไว้เบื้องหลัง API การอภิปรายเดียวกันยังชี้ถึงการเข้าซื้อกิจการมูลค่า 250 ล้านดอลลาร์ที่ผิดพลาด
โมเดลจีนของ Apple-Alibaba. มีรายงานว่า Apple ฝึกโมเดล AI แบบกำหนดเองสำหรับตลาดจีนด้วยความช่วยเหลือจาก Alibaba ก่อนนำ Apple Intelligence ไปสู่อุปกรณ์ในจีน ความร่วมมือนี้เป็นการทำงานร่วมกันระหว่างสหรัฐฯ-จีนที่หายาก
การผลักดัน inference ของ Kog. สตาร์ทอัพฝรั่งเศส Kog ใช้การปรับแต่งซอฟต์แวร์เพื่อดึงความเร็วจาก GPU ทั่วไป เช่น AMD MI300X และ Nvidia H200 โดยมุ่งเน้นการถอดรหัสคำขอเดี่ยวที่เร็วขึ้นสำหรับงานวิศวกรรมซอฟต์แวร์
ความเสี่ยงราคาก๊าซธรรมชาติ. การคาดการณ์ใหม่จาก Noreva เตือนว่าราคาก๊าซธรรมชาติอาจเพิ่มขึ้นสามเท่าในบางส่วนของสหรัฐฯ ขณะที่ผู้ให้บริการ hyperscale อย่าง Amazon, Google, Meta และ Microsoft จองก๊าซสำหรับศูนย์ข้อมูล AI
ไฮไลท์งานวิจัย
โมเดล ARC ขนาด 150M. โมเดล recurrent latent reasoning ที่มีพารามิเตอร์ 150M ทำคะแนน 29.5% บน ARC-AGI-1 ด้วยต้นทุน $0.0007 ต่องาน ซึ่งอยู่นอก frontier ต้นทุน-ความแม่นยำที่เผยแพร่ มันทำงานบนฮาร์ดแวร์ขั้นต่ำ แต่ยังจำเป็นต้องขยายเป็นพันล้านพารามิเตอร์
ข้อสงสัยเกี่ยวกับงานวิจัยอัตโนมัติ. การศึกษาของ Princeton และ UK AISI โดยใช้เอกสาร NeurIPS ที่ยังไม่ได้ตีพิมพ์ พบว่าโมเดลชั้นนำในปัจจุบันจัดการวิศวกรรมการวิจัยได้ แต่ล้มเหลวในส่วนที่สำคัญของงานวิจัย ซึ่งขัดแย้งกับคำกล่าวอ้างของห้องแล็บเกี่ยวกับงานวิจัย AI อัตโนมัติ
วิวัฒนาการ harness ของ DarwinX. DarwinX พัฒนา harness ของเอเจนต์ผ่านการคัดเลือกโดยธรรมชาติเหนือพรอมpt เครื่องมือ ทักษะ และการควบคุมโฟลว์ โดยคงน้ำหนักโมเดลให้คงที่ มันเพิ่มคะแนนเฉลี่ยประมาณ 17 จุดจากสี่ benchmark และถ่ายโอนไปยัง SWE-bench Verified ได้โดยไม่เปลี่ยนแปลง
benchmark PlayWorld. PlayWorld วัดประสิทธิภาพโมเดลโลกวิดีโอโดยใช้ผู้เล่นเอเจนต์แบบ multimodal ที่ทำตามวัตถุประสงค์ระยะยาว 171 รายการ โดยวัดความสม่ำเสมอของเรขาคณิต ความถูกต้องของการโต้ตอบ วิวัฒนาการนอกขอบเขตการมองเห็น และวิวัฒนาการของความเข้าใจ
นี่คือทั้งหมดสำหรับวันนี้ - อ่านประมาณ 5 นาที