Agentic AI News วันนี้

ข่าว AI agents ประจำวันใน 5 นาที: เปิดตัว, เครื่องมือ, งานวิจัย, การเงิน และการเคลื่อนไหวขององค์กร

อัปเดตทุกวัน คัดสรรจาก 30 แหล่ง อาทิตย์, สิงหาคม 23, 2026

โมเดลโลคัลและเวิร์กโหลดเอเจนต์

Qwen3.8 27B โลคัล. การทดสอบในคอมมูนิตี้พบว่า Qwen3.8 27B แข็งแกร่งกว่า Qwen3.6 ในการทำตามคำสั่งและงานบริบทยาว โดย RTX 5090 ใบเดียวรันเวอร์ชัน NVFP4 ที่บริบท 262K ได้ 77 โทเคน/วินาทีเมื่อบริบทสั้น และ 65 โทเคน/วินาทีที่ 128K

Speculative decoding. DFlash 2 พร้อมตัวร่าง n-gram เพิ่มความเร็วขึ้น 2.26 เท่าบนพรอมป์ LiveCodeBench สำหรับ Qwen3.8 27B และสูงสุด 4.68 เท่าในเซสชันเขียนโค้ดยาว ส่วน MTP head แบบคงที่บน Ornith 35B ลดเวลาจริงลงหนึ่งในสาม

การจัดการบริบทแบบรีเคอร์ซีฟ. นักพัฒนากำลังใช้เอเจนต์หลักความเร็วสูงที่รองรับบริบท 64K ร่วมกับเอเจนต์ย่อยแบบรีเคอร์ซีฟและโมเดลบีบอัดขนาดเล็ก เพื่อจัดการงานที่ยาวกว่ามากโดยไม่ต้องจ่ายค่าบริบท 300K

Gemma ฟินจูนเรียกใช้เครื่องมือ. การฟินจูน Gemma 4 12B สำหรับการเรียกใช้เครื่องมือและการใช้ CLI ช่วยให้การใช้เครื่องมือดีขึ้น 2.7 เท่า และเพิ่มการพยายามเรียกใช้เครื่องมือ 15.7% โดยมุ่งเป้าไปที่ระบบ VRAM 16GB

คลัสเตอร์ DGX Spark. คลัสเตอร์ DGX Spark 36 โหนดถูกใช้งานเป็นคลัสเตอร์สมรรถนะของเอเจนต์ โดยกระจายโหนดไปยังโมเดล SOTA, งาน rerank/embeddings, วิดีโอ, รูปภาพ และเสียงพร้อมกัน

เครื่องมือและเฟรมเวิร์ก

llama.cpp 0.2.0. llama.cpp เวอร์ชัน 0.2.0 เปิดตัวพร้อมพรีบิลด์และการเปลี่ยนแปลงจาก upstream ล่าสุดสำหรับการอนุมานในเครื่อง

Cloudflare Kitesurf. Kitesurf เป็นเอนจินเบราว์เซอร์สำหรับเอเจนต์ที่สร้างบน WebAssembly/Rust Workers โดยมี DOM แยกกันในแต่ละหน้า รองรับ CDP ทำให้ Playwright และ Puppeteer ขับเคลื่อนได้โดยใช้โอเวอร์เฮดต่ำกว่า Chromium เต็มรูปแบบ

llm 0.33. llm 0.33 ของ Simon Willison เพิ่มคีย์ API แยกต่อการเรียกสำหรับโมเดล embedding เทมเพลตที่ใช้ซ้ำเพื่อรวมการตั้งค่าโมเดลกับพรอมป์ และตัวเลือก reasoning_summary สำหรับโมเดลให้เหตุผล

เอเจนต์เขียนโค้ดเชิงปฏิบัติ. Simon Willison ชี้ว่าทักษะสำคัญของเอเจนต์เขียนโค้ดคือการสั่งงานและตรวจสอบการเปลี่ยนแปลงอย่างมั่นใจ ส่วน Linus Torvalds เล่าถึง AI ที่ทำงานพื้นฐานในเซสชันดีบั๊กที่ยากลำบาก แต่ต้องถูกผลักดัน หลังจากที่มันยืนยันซ้ำแล้วซ้ำเล่าว่าปัญหาไม่มีทางแก้

งานวิจัยและวิธีการ

ทักษะคือเพลย์บุ๊ก. ในการทดสอบ 8,135 ครั้ง ทักษะของเอเจนต์ช่วยได้หลักๆ จากการให้กระบวนการที่เชื่อถือได้ ไม่ใช่ข้อเท็จจริง โดยการยึดโยงกับกระบวนการคิดเป็น 65.7% ของสิ่งที่ได้ และทักษะล้มเหลวเมื่องานเบี่ยงเบนไปจากกระบวนการที่เรียนรู้มา

โมเดลโลกทางความคิด. งานวิจัยใหม่เพิ่มความเชื่อและความตั้งใจของมนุษย์เข้าไปในเวิลด์โมเดลของ AI ด้วย MENTIS โดยการจำลองความสมเหตุสมผลทั้งทางกายภาพ จิตใจ และสังคม ช่วยปรับปรุงการทำนายพฤติกรรมมนุษย์ได้อย่างมีนัยสำคัญ

จิตมิติเบนช์มาร์กความปลอดภัย. การวิเคราะห์ทางจิตมิติของเบนช์มาร์กความปลอดภัย 8 รายการพบว่า คะแนนเดียวปิดบังข้อแลกเปลี่ยนระหว่างความเข้มงวดในการปฏิเสธ ความจริง และอันตรายเชิงบริบท โมเดลอาจทำให้คะแนนความปลอดภัยสูงเกินจริงด้วยการบล็อกมากเกินไป

CoT แบบย้อนกลับได้. ข้อเสนอเรื่องขั้นตอนการให้เหตุผลที่ย้อนกลับได้โดยประมาณ พร้อมการตรวจสอบความสอดคล้องแบบวงจร (cycle-consistency) และการเลิกคำนวณ (uncomputation) อาจช่วยจับภาพหลอนของโมเดลและลดหน่วยความจำ KV-cache ใน LLM เอดจ์

จำลองทุกอย่าง. Latent Space ชี้ว่าข้อมูลสังเคราะห์ รูบริก และสภาพแวดล้อมกำลังทำให้แต่ละองค์ประกอบของไปป์ไลน์ ML ถูกสร้างขึ้นโดยโมเดล ให้ผลใกล้เคียงการจำลองของมนุษย์ โดยคุณภาพแย่ลง 10% แต่ถูกกว่า 100 เท่าและเร็วกว่า 10,000 เท่า

อุตสาหกรรมและแอปพลิเคชัน

Inherent Faraday. Inherent สตาร์ตอัปจากทีมงาน DeepMind ระบุว่าเอเจนต์ Faraday ของตนมีประสิทธิภาพเหนือโมเดลของ Anthropic และ OpenAI ในการทำซ้ำผลวิจัยทางวิทยาศาสตร์ที่ตีพิมพ์แล้วอย่างอิสระ โดยใช้ขนาดโมเดลเพียงเศษเสี้ยว

LinkedIn AI รีวิวโค้ด. LinkedIn สร้างแพลตฟอร์มรีวิวโค้ดแบบหลายเอเจนต์ที่ใช้ AI ซึ่งยึดโยงฟีดแบ็กกับ diff และธรรมเนียมของโค้ดเบส เพื่อลดภาพหลอนและคอมเมนต์คุณภาพต่ำ

Netflix GenRec. GenRec ระบบแนะนำที่ใช้โมเดลภาษาของ Netflix แปลงพฤติกรรมผู้ใช้เป็นข้อความ และเอาชนะเอนจินฟีเจอร์ที่สร้างด้วยมือในการทดสอบ A/B ทั้งแบบออฟไลน์และสด โดยใช้ข้อมูลน้อยกว่ามาก

DoorDash SafeChat. DoorDash เปิดเผยรายละเอียด SafeChat ระบบความปลอดภัยของมาร์เก็ตเพลสที่สร้างขึ้นในระดับใหญ่ จากนั้นก็แทนที่ด้วยสถาปัตยกรรมที่ทรงพลังกว่าเมื่อมันเริ่มใช้งานได้จริง

อวตาร AI ในการศึกษา. Harvard Business School ใช้คอร์ส bootcamp Foundry ราคา 699 ดอลลาร์ มีอวตาร AI ของ HeyGen ให้ฟีดแบ็กการนำเสนอและการประชุมบอร์ด ผู้เข้าร่วมชอบประสบการณ์ที่มีคนคอยแนะนำ แม้ผู้สอนตัวจริงบอกว่าบทพูดดูหลอนๆ หน่อย

ข่าวโมเดล. Liquid AI กำลังสำรวจความสนใจโมเดล LFM ขนาด 100B ขณะที่โมเดลปริศนาชื่อ Ox Alpha กำลังได้รับความสนใจจากประสิทธิภาพการเขียนโค้ดและการทำงานแบบเอเจนต์ที่แข็งแกร่ง มีการคาดเดาว่าน่าจะเป็นอนุพันธ์ในตระกูล GLM

นโยบาย ความปลอดภัย และความไว้วางใจ

OpenAI SB 53. OpenAI ระบุว่าแคลิฟอร์เนียควรแก้ไข SB 53 เพื่อเพิ่มการควบคุมระหว่างการฝึกโมเดลระดับ frontier และเสริมความแข็งแกร่งด้านความปลอดภัยทางไซเบอร์ หลังเคยคัดค้านร่างกฎหมายนี้มาก่อน

แผนจำกัดวงโมเดล. ผลการศึกษาของ Guidelight ให้คะแนนห้องแล็บ frontier 5 แห่งด้านการจำกัดวงโมเดลที่หลุดการควบคุม โดย OpenAI ได้สูงสุด ส่วน Anthropic และ Meta ได้ต่ำสุด และมีเพียงไม่กี่แล็บที่เผยแพร่แผนรับมือที่แสดงให้เห็นจริง

ลายน้ำของ Claude. มีการอธิบายรายละเอียดของวอเทอร์มาร์กแบบใหม่ที่ Anthropic ใช้กับเอาต์พุตข้อความของ Claude ว่าติดตั้งอย่างไร และทำอะไรได้บ้างไม่ได้บ้าง

ความไว้ใจโมเดลปิด. เธรดใน Reddit r/LocalLLaMA โต้แย้งว่า OpenAI กำลังกั๊กความสามารถในงานโรงเรียน และหันเหออกจากการเสริมพลังผู้ใช้ ผลักให้ผู้ปฏิบัติกลับไปใช้โมเดลโลคัลสำหรับลูปเอเจนต์

นี่คือทั้งหมดสำหรับวันนี้ - อ่านประมาณ 5 นาที

อ่านทุกเช้าตรงในเบราว์เซอร์ของคุณ

ส่วนขยายเปิดสรุปนี้ในแผงด้านข้างของ Chrome — คลิกเดียว ไม่ต้องมีบัญชี

เพิ่มไปยัง Chrome — ฟรี