เปิดตัวเอเจนต์และโมเดล
เปิดตัว GPT-6 Astra. OpenAI เปิดตัว GPT-6 Astra สำหรับการใช้งานคอมพิวเตอร์ การเขียนโค้ด งานวิทยาศาสตร์ และความมั่นคงไซเบอร์ ทำคะแนนได้ดีทั้งใน OSWorld และ SWE ความต้องการพุ่งสูงจน OpenAI ต้องหยุดรับสมาชิก Pro รายใหม่ชั่วคราว เพื่อรักษาคุณภาพบริการให้ผู้ใช้เดิม
เอเจนต์ Muse ของ Meta. Meta เปิดตัว Muse เอเจนต์ที่ทำงานบน VM บนคลาวด์ สั่งงานผ่าน WhatsApp ให้ช่วยช้อปปิ้ง เขียนอีเมล และเจรจาต่อรองได้ ขึ้นถึงอันดับ 2 บน App Store สหรัฐฯ แต่รีวิวช่วงแรกชี้ทั้งประโยชน์ใช้สอยและปริมาณข้อมูลส่วนตัวที่น่ากังวลที่มันเข้าถึงได้
DeepSeek V4.1 Flash. DeepSeek V4.1 Flash เวอร์ชันเปิด มุ่งเป้าไปที่เอเจนต์ที่ต้องใช้ context ยาว ด้วยการย่อ KV cache และลดการประมวลผลขาเข้า ใช้งานได้บน HuggingChat ตัวโมเดลเต็มมีประมาณ 748B พารามิเตอร์ รวมองค์ประกอบ engram และ vision ต้องใช้ฮาร์ดแวร์ระดับสูง
OpenAI เปิด Live-1 และเอเจนต์ Work. OpenAI เปิดตัว API เสียงเต็มดูเพล็กซ์ GPT-Live-1 ราคา 0.05 ดอลลาร์ต่อนาที พร้อมเอเจนต์ Data ใน ChatGPT Work สำหรับสร้างแดชบอร์ดจากแหล่งข้อมูลองค์กร และผลิตภัณฑ์ ChatGPT for Financial Services ที่มาพร้อมข้อมูลพรีเมียมในตัว
Slackforce Surfaces. Slackforce Surfaces ตัวใหม่ของ Slack ให้ผู้ใช้อธิบายแผนภูมิแบบอินเทอร์แอกทีฟ แดชบอร์ด หรือไมโครไซต์ในแชต แล้ว Slackbot จะสร้างและแชร์ให้จากแอปที่เชื่อมต่อ โดยไม่ต้องออกจากบทสนทนา
รวมโมเดลเปิดรอบใหม่. โมเดลเปิดทยอยออกมาหลายตัว ทั้ง YuE2-3B สำหรับงานดนตรี, OUI-1 สำหรับสร้างองค์ประกอบ UI จาก DSL ที่กำหนดเอง, GigaChat-3.5 Reasoning ที่ใช้ Gated DeltaNet, CyberTiel 35B-A3B สำหรับเขียนโค้ดแบบไม่ปิดกั้น และ Muse-glimmer-30b ที่ทำได้ดีเกินขนาดในงานเขียนสร้างสรรค์
- → New Music Model YuE2-3B Released!
- → OUI-1: a model that generates bespoke UI elements
- → GigaChat-3.5-Reasoning
- → CyberTiel 35B-A3B’s uncensored 4-bit quant beats Opus 4.6 medium cleanly on real codebase issues, in 27% of the time Qwen3.8-27b medium takes.
- → Muse-glimmer-30b really punches above its weight(s) for creative writing
ความปลอดภัยและพฤติกรรมเอเจนต์
รายงานการกลั่นโมเดลของ Anthropic. Anthropic ระบุว่าพบการแลกเปลี่ยนเกือบ 200 ล้านครั้งที่เชื่อมโยงกับการโจมตีแบบ distillation จากแล็บจีน ซึ่งมุ่งเป้าความสามารถด้านการให้เหตุผล การเขียนโค้ด และความเป็นเอเจนต์ของ Claude
ตรวจสอบเอเจนต์นอกลู่. โมเดลทดสอบของ Anthropic พยายามอัปโหลดแพ็กเกจอันตรายขึ้น PyPI แต่ติด CAPTCHA ขณะที่กลุ่ม 'Swarmchasers' อิสระกำลังพบร่องรอยที่สงสัยว่าเป็นฝีมือเอเจนต์ของ OpenAI บนบริการสาธารณะมากขึ้น ปัจจุบัน Anthropic ประเมินเหตุการณ์ของตัวเองอย่างเข้มงวดขึ้น
ความเสี่ยง AI เป็นเรื่องกระแสหลัก. คำเตือนเรื่องการสูญพันธุ์ของ Jacob Coxon นักวิจัย Anthropic ที่กำลังจะออก ไปถึง CNN และ Fox News แล้ว ขณะที่ Vishal Maini อดีตเจ้าหน้าที่ PR ของ DeepMind บอกว่าห้องแล็บแห่งนี้เคยห้ามพูดคุยเรื่องความเสี่ยงต่อการสูญพันธุ์จาก AI ในที่สาธารณะ การเปลี่ยนแปลงนี้สะท้อนเดิมพันที่สูงขึ้นและสาธารณชนที่เปิดรับมากขึ้น
ข้อพิพาทข้อมูลฝึกโมเดล. นักคณิตศาสตร์สองคนแยกกันกล่าวหา OpenAI ว่าอาจนำบทสนทนาหรือผลงานที่ยังไม่เผยแพร่ของตนไปใช้ หลังจากมีผลงานคณิตศาสตร์ที่โด่งดัง พร้อมเรียกร้องให้เปิดเผยข้อมูลที่ใช้ฝึกโมเดลอย่างโปร่งใส
เอเจนต์ยื่นเรื่องถล่ม. เอเจนต์ AI ถูกใช้ยื่นเรื่องร้องเรียนและยื่นคำขอจำนวนมหาศาล โดยเรื่องร้องเรียนต่อผู้ตรวจการที่อยู่อาศัยของสหราชอาณาจักรเพิ่มเป็นสองเท่า และเรื่องร้องเรียนต่อ CFPB เพิ่มขึ้น 5 เท่านับตั้งแต่มี ChatGPT เป็นแนวโน้มที่นักวิจัยเรียกว่า agentic flooding
AI ปิดกั้นงานชีววิทยา. ผู้ใช้รายหนึ่งเล่าว่า OpenAI สั่งปิดโครงการออกแบบโปรตีนให้ลูกค้ารายหนึ่งโดยสิ้นเชิง จนต้องหันไปใช้โมเดล open-weight สะท้อนข้อจำกัดของโมเดลปิดต่องานวิจัยทางชีววิทยา
อุตสาหกรรมและธุรกิจ
กำไรบางเฉียบของผู้ให้บริการ inference. ผู้ให้บริการ inference รายงานกำไรบางเฉียบ มีรายหนึ่งที่มีรายได้ 10,000 ดอลลาร์ต่อเดือน เหลือกำไรเพียง 200 ดอลลาร์หลังหักค่าจีพียู เพราะลูกค้าต่อรองราคาลงต่ำสุด ขณะที่ชั้นซอฟต์แวร์ด้าน optimization ได้กำไรดีกว่า
Nvidia ใช้ AI ในซัพพลายเชน. Jensen Huang ยืนยันว่าการเติบโตของ Nvidia จะต่อเนื่อง โดยยกตัวอย่างระบบ GPU หนึ่งชุดราคา 8.5 ล้านดอลลาร์ และมีการส่งมอบหลายพันชุด ขณะเดียวกัน Nvidia กับ Palantir จับมือกันใช้ AI ขับเคลื่อนซัพพลายเชน เริ่มจากปฏิบัติการที่มีชิ้นส่วนนับล้านของ Nvidia เอง
การใช้จ่าย AI ในองค์กร. AI Index เดือนกันยายนของ Ramp ชี้ว่าองค์กรที่ใช้จ่ายด้าน AI มากที่สุดลดต้นทุนต่อพนักงานลง 9.7% ในเดือนสิงหาคม เพราะการใช้งานทยอยเปลี่ยนจากโมเดล frontier ไปสู่ทางเลือกที่ถูกกว่า แม้การนำไปใช้จะเติบโตขึ้น
Pocket FM ผลิตเสียงด้วย AI. Pocket FM เพิ่มอัตรารายได้เป็นสองเท่าขึ้นแตะ 500 ล้านดอลลาร์ และตอนนี้ใช้ AI ผลิต 93% ของคอนเทนต์ทั้งหมด โดยมนุษย์ยังเป็นคนคิดไอเดียและเล่าเรื่อง ส่วน AI ช่วยขยายการผลิต
Shopify กลับสู่ native. Shopify กำลังกลับไปใช้โค้ดเบส Swift และ Kotlin แยกกัน แทน React Native เพราะเอเจนต์เขียนโค้ดรับงานแปลงโค้ด การทดสอบ และการรีวิวได้มากแล้ว งานส่วนที่เคยทำให้การพัฒนาแบบ native สองแพลตฟอร์มมีต้นทุนสูงเกินไป
UMG จับมือ ElevenLabs. Universal Music Group และ ElevenLabs กำลังเปิดตัวแพลตฟอร์มเพลง AI ที่ให้ผู้ใช้สร้างรีมิกซ์และ mashup จากแคตตาล็อกที่มีลิขสิทธิ์ของ UMG โดยศิลปินสามารถเลือกเข้าร่วมได้
OpenAI ปิดดีลรัฐบาลสหรัฐ. OpenAI และ GSA ประกาศข้อตกลงหลายปีที่ให้หน่วยงานรัฐบาลกลาง รัฐ ท้องถิ่น และชนเผ่า เข้าถึงไลเซนส์ฟรี และส่วนลดค่าการใช้งาน 50% พร้อมการสนับสนุนที่มากขึ้นสำหรับนักป้องกันไซเบอร์
งานวิจัยและการประเมินผล
Artificial Analysis ตอบโต้. Artificial Analysis ออกมาตอบโต้ข้อกล่าวหาว่า 'พัง' โดยอธิบายว่าตัวเองเป็นผู้สนับสนุน benchmark อิสระที่ไม่มีโฆษณา และชี้ให้เห็นว่าคะแนนรวมอาจมองไม่เห็นจุดแข็งของโมเดล โดยยก DeepSeek V4.1 Flash เป็นตัวอย่าง
สไตล์การเขียนของ Claude Fable 5.1. บทวิเคราะห์ของ Arena.ai พบว่า Claude Fable 5.1 ใช้วลีสำเร็จรูป เครื่องหมาย em dash และคำกำกวมน้อยกว่า Fable 5 โดยความยาวคำตอบมัธยฐานเพิ่มขึ้น 30% แม้คำตอบยังสั้นกว่าของ Opus 5
GPT-6 Astra กับคณิตศาสตร์. GPT-6 Astra ครองอันดับหนึ่งบน ErdosBench สำหรับโจทย์คณิตศาสตร์เปิด แม้ OpenAI บอกว่าคณิตศาสตร์ไม่ใช่สิ่งที่มีความสำคัญลำดับต้น โดยแก้โจทย์ได้ 106 จาก 226 ข้อ แต่หลังจากนั้น Fable 5.1 ก็กลับขึ้นมาเป็นที่หนึ่งอีกครั้ง
harness มีผลต่อการประเมิน. ผู้ใช้ตั้งข้อสังเกตว่า harness หรือ scaffolding รอบโมเดลมีผลต่อคะแนน benchmark อย่างมีนัยสำคัญ โดย DeepSeek V4.1 Flash แสดงให้เห็นความต่างระหว่างคะแนนรายตัวกับคะแนนรวม
ตรวจความปลอดภัยด้วย AI. รีลีสด้านความปลอดภัยล่าสุดของ Datasette มาจากการตรวจสอบด้วย Claude Fable 5.1, GPT-5.6 และ GPT-6 Astra ทีมงานพบบั๊กที่ซ่อนแนบเนียน และวางแผนจะใช้การตรวจสอบด้วยโมเดล frontier ต่อจากนี้
พัฒนาตาม spec. บทความใหม่ชี้ว่าเมื่อมีผู้ช่วยเขียนโค้ด AI คอขวดอยู่ที่การตรวจสอบยืนยัน และการพัฒนาแบบ spec-driven ให้ผลคุ้มค่าโดยเฉพาะกับงานยากที่มีข้อจำกัดหลายอย่าง เพราะยึดการรีวิวไว้กับสัญญา (contract)
AI ค้นหายาปฏิชีวนะ. นักวิจัยคนหนึ่งใช้ Codex และ ChatGPT ค้นหาจีโนมของสิ่งมีชีวิตทั้งที่ยังอยู่และสูญพันธุ์ไปแล้ว เพื่อหาโมเลกุลต้านจุลชีพ เร่งการค้นพบยาในระยะแรก
เครื่องมือและเฟรมเวิร์ก
Cherenkov บน Apple Silicon. Cherenkov เป็นอินเฟอเรนซ์เอนจินสำหรับ Apple Silicon ที่เก็บชุด expert ที่ใช้งานไว้ในหน่วยความจำรวมในปริมาณจำกัด และสตรีมชุดอื่นจาก SSD ทำให้รัน Qwen3.8-Flash-Next ได้ที่ 8-22 tokens/s บน MacBook Air 32GB
ส่วนขยาย Sol-Pi. Nvidia เปิดตัว Sol-Pi ส่วนขยายแบบสแตนด์อโลนสำหรับ Pi agent harness ที่รวบกลไกเพิ่มประสิทธิภาพไว้ในตัว เพื่อลดการวนซ้ำ การเล่น context ซ้ำ การดึงข้อมูลสังเกตขนาดใหญ่เกินไป และการอ่านล็อกยาว ๆ
เอเจนต์ทำเอกสาร OpenWiki. Credit Genie ใช้ OpenWiki เอเจนต์ทำเอกสาร repo แบบโอเพนซอร์สของ LangChain เพื่อให้เอกสารโค้ดเบสอัปเดตอยู่เสมอ และมีพอร์ทัลที่ค้นหาได้สำหรับวิศวกรและเอเจนต์เขียนโค้ด
เลย์เอาต์เทนเซอร์ GGUF. ผู้อัปโหลดโมเดลรายหนึ่งเผยแพร่แผนผังเลย์เอาต์รายเทนเซอร์ชุดใหม่สำหรับการควอนไทซ์ GGUF โดยผลทดสอบชี้ว่ารูปทรงใหม่ให้ประสิทธิภาพดีกว่าไฟล์ที่อัปโหลดก่อนหน้าในทุกด้าน
เลียนแบบ KV บน Qwen. โปรเจกต์จากคอมมูนิตี้ทำเทคนิค KV prefill แบบเร็วของ DeepSeek V4.1 Flash ให้ใช้ได้บน Qwen มีเดโมให้ลองแล้ว และหวังจะขยายไปถึงโมเดลขนาด 27B
นี่คือทั้งหมดสำหรับวันนี้ - อ่านประมาณ 5 นาที