เปิดตัวเอเจนต์และโมเดลใหม่
Claude Fable 5.1. Anthropic เปิดตัว Fable 5.1 และ Mythos 5.1 โดยอ้างว่าทำงานด้านโค้ดและงานวิจัยได้ดีขึ้น และงานแบบเอเจนต์มีต้นทุนต่ำลงถึง 45% จากการอ่านแคชที่ถูกลง Fable 5.1 เวอร์ชันไร้ข้อจำกัดเปิดให้ใช้แล้ววันนี้ แม้การวิเคราะห์ต้นทุนในช่วงแรกจะแย้งว่าตัวเลขการประหยัดสูงสุดที่การใช้เหตุผลระดับสูงสุดยังเป็นที่น่าสงสัย
- → Claude Fable 5.1 made me a really nice animated pelican
- → Anthropic launches Claude Fable 5.1 and says it’s up to 45 percent cheaper for agentic work
- → Anthropic's Claude Fable 5.1 promises better coding and research at up to 45 percent less
- → Anthropic’s new Fable release is cheaper, less restrictive
OpenAI เตรียมเปิดตัว Astra. OpenAI ระบุว่าโมเดล Astra ที่กำลังจะเปิดตัวเป็น LLM รุ่นแรกที่ผ่านเกณฑ์ความปลอดภัยทางไซเบอร์ระดับวิกฤต โดยสามารถค้นหาและใช้ประโยชน์จากช่องโหว่ที่ไม่รู้จักได้ด้วยตัวเอง บริษัทเลื่อนการพัฒนาบางส่วนออกไปหลังจากเหตุการณ์แฮก Hugging Face เพื่อเสริมการป้องกัน และจะจำกัดการเข้าถึงความสามารถด้านไซเบอร์ซีเคียวริตี้ขั้นสูงสุด
โมเดล Spark-X2.5 ใหม่. โมเดลโอเพนซอร์ส Spark-X2.5-4B และ 1.7B ปรากฏบน Hugging Face พร้อมสถาปัตยกรรมแบบใหม่ อ้างว่าประสิทธิภาพสูสีกับ Qwen 3.5 9B และรองรับบริบท 1M ในตัว ยังไม่สามารถรันบน llama.cpp เวอร์ชันหลักได้ แต่มี fork ที่ปรับแต่งเอง
Runway เปิดตัว Solaris. Runway เปิดตัว Solaris “Interface World Model” ที่สร้างเฟรม UI แบบเรียลไทม์แทนการรันโค้ด และตอบสนองต่อการคลิกและเสียง ตอนนี้ยังเป็นเพียงงานวิจัย มีข้อจำกัดด้านการเรนเดอร์ข้อความและการรองรับโปรแกรมอ่านหน้าจอ
AI ในเครื่องและฮาร์ดแวร์
ผลทดสอบ Qwen3.8 ในเครื่อง. รายงานจากคอมมูนิตี้เผยการรัน Qwen3.8 27B และ Flash-Next บนฮาร์ดแวร์หลากหลายรูปแบบ: Mac 48GB ได้ 12 โทเคนต่อวินาที, Epyc R9700 สองตัวพร้อมเคอร์เนล MXFP4 ดีโค้ดได้ 280 โทเคนต่อวินาที และ RTX 3090 ตัวเดียวหลังปรับแต่งพิเศษดีโค้ดได้ 132 โทเคนต่อวินาที ผลเทียบควอนไทเซชันชี้ว่า UD Q3_K_XL เหมาะกับการ์ด 16GB ขณะที่ผู้ใช้บางคนมองว่า Qwen3.8 เขียนโค้ดเก่งแต่ชอบแก้โค้ดเกินจำเป็น
- → Running 104GB Qwen3.8-Flash-Next on 48GB Mac at ~12 tok/s
- → How I got 280 tok/s on Qwen3.8 27B on 2xr9700's and 940k tokens kv cache
- → I pushed Qwen3.8-27B to 2.000 prefill per second and 132 decode per second on A RTX 3090.
- → Kaitchup posted Qwen3.8 27B Benchmarks for quants from Q4 to Q1
- → Everyone is t/s maxing.. 3.8.. but after a week of using it for work I'm tempted to switch back to 3.6
DGX Spark ราคาพุ่ง. DGX Spark ของ Nvidia และ Asus Ascent GX10 ราคาเพิ่มขึ้นอย่างมีนัยสำคัญ โดยรุ่น Asus กระโดดจาก 3,999 ดอลลาร์เป็น 5,999 ดอลลาร์ ผู้ซื้อเริ่มตั้งคำถามว่าคลัสเตอร์ของ DGX Spark คุ้มค่าเมื่อเทียบกับระบบ AMD Epyc ซึ่งมีแบนด์วิดท์หน่วยความจำสูงกว่า แม้ DGX จะรองรับ FP4 และ tensor parallelism ก็ตาม
CMP 170HX เจอปัญหา. ผู้ใช้รายหนึ่งรายงานว่า GPU CMP 170HX 2 ใน 5 ตัวเสียภายในสองสัปดาห์ และอีกตัวมีเทนเซอร์คอร์บกพร่อง พร้อมให้เหตุผลว่าราคาปัจจุบันไม่คุ้มกับความเสี่ยงสำหรับงานอินเฟอร์เรนซ์ LLM
INT8 กับควอนต์หลอกตา. การถกเถียงในคอมมูนิตี้ตั้งคำถามว่าเหตุใดโมเดล INT8 W8A8 ถึงไม่แพร่หลายบน RTX 3090 ทั้งที่การ์ดมีเทนเซอร์คอร์ INT8 ในตัว ขณะที่ผู้ใช้อีกรายกล่าวหา AtomicChat ว่าติดป้ายควอนต์ IQ2_S ผิดเป็น Q4_K_M
Intel กลับสู่ตลาดหน่วยความจำ. Intel ส่งสัญญาณว่าจะกลับเข้าสู่ธุรกิจหน่วยความจำอีกครั้ง โดยซีอีโอกล่าวถึงการจ้าง Seok-Hee Lee อดีตผู้บริหาร SK Hynix และสถาปัตยกรรมหน่วยความจำแบบใหม่ แต่รายละเอียดยังมีไม่มาก
เครื่องมือและเฟรมเวิร์ก
OpenClaw 2.0 เปิดตัว. OpenClaw 2.0 เอเจนต์ AI ส่วนตัวแบบโอเพนซอร์ส ช่วยให้การตั้งค่าง่ายขึ้นด้วยการตรวจเจอซับสคริปชัน ChatGPT/Claude ที่มีอยู่และโมเดลในเครื่อง พร้อมปรับให้เบราว์เซอร์เป็นอินเทอร์เฟซหลัก และเพิ่มเซสชันคลาวด์ที่แชร์กันได้เพื่อทำงานร่วมกัน
เครื่องมือในตัวของ Codex. แอปเดสก์ท็อป Codex ของ OpenAI ตอนนี้มาพร้อม LibreOffice แบบเต็มรูปแบบและไบนารีอื่นๆ เช่น Poppler และ git ในรันไทม์ ทำให้ความสามารถด้านการประมวลผลเอกสารทำงานได้โดยไม่ต้องมีโปรแกรมภายนอกติดตั้งเพิ่ม
โรงงานซอฟต์แวร์ AI. โปรเจกต์โอเพนซอร์ส AI ชั้นนำอย่าง Flue และ tldraw กำลังปฏิเสธ PR จากภายนอก แล้วหันมาใช้ทีมเอเจนต์เพื่อคัดแยก ทำซ้ำ แก้ไข และรีวิว issue แทน ส่วนโปรเจกต์ AI SDK ของ Vercel ใช้ “software factory” แบบหลายเอเจนต์เพื่อเคลียร์งานค้างกว่า 1,000 issue และ 800 PR
Terraform สำหรับเอเจนต์. HashiCorp วางตำแหน่ง HCP Terraform ให้เป็น control plane ที่มีการกำกับดูแลสำหรับโครงสร้างพื้นฐานที่ขับเคลื่อนด้วย AI โดยให้เอเจนต์เขียนและนำการเปลี่ยนแปลง Terraform ไปใช้ พร้อมบังคับใช้นโยบาย ตัวตน และการควบคุมการตรวจสอบ
อัปเดต datasette-mcp. ปลั๊กอิน datasette-mcp ปล่อยเวอร์ชัน 0.2 โดยเปลี่ยนผลลัพธ์การสอบถาม SQL จากอาร์เรย์เป็นอ็อบเจกต์ เพื่อช่วยให้โมเดลที่มีความสามารถน้อยกว่าจับคู่คอลัมน์ได้ถูกต้อง
งานวิจัยและความปลอดภัย
ตรวจเบนช์มาร์กด้วย BenchMIRT. Hugging Face เปิดตัว BenchMIRT วิธีการตรวจสอบเบนช์มาร์ก LLM ในระดับพรอมป์รายตัว ซึ่งเผยว่าพรอมป์ภายในเบนช์มาร์กเดียวกันอาจวัดความสามารถที่ต่างกัน และคะแนนเฉลี่ยอาจทำให้ประเด็นนี้ไม่ชัดเจน
วิดีโอเอเจนต์ Gemini. Google DeepMind เปิดตัวความสามารถด้านวิดีโอแบบเอเจนต์ใน Gemini 3.7/3.6/3.5 Flash-Lite โดยใช้เครื่องมือวิดีโอในตัวเพื่อค้นหาและตรวจสอบส่วนต่างๆ ของวิดีโอแบบไดนามิก ช่วยเพิ่มความแม่นยำและลดการใช้โทเคนในการวิเคราะห์วิดีโอ
ลายน้ำข้อความ Claude. Anthropic เปิด API สำหรับตรวจสอบลายน้ำให้หน่วยงานกำกับดูแล สื่อ และนักตรวจสอบข้อเท็จจริง โดยองค์กรที่ได้รับอนุมัติสามารถตรวจหาข้อความที่สร้างโดย Claude ผ่านรูปแบบทางสถิติที่อาจทนต่อการแก้ไขบางส่วน ตามที่ EU AI Act กำหนด
ปัญหาเลือกตั้งและอคติ. AlgorithmWatch พบว่า AI Overviews เกี่ยวกับการเลือกตั้งของ Google ให้ข้อมูลไม่สอดคล้องกัน พึ่งพาแหล่งข้อมูลเพียงไม่กี่แห่ง และบางครั้งบรรยายผู้สมัครในเชิงเอนเอียงทางการเมือง ขณะเดียวกัน การค้นหาด้วย AI ของ Google ก็ให้คำแนะนำการโทรฉุกเฉินโดยอิงสัญชาติ จนต้องมีการแก้ไข
อุตสาหกรรมและธุรกิจ
AfterQuery โตไว. สตาร์ทอัปด้านข้อมูลฝึก AI อย่าง AfterQuery ระดมทุนที่มูลค่า 3.2 พันล้านดอลลาร์ เพิ่มขึ้น 10 เท่าในห้าเดือน กลายเป็นยูนิคอร์นที่โตเร็วที่สุดในประวัติศาสตร์ Y Combinator บริษัทจ้างมืออาชีพมาสอนโมเดลให้ทำงานเสร็จแบบเดียวกับที่มืออาชีพทำ
AIR ได้ 50 ล้านดอลลาร์. สตาร์ทอัปด้านความปลอดภัย AI อย่าง AIR ออกจากโหมด stealth พร้อมทุน 50 ล้านดอลลาร์ เพื่อช่วยบริษัทค้นหาเอเจนต์ และตรวจสอบสกิล MCP server และแอดออนที่ใช้งานอยู่เป็นประจำ พร้อมบล็อกการเชื่อมต่อซอฟต์แวร์ที่ไม่ได้รับอนุญาต
Google เจรจาไลเซนส์ฮอลลีวูด. มีรายงานว่า Google กำลังเจรจาข้อตกลงไลเซนส์กับสตูดิโอใหญ่เพื่อนำคอนเทนต์ที่มีลิขสิทธิ์มาเทรนโมเดล AI โดยเสนอค่าตอบแทนจำนวนมาก แต่นักวิเคราะห์เตือนว่าข้อตกลงเหล่านี้อาจส่งผลเสียต่อภาพลักษณ์ของสตูดิโอต่อสาธารณะ
โฟกัส Frontier AI. Koray Kavukcuoglu หัวหน้าคนใหม่ของ Google DeepMind กล่าวว่าการเป็นผู้นำด้าน frontier AI คือสิ่งเดียวที่สำคัญ พร้อมยอมรับว่าโมเดลปัจจุบันยังห่างจากระดับ frontier อยู่เล็กน้อย แต่ให้คำมั่นว่าจะปิดช่องว่างให้ได้ โดยไม่มีความคืบหน้าอย่างเป็นรูปธรรมเกี่ยวกับ Gemini 4 หรือ 3.5 Pro
เอเจนต์ในงานดำเนินงาน. Enterprise Signals ของ OpenAI ชี้ว่าบริษัทระดับ frontier สร้างโทเคนเอาต์พุตต่อผู้ใช้ที่ใช้งานจริงมากกว่า 8.3 เท่า ขณะที่สตาร์ทอัปอย่าง Basis, Clay และ Exa Labs ฝังเอเจนต์ไว้ในขั้นตอน onboarding การจัดการบัญชี และการอินทิเกรตสำหรับนักพัฒนา
ศึกกฎหมาย Apple-OpenAI. Apple ยื่นขอให้มีการเปิดเผยหลักฐานอย่างเร่งด่วนในคดีกับ OpenAI โดยกล่าวหาว่าบริษัทไม่ตรวจสอบ MacBook ของอดีตพนักงาน Apple ซึ่งมีบทสนทนาเกี่ยวกับการทำลายข้อมูลหลักฐานทางนิติวิทยาศาสตร์
เครื่องมือออกแบบ Google Pics. Google เปิดตัว Google Pics เครื่องมือสร้างและแก้ไขภาพด้วย AI สำหรับ Workspace ที่ขับเคลื่อนโดย Nano Banana เพื่อแข่งขันกับ Canva และ Adobe Express ด้วยการออกแบบจากพรอมป์และการแก้ไขวัตถุอย่างแม่นยำ
เอเจนต์ AI ผู้บริโภค. Fambot เปิดตัว AI ผู้จัดการธุระครอบครัวเพื่อจัดการงานบ้าน John Deere เปิดตัวผู้ช่วย JD AI สำหรับเกษตรกรโดยใช้ข้อมูลของตัวเกษตรกรเอง ส่วน Amazon เพิ่มการแจ้งเตือนช้อปปิ้ง “Update Me When” ใน Alexa
นี่คือทั้งหมดสำหรับวันนี้ - อ่านประมาณ 5 นาที