การเปิดตัวโมเดลโอเพนและโลคัล
ตระกูลโอเพน Ornith-1.5. Ornith-1.5 เปิดตัวในรุ่น 9B dense, 35B MoE และ 397B MoE ภายใต้สัญญา MIT พร้อม benchmark ด้าน agentic และการเขียนโค้ดที่แข็งแกร่ง; quantization จากชุมชนแสดงให้เห็นว่า 35B ทำงานที่ 60 tk/s บน 4070 Ti ขนาด 12GB และ 9B ทำผลงานได้ดีกว่าโมเดลเล็กๆ รุ่นก่อนหน้า
รายงานภาคสนาม Qwen3.8-27B. ผู้ใช้ในพื้นที่รายงานว่า Qwen3.8-27B สามารถดำเนินการเรียกใช้เครื่องมือมากกว่า 80 ครั้งได้โดยอัตโนมัติ และจัดการห่วงโซ่ agentic ที่ยาวได้ แต่ความรู้แบบออฟไลน์และคะแนนการเขียนโค้ดที่เข้มงวดนั้นอ่อนกว่ารุ่นก่อน ดังนั้นจึงทำงานได้ดีที่สุดเมื่อมีคำสั่งที่ชัดเจนหรือใช้เป็นตัวช่วย (copilot)
การเร่งความเร็วและ quant ของ Qwen3.8. ความพยายามของชุมชนผลักดัน Qwen3.8-27B ให้ทำงานที่ 138 tps บน RTX 3090 ด้วย DFlash2, เปิดตัว quant Dynamic V3 ที่อ้างว่ามีความแม่นยำสูงขึ้น 10%, โมเดล Mini-Me ขนาด 22.7B ที่ผ่านการตัดความลึก (depth-pruned) และ FP4 ดั้งเดิมบน V100 รุ่นปี 2017 ที่เทียบเท่ากับ 5090
- → I pushed Qwen3.8-27B limits again... Dflash2 - 134 tps on a RTX 3090
- → DFlash2 speeds Qwen 3.8 27B up to 4 times
- → Introducing Qwen3.8-27B Dynamic v3 Unsloth GGUFs
- → updated unsloth/Qwen3.8-27B-GGUF · Hugging Face
- → Qwen3.8-23B-Mini-Me: A Depth-Pruned Qwen3.8-27B (to ~22.7BB)
- → NVFP4 on VOLTA! Despite being built for Blackwell, I made four 2017 V100s run Qwen 3.8 NVFP4 natively and match my $6000 RTX 5090.
เช็คพอยต์โมเดลฐานของ Ling. AntLing เปิดซอร์สเช็คพอยต์ base และ midtrain สำหรับ Ling-3.0-tiny และ flash โดยไม่ผ่าน post-training และมีผู้ใช้จับคู่ Ling tiny เป็นตัวช่วยสำหรับการบีบอัดบริบทร่วมกับ Qwen3.8
LFM2.5 QAD quants. Liquid AI เปิดตัวเช็คพอยต์ Q4_0 ที่ฝึกด้วย quantization-aware distillation โดยสามารถเรียกคืนความแม่นยำของ BF16 ได้ 97% ด้วยความเร็วและหน่วยความจำเท่าเดิม
GLM-5.3 และการเปิดตัวโมเดล frontier. GLM-5.3 เสมอกับ Kimi K3 ในอันดับต้นของโมเดลโอเพน ด้วยการปรับปรุงด้าน agentic อย่างมากและต้นทุนที่ต่ำกว่า แม้จะเลื่อนการเปิดเผยน้ำหนัก (open weights) ออกไปสองสัปดาห์; DeepSeek V4-Pro GA และ NVIDIA Nemotron 3.5 Lightning/NeMo Switchyard ก็เปิดตัวเช่นกัน
เครื่องมือ Agent และอัปเดตผลิตภัณฑ์
แซนด์บ็อกซ์ที่ปลอดภัย. Simon Willison ทดสอบ smolmachines/smolvm เป็นแซนด์บ็อกซ์สำหรับ Python และ JavaScript ที่ไม่น่าเชื่อถือ ด้วยการจำกัด CPU/RAM และไม่มีเครือข่าย; Jeremy Morrell โต้แย้งว่าส่วนขยายที่เขียนโดย LLM ประกอบกับพื้นฐานแซนด์บ็อกซ์ช่วยให้ซอฟต์แวร์ที่ขยายได้ปลอดภัย
โหมดฟรีของ Replit. Replit เปิดตัวโหมดฟรีที่ขับเคลื่อนด้วย GPT-5.6 Luna ให้ทุกคนสร้างแอปและเอเจนต์ได้โดยไม่มีข้อจำกัดด้านต้นทุนโทเค็น
บันทึก AI ของ Calendly. Calendly เข้าสู่การจดบันทึกการประชุมด้วยบทสรุป รายการสิ่งที่ต้องทำ และผู้ช่วย Callie ที่กำลังจะเปิดตัว ซึ่งใช้บริบทการประชุมเพื่อกำหนดเวลานัดติดตามผล
แอป Mac ของ Meta AI. Meta เปิดตัวแอป Mac สำหรับแชทบอต AI ของบริษัท พร้อมการแชร์หน้าจอ การพิมพ์ตามคำบอก และการผสานรวม Google Workspace เพื่อแข่งขันกับผู้ช่วยเดสก์ท็อป Gemini, ChatGPT และ Claude
การตรวจจับสแกมบนอุปกรณ์ของ WhatsApp. WhatsApp กำลังทดสอบ Scam Alert ซึ่งเป็นโมเดลบนอุปกรณ์แบบเลือกใช้ ที่จำแนกข้อความจากผู้ที่ไม่ใช่ผู้ติดต่อ ขณะที่ใช้การวิเคราะห์แบบเฟเดเรตที่เป็นความลับเพื่อรักษาความเป็นส่วนตัว
เครื่องมือเรียนของ Google. Google เปิดตัวศูนย์รวมนักเรียน Gemini, ภาพเชิงโต้ตอบและแบบทดสอบที่สร้างโดย AI ใน Search และ Deep Research ใน Gemini Live สำหรับช่วงเปิดเทอม
Alexa+ ฟรีบน Fire TV. Amazon ทำให้ Alexa+ ฟรีบน Fire TV โดยไม่ต้องใช้ Prime พร้อมเปิดตัวการค้นหาเชิงสนทนา การควบคุมสมาร์ทโฮม และคำแนะนำ AI โดยอัตโนมัติ
อุตสาหกรรมและธุรกิจ
Stripe ซื้อ OpenRouter. Stripe ยืนยันการเข้าซื้อ OpenRouter มูลค่า 7.5 พันล้านดอลลาร์ และผู้ก่อตั้งอ้างถึง 'singularity' เป็นเหตุผลในการคงความเป็นบริษัทเอกชนและลงทุนในโครงสร้างพื้นฐานสำหรับเอเจนต์
รายงาน SpaceX-Cognition ถูกปฏิเสธ. Bloomberg รายงานว่า SpaceX พยายามเข้าซื้อ Cognition แต่ CEO Scott Wu ปฏิเสธเรื่องดังกล่าว โดยกล่าวว่า Cognition ไม่ได้มีไว้ขาย และไม่มีการเจรจาใดๆ เกิดขึ้น
Anthropic นำรายได้. Anthropic แซงหน้า OpenAI ในรายได้รายไตรมาสเป็นครั้งแรก โดยทำได้ 11.6 พันล้านดอลลาร์ พร้อมกำไรจากการดำเนินงานเล็กน้อย ในขณะที่ OpenAI ทำได้ 6.7 พันล้านดอลลาร์ แต่ขาดทุนมากขึ้น
คอมพิวต์ในฐานะสินทรัพย์ประเภทหนึ่ง. Nvidia กำลังทำงานร่วมกับ Apollo, BlackRock และอื่นๆ ในการจัดหาเงินทุน 5 แสนล้านดอลลาร์ เพื่อทำให้คอมพิวต์เป็นสินทรัพย์ที่ลงทุนได้; Silicon Data ระดมทุน 30 ล้านดอลลาร์เพื่อเปิดตัวฟิวเจอร์ส GPU ของ CME
หน่วยความจำและอุปทานชิป. ราคา DRAM เพิ่มขึ้น 500% ใน 12 เดือน และไฮเปอร์สเกลเลอร์ได้จองอุปทานปี 2027 แล้ว; จีนอนุญาตให้ส่ง H200 รุ่นเล็กจำนวนจำกัดให้ ByteDance และ Tencent เพื่อบรรเทาขีดความสามารถในการอนุมาน
โครงสร้างพื้นฐานศูนย์ข้อมูล. TerraPower วางแผนโครงการศูนย์ข้อมูลโดยใช้การจัดเก็บพลังงานของเครื่องปฏิกรณ์ Natrium ขณะที่ Relativity Networks ระดมทุน 22 ล้านดอลลาร์สำหรับไฟเบอร์แกนกลวงที่ส่งข้อมูลได้เร็วขึ้น 50%
ชื่อเสียงของ AI แย่ลง. Pew พบว่าชาวอเมริกัน 52% กังวลมากกว่าตื่นเต้นเกี่ยวกับ AI และข้อตกลงศูนย์ข้อมูลในพื้นที่กำลังเผชิญกับการต่อต้านจากสาธารณะ
ความปลอดภัย ความเป็นส่วนตัว และความมั่นคง
การประมวลผลความปลอดภัยส่วนตัวของ OpenAI. OpenAI เปิดตัว Private Safety Processing สำหรับลูกค้าที่ไม่เก็บข้อมูลใดๆ (zero-data-retention) ทำให้สามารถตรวจจับการละเมิดในปฏิสัมพันธ์ต่างๆ โดยไม่เปิดเผยเนื้อหาให้เจ้าหน้าที่เห็น; ซึ่งแตกต่างจากนโยบายการเก็บข้อมูล 30 วันของ Anthropic
OpenAI แก้ไข Codex และ TAC. OpenAI เปิดตัวมาตรการป้องกันหลังจาก Codex ลบไฟล์จริงของผู้ใช้ผ่านคำสั่ง cleanup ที่ผิดพลาด และยืนยันว่าข้อผิดพลาดอีกเรื่องหนึ่งทำให้การเข้าถึงโปรแกรม Trusted Access for Cyber ถูกเพิกถอนชั่วคราว
เอ็กซ์พลอยต์ ICS ที่สร้างโดย AI. หน่วยงานของสหรัฐฯ เตือนว่าผู้โจมตีใช้ AI เพื่อสร้างสคริปต์เอ็กซ์พลอยต์สำหรับ Siemens S7 ซึ่งลดทักษะและเวลาที่ต้องใช้ในการโจมตีระบบควบคุมอุตสาหกรรม
การควบคุมภายในของห้องแล็บ AI. การประเมินครั้งแรกของ Guidelight พบว่าไม่มีบริษัท AI ใดใช้การควบคุมภายในขั้นพื้นฐานอย่างเต็มรูปแบบ; Anthropic และ OpenAI นำด้วยเกรด C+ ขณะที่ xAI และ Meta ได้ D- และ F
โฆษณาดีปเฟคของ Meta. Meta ลงโฆษณาแอป AI แต่งภาพเปลือยที่พุ่งเป้าไปที่นักการเมืองหญิง แม้จะมีนโยบายห้ามเนื้อหาทางเพศ
การขายข้อมูลพนักงาน Spirit. Google ชนะการประมูลข้อมูลการจ้างงานของ Spirit Airlines; อดีตพนักงานต้อนรับบนเครื่องบินคัดค้านว่าความลับของพนักงานอาจไม่ได้รับการปกป้องจากการระบุตัวตนซ้ำ
OpenAI ชะลอการพัฒนา. OpenAI หยุดการฝึก RL บางส่วนและเลื่อนการรัน frontier ขณะที่เพิ่มความเข้มงวดด้านมาตรการป้องกัน เพื่อทดสอบว่าการชะลอโดยสมัครใจจะได้ผลหรือไม่โดยไม่ต้องมีการนำไปใช้ทั่วทั้งอุตสาหกรรม
งานวิจัยและการวิเคราะห์
การออกแบบโปรตีนของ Claude. โมเดล Claude ของ Anthropic ออกแบบมินิไบน์เดอร์ (minibinders) ครอบคลุมเป้าหมาย 15 รายการ ด้วยอัตราความสำเร็จ 26.8% ซึ่งดีกว่าผลลัพธ์การค้นพบยาในระยะเริ่มต้นทั่วไป แม้จะยังรอการตรวจสอบโดยอิสระ
ข้อมูลเนื้อเยื่อของ Vivodyne. ห้องแล็บ HIVE แบบหุ่นยนต์ของ Vivodyne เพาะเนื้อเยื่อมนุษย์ 20 ชนิด และสร้างข้อมูลทางชีววิทยาเชิงเหตุผล เพื่อแก้ปัญหาที่บริษัทมองว่าเป็นข้อมูลที่ขาดหายไปของการค้นพบยาด้วย AI
ตำนานโทเค็นการให้เหตุผล. งานวิจัยท้าทายแนวคิดที่ว่าโทเค็นขั้นกลางของ LLM เป็นการให้เหตุผลที่มีความหมายเชิงความหมาย; โมเดลมักสร้างร่องรอยที่ไม่ถูกต้องแม้คำตอบจะถูกต้อง และการฝึกด้วยร่องรอยที่เสียหายก็ยังได้ผล
เมตริกประสิทธิภาพการเขียนโค้ด. Simon Willison โต้แย้งว่าจำนวนบรรทัดของโค้ด production ที่ผ่านการดีบักยังคงเป็นเมตริกประสิทธิภาพที่มีความหมายกับเอเจนต์เขียนโค้ด แต่การได้ผลลัพธ์นั้นยังต้องใช้ทักษะวิศวกรระดับสูง
นี่คือทั้งหมดสำหรับวันนี้ - อ่านประมาณ 5 นาที